Articulo de referencia

BLEU

BLEU ( Bilingual Evaluation Understudy ) es un algoritmo para evaluar la calidad de un texto traducido automáticamente de un idioma natural a otro. La calidad se define como la ...

Este es un buen artículo. Haz clic aquí para obtener más información.

BLEU ( Bilingual Evaluation Understudy ) es un algoritmo para evaluar la calidad de un texto traducido automáticamente de un idioma natural a otro. La calidad se define como la correspondencia entre la traducción automática y la humana: «cuanto más se acerque una traducción automática a una traducción humana profesional, mejor será». Esta es la idea central de BLEU.Inventado en IBM en 2001, BLEU fue una de las primeras métricas en afirmar una alta correlación con los juicios humanos de calidad,y sigue siendo una de las métricas automatizadas y económicas más populares.

Las puntuaciones se calculan para cada segmento traducido —generalmente oraciones— comparándolo con un conjunto de traducciones de referencia de buena calidad. Posteriormente, se promedian estas puntuaciones en todo el corpus para obtener una estimación de la calidad general de la traducción. No se tienen en cuenta la inteligibilidad ni la corrección gramatical.

El resultado de BLEU siempre es un número entre 0 y 1. Este valor indica la similitud del texto candidato con los textos de referencia; los valores más cercanos a 1 representan una mayor similitud. Pocas traducciones humanas alcanzan una puntuación de 1, ya que esto indicaría que el texto candidato es idéntico a una de las traducciones de referencia. Por este motivo, no es necesario obtener una puntuación de 1. Dado que existen más posibilidades de coincidencia, añadir traducciones de referencia adicionales aumentará la puntuación BLEU.

Definición matemática

Configuración básica

Un primer intento básico de definir la puntuación BLEU tomaría dos argumentos: una cadena candidatay^{\displaystyle {\hat {y}}}y una lista de cadenas de referencia(y(1),...,y(norte)){\displaystyle (y^{(1)},...,y^{(N)})}La idea es queBLmiU(y^;y(1),...,y(norte)){\displaystyle BLEU({\sombrero {y}};y^{(1)},...,y^{(N)})}debería estar cerca de 1 cuandoy^{\displaystyle {\hat {y}}}es similar ay(1),...,y(norte){\displaystyle y^{(1)},...,y^{(N)}}y cercano a 0 en caso contrario.

A modo de analogía, la puntuación BLEU es como un profesor de idiomas que intenta calificar la calidad de la traducción de un estudiante.y^{\displaystyle {\hat {y}}}comprobando qué tan fielmente sigue las respuestas de referenciay(1),...,y(norte){\displaystyle y^{(1)},...,y^{(N)}}.

Dado que en el procesamiento del lenguaje natural se debe evaluar un gran conjunto de cadenas candidatas, es necesario generalizar la puntuación BLEU al caso en el que se dispone de una lista de M cadenas candidatas (denominada " corpus ").(y^(1),,y^(METRO)){\displaystyle ({\hat {y}}^{(1)},\cdots ,{\hat {y}}^{(M)})}y para cada cadena candidatay^(i){\displaystyle {\sombrero {y}}^{(i)}}, una lista de cadenas candidatas de referenciaSi:=(y(i,1),...,y(i,nortei)){\displaystyle S_{i}:=(y^{(i,1)},...,y^{(i,N_{i})})}.

Dada cualquier cadenay=y1y2yK{\displaystyle y=y_{1}y_{2}\cdots y_{K}}y cualquier número enteronorte1{\displaystyle n\geq 1}, definimos el conjunto de sus n-gramas comoGRAMOnorte(y)={y1ynorte,y2ynorte+1,,yKnorte+1yK}{\displaystyle G_{n}(y)=\{y_{1}\cdots y_{n},y_{2}\cdots y_{n+1},\cdots ,y_{K-n+1}\cdots y_{K}\}}Tenga en cuenta que se trata de un conjunto de elementos únicos, no de un multiconjunto que permita elementos redundantes, de modo que, por ejemplo,GRAMO2(abab)={ab,ba}{\displaystyle G_{2}(abab)=\{ab,ba\}}.

Dadas dos cadenas cualesquieras,y{\displaystyle s,y}, define el recuento de subcadenasdo(s,y){\displaystyle C(s,y)}ser el número de apariciones des{\displaystyle s}como una subcadena dey{\displaystyle y}. Por ejemplo,do(ab,abdobab)=2{\displaystyle C(ab,abcbab)=2}.

Ahora, fijemos un corpus candidato.S^:=(y^(1),,y^(METRO)){\displaystyle {\hat {S}}:=({\hat {y}}^{(1)},\cdots ,{\hat {y}}^{(M)})}y corpus de candidatos de referenciaS=(S1,,SMETRO){\displaystyle S=(S_{1},\cdots ,S_{M})}, donde cadaSi:=(y(i,1),...,y(i,nortei)){\displaystyle S_{i}:=(y^{(i,1)},...,y^{(i,N_{i})})}.

Precisión de n-gramas modificada

Defina la función de precisión de n-gramas modificada como:pagnorte(S^;S):=i=1METROsGRAMOnorte(y^(i))min(do(s,y^(i)),máximoySido(s,y))i=1METROsGRAMOnorte(y^(i))do(s,y^(i)){\displaystyle p_{n}({\hat {S}};S):={\frac {\sum _{i=1}^{M}\sum _{s\in G_{n}({\hat {y}}^{(i)})}\min(C(s,{\hat {y}}^{(i)}),\max _{y\in S_{i}}C(s,y))}{\sum _{i=1}^{M}\sum _{s\in G_{n}({\hat {y}}^{(i)})}C(s,{\hat {y}}^{(i)})}}}El n-grama modificado, que parece complicado, es simplemente una generalización directa del caso prototípico: una oración candidata y una oración de referencia. En este caso, espagnorte({y^};{y})=sGRAMOnorte(y^)min(do(s,y^),do(s,y))sGRAMOnorte(y^)do(s,y^){\displaystyle p_{n}(\{{\hat {y}}\};\{y\})={\frac {\sum _{s\in G_{n}({\hat {y}})}\min(C(s,{\hat {y}}),C(s,y))}{\sum _{s\in G_{n}({\hat {y}})}C(s,{\hat {y}})}}}Para llegar a esta expresión, comenzamos con la suma de conteo de n-gramas más obvia:sGRAMOnorte(y^)do(s,y)=número de n-subcadenas en y^ que aparecen en y{\displaystyle \sum _{s\in G_{n}({\hat {y}})}C(s,y)={\text{número de n-subcadenas en }}{\hat {y}}{\text{ que aparecen en }}y} Esta cantidad mide cuántos n-gramas de la oración de referencia se reproducen en la oración candidata. Tenga en cuenta que contamos las n-subcadenas , no los n-gramas . Por ejemplo, cuandoy^=aba,y=abababa,norte=2{\displaystyle {\sombrero {y}}=aba,y=abababa,n=2}, todas las subcadenas de 2 elementos eny^{\displaystyle {\hat {y}}}(ab y ba) aparecen eny{\displaystyle y}3 veces cada uno, por lo que el recuento es 6, no 2.

En la situación anterior, sin embargo, la cadena candidata es demasiado corta. En lugar de 3 apariciones deab{\displaystyle ab}Contiene solo uno, así que añadimos una función mínima para corregirlo:sGRAMOnorte(y^)min(do(s,y^),do(s,y)){\displaystyle {\sum _{s\in G_{n}({\hat {y}})}\min(C(s,{\hat {y}}),C(s,y))}}Esta suma de recuentos no se puede utilizar para comparar entre oraciones, ya que no está normalizada. Si tanto la oración de referencia como la candidata son largas, el recuento podría ser grande, incluso si la candidata es de muy mala calidad. Por lo tanto, la normalizamos.sGRAMOnorte(y^)min(do(s,y^),do(s,y))sGRAMOnorte(y^)do(s,y^){\displaystyle {\frac {\sum _{s\in G_{n}({\hat {y}})}\min(C(s,{\hat {y}}),C(s,y))}{\sum _{s\in G_{n}({\hat {y}})}C(s,{\hat {y}})}}}La normalización es tal que siempre es un número en[0,1]{\displaystyle [0,1]}, lo que permite realizar comparaciones significativas entre corpus. Es cero si ninguna de las n-subcadenas del candidato está en la referencia. Es uno si cada n-grama del candidato aparece en la referencia, al menos tantas veces como en el candidato. En particular, si el candidato es una subcadena de la referencia, entonces es uno.

Penalización por brevedad

La precisión de n-gramas modificada otorga indebidamente una puntuación alta a las cadenas candidatas que son " telegráficas ", es decir, que contienen todos los n-gramas de las cadenas de referencia, pero la menor cantidad de veces posible.

Para castigar las cadenas candidatas que son demasiado cortas, defina la penalización por brevedad como:BPAG(S^;S):=mi(r/do1)+{\displaystyle BP({\hat {S}};S):=e^{-(r/c-1)^{+}}}dónde(r/do1)+=máximo(0,r/do1){\displaystyle (r/c-1)^{+}=\max(0,r/c-1)}es la parte positiva der/do1{\displaystyle r/c-1}.

  • Cuandordo{\displaystyle r\leq c}la penalización por brevedadBPAG=1{\displaystyle BP=1}, lo que significa que no penalizamos a los candidatos con puntuaciones largas, sino solo a los candidatos con puntuaciones cortas.
  • Cuandor>do{\displaystyle r>c}la penalización por brevedadBPAG=mi1r/do{\displaystyle BP=e^{1-r/c}}

do{\displaystyle c}es la longitud del corpus candidato, es decir,do:=i=1METRO|y^(i)|{\displaystyle c:=\sum _{i=1}^{M}|{\hat {y}}^{(i)}|}dónde|y|{\displaystyle |y|}es la longitud dey{\displaystyle y}.

r{\displaystyle r}es la longitud efectiva del corpus de referencia , es decir,r:=i=1METRO|y(i,j)|{\displaystyle r:=\sum _{i=1}^{M}|y^{(i,j)}|}dóndey(i,j)=argminySi||y||y^(i)||{\displaystyle y^{(i,j)}=\arg \min _{y\in S_{i}}||y|-|{\hat {y}}^{(i)}||}, es decir, la oración deSi{\displaystyle S_{i}}cuya longitud es lo más cercana posible a|y^(i)|{\displaystyle |{\sombrero {y}}^{(i)}|}en la medida de lo posible.

Fórmula final

No existe una única definición de BLEU, sino toda una familia de ellas, parametrizadas por el vector de ponderación.w:=(w1,w2,){\displaystyle w:=(w_{1},w_{2},\cdots)}. Es una distribución de probabilidad sobre{1,2,3,}{\displaystyle \{1,2,3,\cdots \}}, eso es,i=1wi=1{\displaystyle \sum _{i=1}^{\infty }w_{i}=1}, yi{1,2,3,},wi[0,1]{\displaystyle \forall i\in \{1,2,3,\cdots \},w_{i}\in [0,1]}.

Con opción dew{\displaystyle w}, la puntuación BLEU esBLmiUw(S^;S):=BPAG(S^;S)exp(norte=1wnortelnpagnorte(S^;S)){\displaystyle BLEU_{w}({\hat {S}};S):=BP({\hat {S}};S)\cdot \exp \left(\sum _{n=1}^{\infty }w_{n}\ln p_{n}({\hat {S}};S)\right)}En otras palabras, se trata de una media geométrica ponderada de todas las precisiones de n-gramas modificados, multiplicada por la penalización por brevedad. Utilizamos la media geométrica ponderada, en lugar de la media aritmética ponderada, para favorecer los corpus candidatos que sean buenos simultáneamente según múltiples precisiones de n-gramas.

La opción más típica, la recomendada en el artículo original, esw1==w4=14{\displaystyle w_{1}=\cdots =w_{4}={\frac {1}{4}}}. [ 1 ]

Algoritmo

Esto se ilustra en el siguiente ejemplo de Papineni et al. (2002):

De las siete palabras de la traducción candidata, todas aparecen en las traducciones de referencia. Por lo tanto, al texto candidato se le da una precisión de unigrama de,

PAG=metrowt=77=1{\displaystyle P={\frac {m}{w_{t}}}={\frac {7}{7}}=1}

dónde metro{\displaystyle ~m}es el número de palabras del candidato que se encuentran en la referencia, y wt{\displaystyle ~w_{t}}es el número total de palabras en el candidato. Esta es una puntuación perfecta, a pesar de que la traducción candidata anterior conserva poco del contenido de ambas referencias.

La modificación que hace BLEU es bastante sencilla. Para cada palabra en la traducción candidata, el algoritmo toma su recuento total máximo, metrometroaincógnita{\displaystyle ~m_{max}}, en cualquiera de las traducciones de referencia. En el ejemplo anterior, la palabra "the" aparece dos veces en la referencia 1 y una vez en la referencia 2. Por lo tanto metrometroaincógnita=2{\displaystyle ~m_{max}=2}.

Para la traducción candidata, el recuentometrow{\displaystyle m_{w}}de cada palabra se recorta a un máximo demetrometroaincógnita{\displaystyle m_{max}}para esa palabra. En este caso, "el" tiene metrow=7{\displaystyle ~m_{w}=7}y metrometroaincógnita=2{\displaystyle ~m_{max}=2}, de este modo metrow{\displaystyle ~m_{w}}se recorta a 2. Estos recuentos recortados metrow{\displaystyle ~m_{w}}Luego se suman todas las palabras distintas en la traducción candidata. Esta suma se divide por el número total de unigramas en la traducción candidata. En el ejemplo anterior, la puntuación de precisión de unigramas modificada sería:

PAG=27{\displaystyle P={\frac {2}{7}}}

En la práctica, sin embargo, usar palabras individuales como unidad de comparación no es óptimo. En cambio, BLEU calcula la misma métrica de precisión modificada usando n-gramas . La longitud que tiene la "mayor correlación con los juicios humanos monolingües"Se determinó que era cuatro. Se encontró que las puntuaciones de unigramas reflejan la adecuación de la traducción, es decir, cuánta información se retiene. Las puntuaciones de n -gramas más largos reflejan la fluidez de la traducción, o hasta qué punto suena como un "buen inglés".

Un ejemplo de posible traducción para las mismas referencias que las anteriores podría ser:

el gato

En este ejemplo, la precisión del unigrama modificado sería:

PAG=12+12=22{\displaystyle P={\frac {1}{2}}+{\frac {1}{2}}={\frac {2}{2}}}

como la palabra 'the' y la palabra 'cat' aparecen una vez cada una en el candidato, y el número total de palabras es dos. La precisión de bigramas modificada sería1/1{\displaystyle 1/1}Como bigrama, "el gato" aparece una vez en el candidato. Se ha señalado que la precisión suele ir acompañada de exhaustividad para superar este problema., ya que la recuperación de unigramas de este ejemplo sería3/6{\displaystyle 3/6}o2/7{\displaystyle 2/7}El problema radica en que, al haber múltiples traducciones de referencia, una mala traducción podría fácilmente tener una tasa de recuperación inflada, como por ejemplo una traducción que consistiera en todas las palabras de cada una de las referencias.

Para producir una puntuación para todo el corpus, las puntuaciones de precisión modificadas para los segmentos se combinan utilizando la media geométrica multiplicada por una penalización de brevedad para evitar que los candidatos muy cortos reciban una puntuación demasiado alta. Sea r la longitud total del corpus de referencia y c la longitud total del corpus de traducción. Sidor{\displaystyle c\leq r}, se aplica la penalización por brevedad, definida comomi(1r/do){\displaystyle e^{(1-r/c)}}(En el caso de múltiples oraciones de referencia, r se considera la suma de las longitudes de las oraciones cuyas longitudes son más cercanas a las longitudes de las oraciones candidatas. Sin embargo, en la versión de la métrica utilizada por las evaluaciones del NIST antes de 2009, se utilizaba la oración de referencia más corta).

iBLEU es una versión interactiva de BLEU que permite al usuario examinar visualmente las puntuaciones BLEU obtenidas por las traducciones candidatas. También permite comparar dos sistemas diferentes de forma visual e interactiva, lo cual resulta útil para el desarrollo de sistemas.

Actuación

Se ha informado con frecuencia que BLEU se correlaciona bien con el juicio humano,y sigue siendo un referente para la evaluación de cualquier nueva métrica de evaluación. Sin embargo, se han formulado varias críticas. Se ha señalado que, si bien en principio es capaz de evaluar traducciones de cualquier idioma, BLEU, en su forma actual, no puede trabajar con idiomas que carecen de límites de palabras.Diseñado para usarse con varias traducciones de referencia, en la práctica se usa solo con una. [ 2 ] BLEU es conocido por su dependencia de la técnica de tokenización , y las puntuaciones obtenidas con diferentes técnicas son incomparables (lo cual suele pasarse por alto); para mejorar la reproducibilidad y la comparabilidad, se diseñó la variante SacreBLEU. [ 2 ]

Se ha argumentado que, si bien BLEU tiene ventajas significativas, no hay garantía de que un aumento en la puntuación BLEU sea un indicador de una mejor calidad de la traducción.

Véase también

Notas

  1. ^ Papineni, K., et al. (2002)
  2. ^ Papineni, K., et al. (2002)
  3. ^ Coughlin, D. (2003)
  4. ^ Papineni, K., et al. (2002)
  5. ^ Papineni, K., et al. (2002)
  6. ^ Papineni, K., et al. (2002)
  7. ^ Coughlin, D. (2003)
  8. ^ Doddington, G. (2002)
  9. ^ Denoual, E. y Lepage, Y. (2005)
  10. ^ Callison-Burch, C., Osborne, M. y Koehn, P. (2006)
  11. ^ Lee, A. y Przybocki, M. (2005)
  12. ^ Callison-Burch, C., Osborne, M. y Koehn, P. (2006)
  13. ^ Lin, C. y Och, F. (2004)
  14. ^ Callison-Burch, C., Osborne, M. y Koehn, P. (2006)
  15. ^ Madnani, N. (2011)

Referencias

  1. Papineni, Kishore; Roukos, Salim; Ward, Todd; Zhu, Wei-Jing (2001). "BLEU" . Actas de la 40.ª Reunión Anual de la Asociación de Lingüística Computacional - ACL '02 . Morristown, NJ, EE. UU.: Asociación de Lingüística Computacional: 311. doi : 10.3115/1073083.1073135 . S2CID 11080756 . 
  2. 1 2 Marie, Benjamin (5 de noviembre de 2022). "BLEU: Una métrica incomprendida de otra época" . Hacia la ciencia de datos .

Bibliografía

  • Papineni, K.; Roukos, S.; Ward, T.; Zhu, WJ (2002). BLEU: un método para la evaluación automática de la traducción automática (PDF) . ACL-2002: 40.ª Reunión Anual de la Asociación de Lingüística Computacional. pp. 311–318 . CiteSeerX 10.1.1.19.9416 .  
  • Papineni, K., Roukos, S., Ward, T., Henderson, J. y Reeder, F. (2002). « Evaluación integral y diagnóstica de la traducción automática basada en corpus: resultados iniciales en árabe, chino, francés y español. Archivado el 4 de marzo de 2016 en Wayback Machine » en Actas de Human Language Technology 2002, San Diego, pp.  132-137 .
  • Callison-Burch, C., Osborne, M. y Koehn, P. (2006) " Reevaluación del papel de BLEU en la investigación de la traducción automática. Archivado el 4 de diciembre de 2008 en Wayback Machine " en 11.ª Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional: EACL 2006, págs.  249-256.
  • Doddington, G. (2002) " Evaluación automática de la calidad de la traducción automática mediante estadísticas de coocurrencia de n-gramas. Archivado el 12 de octubre de 2013 en Wayback Machine " en Actas de la Conferencia de Tecnología del Lenguaje Humano (HLT), San Diego, CA, págs.  128-132 .
  • Coughlin, D. (2003) " Correlación entre evaluaciones automatizadas y humanas de la calidad de la traducción automática. Archivado el 6 de septiembre de 2008 en Wayback Machine " en MT Summit IX, Nueva Orleans, EE. UU. , págs.  23-27 .
  • Denoual, E. y Lepage, Y. (2005) " BLEU en caracteres: hacia la evaluación automática de la traducción automática en lenguas sin delimitadores de palabras. Archivado el 18 de julio de 2011 en Wayback Machine " en Volumen complementario de las Actas de la Segunda Conferencia Internacional Conjunta sobre Procesamiento del Lenguaje Natural, págs.  81-86 .
  • Lee, A. y Przybocki, M. (2005) Resultados oficiales de la evaluación de traducción automática del NIST 2005
  • Lin, C. y Och, F. (2004) " Evaluación automática de la calidad de la traducción automática utilizando la subsecuencia común más larga y las estadísticas de bigramas salteados. Archivado el 5 de julio de 2008 en Wayback Machine " en Actas de la 42.ª Reunión Anual de la Asociación de Lingüística Computacional .
  • Madnani, N. (2011). " iBLEU: Puntuación y depuración interactivas de sistemas de traducción automática estadística " en "Actas de la Quinta Conferencia Internacional IEEE sobre Computación Semántica (Demos), Palo Alto, CA", págs.  213-214 .
  • BLEU – Evaluación Bilingüe. Clase de apoyo para estudiantes del curso de Traducción Automática del Instituto Tecnológico de Karlsruhe , Coursera.