BLEU ( Bilingual Evaluation Understudy ) es un algoritmo para evaluar la calidad de un texto traducido automáticamente de un idioma natural a otro. La calidad se define como la correspondencia entre la traducción automática y la humana: «cuanto más se acerque una traducción automática a una traducción humana profesional, mejor será». Esta es la idea central de BLEU.Inventado en IBM en 2001, BLEU fue una de las primeras métricas en afirmar una alta correlación con los juicios humanos de calidad,y sigue siendo una de las métricas automatizadas y económicas más populares.
Las puntuaciones se calculan para cada segmento traducido —generalmente oraciones— comparándolo con un conjunto de traducciones de referencia de buena calidad. Posteriormente, se promedian estas puntuaciones en todo el corpus para obtener una estimación de la calidad general de la traducción. No se tienen en cuenta la inteligibilidad ni la corrección gramatical.
El resultado de BLEU siempre es un número entre 0 y 1. Este valor indica la similitud del texto candidato con los textos de referencia; los valores más cercanos a 1 representan una mayor similitud. Pocas traducciones humanas alcanzan una puntuación de 1, ya que esto indicaría que el texto candidato es idéntico a una de las traducciones de referencia. Por este motivo, no es necesario obtener una puntuación de 1. Dado que existen más posibilidades de coincidencia, añadir traducciones de referencia adicionales aumentará la puntuación BLEU.
Definición matemática
Configuración básica
Un primer intento básico de definir la puntuación BLEU tomaría dos argumentos: una cadena candidatay una lista de cadenas de referenciaLa idea es quedebería estar cerca de 1 cuandoes similar ay cercano a 0 en caso contrario.
A modo de analogía, la puntuación BLEU es como un profesor de idiomas que intenta calificar la calidad de la traducción de un estudiante.comprobando qué tan fielmente sigue las respuestas de referencia.
Dado que en el procesamiento del lenguaje natural se debe evaluar un gran conjunto de cadenas candidatas, es necesario generalizar la puntuación BLEU al caso en el que se dispone de una lista de M cadenas candidatas (denominada " corpus ").y para cada cadena candidata, una lista de cadenas candidatas de referencia.
Dada cualquier cadenay cualquier número entero, definimos el conjunto de sus n-gramas comoTenga en cuenta que se trata de un conjunto de elementos únicos, no de un multiconjunto que permita elementos redundantes, de modo que, por ejemplo,.
Dadas dos cadenas cualesquiera, define el recuento de subcadenasser el número de apariciones decomo una subcadena de. Por ejemplo,.
Ahora, fijemos un corpus candidato.y corpus de candidatos de referencia, donde cada.
Precisión de n-gramas modificada
Defina la función de precisión de n-gramas modificada como:El n-grama modificado, que parece complicado, es simplemente una generalización directa del caso prototípico: una oración candidata y una oración de referencia. En este caso, esPara llegar a esta expresión, comenzamos con la suma de conteo de n-gramas más obvia: Esta cantidad mide cuántos n-gramas de la oración de referencia se reproducen en la oración candidata. Tenga en cuenta que contamos las n-subcadenas , no los n-gramas . Por ejemplo, cuando, todas las subcadenas de 2 elementos en(ab y ba) aparecen en3 veces cada uno, por lo que el recuento es 6, no 2.
En la situación anterior, sin embargo, la cadena candidata es demasiado corta. En lugar de 3 apariciones deContiene solo uno, así que añadimos una función mínima para corregirlo:Esta suma de recuentos no se puede utilizar para comparar entre oraciones, ya que no está normalizada. Si tanto la oración de referencia como la candidata son largas, el recuento podría ser grande, incluso si la candidata es de muy mala calidad. Por lo tanto, la normalizamos.La normalización es tal que siempre es un número en, lo que permite realizar comparaciones significativas entre corpus. Es cero si ninguna de las n-subcadenas del candidato está en la referencia. Es uno si cada n-grama del candidato aparece en la referencia, al menos tantas veces como en el candidato. En particular, si el candidato es una subcadena de la referencia, entonces es uno.
Penalización por brevedad
La precisión de n-gramas modificada otorga indebidamente una puntuación alta a las cadenas candidatas que son " telegráficas ", es decir, que contienen todos los n-gramas de las cadenas de referencia, pero la menor cantidad de veces posible.
Para castigar las cadenas candidatas que son demasiado cortas, defina la penalización por brevedad como:dóndees la parte positiva de.
- Cuandola penalización por brevedad, lo que significa que no penalizamos a los candidatos con puntuaciones largas, sino solo a los candidatos con puntuaciones cortas.
- Cuandola penalización por brevedad
es la longitud del corpus candidato, es decir,dóndees la longitud de.
es la longitud efectiva del corpus de referencia , es decir,dónde, es decir, la oración decuya longitud es lo más cercana posible aen la medida de lo posible.
Fórmula final
No existe una única definición de BLEU, sino toda una familia de ellas, parametrizadas por el vector de ponderación.. Es una distribución de probabilidad sobre, eso es,, y.
Con opción de, la puntuación BLEU esEn otras palabras, se trata de una media geométrica ponderada de todas las precisiones de n-gramas modificados, multiplicada por la penalización por brevedad. Utilizamos la media geométrica ponderada, en lugar de la media aritmética ponderada, para favorecer los corpus candidatos que sean buenos simultáneamente según múltiples precisiones de n-gramas.
La opción más típica, la recomendada en el artículo original, es. [ 1 ]
Algoritmo
Esto se ilustra en el siguiente ejemplo de Papineni et al. (2002):
De las siete palabras de la traducción candidata, todas aparecen en las traducciones de referencia. Por lo tanto, al texto candidato se le da una precisión de unigrama de,
dóndees el número de palabras del candidato que se encuentran en la referencia, yes el número total de palabras en el candidato. Esta es una puntuación perfecta, a pesar de que la traducción candidata anterior conserva poco del contenido de ambas referencias.
La modificación que hace BLEU es bastante sencilla. Para cada palabra en la traducción candidata, el algoritmo toma su recuento total máximo,, en cualquiera de las traducciones de referencia. En el ejemplo anterior, la palabra "the" aparece dos veces en la referencia 1 y una vez en la referencia 2. Por lo tanto.
Para la traducción candidata, el recuentode cada palabra se recorta a un máximo depara esa palabra. En este caso, "el" tieney, de este modose recorta a 2. Estos recuentos recortadosLuego se suman todas las palabras distintas en la traducción candidata. Esta suma se divide por el número total de unigramas en la traducción candidata. En el ejemplo anterior, la puntuación de precisión de unigramas modificada sería:
En la práctica, sin embargo, usar palabras individuales como unidad de comparación no es óptimo. En cambio, BLEU calcula la misma métrica de precisión modificada usando n-gramas . La longitud que tiene la "mayor correlación con los juicios humanos monolingües"Se determinó que era cuatro. Se encontró que las puntuaciones de unigramas reflejan la adecuación de la traducción, es decir, cuánta información se retiene. Las puntuaciones de n -gramas más largos reflejan la fluidez de la traducción, o hasta qué punto suena como un "buen inglés".
Un ejemplo de posible traducción para las mismas referencias que las anteriores podría ser:
- el gato
En este ejemplo, la precisión del unigrama modificado sería:
como la palabra 'the' y la palabra 'cat' aparecen una vez cada una en el candidato, y el número total de palabras es dos. La precisión de bigramas modificada seríaComo bigrama, "el gato" aparece una vez en el candidato. Se ha señalado que la precisión suele ir acompañada de exhaustividad para superar este problema., ya que la recuperación de unigramas de este ejemplo seríaoEl problema radica en que, al haber múltiples traducciones de referencia, una mala traducción podría fácilmente tener una tasa de recuperación inflada, como por ejemplo una traducción que consistiera en todas las palabras de cada una de las referencias.
Para producir una puntuación para todo el corpus, las puntuaciones de precisión modificadas para los segmentos se combinan utilizando la media geométrica multiplicada por una penalización de brevedad para evitar que los candidatos muy cortos reciban una puntuación demasiado alta. Sea r la longitud total del corpus de referencia y c la longitud total del corpus de traducción. Si, se aplica la penalización por brevedad, definida como(En el caso de múltiples oraciones de referencia, r se considera la suma de las longitudes de las oraciones cuyas longitudes son más cercanas a las longitudes de las oraciones candidatas. Sin embargo, en la versión de la métrica utilizada por las evaluaciones del NIST antes de 2009, se utilizaba la oración de referencia más corta).
iBLEU es una versión interactiva de BLEU que permite al usuario examinar visualmente las puntuaciones BLEU obtenidas por las traducciones candidatas. También permite comparar dos sistemas diferentes de forma visual e interactiva, lo cual resulta útil para el desarrollo de sistemas.
Actuación
Se ha informado con frecuencia que BLEU se correlaciona bien con el juicio humano,y sigue siendo un referente para la evaluación de cualquier nueva métrica de evaluación. Sin embargo, se han formulado varias críticas. Se ha señalado que, si bien en principio es capaz de evaluar traducciones de cualquier idioma, BLEU, en su forma actual, no puede trabajar con idiomas que carecen de límites de palabras.Diseñado para usarse con varias traducciones de referencia, en la práctica se usa solo con una. [ 2 ] BLEU es conocido por su dependencia de la técnica de tokenización , y las puntuaciones obtenidas con diferentes técnicas son incomparables (lo cual suele pasarse por alto); para mejorar la reproducibilidad y la comparabilidad, se diseñó la variante SacreBLEU. [ 2 ]
Se ha argumentado que, si bien BLEU tiene ventajas significativas, no hay garantía de que un aumento en la puntuación BLEU sea un indicador de una mejor calidad de la traducción.
Véase también
Notas
- ^ Papineni, K., et al. (2002)
- ^ Papineni, K., et al. (2002)
- ^ Coughlin, D. (2003)
- ^ Papineni, K., et al. (2002)
- ^ Papineni, K., et al. (2002)
- ^ Papineni, K., et al. (2002)
- ^ Coughlin, D. (2003)
- ^ Doddington, G. (2002)
- ^ Denoual, E. y Lepage, Y. (2005)
- ^ Callison-Burch, C., Osborne, M. y Koehn, P. (2006)
- ^ Lee, A. y Przybocki, M. (2005)
- ^ Callison-Burch, C., Osborne, M. y Koehn, P. (2006)
- ^ Lin, C. y Och, F. (2004)
- ^ Callison-Burch, C., Osborne, M. y Koehn, P. (2006)
- ^ Madnani, N. (2011)
Referencias
- ↑ Papineni, Kishore; Roukos, Salim; Ward, Todd; Zhu, Wei-Jing (2001). "BLEU" . Actas de la 40.ª Reunión Anual de la Asociación de Lingüística Computacional - ACL '02 . Morristown, NJ, EE. UU.: Asociación de Lingüística Computacional: 311. doi : 10.3115/1073083.1073135 . S2CID 11080756 .
- 1 2 Marie, Benjamin (5 de noviembre de 2022). "BLEU: Una métrica incomprendida de otra época" . Hacia la ciencia de datos .
Bibliografía
- Papineni, K.; Roukos, S.; Ward, T.; Zhu, WJ (2002). BLEU: un método para la evaluación automática de la traducción automática (PDF) . ACL-2002: 40.ª Reunión Anual de la Asociación de Lingüística Computacional. pp. 311–318 . CiteSeerX 10.1.1.19.9416 .
- Papineni, K., Roukos, S., Ward, T., Henderson, J. y Reeder, F. (2002). « Evaluación integral y diagnóstica de la traducción automática basada en corpus: resultados iniciales en árabe, chino, francés y español. Archivado el 4 de marzo de 2016 en Wayback Machine » en Actas de Human Language Technology 2002, San Diego, pp. 132-137 .
- Callison-Burch, C., Osborne, M. y Koehn, P. (2006) " Reevaluación del papel de BLEU en la investigación de la traducción automática. Archivado el 4 de diciembre de 2008 en Wayback Machine " en 11.ª Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional: EACL 2006, págs. 249-256.
- Doddington, G. (2002) " Evaluación automática de la calidad de la traducción automática mediante estadísticas de coocurrencia de n-gramas. Archivado el 12 de octubre de 2013 en Wayback Machine " en Actas de la Conferencia de Tecnología del Lenguaje Humano (HLT), San Diego, CA, págs. 128-132 .
- Coughlin, D. (2003) " Correlación entre evaluaciones automatizadas y humanas de la calidad de la traducción automática. Archivado el 6 de septiembre de 2008 en Wayback Machine " en MT Summit IX, Nueva Orleans, EE. UU. , págs. 23-27 .
- Denoual, E. y Lepage, Y. (2005) " BLEU en caracteres: hacia la evaluación automática de la traducción automática en lenguas sin delimitadores de palabras. Archivado el 18 de julio de 2011 en Wayback Machine " en Volumen complementario de las Actas de la Segunda Conferencia Internacional Conjunta sobre Procesamiento del Lenguaje Natural, págs. 81-86 .
- Lee, A. y Przybocki, M. (2005) Resultados oficiales de la evaluación de traducción automática del NIST 2005
- Lin, C. y Och, F. (2004) " Evaluación automática de la calidad de la traducción automática utilizando la subsecuencia común más larga y las estadísticas de bigramas salteados. Archivado el 5 de julio de 2008 en Wayback Machine " en Actas de la 42.ª Reunión Anual de la Asociación de Lingüística Computacional .
- Madnani, N. (2011). " iBLEU: Puntuación y depuración interactivas de sistemas de traducción automática estadística " en "Actas de la Quinta Conferencia Internacional IEEE sobre Computación Semántica (Demos), Palo Alto, CA", págs. 213-214 .
Enlaces externos
- BLEU – Evaluación Bilingüe. Clase de apoyo para estudiantes del curso de Traducción Automática del Instituto Tecnológico de Karlsruhe , Coursera.
- Evaluación de la traducción automática