METEOR ( Métrica para la Evaluación de la Traducción con Ordenación Explícita ) es una métrica para evaluar la salida de la traducción automática . Se basa en la media armónica de la precisión y la exhaustividad de los unigramas , con mayor peso para la exhaustividad que para la precisión. Además, incluye varias características que no se encuentran en otras métricas, como la derivación y la coincidencia de sinónimos , junto con la coincidencia exacta de palabras estándar. Esta métrica se diseñó para corregir algunos de los problemas de la popular métrica BLEU y, a su vez, para lograr una buena correlación con el juicio humano a nivel de oración o segmento. Esto difiere de la métrica BLEU, ya que esta última busca la correlación a nivel de corpus.

Se han presentado resultados que muestran una correlación de hasta 0,964 con el juicio humano a nivel de corpus, en comparación con el resultado de BLEU de 0,817 en el mismo conjunto de datos. A nivel de oración, la correlación máxima con el juicio humano alcanzada fue de 0,403.

Algoritmo
Al igual que con BLEU , la unidad básica de evaluación es la oración. El algoritmo primero crea una alineación (ver ilustraciones) entre dos oraciones : la cadena de traducción candidata y la cadena de traducción de referencia. La alineación es un conjunto de correspondencias entre unigramas . Una correspondencia puede considerarse como una línea entre un unigrama de una cadena y un unigrama de otra. Las restricciones son las siguientes: cada unigrama de la traducción candidata debe corresponder a cero o un unigrama de la referencia. Se seleccionan correspondencias para producir una alineación como se definió anteriormente. Si hay dos alineaciones con el mismo número de correspondencias, se elige la alineación con menos cruces , es decir, con menos intersecciones de dos correspondencias. De las dos alineaciones mostradas, se seleccionaría la alineación (a) en este punto. Las etapas se ejecutan consecutivamente y cada etapa solo agrega a la alineación aquellos unigramas que no se han emparejado en etapas anteriores. Una vez calculada la alineación final, la puntuación se calcula de la siguiente manera: La precisión del unigrama P se calcula como:
Donde m es el número de unigramas en la traducción candidata que también se encuentran en la traducción de referencia, yes el número de unigramas en la traducción candidata. La recuperación de unigramas R se calcula como:
Donde m es como se indicó anteriormente, yes el número de unigramas en la traducción de referencia. La precisión y la exhaustividad se combinan utilizando la media armónica de la siguiente manera, con la exhaustividad ponderada 9 veces más que la precisión:
Las medidas introducidas hasta ahora solo consideran la congruencia entre palabras individuales, pero no entre segmentos más largos presentes tanto en la oración de referencia como en la candidata. Para tener esto en cuenta, se utilizan coincidencias de n -gramas más largas para calcular una penalización p para la alineación. Cuanto mayor sea el número de correspondencias no adyacentes entre la oración de referencia y la candidata, mayor será la penalización.
Para calcular esta penalización, los unigramas se agrupan en la menor cantidad posible de fragmentos , donde un fragmento se define como un conjunto de unigramas que son adyacentes en la hipótesis y en la referencia. Cuanto más largas sean las correspondencias adyacentes entre el candidato y la referencia, menor será el número de fragmentos. Una traducción idéntica a la referencia dará como resultado un solo fragmento. La penalización p se calcula de la siguiente manera:
Donde c es el número de fragmentos, yes el número de unigramas que se han mapeado. La puntuación final de un segmento se calcula como M a continuación. La penalización tiene el efecto de reducir lahasta un 50% si no hay coincidencias de bigramas o más largas.
Para calcular una puntuación sobre un corpus completo o un conjunto de segmentos, se toman los valores agregados de P , R y p y se combinan mediante la misma fórmula. El algoritmo también permite comparar una traducción candidata con varias traducciones de referencia. En este caso, compara la traducción candidata con cada una de las referencias y selecciona la que tenga la puntuación más alta.
Ejemplos
Véase también
Notas
- ^ Banerjee, S. y Lavie, A. (2005)
Referencias
- Banerjee, S. y Lavie, A. (2005) "METEOR: Una métrica automática para la evaluación de la traducción automática con una correlación mejorada con los juicios humanos" en Actas del Taller sobre Medidas de Evaluación Intrínsecas y Extrínsecas para la Traducción Automática y/o la Generación de Resumen en la 43.ª Reunión Anual de la Asociación de Lingüística Computacional (ACL-2005), Ann Arbor, Michigan, junio de 2005.
- Lavie, A., Sagae, K. y Jayaraman, S. (2004) "La importancia de la exhaustividad en las métricas automáticas para la evaluación de la traducción automática" en Actas de AMTA 2004, Washington D.C., septiembre de 2004.
Enlaces externos
- Sistema de evaluación de traducción automática METEOR (incluye enlace de descarga)
- Procesamiento del lenguaje natural
- Evaluación de la traducción automática