Articulo de referencia

LEPROSO

LEPOR ( Penalización de longitud , precisión , penalización por diferencia de posición de n-gramas y recuperación ) es una métrica de evaluación de traducción automática indepen...

LEPOR ( Penalización de longitud , precisión , penalización por diferencia de posición de n-gramas y recuperación ) es una métrica de evaluación de traducción automática independiente del idioma con parámetros ajustables y factores reforzados.

Fondo

Desde que IBM propuso y realizó el sistema BLEU [ 1 ] como la métrica automática para la evaluación de la traducción automática (TA), [ 2 ] se han propuesto muchos otros métodos para revisarlo o mejorarlo, como TER, METEOR , [ 3 ] etc. Sin embargo, existen algunos problemas en las métricas de evaluación automática tradicionales . Algunas métricas funcionan bien en ciertos idiomas pero mal en otros, lo que generalmente se denomina problema de sesgo lingüístico. Algunas métricas dependen de muchas características del idioma o información lingüística, lo que hace que sea difícil para otros investigadores repetir los experimentos. LEPOR es una métrica de evaluación automática que intenta abordar algunos de los problemas existentes. [ 4 ] LEPOR está diseñado con factores aumentados y los parámetros ajustables correspondientes para abordar el problema del sesgo lingüístico. Además, en la versión mejorada de LEPOR, es decir, hLEPOR, [ 5 ] intenta utilizar las características lingüísticas optimizadas que se extraen de los bancos de árboles . Otra versión avanzada de LEPOR es la métrica nLEPOR, [ 6 ] que añade las características de n-gramas a los factores anteriores. Hasta ahora, la métrica LEPOR se ha desarrollado en la serie LEPOR. [ 7 ] [ 8 ]

Las métricas LEPOR han sido estudiadas y analizadas por muchos investigadores de diferentes campos, como la traducción automática, [ 9 ] la generación de lenguaje natural , [ 10 ] y la búsqueda, [ 11 ] y más allá. Las métricas LEPOR están recibiendo más atención por parte de los investigadores científicos en el procesamiento del lenguaje natural .

Diseño

LEPOR [ 4 ] está diseñado con los factores de penalización de longitud mejorada, precisión , penalización de orden de palabras n-grama y exhaustividad . La penalización de longitud mejorada garantiza que la traducción de la hipótesis, que generalmente se traduce mediante sistemas de traducción automática, sea penalizada si es más larga o más corta que la traducción de referencia. La puntuación de precisión refleja la exactitud de la traducción de la hipótesis. La puntuación de exhaustividad refleja la fidelidad de la traducción de la hipótesis a la traducción de referencia o al idioma de origen. El factor de penalización de orden de palabras basado en n-gramas está diseñado para los diferentes órdenes de posición entre la traducción de la hipótesis y la traducción de referencia. El factor de penalización de orden de palabras ha demostrado ser útil para muchos investigadores, como el trabajo de Wong y Kit (2008). [ 12 ]

En vista de que las métricas de coincidencia de cadenas de superficie de palabras fueron criticadas por falta de conciencia sintáctica y semántica, la métrica LEPOR desarrollada (hLEPOR) investiga la integración de características lingüísticas, como la categoría gramatical (POS). [ 5 ] [ 8 ] La POS se introduce como una cierta funcionalidad tanto desde el punto de vista sintáctico como semántico, por ejemplo, si un token de la oración de salida es un verbo cuando se espera que sea un sustantivo, entonces habrá una penalización; también, si la POS es la misma pero la palabra exacta no es la misma, por ejemplo, bueno vs. agradable entonces este candidato obtendrá cierto crédito. La puntuación general de hLEPOR entonces es como la combinación de la puntuación a nivel de palabra y la puntuación a nivel de POS con un conjunto de ponderación. El conocimiento de n-gramas inspirado en el modelado del lenguaje también se explora ampliamente en nLEPOR. [ 6 ] [ 8 ] Además del conocimiento de n-gramas para el cálculo de la penalización de diferencia de posición de n-gramas, n-gramas también se aplica a la precisión de n-gramas y la recuperación de n-gramas en nLEPOR, y el parámetro n es un factor ajustable. Además del conocimiento de POS en hLEPOR, la estructura de frases de la información de análisis se incluye en una nueva variante HPPR. [ 13 ] En el modelado de evaluación de HPPR, el conjunto de estructura de frases, como frases nominales , frases verbales , frases preposicionales, frases adverbiales se consideran durante la coincidencia del texto candidato con el texto de referencia.

Implementación de software

Las métricas LEPOR se implementaron originalmente en el lenguaje de programación Perl, [ 14 ] y recientemente la versión Python [ 15 ] está disponible para otros investigadores e ingenieros, [ 16 ] con un anuncio de prensa [ 17 ] de la empresa Logrus Global Language Service.

Actuación

La serie LEPOR ha demostrado su buen desempeño en el taller internacional anual de traducción automática estadística de la ACL ( ACL-WMT Archivado el 26 de abril de 2021 en Wayback Machine ). ACL-WMT es organizado por el grupo de interés especial de traducción automática (SIGMT) en la asociación internacional de lingüística computacional (ACL). En ACL-WMT 2013, [ 18 ] hay dos pistas de traducción y evaluación, inglés a otros y otros a inglés. Los idiomas "otros" incluyen español , francés , alemán , checo y ruso . En la dirección inglés a otros, la métrica nLEPOR logra la puntuación de correlación más alta a nivel de sistema con juicios humanos utilizando el coeficiente de correlación de Pearson, la segunda puntuación de correlación más alta a nivel de sistema con juicios humanos utilizando el coeficiente de correlación de rangos de Spearman . En la dirección de otros idiomas al inglés, nLEPOR tiene un rendimiento moderado y METEOR produce la puntuación de correlación más alta con los juicios humanos, lo que se debe a que nLEPOR solo utiliza la característica lingüística concisa, la información de la parte de la oración, excepto los datos de entrenamiento ofrecidos oficialmente; sin embargo, METEOR ha utilizado muchos otros recursos externos, como diccionarios de sinónimos , paráfrasis y derivación , etc.

Un trabajo extenso y una introducción sobre el desempeño de LEPOR con diferentes condiciones, incluyendo la forma superficial de la palabra pura, características de la categoría gramatical y características de las etiquetas de frase, se describen en una tesis de la Universidad de Macao . [ 8 ]

Existe un análisis estadístico profundo sobre el rendimiento de hLEPOR y nLEPOR en WMT13, que muestra que se desempeñó como una de las mejores métricas "tanto en la evaluación de pares de idiomas individuales para español a inglés como en el conjunto agregado de 9 pares de idiomas", véase el artículo (Evaluación precisa de métricas de traducción automática a nivel de segmento) " https://www.aclweb.org/anthology/N15-1124 " Graham et al. 2015 NAACL ( https://github.com/ygraham/segment-mteval )

En una presentación de la sección de usuarios de traducción automática de MT Summit 2021, investigadores de https://www.welocalize.com/ muestran que la métrica hLEPOR tiene correlación con el rendimiento humano en múltiples pares de idiomas probados, incluidos alemán, hindi (sin modelo para Prism), italiano, ruso y chino simplificado (página 459 https://aclanthology.org/attachments/2021.mtsummit-up.29.Presentation.pdf ).

Aplicaciones

La serie de métricas automáticas LEPOR ha sido aplicada y utilizada por muchos investigadores de diferentes campos en el procesamiento del lenguaje natural . Por ejemplo, en la traducción automática estándar y la traducción automática neuronal. [ 19 ] También fuera de la comunidad de traducción automática, por ejemplo, [ 11 ] aplicó LEPOR en la evaluación de búsqueda; [ 20 ] mencionó la aplicación de LEPOR para la evaluación de la generación de código (lenguaje de programación); [ 10 ] investigó la evaluación automática de la generación de lenguaje natural [ 21 ] con métricas que incluyen LEPOR, y argumentó que las métricas automáticas pueden ayudar a las evaluaciones a nivel de sistema; también se aplica LEPOR en la evaluación de subtítulos de imágenes. [ 22 ]

Véase también

Notas

  1. Papineni et al. (2002)
  2. Han (2016)
  3. Banerjee y Lavie (2005)
  4. 1 2 Han et al. (2012)
  5. 1 2 Han et al. (2013a)
  6. 1 2 Han et al. (2013b)
  7. Han et al. (2014)
  8. 1 2 3 4 Han (2014)
  9. Graham et al. (2015)
  10. 1 2 Novikova et al. (2017)
  11. 1 2 Liu et al. (2021)
  12. Wong y Kit (2008)
  13. Han et al. (2013c)
  14. ^ "GitHub - aaronlifenghan/Aaron-project-lepor: LEPOR: una métrica de evaluación sólida para la traducción automática con factores aumentados" . GitHub . 8 de enero de 2022.
  15. ^ "HLepor: esta es la versión Python del algoritmo original de Aaron Li-Feng Han" .
  16. ^ "GitHub - lHan87/LEPOR" . GitHub . 5 de mayo de 2021.
  17. Global, Logrus (30 de abril de 2021). "Logrus Global añade la implementación en Python de la métrica de evaluación de la calidad de la traducción hLEPOR en PyPi.org" . Slator (Comunicado de prensa) . Consultado el 2 de noviembre de 2022 .
  18. ACL-WMT (2013)
  19. ^ Marzouk y Hansen-Schirra (2019)
  20. Liguori et al. (2021)
  21. ^ Çelikyılmaz et al. (2020)
  22. Qiu et al. (2020)

Referencias

  • Papineni, K., Roukos, S., Ward, T., y Zhu, WJ (2002). "BLEU: un método para la evaluación automática de la traducción automática" en ACL-2002: 40.ª Reunión Anual de la Asociación de Lingüística Computacional, págs.  311-318.
  • Han, ALF, Wong, DF y Chao, LS (2012) «LEPOR: Una métrica de evaluación robusta para la traducción automática con factores aumentados» en Actas de la 24.ª Conferencia Internacional sobre Lingüística Computacional (COLING 2012): Pósteres, págs.  441-450. Bombay, India. Artículo en línea . Herramienta de código abierto.
  • Han, ALF, Wong, DF, Chao, LS, He, L., Lu, Y., Xing, J., y Zeng, X. (2013a) «Modelo independiente del idioma para la evaluación de la traducción automática con factores reforzados» en Actas de la XIV Cumbre de Traducción Automática (MT SUMMIT 2013), pp. 215-222. Niza, Francia. Editorial: Asociación Internacional de Traducción Automática. Artículo en línea archivado el 16 de enero de 2019 en Wayback Machine . Herramienta de código abierto.
  • Han, ALF, Wong, DF, Chao, LS, Lu, Y., He, L., Wang, Y., y Zhou, J. (2013b) «Descripción de sistemas de evaluación de traducción automática ajustables en la tarea de métricas WMT13» en Actas del Octavo Taller sobre Traducción Automática Estadística, ACL-WMT13, Sofía, Bulgaria. Asociación de Lingüística Computacional. Artículo en línea , págs.  414-421 .
  • Han, Aaron L.-F.; Wong, Derek F.; Chao, Lidia S.; He, Liangye; Lu, Yi (2014). "Modelo de estimación de calidad no supervisado para la traducción del inglés al alemán y su aplicación en la evaluación supervisada exhaustiva" . The Scientific World Journal . 2014 : 1–12 . doi : 10.1155/2014/760301 . PMC 4032676. PMID 24892086 .  
  • ACL-WMT. (2013) " TAREA DE MÉTRICAS ACL-WMT13 "
  • Wong, B. TM y Kit, C. (2008). "Elección de palabras y posición de las palabras para la evaluación automática de la traducción automática" en Workshop: MetricsMATR de la Association for Machine Translation in the Americas (AMTA) , documento breve, Waikiki, EE. UU.
  • Banerjee, S. y Lavie, A. (2005) "METEOR: Una métrica automática para la evaluación de la traducción automática con una correlación mejorada con los juicios humanos" en Actas del Taller sobre Medidas de Evaluación Intrínsecas y Extrínsecas para la Traducción Automática y/o la Generación de Resumen en la 43.ª Reunión Anual de la Asociación de Lingüística Computacional (ACL-2005), Ann Arbor, Michigan, junio de 2005.
  • Han, Lifeng. (2014) "LEPOR: Una métrica de evaluación de traducción automática aumentada". Tesis de maestría en ingeniería de software. Universidad de Macao, Macao.Presentación de PowerPoint
  • Yvette Graham, Timothy Baldwin y Nitika Mathur. (2015) Evaluación precisa de métricas de traducción automática a nivel de segmento. En NAACL HLT 2015, Conferencia de 2015 del Capítulo Norteamericano de la Asociación de Lingüística Computacional: Tecnologías del Lenguaje Humano, Denver, Colorado, EE. UU., 31 de mayo - 5 de junio de 2015, páginas 1183–1191.
  • Han, Lifeng (2016). "Recursos y métodos de evaluación de la traducción automática: una revisión". arXiv : 1605.04515 [ cs.CL ].
  • Jekaterina Novikova, Ondˇrej Dušek, Amanda Cercas Curry y Verena Rieser. (2017) Por qué necesitamos nuevas métricas de evaluación para la GNL. En Actas de la Conferencia de 2017 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural, páginas 2241–2252, Copenhague, Dinamarca. Asociación de Lingüística Computacional.
  • Liu, Zeyang; Zhou, Ke; Wilson, Max L. (2021). "Metaevaluación de métricas de evaluación de búsqueda conversacional". ACM Transactions on Information Systems . 39 (4): 1– 42. arXiv : 2104.13453 . doi : 10.1145/3445029 . S2CID 233423567 . 
  • Liguori, Pietro; Al-Hossami, Erfan; Cotroneo, Domenico; Natella, Roberto; Cukic, Bojan; Shaikh, Samira (2021). "Shellcode_IA32: Un conjunto de datos para la generación automática de shellcode". Actas del 1er Taller sobre Procesamiento del Lenguaje Natural para la Programación (NLP4Prog 2021) . págs. 58–64 . arXiv : 2104.13100 . doi : 10.18653/v1/2021.nlp4prog-1.7 . S2CID 233407761 .  
  • Çelikyılmaz, Aslı ; Clark, Elizabeth; Gao, Jianfeng (2020). "Evaluación de la generación de texto: una revisión". arXiv : 2006.14799 [ cs.CL ].
  • D Qiu, B Rothrock, T Islam, AK Didier, VZ Sun... (2020) SCOTI: Subtitulado científico de imágenes de terreno para la priorización de datos y la búsqueda local de imágenes. Planetary and Space. Elsevier
  • Marzouk, Shaimaa; Hansen-Schirra, Silvia (2019). "Evaluación del impacto del lenguaje controlado en la traducción automática neuronal en comparación con otras arquitecturas de traducción automática". Machine Translation . 33 ( 1–2 ): 179–203 . doi : 10.1007/s10590-019-09233-w . S2CID 171094946 . 
  • Han, Aaron Li-Feng; Wong, Derek F.; Chao, Lidia S.; He, Liangye; Li, Shuo; Zhu, Ling (2013). "Mapeo de conjuntos de etiquetas de frases para corpus arbóreos en francés e inglés y su aplicación en la evaluación de la traducción automática". Procesamiento del lenguaje y conocimiento en la web . Notas de clase en ciencias de la computación. Vol.  8105. pp. 119–131 . doi : 10.1007/978-3-642-40722-2_13 . ISBN  978-3-642-40721-5.
  • Código LEPOR-google
  • LEPOR y hLEPOR en Git
  • hLEPOR
  • EBLEU
  • HPPR
  • BLEU
  • Medida F
  • METEORITO
  • TER