Articulo de referencia

Traducción automática estadística

La traducción automática estadística ( TAE ) es un método de traducción automática en el que las traducciones se generan a partir de modelos estadísticos cuyos parámetros se der...

La traducción automática estadística ( TAE ) es un método de traducción automática en el que las traducciones se generan a partir de modelos estadísticos cuyos parámetros se derivan del análisis de corpus de texto bilingües . Este método estadístico contrasta con los métodos de traducción automática basados ​​en reglas, así como con la traducción automática basada en ejemplos [ 1 ] , que sustituyó al método anterior basado en reglas, el cual requería la descripción explícita de cada regla lingüística, lo cual era costoso y, a menudo, no se generalizaba a otros idiomas.

Las primeras ideas de traducción automática estadística fueron introducidas por Warren Weaver en 1949, [ 2 ] incluyendo las ideas de aplicar la teoría de la información de Claude Shannon . La traducción automática estadística fue reintroducida a finales de la década de 1980 y principios de la de 1990 por investigadores del Centro de Investigación Thomas J. Watson de IBM . [ 3 ] [ 4 ] [ 5 ] Antes de la introducción de la traducción automática neuronal, era, con mucho, el método de traducción automática más estudiado.

Base

La idea detrás de la traducción automática estadística proviene de la teoría de la información . Un documento se traduce según la distribución de probabilidad.pag(mi|F){\displaystyle p(e|f)}que una cuerdami{\displaystyle e}en el idioma de destino (por ejemplo, inglés) es la traducción de una cadenaF{\displaystyle f}en el idioma de origen (por ejemplo, francés).

El problema de modelar la distribución de probabilidadpag(mi|F){\displaystyle p(e|f)}Se ha abordado de varias maneras. Un enfoque que se presta bien a la implementación informática es aplicar el teorema de Bayes , es decirpag(mi|F)pag(F|mi)pag(mi){\displaystyle p(e|f)\propto p(f|e)p(e)}donde el modelo de traducciónpag(F|mi){\displaystyle p(f|e)}es la probabilidad de que la cadena de origen sea la traducción de la cadena de destino, y el modelo de lenguajepag(mi){\displaystyle p(e)}es la probabilidad de ver esa cadena en el idioma de destino. Esta descomposición es atractiva ya que divide el problema en dos subproblemas. Encontrar la mejor traducciónmi~{\displaystyle {\tilde {e}}}se hace eligiendo el que da la mayor probabilidad:

mi~=argramomáximomimipag(mi|F)=argramomáximomimipag(F|mi)pag(mi){\displaystyle {\tilde {e}}=arg\max _{e\in e^{*}}p(e|f)=arg\max _{e\in e^{*}}p(f|e)p(e)}.

Para una implementación rigurosa de esto, habría que realizar una búsqueda exhaustiva recorriendo todas las cadenas.mi{\displaystyle e^{*}}en el idioma nativo. La búsqueda eficiente es tarea de un decodificador de traducción automática que utiliza la cadena de caracteres extranjera, heurísticas y otros métodos para limitar el espacio de búsqueda y, al mismo tiempo, mantener una calidad aceptable. Este equilibrio entre calidad y tiempo de uso también se observa en el reconocimiento de voz .

Dado que los sistemas de traducción no pueden almacenar todas las cadenas de texto originales y sus traducciones, un documento se suele traducir frase por frase. Los modelos de lenguaje se suelen aproximar mediante modelos de n -gramas suavizados , y se han aplicado enfoques similares a los modelos de traducción, pero esto introduce una complejidad adicional debido a las diferentes longitudes de las frases y el orden de las palabras en los distintos idiomas.

Los modelos de traducción estadística se basaban inicialmente en palabras (modelos 1-5 del modelo oculto de Markov de IBM de Stephan Vogel [ 6 ] y modelo 6 de Franz-Joseph Och [ 7 ] ), pero se lograron avances significativos con la introducción de modelos basados ​​en frases . [ 8 ] Trabajos posteriores incorporaron sintaxis o estructuras cuasi-sintácticas. [ 9 ]

Beneficios

Los beneficios más citados de la traducción automática estadística (SMT) frente al enfoque basado en reglas son:

  • Uso más eficiente de los recursos humanos y de datos.
    • Existen numerosos corpus paralelos en formato legible por máquina e incluso más datos monolingües.
    • Por lo general, los sistemas SMT no están diseñados para ningún par de idiomas específico.
  • Traducciones más fluidas gracias al uso de un modelo lingüístico.

deficiencias

  • La creación de corpus puede resultar costosa.
  • Es difícil predecir y corregir errores específicos.
  • Los resultados pueden tener una fluidez superficial que enmascara problemas de traducción. [ 10 ]
  • La traducción automática estadística suele funcionar peor con pares de idiomas que presentan un orden de palabras significativamente diferente.
  • Los beneficios obtenidos en la traducción entre lenguas de Europa Occidental no son representativos de los resultados para otros pares de idiomas, debido a la menor cantidad de corpus de entrenamiento y a las mayores diferencias gramaticales.

Traducción basada en palabras

En la traducción literal, la unidad fundamental de traducción es una palabra en algún idioma natural. Por lo general, el número de palabras en las oraciones traducidas varía debido a las palabras compuestas, la morfología y las expresiones idiomáticas. La proporción entre las longitudes de las secuencias de palabras traducidas se denomina fertilidad, que indica cuántas palabras extranjeras produce cada palabra nativa. La teoría de la información asume necesariamente que cada palabra abarca el mismo concepto. En la práctica, esto no es del todo cierto. Por ejemplo, la palabra inglesa corner puede traducirse al español como rincón o esquina , dependiendo de si se refiere a su ángulo interno o externo.

La traducción simple basada en palabras no puede traducir entre idiomas con diferente fertilidad. Los sistemas de traducción basados ​​en palabras pueden manejarse con relativa facilidad con alta fertilidad, de modo que puedan asignar una sola palabra a varias, pero no al revés . Por ejemplo, si traducimos del inglés al francés, cada palabra en inglés puede producir cualquier número de palabras en francés , a veces ninguna. Pero no hay forma de agrupar dos palabras en inglés para producir una sola palabra en francés.

Un ejemplo de un sistema de traducción basado en palabras es el paquete GIZA++ disponible gratuitamente ( GPLed ), que incluye el programa de entrenamiento para los modelos IBM y el modelo HMM y el Modelo 6. [ 7 ]

La traducción basada en palabras no se usa ampliamente hoy en día; los sistemas basados ​​en frases son más comunes. La mayoría de los sistemas basados ​​en frases todavía usan GIZA++ para alinear el corpus . Las alineaciones se usan para extraer frases o deducir reglas sintácticas. [ 11 ] Y la coincidencia de palabras en textos bilingües sigue siendo un problema que se debate activamente en la comunidad. Debido a la predominancia de GIZA++, ahora existen varias implementaciones distribuidas en línea. [ 12 ]

Traducción basada en frases

En la traducción basada en frases, el objetivo es reducir las restricciones de la traducción basada en palabras traduciendo secuencias completas de palabras, cuya longitud puede variar. Estas secuencias de palabras se denominan bloques o frases. Por lo general, no se trata de frases lingüísticas , sino de fraseos extraídos de corpus mediante métodos estadísticos. Se ha demostrado que restringir las frases a frases lingüísticas (grupos de palabras con motivación sintáctica, véase categorías sintácticas ) disminuye la calidad de la traducción. [ 13 ]

Las frases elegidas se asignan posteriormente de forma uno a uno basándose en una tabla de traducción de frases, y pueden reordenarse. Esta tabla podría aprenderse mediante alineación de palabras o directamente a partir de un corpus paralelo. El segundo modelo se entrena utilizando el algoritmo de maximización de la expectativa , de forma similar al modelo IBM basado en palabras . [ 14 ]

Traducción basada en la sintaxis

La traducción basada en la sintaxis se basa en la idea de traducir unidades sintácticas , en lugar de palabras individuales o cadenas de palabras (como en la traducción automática basada en frases), es decir, árboles de análisis (parciales) de oraciones/enunciados. [ 15 ] Hasta la década de 1990, con la llegada de los analizadores estocásticos potentes , la contraparte estadística de la antigua idea de la traducción basada en la sintaxis no despegó. Ejemplos de este enfoque incluyen la traducción automática basada en DOP y, posteriormente, las gramáticas libres de contexto síncronas .

Traducción jerárquica basada en frases

La traducción jerárquica basada en frases combina los enfoques de traducción basados ​​en frases y en sintaxis. Utiliza reglas gramaticales sincrónicas libres de contexto , pero las gramáticas pueden construirse mediante una extensión de los métodos de traducción basada en frases sin referencia a constituyentes sintácticos con motivación lingüística. Esta idea se introdujo por primera vez en el sistema Hiero de Chiang (2005). [ 9 ]

Modelos de lenguaje

Un modelo de lenguaje es un componente esencial de cualquier sistema de traducción automática estadística, ya que ayuda a lograr una traducción lo más fluida posible. Es una función que toma una oración traducida y devuelve la probabilidad de que la diga un hablante nativo. Un buen modelo de lenguaje, por ejemplo, asignará una mayor probabilidad a la oración "la casa es pequeña" que a "pequeña la es casa". Además del orden de las palabras , los modelos de lenguaje también pueden ayudar con la elección de palabras: si una palabra extranjera tiene múltiples traducciones posibles, estas funciones pueden proporcionar mejores probabilidades para ciertas traducciones en contextos específicos en el idioma de destino. [ 14 ]

Sistemas que implementan la traducción automática estadística

  • Yandex.Translate (cambió a un enfoque híbrido que incorpora traducción automática neuronal en 2017) [ 18 ]

Desafíos de la traducción automática estadística

Los problemas de la traducción automática estadística incluyen:

Alineación de oraciones

Es posible encontrar oraciones individuales en un idioma traducidas a varias oraciones en otro, y viceversa. [ 15 ] Las oraciones largas pueden dividirse, mientras que las cortas pueden fusionarse. Incluso existen idiomas que utilizan sistemas de escritura sin una indicación clara del final de la oración, como el tailandés . La alineación de oraciones se puede realizar mediante el algoritmo de alineación de Gale-Church . Mediante este y otros modelos matemáticos, es posible buscar y recuperar de forma eficiente la alineación de oraciones con la puntuación más alta.

Alineación de palabras

La alineación de oraciones generalmente la proporciona el corpus o se obtiene mediante el algoritmo de alineación de Gale-Church mencionado anteriormente . Sin embargo, para aprender, por ejemplo, el modelo de traducción, necesitamos saber qué palabras se alinean en un par de oraciones de origen-destino. Los modelos IBM o el enfoque HMM fueron intentos de resolver este problema.

Las palabras funcionales que no tienen un equivalente claro en el idioma de destino representan otro problema para los modelos estadísticos. Por ejemplo, al traducir del inglés al alemán, en la oración "John does not live here", la palabra "does" no tiene una alineación clara en la oración traducida "John wohnt hier nicht". Mediante razonamiento lógico, puede estar alineada con las palabras "wohnt" (ya que contiene información gramatical para la palabra inglesa "live") o "nicht" (ya que solo aparece en la oración porque está negada), o puede estar desalineada. [ 14 ]

Anomalías estadísticas

Un ejemplo de tal anomalía es la frase "Tomé el tren a Berlín", que se traduce erróneamente como "Tomé el tren a París" debido a la abundancia estadística de "tren a París" en el conjunto de datos de entrenamiento.

Modismo y registro

Dependiendo del corpus utilizado, el uso de modismos y registros lingüísticos podría no recibir una traducción que represente con precisión la intención original. Por ejemplo, el popular corpus bilingüe canadiense Hansard consiste principalmente en ejemplos de discursos parlamentarios, donde "¡Hear, Hear!" se asocia frecuentemente con "¡Bravo!". Utilizar un modelo basado en este corpus para traducir el habla cotidiana en un registro conversacional daría como resultado una traducción incorrecta de la palabra " hear " como "¡Bravo! ". [ 19 ]

Este problema está relacionado con la alineación de palabras, ya que en contextos muy específicos la expresión idiomática se alineaba con palabras que daban como resultado una expresión idiomática del mismo significado en la lengua meta. Sin embargo, es improbable, ya que la alineación generalmente no funciona en otros contextos. Por esa razón, los modismos solo podían someterse a alineación sintagmática, ya que no podían descomponerse más sin perder su significado. Este problema era específico de la traducción basada en palabras. [ 14 ]

Diferentes órdenes de palabras

El orden de las palabras varía en los idiomas. Se puede establecer una clasificación nombrando el orden típico del sujeto (S), el verbo (V) y el objeto (O) en una oración; por ejemplo, se puede hablar de lenguas SVO o VSO. También existen otras diferencias en el orden de las palabras, como la ubicación de los modificadores de los sustantivos o el uso de las mismas palabras para formular preguntas o afirmaciones.

En el reconocimiento de voz , la señal de voz y su representación textual correspondiente se pueden mapear entre sí en bloques ordenados. Esto no siempre ocurre con el mismo texto en dos idiomas. En la traducción automática estadística (SMT), el traductor automático solo puede procesar secuencias cortas de palabras, y el programador debe considerar el orden de las palabras. Entre las soluciones propuestas se incluyen modelos de reordenamiento, donde se estima una distribución de cambios de ubicación para cada elemento de la traducción a partir de un bitexto alineado. Los diferentes cambios de ubicación se pueden clasificar con la ayuda del modelo de lenguaje y seleccionar el mejor.

Palabras fuera del vocabulario (OOV, por sus siglas en inglés)

Los sistemas de traducción automática estadística (SMT) suelen almacenar las distintas formas de las palabras como símbolos separados, sin ninguna relación entre sí, y las palabras o frases que no se encuentran en los datos de entrenamiento no se pueden traducir. Esto puede deberse a la falta de datos de entrenamiento, a cambios en el ámbito humano en el que se utiliza el sistema o a diferencias morfológicas.

Véase también

Notas y referencias

  1. Koehn, Philipp (2009). «Introducción». Traducción automática estadística . Cambridge University Press. pág.  27. doi : 10.1017/CBO9780511815829.002 . ISBN 978-0521874151Recuperado el 22 de marzo de 2015. La traducción automática estadística está relacionada con otros métodos de traducción automática basados ​​en datos, como los trabajos anteriores sobre traducción automática basada en ejemplos. Esto contrasta con los sistemas que se basan en reglas elaboradas manualmente.
  2. W. Weaver (1955). Traducción (1949). En: Traducción automática de idiomas , MIT Press, Cambridge, MA.
  3. P. Brown; John Cocke ; S. Della Pietra; V. Della Pietra; Frederick Jelinek ; Robert L. Mercer ; P. Roossin (1988). "Un enfoque estadístico para la traducción de idiomas" . Coling'88 . 1. Asociación de Lingüística Computacional: 71–76 . Recuperado el 22 de marzo de 2015 .
  4. P. Brown; John Cocke ; S. Della Pietra; V. Della Pietra; Frederick Jelinek ; John D. Lafferty ; Robert L. Mercer ; P. Roossin (1990). "Un enfoque estadístico para la traducción automática" . Lingüística Computacional . 16 (2). MIT Press: 79–85 . Recuperado el 22 de marzo de 2015 .
  5. P. Brown; S. Della Pietra; V. Della Pietra; R. Mercer ( 1993). "Las matemáticas de la traducción automática estadística: estimación de parámetros" . Lingüística Computacional . 19 (2). MIT Press: 263–311 . Recuperado el 22 de marzo de 2015 .
  6. S. Vogel, H. Ney y C. Tillmann. 1996. Alineación de palabras basada en HMM en traducción estadística . En COLING '96: 16.ª Conferencia Internacional sobre Lingüística Computacional, págs. 836-841, Copenhague, Dinamarca.
  7. 1 2 Och, Franz Josef; Ney, Hermann (2003). "Una comparación sistemática de varios modelos de alineación estadística" . Lingüística Computacional . 29 : 19–51 . doi : 10.1162/089120103321337421 .
  8. P. Koehn, FJ Och y D. Marcu (2003). Traducción estadística basada en frases . En Actas de la Conferencia Conjunta sobre Tecnologías del Lenguaje Humano y la Reunión Anual del Capítulo Norteamericano de la Asociación de Lingüística Computacional (HLT/NAACL) .
  9. 1 2 D. Chiang (2005). Un modelo jerárquico basado en frases para la traducción automática estadística . En Actas de la 43.ª Reunión Anual de la Asociación de Lingüística Computacional (ACL'05) .
  10. Zhou, Sharon (25 de julio de 2018). "¿Ha superado la IA a los humanos en traducción? ¡Ni de cerca!" . Skynet Today . Consultado el 2 de agosto de 2018 .
  11. P. Koehn, H. Hoang, A. Birch, C. Callison-Burch, M. Federico, N. Bertoldi, B. Cowan, W. Shen, C. Moran, R. Zens, C. Dyer, O. Bojar, A. Constantin, E. Herbst. 2007. Moses: Kit de herramientas de código abierto para la traducción automática estadística . ACL 2007, Sesión de demostración, Praga, República Checa
  12. Q. Gao, S. Vogel, " Implementaciones paralelas de la herramienta de alineación de palabras ", Ingeniería de software, pruebas y garantía de calidad para el procesamiento del lenguaje natural, págs. 49-57, junio de 2008
  13. Philipp Koehn, Franz Josef Och, Daniel Marcu: Traducción estadística basada en frases (2003)
  14. 1 2 3 4 Koehn, Philipp (2010). Traducción automática estadística . Cambridge University Press. ISBN 978-0-521-87415-1.
  15. 1 2 Philip Williams; Rico Sennrich; Matt Post; Philipp Koehn (1 de agosto de 2016). Traducción automática estadística basada en sintaxis . Morgan & Claypool Publishers. ISBN 978-1-62705-502-4.
  16. Turovsky, Barak (15 de noviembre de 2016). "Encontrado en la traducción: oraciones más precisas y fluidas en Google Translate" . Google . Consultado el 3 de octubre de 2019 .
  17. "Traducción automática" . Microsoft Translator for Business . Consultado el 3 de octubre de 2019 .
  18. "Un modelo es mejor que dos. Yandex.Translate lanza un sistema híbrido de traducción automática" . Blog de Yandex . 14 de septiembre de 2017. Consultado el 3 de octubre de 2019 .
  19. WJ Hutchins y H. Somers. (1992). Introducción a la traducción automática , 18.3:322. ISBN 978-0-12-362830-5
  • Lista comentada de recursos estadísticos de procesamiento del lenguaje natural : incluye enlaces a software de traducción automática estadística de libre acceso.

Obtenido de " https://en.wikipedia.org/w/index.php?title=Statistical_machine_translation&oldid=1360867094 "