
La traducción automática puede utilizar un método basado en entradas de diccionario , lo que significa que las palabras se traducirán como lo hace un diccionario: palabra por palabra, generalmente sin mucha correlación de significado entre ellas. Las búsquedas en el diccionario pueden realizarse con o sin análisis morfológico o lematización . Si bien este enfoque de la traducción automática es probablemente el menos sofisticado, la traducción automática basada en diccionarios es ideal para la traducción de largas listas de frases a nivel suboracional (es decir, no una oración completa), por ejemplo, inventarios o catálogos simples de productos y servicios. [ 1 ]
También puede utilizarse para agilizar la traducción manual, si la persona que la realiza domina ambos idiomas y, por lo tanto, es capaz de corregir la sintaxis y la gramática.
LMT
LMT, introducido alrededor de 1990, [ 2 ] es un sistema de traducción automática basado en Prolog que funciona con diccionarios bilingües especialmente diseñados, como el Collins English-German (CEG), que han sido reescritos en un formato indexado fácilmente legible por ordenadores. Este método utiliza una base de datos léxica estructurada (LDB) para identificar correctamente las categorías de palabras del idioma de origen, construyendo así una oración coherente en el idioma de destino, basándose en un análisis morfológico rudimentario. Este sistema utiliza «marcos» [ 2 ] para identificar la posición que debe tener una palabra determinada, desde un punto de vista sintáctico, en una oración. Estos «marcos» [ 2 ] se asignan mediante convenciones lingüísticas, como UDICT en el caso del inglés.
En su forma inicial (prototipo), LMT [ 2 ] utiliza tres léxicos, a los que se accede simultáneamente: origen, transferencia y destino, aunque es posible encapsular toda esta información en un único léxico. El programa emplea una configuración léxica compuesta por dos elementos principales. El primero es un apéndice léxico codificado manualmente que contiene posibles traducciones incorrectas. El segundo consta de varios diccionarios bilingües y monolingües sobre los dos idiomas, que son el de origen y el de destino.
Traducción automática basada en ejemplos y en diccionarios
Este método de traducción automática basada en diccionarios explora un paradigma diferente al de sistemas como LMT. Un sistema de traducción automática basado en ejemplos recibe únicamente un "corpus bilingüe alineado a nivel de oración". [ 3 ] Utilizando estos datos, el programa de traducción genera un "diccionario bilingüe palabra por palabra" [ 3 ] que se utiliza para la traducción posterior.
Si bien este sistema se consideraría generalmente como una forma de traducción automática completamente distinta a la traducción automática basada en diccionarios, es importante comprender la naturaleza complementaria de estos paradigmas. Con la potencia combinada inherente a ambos sistemas, junto con el hecho de que la traducción automática basada en diccionarios funciona mejor con listas de palabras de un "diccionario bilingüe palabra por palabra" [ 3 ], se demuestra que la combinación de estos dos motores de traducción generaría una herramienta de traducción muy potente que, además de ser semánticamente precisa, es capaz de mejorar sus propias funcionalidades mediante bucles de retroalimentación continuos.
Un sistema que combina ambos paradigmas de forma similar a lo descrito en el párrafo anterior es el motor de traducción automática Pangloss Example-Based Machine Translation (PanEBMT) [ 3 ] . PanEBMT utiliza una tabla de correspondencia entre idiomas para crear su corpus. Además, admite múltiples operaciones incrementales sobre su corpus, lo que facilita una traducción sesgada que se utiliza para fines de filtrado.
Procesamiento de texto en paralelo
Douglas Hofstadter, a través de su obra "Le Ton beau de Marot: In Praise of the Music of Language" (Elogio de la música del lenguaje), demuestra la complejidad de la traducción. El autor elaboró y analizó decenas de posibles traducciones de un poema francés de dieciocho versos, revelando así el complejo funcionamiento interno de la sintaxis, la morfología y el significado. [ 4 ] A diferencia de la mayoría de los motores de traducción que seleccionan una única traducción basándose en la comparación directa de los textos en los idiomas de origen y destino, el trabajo de Douglas Hofstadter demuestra el nivel de error inherente a cualquier traducción cuando el significado del texto original es demasiado detallado o complejo. De este modo, se pone de relieve el problema de la alineación textual y la "estadística del lenguaje" [ 4 ] .
Estas discrepancias dieron lugar a las ideas de Martin Kay sobre la traducción y los motores de traducción en general. Como afirma Kay: «Para lograr éxitos más sustanciales en estas empresas se requiere una visión del mundo más nítida que la que se puede obtener simplemente a partir de las estadísticas de uso del lenguaje» [(página xvii) Procesamiento de texto paralelo: alineación y uso de corpus de traducción]. [ 4 ] De este modo, Kay ha vuelto a poner de relieve la cuestión del significado dentro del lenguaje y la distorsión del significado a través de los procesos de traducción.
Estructura conceptual léxica
Uno de los posibles usos de la traducción automática basada en diccionarios es facilitar la enseñanza de lenguas extranjeras (FLT). Esto se puede lograr mediante el uso de tecnología de traducción automática, así como de lingüística, semántica y morfología, para producir diccionarios a gran escala [ 5 ] en prácticamente cualquier idioma. El desarrollo de la semántica léxica y la lingüística computacional entre 1990 y 1996 permitió el florecimiento del procesamiento del lenguaje natural (PLN), que adquirió nuevas capacidades y, en general, benefició a la traducción automática. [ 5 ]
La «Estructura Conceptual Léxica» (ECL) es una representación independiente del idioma. Se utiliza principalmente en la enseñanza de lenguas extranjeras, especialmente en el procesamiento del lenguaje natural. La ECL también ha demostrado ser una herramienta indispensable para la traducción automática de cualquier tipo, como la traducción automática basada en diccionarios. En general, uno de los objetivos principales de la ECL es «demostrar que los sentidos de los verbos sinónimos comparten patrones distribucionales». [ 5 ]
"DKvec"
"DKvec es un método para extraer léxicos bilingües a partir de corpus paralelos ruidosos, basado en las distancias de llegada de las palabras en dichos corpus". Este método surgió como respuesta a dos problemas que aquejan la extracción estadística de léxicos bilingües: "(1) ¿Cómo se pueden utilizar los corpus paralelos ruidosos? (2) ¿Cómo se pueden utilizar los corpus no paralelos pero comparables?" [ 6 ]
El método "DKvec" ha demostrado ser invaluable para la traducción automática en general, debido al asombroso éxito que ha tenido en pruebas realizadas con corpus paralelos ruidosos de inglés-japonés e inglés-chino. Las cifras de precisión "muestran una precisión del 55,35 % en un corpus pequeño y del 89,93 % en un corpus más grande". [ 6 ] Con cifras tan impresionantes, es seguro asumir el inmenso impacto que métodos como "DKvec" han tenido en la evolución de la traducción automática en general, especialmente en la traducción automática basada en diccionarios.
Los algoritmos utilizados para extraer corpus paralelos en formato bilingüe explotan las siguientes reglas para lograr una precisión y calidad general satisfactorias: [ 6 ]
- Las palabras tienen un solo significado por corpus.
- Cada palabra tiene una única traducción por corpus.
- No faltan traducciones en el documento de destino.
- Las frecuencias de aparición de palabras bilingües son comparables.
- Las posiciones de aparición de palabras bilingües son comparables.
Estos métodos pueden utilizarse para generar o buscar patrones de ocurrencia que, a su vez, se utilizan para producir vectores de ocurrencia binarios que son utilizados por el método "DKvec".
Historia de la traducción automática
La historia de la traducción automática (TA) comienza a mediados de la década de 1940. Probablemente, la traducción automática fue la primera vez que se utilizaron computadoras para fines no numéricos. La traducción automática despertó un gran interés en la investigación durante las décadas de 1950 y 1960, seguido de un estancamiento hasta la década de 1980. [ 7 ] Después de la década de 1980, la traducción automática volvió a ser una práctica común, gozando de una popularidad aún mayor que en las décadas de 1950 y 1960, así como de una rápida expansión, basada en gran medida en el enfoque de corpus de texto.
El concepto básico de traducción automática se remonta al siglo XVII, a las especulaciones sobre "lenguas universales y diccionarios mecánicos". [ 7 ] Las primeras sugerencias prácticas de traducción automática fueron hechas en 1933 por Georges Artsrouni en Francia y Petr Trojanskij en Rusia. Ambos habían patentado máquinas que creían que podían usarse para traducir el significado de un idioma a otro. "En junio de 1952, Yehoshua Bar-Hillel organizó la primera conferencia de traducción automática en el MIT". [ 7 ] El 7 de enero de 1954, una convención de traducción automática en Nueva York, patrocinada por IBM, sirvió para popularizar el campo. La popularidad de la convención se debió a la traducción de oraciones cortas del inglés al ruso. Esta hazaña de ingeniería cautivó al público y a los gobiernos de EE. UU. y la URSS, lo que impulsó una financiación a gran escala para la investigación en traducción automática. [ 7 ] Aunque el entusiasmo por la traducción automática era extremadamente alto, las limitaciones técnicas y de conocimiento llevaron a la desilusión con respecto a lo que la traducción automática era realmente capaz de hacer, al menos en ese momento. De este modo, la traducción automática perdió popularidad hasta la década de 1980, cuando los avances en lingüística y tecnología contribuyeron a revitalizar el interés por este campo.
Recuperación de información translingüe
La recuperación de información translingüe (TLIR) consiste en proporcionar una consulta en un idioma y buscar en colecciones de documentos en uno o más idiomas diferentes. La mayoría de los métodos de TLIR se pueden clasificar en dos categorías: enfoques estadísticos de recuperación de información y traducción de consultas. La TLIR basada en traducción automática funciona de dos maneras: o bien la consulta se traduce al idioma de destino, o bien se utiliza la consulta original para la búsqueda, mientras que la colección de posibles resultados se traduce al idioma de la consulta y se utiliza para referencias cruzadas. Ambos métodos tienen ventajas y desventajas, a saber: [ 8 ]
- La precisión de la traducción —la corrección de cualquier traducción automática— depende del tamaño del texto traducido; por lo tanto, los textos o palabras cortos pueden presentar un mayor grado de errores semánticos y ambigüedades léxicas, mientras que un texto más extenso puede proporcionar contexto, lo que ayuda a desambiguar el texto.
- Precisión en la recuperación: siguiendo la misma lógica expuesta anteriormente, es preferible traducir documentos completos en lugar de consultas, ya que es más probable que los textos extensos sufran una menor pérdida de significado en la traducción que las consultas cortas.
- Practicidad: a diferencia de los puntos anteriores, traducir consultas breves es la mejor opción. Esto se debe a que es fácil traducir textos cortos, mientras que traducir bibliotecas completas requiere muchos recursos, además de que el volumen de dicha tarea implica la indexación de los nuevos documentos traducidos.
Todos estos puntos demuestran que la traducción automática basada en diccionarios es la forma de traducción más eficiente y fiable al trabajar con TLIR. Esto se debe a que el proceso "busca cada término de consulta en un diccionario bilingüe de propósito general y utiliza todas sus posibles traducciones". [ 8 ]
Traducción automática de idiomas muy parecidos
Los ejemplos de RUSLAN, un sistema de traducción automática basado en diccionarios entre checo y ruso, y CESILKO, un sistema de traducción automática basado en diccionarios entre checo y eslovaco, muestran que en el caso de lenguas muy cercanas, los métodos de traducción más sencillos son más eficientes, rápidos y fiables. [ 9 ]
El sistema RUSLAN se creó para demostrar la hipótesis de que las lenguas emparentadas son más fáciles de traducir. Su desarrollo comenzó en 1985 y se interrumpió cinco años después por falta de financiación. Las lecciones aprendidas del experimento RUSLAN demuestran que un enfoque de traducción basado en la transferencia mantiene su calidad independientemente de la similitud entre las lenguas. Los dos principales obstáculos de los «sistemas completos basados en la transferencia» [ 9 ] son la complejidad y la falta de fiabilidad del análisis sintáctico. [ 10 ]
Recuperación de información multilingüe (MLIR)
Los sistemas de recuperación de información clasifican los documentos según medidas de similitud estadística basadas en la coocurrencia de términos en consultas y documentos. El sistema MLIR se creó y optimizó para facilitar la traducción de consultas mediante diccionarios. Esto se debe a que las consultas suelen ser cortas, de un par de palabras, lo que, si bien no proporciona mucho contexto, resulta más factible que traducir documentos completos por razones prácticas. A pesar de todo esto, el sistema MLIR depende en gran medida de muchos recursos, como el software de detección automática de idiomas . [ 11 ]
Véase también
Bibliografía
- ↑ Uwe Muegge (2006), "Una excelente aplicación para la traducción automática deficiente: traducción automática de una gran base de datos", en Elisabeth Gräfe (2006; ed.), Actas de la Conferencia Anual de la Sociedad Alemana de Comunicadores Técnicos , Stuttgart: tekom, 18–21.
- 1 2 3 4 Mary S. Neff Michael C. McCord (1990). "ADQUISICIÓN DE DATOS LÉXICOS DE RECURSOS DE DICCIONARIOS LEGIBLES POR MÁQUINA PARA LA TRADUCCIÓN AUTOMÁTICA". IBM TJ Watson Research Center, PO Box 704, Yorktown Heights, Nueva York 10598: 85– 90. CiteSeerX 10.1.1.132.8355 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - 1 2 3 4 Ralf D. Brown. "Extracción automatizada de diccionarios para traducción basada en ejemplos "sin conocimiento previo"" (PDF) . Instituto de Tecnologías del Lenguaje (Centro de Traducción Automática) Universidad Carnegie Mellon Pittsburgh, PA 15213-3890 EE. UU. Archivado del original (PDF) el 6 de julio de 2008. Recuperado el 2 de noviembre de 2015 .
- 1 2 3 Jean Véronis (2001). Procesamiento paralelo de texto: alineación y uso de corpus de traducción . Vol. 27. Dordrecht: Kluwer Academic Publishers (Serie de tecnología de texto, habla y lenguaje, editada por Nancy Ide y Jean Véronis, volumen 13), 2000, xxiii+402 pp; tapa dura. pp. 592–595 . doi : 10.1162/coli.2000.27.4.592 . ISBN 978-0-7923-6546-4. S2CID 14796449 .
{{cite book}}:|journal=ignorado ( ayuda ) - 1 2 3 Dorr, Bonnie J. (1997). "Construcción de diccionarios a gran escala para la enseñanza de lenguas extranjeras y la traducción automática interlingüística". Traducción automática . 12 (4): 271– 322. doi : 10.1023/A:1007965530302 . S2CID 1548552 .
- 1 2 3 David Farwell Laurie Gerber Eduard Hovy (1998). Traducción automática y la sopa de información . Notas de clase en informática. Vol. 1529. Clasificación de materias CR (1998): I.2.7, H.3, F.4.3, H.5, J.5 Springer-Verlag Berlín Heidelberg Nueva York. doi : 10.1007/3-540-49478-2 . hdl : 11693/27676 . ISBN 978-3-540-65259-5. S2CID 19677267 .
- 1 2 3 4 J. Hutchins (enero de 2006). «Traducción automática: historia». págs. 375–383 . doi : 10.1016/B0-08-044854-2/00937-8 . ISBN 9780080448541.
{{cite book}}:|journal=ignorado ( ayuda ) ; Falta o está vacío|title=( ayuda ) - 1 2 Yiming Yang; Jaime G. Carbonell; Ralf D. Brown; Robert E. Frederking (agosto de 1998). "Recuperación de información translingüística: aprendizaje a partir de corpus bilingües" . Inteligencia Artificial . 103 ( 1–2 ). Instituto de Tecnologías del Lenguaje, Escuela de Ciencias de la Computación, Universidad Carnegie Mellon, 5000 Forbes Avenue, Pittsburgh, PA 15213, EE. UU.: 323–345 . doi : 10.1016/S0004-3702(98)00063-0 .
- 1 2 Jan HAJIC; Jan HRIC; Vladislav KUBON (2000). "Traducción automática de lenguas muy cercanas" . Actas de la sexta conferencia sobre procesamiento del lenguaje natural aplicado . pp. 7–12 . doi : 10.3115/974147.974149 . S2CID 8355580. Consultado el 2 de noviembre de 2015 .
- ↑ Ari Pirkola (1998). "Los efectos de la estructura de consulta y la configuración del diccionario en la recuperación de información multilingüe basada en diccionarios". Actas de la 21.ª conferencia internacional anual ACM SIGIR sobre investigación y desarrollo en recuperación de información . Departamento de Estudios de la Información, Universidad de Tampere. pp. 55–63 . CiteSeerX 10.1.1.20.3202 . doi : 10.1145/290941.290957 . ISBN 978-1581130157. S2CID 16199588 . Consultado el 2 de noviembre de 2015 .
- ↑ David A. Hull; Gregory Grefenstette (1996). «Consultas en diferentes idiomas: Un enfoque basado en diccionarios para la recuperación de información multilingüe». Actas de la 19.ª conferencia internacional anual ACM SIGIR sobre investigación y desarrollo en recuperación de información - SIGIR '96 . Rank Xerox Research Centre, 6 chemin de Maupertuis, 38240 Meylan, Francia. pp. 49–57 . doi : 10.1145/243199.243212 . ISBN 978-0897917926. S2CID 1274065 .
- Traducción automática