Articulo de referencia

Modelos de alineación de IBM

Los modelos de alineación de IBM son una secuencia de modelos cada vez más complejos que se utilizan en la traducción automática estadística para entrenar un modelo de traducció...

Los modelos de alineación de IBM son una secuencia de modelos cada vez más complejos que se utilizan en la traducción automática estadística para entrenar un modelo de traducción y un modelo de alineación, comenzando con probabilidades de traducción léxica y avanzando hacia la reordenación y la duplicación de palabras. [ 1 ] [ 2 ] Estos modelos sustentaron la mayoría de los sistemas de traducción automática estadística durante casi veinte años, desde principios de la década de 1990, hasta que la traducción automática neuronal comenzó a dominar. Estos modelos ofrecen una formulación probabilística basada en principios y una inferencia (en su mayoría) manejable. [ 3 ]

Los modelos de alineación de IBM se publicaron por partes en 1988 [ 4 ] y 1990, [ 5 ] y la serie completa se publicó en 1993. [ 1 ] Todos los autores del artículo de 1993 posteriormente se unieron al fondo de cobertura Renaissance Technologies . [ 6 ]

El trabajo original sobre traducción automática estadística en IBM propuso cinco modelos, y posteriormente se propuso un sexto modelo. La secuencia de los seis modelos se puede resumir de la siguiente manera:

  • Modelo 1: traducción léxica
  • Modelo 2: modelo de alineación absoluta adicional
  • Modelo 3: modelo de fertilidad adicional
  • Modelo 4: se agregó el modelo de alineación relativa
  • Modelo 5: problema de deficiencia fija.
  • Modelo 6: Modelo 4 combinado con un modelo de alineación HMM de forma logarítmica lineal.

Configuración matemática

El modelo de alineación de IBM traduce la traducción como un modelo de probabilidad condicional . Para cada oración en idioma de origen ("extranjero")F{\displaystyle f}, generamos una oración en el idioma de destino ("inglés")mi{\displaystyle e}y una alineacióna{\displaystyle a}. El problema entonces es encontrar un buen modelo estadístico parapag(mi,a|F){\displaystyle p(e,a|f)}, la probabilidad de que generemos una oración en idioma inglésmi{\displaystyle e}y una alineacióna{\displaystyle a}dada una sentencia extranjeraF{\displaystyle f}.

El significado de una alineación se vuelve cada vez más complejo a medida que aumenta el número de versión del modelo. Consulte el Modelo 1 para obtener la versión más sencilla y comprensible.

Modelo 1

Alineación de palabras

Dado cualquier par de oraciones en inglés extranjero(mi,F){\displaystyle (e,f)}, una alineación para el par de oraciones es una función de tipo{1,.,...,lmi}{0,1,.,...,lF}{\displaystyle \{1,.,...,l_{e}\}\to \{0,1,.,...,l_{f}\}}. Es decir, asumimos que la palabra inglesa en la ubicacióni{\displaystyle i}se "explica" por la palabra extranjera en la ubicacióna(i){\displaystyle a(i)}Por ejemplo, consideremos el siguiente par de oraciones.

Seguramente lloverá mañana --明日 は きっと 雨 だ

Podemos hacer coincidir algunas palabras en inglés con sus correspondientes palabras en japonés, pero no todas:

eso ->  ?

voluntad ->  ?

seguramente -> きっと

lluvia -> 雨

mañana -> 明日

Esto generalmente sucede debido a las diferentes gramáticas y convenciones del habla en diferentes idiomas. Las oraciones en inglés requieren un sujeto, y cuando no hay un sujeto disponible, se usa el pronombre mudo it . Los verbos japoneses no tienen formas diferentes para el futuro y el presente, y el futuro está implícito en el sustantivo 明日 (mañana). Por el contrario, el marcador de temaは y la palabra gramatical だ (aproximadamente "ser") no corresponden a ninguna palabra en la oración en inglés. Entonces, podemos escribir la alineación como

1 -> 0; 2 -> 0; 3 -> 3; 4 -> 4; 5 -> 1

donde 0 significa que no hay una alineación correspondiente.

Así, vemos que la función de alineación es en general una función de tipo{1,.,...,lmi}{0,1,.,...,lF}{\displaystyle \{1,.,...,l_{e}\}\to \{0,1,.,...,l_{f}\}}.

Los modelos futuros permitirán que un mismo idioma inglés se alinee con múltiples palabras extranjeras.

Modelo estadístico

Dada la definición de alineación anterior, podemos definir el modelo estadístico utilizado por el Modelo 1:

  • Comience con un "diccionario". Sus entradas son de format(mii|Fj){\displaystyle t(e_{i}|f_{j})}, lo cual puede interpretarse como decir "la palabra extranjera"Fj{\displaystyle f_{j}}se traduce a la palabra inglesamii{\displaystyle e_{i}}con probabilidadt(mii|Fj){\displaystyle t(e_{i}|f_{j})}".
  • Tras recibir una sentencia extranjeraF{\displaystyle f}con longitudlF{\displaystyle l_{f}}Primero generamos una oración en inglés de longitudlmi{\displaystyle l_{e}}uniformemente en un rangoUnorteiFormetro[1,2,...,norte]{\displaystyle Uniform[1,2,...,N]}. En particular, no depende deF{\displaystyle f}olF{\displaystyle l_{f}}.
  • Luego, generamos una alineación uniforme en el conjunto de todas las funciones de alineación posibles.{1,.,...,lmi}{0,1,.,...,lF}{\displaystyle \{1,.,...,l_{e}\}\to \{0,1,.,...,l_{f}\}}.
  • Finalmente, para cada palabra en inglésmi1,mi2,...milmi{\ Displaystyle e_ {1}, e_ {2},... e_ {l_ {e}}}, generar cada una independientemente de cualquier otra palabra en inglés. Para la palabramii{\displaystyle e_{i}}, generarlo segúnt(mii|Fa(i)){\displaystyle t(e_{i}|f_{a(i)})}.

Juntos, tenemos la probabilidadpag(mi,a|F)=1/norte(1+lF)lmii=1lmit(mii|Fa(i)){\displaystyle p(e,a|f)={\frac {1/N}{(1+l_{f})^{l_{e}}}}\prod _{i=1}^{l_{e}}t(e_{i}|f_{a(i)})}El modelo 1 de IBM utiliza supuestos muy simplistas sobre el modelo estadístico, para permitir que el siguiente algoritmo tenga una solución analítica.

Aprendizaje a partir de un corpus

Si no se proporciona un diccionario al principio, pero tenemos un corpus de pares inglés-lengua extranjera{(mi(k),F(k))}k{\displaystyle \{(e^{(k)},f^{(k)})\}_{k}}(sin información de alineación), entonces el modelo se puede convertir al siguiente formato:

  • parámetros fijos: las oraciones extranjeras{F(k)}k{\displaystyle \{f^{(k)}\}_{k}}.
  • parámetros aprendibles: las entradas del diccionariot(mii|Fj){\displaystyle t(e_{i}|f_{j})}.
  • variables observables: las oraciones en inglés{mi(k)}k{\displaystyle \{e^{(k)}\}_{k}}.
  • variables latentes: los alineamientos{a(k)}k{\displaystyle \{a^{(k)}\}_{k}}

En esta forma, este es precisamente el tipo de problema que resuelve el algoritmo de maximización de la esperanza . Debido a las suposiciones simplistas, el algoritmo tiene una solución analítica y computable de manera eficiente, que es la solución de las siguientes ecuaciones:{máximotkia(k)t(a(k)|mi(k),F(k))lnt(mii(k)|Fa(k)(i)(k))incógnitat(miincógnita|Fy)=1y{\displaystyle {\begin{cases}\max _{t'}\sum _{k}\sum _{i}\sum _{a^{(k)}}t(a^{(k)}|e^{(k)},f^{(k)})\ln t(e_{i}^{(k)}|f_{a^{(k)}(i)}^{(k)})\\\sum _{x}t'(e_{x}|f_{y})=1\quad \forall y\end{cases}}}Esto se puede resolver mediante multiplicadores de Lagrange , y luego simplificar. Para una derivación detallada del algoritmo, véase [ 7 ] capítulo 4 y [ 8 ] .

En resumen, el algoritmo EM funciona de la siguiente manera:

ENTRADA. Un corpus de pares de oraciones en inglés y otros idiomas.{(mi(k),F(k))}k{\displaystyle \{(e^{(k)},f^{(k)})\}_{k}}

INICIALIZAR. Matriz de probabilidades de traslacionest(miincógnita|Fy){\displaystyle t(e_{x}|f_{y})}.

Esto podría ser uniforme o aleatorio. Solo se requiere que cada entrada sea positiva y para caday{\displaystyle y}, la probabilidad suma uno:incógnitat(miincógnita|Fy)=1{\displaystyle \sum _{x}t(e_{x}|f_{y})=1}.

BUCLE. hastat(miincógnita|Fy){\displaystyle t(e_{x}|f_{y})}converge:

t(miincógnita|Fy)t(miincógnita|Fy)λyk,i,jδ(miincógnita,mii(k))δ(Fy,Fj(k))jt(mii(k)|Fj(k)){\displaystyle t(e_{x}|f_{y})\leftarrow {\frac {t(e_{x}|f_{y})}{\lambda _{y}}}\sum _{k,i,j}{\frac {\delta (e_{x},e_{i}^{(k)})\delta (f_{y},f_{j}^{(k)})}{\sum _{j'}t(e_{i}^{(k)}|f_{j'}^{(k)})}}}
donde cadaλy{\displaystyle \lambda _{y}}es una constante de normalización que garantiza que cadaincógnitat(miincógnita|Fy)=1{\displaystyle \sum _{x}t(e_{x}|f_{y})=1}.

DEVOLVER.t(miincógnita|Fy){\displaystyle t(e_{x}|f_{y})}.

En la fórmula anterior,δ{\displaystyle \delta }es la función delta de Dirac ; es igual a 1 si las dos entradas son iguales y 0 en caso contrario. La notación de índices es la siguiente:

k{\displaystyle k}abarca pares de oraciones en inglés y en idiomas extranjeros en el corpus;

i{\displaystyle i}abarca palabras en oraciones en inglés;

j{\displaystyle j}abarca palabras en oraciones en idioma extranjero;

incógnita{\displaystyle x}abarca todo el vocabulario de palabras en inglés del corpus;

y{\displaystyle y}Abarca todo el vocabulario de palabras extranjeras del corpus.

Limitaciones

Existen varias limitaciones en el modelo 1 de IBM. [ 7 ]

  • Sin fluidez: Dado cualquier par de oraciones(mi,F){\displaystyle (e,f)}Cualquier permutación de la oración en inglés es igualmente probable:pag(mi|F)=pag(mi|F){\displaystyle p(e|f)=p(e'|f)}para cualquier permutación de la oración en inglésmi{\displaystyle e}enmi{\displaystyle e'}.
  • Sin preferencia de longitud: La probabilidad de cada longitud de traducción es igual:mi tiene longitud lpag(mi|F)=1norte{\displaystyle \sum _{e{\text{ has length }}l}p(e|f)={\frac {1}{N}}}para cualquierl{1,2,...,norte}{\displaystyle l\in \{1,2,...,N\}}.
  • No modela explícitamente la fertilidad: algunas palabras extranjeras tienden a producir un número fijo de palabras en inglés. Por ejemplo, para la traducción del alemán al inglés, ja generalmente se omite, y zum generalmente se traduce como uno de to the, for the, to a, for a .

Modelo 2

El modelo 2 permite que la alineación sea condicional a la longitud de las oraciones. Es decir, tenemos una distribución de probabilidad.paga(j|i,lmi,lF){\displaystyle p_{a}(j|i,l_{e},l_{f})}, que significa "la probabilidad de que la palabra inglesai{\displaystyle i}está alineado con palabra extranjeraj{\displaystyle j}, cuando la oración en inglés es de longitudlmi{\displaystyle l_{e}}y la frase extranjera es de longitudlF{\displaystyle l_{f}}".

El resto del Modelo 1 no ha cambiado. Con eso, tenemospag(mi,a|F)=1/nortei=1lmit(mii|Fa(i))paga(a(i)|i,lmi,lF){\displaystyle p(e,a|f)={1/N}\prod _{i=1}^{l_{e}}t(e_{i}|f_{a(i)})p_{a}(a(i)|i,l_{e},l_{f})}El algoritmo EM aún puede resolverse de forma cerrada, obteniéndose el siguiente algoritmo:t(miincógnita|Fy)1λyk,i,jt(mii(k)|Fj(k))paga(j|i,lmi,lF)δ(miincógnita,mii(k))δ(Fy,Fj(k))jt(mii(k)|Fj(k))paga(j|i,lmi,lF){\displaystyle t(e_{x}|f_{y})\leftarrow {\frac {1}{\lambda _{y}}}\sum _{k,i,j}{\frac {t(e_{i}^{(k)}|f_{j}^{(k)})p_{a}(j|i,l_{e},l_{f})\delta (e_{x},e_{i}^{(k)})\delta (f_{y},f_{j}^{(k)})}{\sum _{j'}t(e_{i}^{(k)}|f_{j'}^{(k)})p_{a}(j'|i,l_{e},l_{f})}}}paga(j|i,lmi,lF)1λi,lmi,lFkt(mii(k)|Fj(k))paga(j|i,lmi,lF)δ(miincógnita,mii(k))δ(Fy,Fj(k))δ(lmi,lmi(k))δ(lF,lF(k))jt(mii(k)|Fj(k))paga(j|i,lmi,lF){\displaystyle p_{a}(j|i,l_{e},l_{f})\leftarrow {\frac {1}{\lambda _{i,l_{e},l_{f}}}}\sum _{k}{\frac {t(e_{i}^{(k)}|f_{j}^{(k)})p_{a}(j|i,l_{e},l_{f})\delta (e_{x},e_{i}^{(k)})\delta (f_{y},f_{j}^{(k)})\delta (l_{e},l_{e}^{(k)})\delta (l_{f},l_{f}^{(k)})}{\sum _{j'}t(e_{i}^{(k)}|f_{j'}^{(k)})p_{a}(j'|i,l_{e},l_{f})}}}dóndeλ{\displaystyle \lambda }siguen siendo factores de normalización. Consulte la sección 4.4.1 [ 7 ] para una derivación y un algoritmo.

Modelo 3

El problema de la fertilidad se aborda en el Modelo 3 de IBM. La fertilidad se modela utilizando una distribución de probabilidad definida como:

norte(ϕF){\displaystyle n(\phi \lor f)}

Por cada palabra extranjeraj{\displaystyle j}, dicha distribución indica a cuántas palabras de salidaϕ{\displaystyle \phi }Por lo general, se traduce. Este modelo se encarga de descartar palabras de entrada porque permiteϕ=0{\displaystyle \phi =0}. Pero aún existe un problema al agregar palabras. Por ejemplo, la palabra inglesa " do" se inserta con frecuencia al negar. Este problema genera un token NULL especial cuya fertilidad también puede modelarse mediante una distribución condicional definida como:

norte(norteULL){\displaystyle n(\varnothing \lor NULL)}

El número de palabras insertadas depende de la longitud de la oración. Por eso, la inserción del token NULL se modela como un paso adicional: el paso de fertilidad. Esto aumenta el proceso de traducción del Modelo 3 de IBM a cuatro pasos:

El último paso se llama distorsión en lugar de alineación porque es posible producir la misma traducción con la misma alineación de diferentes maneras. Por ejemplo, en el ejemplo anterior, tenemos otra forma de obtener la misma alineación: [ 9 ]

  • ja NULL nie pôjde tak do do domu
  • No voy a la casa
  • No voy a la casa

El modelo IBM 3 se puede expresar matemáticamente como:

PAG(Smi,A)=i=1IΦi¡norte(Φmij)j=1Jt(Fjmiaj)j:a(j)0Jd(j|aj,I,J)(JΦ0Φ0)pag0Φ0pag1J{\displaystyle P(S\mid E,A)=\prod _{i=1}^{I}\Phi _{i}!n(\Phi \mid e_{j})*\prod _{j=1}^{J}t(f_{j}\mid e_{a_{j}})*\prod _{j:a(j)\neq 0}^{J}d(j|a_{j},I,J){\binom {J-\Phi _{0}}{\Phi _{0}}}p_{0}^{\Phi _{0}}p_{1}^{J}}

dóndeΦi{\displaystyle \Phi _{i}}representa la fertilidad demii{\displaystyle e_{i}}, cada palabra fuentes{\displaystyle s}Se le asigna una distribución de fertilidad.norte{\displaystyle n}, yI{\displaystyle I}yJ{\displaystyle J}se refieren a las longitudes absolutas de las oraciones de destino y de origen, respectivamente. [ 10 ]

Consulte la sección 4.4.2 [ 7 ] para una derivación y un algoritmo.

Modelo 4

En el Modelo 4 de IBM, cada palabra depende de la palabra previamente alineada y de las clases de palabras de las palabras circundantes. Algunas palabras tienden a reordenarse durante la traducción más que otras (por ejemplo, la inversión adjetivo-sustantivo al traducir del polaco al inglés). Los adjetivos a menudo se mueven antes del sustantivo que los precede. Las clases de palabras introducidas en el Modelo 4 resuelven este problema condicionando las distribuciones de probabilidad de estas clases. El resultado de dicha distribución es un modelo lexicalizado. Dicha distribución se puede definir de la siguiente manera:

Para la palabra inicial en el concepto:d1(j[i1]A(F[i1]),B(mij)){\displaystyle d_{1}(j-\odot _{[i-1]}\lor A(f_{[i-1]}),B(e_{j}))}

Para palabras adicionales:d1(jπi,k1B(mij)){\displaystyle d_{1}(j-\pi _{i,k-1}\lor B(e_{j}))}

dóndeA(F){\displaystyle A(f)}yB(mi){\displaystyle B(e)}Las funciones asignan palabras a sus clases de palabras ymij{\displaystyle e_{j}}yF[i1]{\displaystyle f_{[i-1]}}son distribuciones de probabilidad de distorsión de las palabras. El cept se forma alineando cada palabra de entrada.Fi{\displaystyle f_{i}}a al menos una palabra de salida. [ 11 ]

Tanto el Modelo 3 como el Modelo 4 ignoran si se eligió una posición de entrada y si la masa de probabilidad se reservó para las posiciones de entrada fuera de los límites de la oración. Esta es la razón por la que las probabilidades de todas las alineaciones correctas no suman la unidad en estos dos modelos (modelos deficientes). [ 11 ]

Modelo 5

El modelo IBM 5 reformula el modelo IBM 4 mejorando el modelo de alineación con más parámetros de entrenamiento para superar la deficiencia del modelo. [ 12 ] Durante la traducción en los modelos 3 y 4 no hay heurísticas que prohíban la colocación de una palabra de salida en una posición ya ocupada. En el modelo 5 es importante colocar las palabras solo en posiciones libres. Esto se logra rastreando el número de posiciones libres y permitiendo la colocación solo en dichas posiciones. El modelo de distorsión es similar al modelo IBM 4, pero se basa en posiciones libres. Sivj{\displaystyle v_{j}}denota el número de posiciones libres en la salida, las probabilidades de distorsión del modelo IBM 5 se definirían como: [ 1 ]

Para la palabra inicial en el concepto: d1(vjB(mij),vi1,vmetroaincógnita){\displaystyle d_{1}(v_{j}\lor B(e_{j}),v_{\odot i-1},v_{max})}

Para palabras adicionales: d1(vjvπi,k1B(mij),vmetroaincógnita){\displaystyle d_{1}(v_{j}-v_{\pi _{i,k-1}}\lor B(e_{j}),v_{max'})}

Los modelos de alineación que utilizan dependencias de primer orden, como HMM o los modelos 4 y 5 de IBM, producen mejores resultados que otros métodos de alineación. La idea principal de HMM es predecir la distancia entre posiciones consecutivas del idioma de origen. Por otro lado, el modelo 4 de IBM intenta predecir la distancia entre posiciones consecutivas del idioma de destino. Dado que se esperaba lograr una mejor calidad de alineación al utilizar ambos tipos de dependencias, HMM y el modelo 4 se combinaron de forma logarítmica lineal en el modelo 6 de la siguiente manera: [ 13 ]

pag6(F,ami)=pag4(F,ami)αpagHMETROMETRO(F,ami)a,Fpag4(F,ami)αpagHMETROMETRO(F,ami){\displaystyle p_{6}(f,a\lor e)={\frac {p_{4}(f,a\lor e)^{\alpha }*p_{HMM}(f,a\lor e)}{\sum _{a',f'}p_{4}(f',a'\lor e)^{\alpha }*p_{HMM}(f',a'\lor e)}}}

donde el parámetro de interpolaciónα{\displaystyle \alpha }se utiliza para contar el peso del Modelo 4 en relación con el modelo oculto de Markov . Una combinación log-lineal de varios modelos se puede definir comopagk(F,ami){\displaystyle p_{k}(f,a\mid e)}conk=1,2,,K{\displaystyle k=1,2,\dotsc ,K}como:

pag6(F,ami)=k=1Kpagk(F,ami)αka,Fk=1Kpagk(F,ami)αk{\displaystyle p_{6}(f,a\lor e)={\frac {\prod _{k=1}^{K}p_{k}(f,a\lor e)^{\alpha _{k}}}{\sum _{a',f'}\prod _{k=1}^{K}p_{k}(f',a'\mid e)^{\alpha _{k}}}}}

La combinación log-lineal se utiliza en lugar de la combinación lineal porquePAGr(F,ami){\displaystyle P_{r}(f,a\mid e)}Los valores suelen ser diferentes en términos de sus órdenes de magnitud para HMM e IBM Model 4. [ 14 ]

Referencias

  1. 1 2 3 Brown, Peter F. ; Pietra, Vincent J. Della; Pietra, Stephen A. Della; Mercer, Robert L. (1993-06-01). "Las matemáticas de la traducción automática estadística: estimación de parámetros" . Comput. Linguist . 19 (2): 263– 311. ISSN 0891-2017 . 
  2. "Modelos de IBM" . Wiki de la encuesta de investigación de SMT. 11 de septiembre de 2015. Consultado el 26 de octubre de 2015 .
  3. Yarin Gal; Phil Blunsom (12 de junio de 2013). "Un tratamiento bayesiano sistemático de los modelos de alineación de IBM" (PDF) . Universidad de Cambridge. Archivado del original (PDF) el 4 de marzo de 2016. Recuperado el 26 de octubre de 2015 .
  4. Brown, P.; Cocke, J.; Della Pietra, S.; Della Pietra, V.; Jelinek, F.; Mercer, R.; Roossin, P. (1988). "Un enfoque estadístico para la traducción de idiomas" . Coling Budapest 1988 Volumen 1: Conferencia Internacional sobre Lingüística Computacional .
  5. Brown, Peter F.; Cocke, John; Della Pietra, Stephen A.; Della Pietra, Vincent J.; Jelinek, Fredrick; Lafferty, John D.; Mercer, Robert L.; Roossin, Paul S. (1990). "Un enfoque estadístico para la traducción automática" . Lingüística Computacional . 16 (2): 79– 85.
  6. walutowyjohn (28 de enero de 2013). "Un regalo visionario: la familia Della Pietra financia la cátedra de imágenes biomédicas - Noticias de SBU" . Noticias de la Universidad de Stony Brook . Consultado el 6 de enero de 2025 .
  7. 1 2 3 4 Koehn, Philipp (2010). "4. Modelos basados ​​en palabras". Traducción automática estadística . Cambridge University Press. ISBN 978-0-521-87415-1.
  8. "CS288, Primavera 2020, Lección 05: Traducción automática estadística" (PDF) . Archivado (PDF) del original el 24 de octubre de 2020.
  9. Wołk K., Marasek K. (2014). Sistemas de traducción automática estadística de voz polaco-inglés para el IWSLT 2014. Actas del 11.º Taller Internacional sobre Traducción de Lenguaje Hablado, Lake Tahoe, EE. UU. arXiv : 1509.08874 .
  10. FERNÁNDEZ, Pablo Malvar. Mejora de la alineación palabra por palabra mediante información morfológica. 2008. Tesis doctoral. Universidad Estatal de San Diego.
  11. 1 2 Schoenemann, Thomas (2010). Cálculo de alineaciones óptimas para el modelo de traducción IBM-3 . Actas de la Decimocuarta Conferencia sobre Aprendizaje Computacional del Lenguaje Natural. Asociación de Lingüística Computacional. págs. 98–106 . 
  12. KNIGHT, Kevin. Un manual tutorial de MT estadística. Manuscrito preparado para el Taller de Verano de JHU de 1999, 1999.
  13. Vulić I. (2010). "Alineación de términos. Descripción general del estado del arte" (PDF) . Universidad Católica de Lovaina . Consultado el 26 de octubre de 2015 .
  14. Wołk, K. (2015). "Metodología de filtrado de corpus comparables y paralelos ruidosos para la extracción de datos equivalentes bilingües a nivel de oración". Ciencias de la Computación . 16 (2): 169– 184. arXiv : 1510.04500 . Bibcode : 2015arXiv151004500W . doi : 10.7494/csci.2015.16.2.169 . S2CID 12860633 . 

Lecturas adicionales

  • Knight, Kevin (15 de diciembre de 1997). "Automatización de la adquisición de conocimiento para la traducción automática" . AI Magazine . 18 (4): 81. doi : 10.1609/aimag.v18i4.1323 . ISSN 2371-9621 . 
  • Knight, Kevin. " Un manual tutorial de MT estadística ". Preparado para el Taller de Verano de JHU de 1999. 1999.