Articulo de referencia

Modelo de lenguaje factorizado

El modelo de lenguaje factorizado ( FLM , por sus siglas en inglés) es una extensión de un modelo de lenguaje convencional introducido por Jeff Bilmes y Katrin Kirchoff en 2003....

El modelo de lenguaje factorizado ( FLM , por sus siglas en inglés) es una extensión de un modelo de lenguaje convencional introducido por Jeff Bilmes y Katrin Kirchoff en 2003. En un FLM, cada palabra se considera un vector de k factores:wi={Fi1,...,Fik}.{\displaystyle w_{i}=\{f_{i}^{1},...,f_{i}^{k}\}.} Un FLM proporciona el modelo probabilísticoPAG(F|F1,...,Fnorte){\displaystyle P(f|f_{1},...,f_{N})}donde la predicción de un factorF{\displaystyle f}se basa ennorte{\displaystyle N}padres{F1,...,Fnorte}{\displaystyle \{f_{1},...,f_{N}\}}. Por ejemplo, siw{\displaystyle w}representa un token de palabra yt{\displaystyle t}representa una etiqueta de parte de la oración para inglés, la expresiónPAG(wi|wi2,wi1,ti1){\displaystyle P(w_{i}|w_{i-2},w_{i-1},t_{i-1})}Proporciona un modelo para predecir el token de palabra actual basándose en un modelo Ngram tradicional , así como en la etiqueta de categoría gramatical de la palabra anterior.

Una de las principales ventajas de los modelos de lenguaje factorizados es que permiten a los usuarios especificar conocimientos lingüísticos, como la relación entre las palabras y su categoría gramatical en inglés, o información morfológica (raíces, etc.) en árabe.

Al igual que en los modelos N-grama , las técnicas de suavizado son necesarias en la estimación de parámetros. En particular, el retroceso generalizado se utiliza en el entrenamiento de un modelo lineal fraccional (FLM).

Referencias

  • J. Bilmes y K. Kirchhoff (2003). "Modelos de lenguaje factorizados y retroceso paralelo generalizado" (PDF) . Conferencia sobre tecnología del lenguaje humano . Archivado del original (PDF) el 17 de julio de 2012.