El modelo de lenguaje factorizado ( FLM , por sus siglas en inglés) es una extensión de un modelo de lenguaje convencional introducido por Jeff Bilmes y Katrin Kirchoff en 2003. En un FLM, cada palabra se considera un vector de k factores: Un FLM proporciona el modelo probabilísticodonde la predicción de un factorse basa enpadres. Por ejemplo, sirepresenta un token de palabra yrepresenta una etiqueta de parte de la oración para inglés, la expresiónProporciona un modelo para predecir el token de palabra actual basándose en un modelo Ngram tradicional , así como en la etiqueta de categoría gramatical de la palabra anterior.
Una de las principales ventajas de los modelos de lenguaje factorizados es que permiten a los usuarios especificar conocimientos lingüísticos, como la relación entre las palabras y su categoría gramatical en inglés, o información morfológica (raíces, etc.) en árabe.
Al igual que en los modelos N-grama , las técnicas de suavizado son necesarias en la estimación de parámetros. En particular, el retroceso generalizado se utiliza en el entrenamiento de un modelo lineal fraccional (FLM).
Referencias
- J. Bilmes y K. Kirchhoff (2003). "Modelos de lenguaje factorizados y retroceso paralelo generalizado" (PDF) . Conferencia sobre tecnología del lenguaje humano . Archivado del original (PDF) el 17 de julio de 2012.
- Modelado del lenguaje
- Procesamiento estadístico del lenguaje natural
- Modelos probabilísticos
- Stubs de procesamiento del lenguaje natural