En lingüística computacional , un etiquetador de trigramas es un método estadístico para identificar automáticamente palabras como sustantivos, verbos, adjetivos, adverbios, etc., basándose en modelos de Markov de segundo orden que consideran tríos de palabras consecutivas. Se entrena con un corpus de texto para predecir la siguiente palabra, multiplicando las probabilidades de unigramas , bigramas y trigramas . En el reconocimiento de voz , los algoritmos que utilizan el etiquetador de trigramas obtienen mejores resultados que los que utilizan el etiquetador IIMM, pero peores que el etiquetador Net.
La descripción del etiquetador de trigramas la proporciona Brants (2000).
Referencias
- Kempe Andre (1993). "Un etiquetador estocástico y un análisis de errores de etiquetado". Documento interno. Instituto de Lingüística Computacional, Universidad de Stuttgart.
- Brants, T. (2000) TnT - Un etiquetador estadístico de partes del habla , Actas de la 6ª Conferencia de Procesamiento del Lenguaje Natural Aplicado, ANLP-200
Enlaces externos
- TnT: Etiquetado estadístico de partes de la oración por Thorsten Brants
- Procesamiento estadístico del lenguaje natural
- Esbozos estadísticos
- Stubs de procesamiento del lenguaje natural