Articulo de referencia

Etiquetado de partes de la oración

En lingüística de corpus , el etiquetado de partes de la oración ( POS tagging , PoS tagging o POST ), también llamado etiquetado gramatical , es el proceso de marcar una palabr...

En lingüística de corpus , el etiquetado de partes de la oración ( POS tagging , PoS tagging o POST ), también llamado etiquetado gramatical , es el proceso de marcar una palabra en un texto ( corpus ) como correspondiente a una parte de la oración particular , [ 1 ] basándose tanto en su definición como en su contexto . Una forma simplificada de esto se enseña comúnmente a niños en edad escolar, en la identificación de palabras como sustantivos , verbos , adjetivos , adverbios , etc.

Antes realizado manualmente, el etiquetado POS se lleva a cabo ahora en el contexto de la lingüística computacional , utilizando algoritmos que asocian términos específicos, así como partes de la oración ocultas, mediante un conjunto de etiquetas descriptivas. Los algoritmos de etiquetado POS se dividen en dos grupos distintos: basados ​​en reglas y estocásticos. El etiquetador de E. Brill , uno de los primeros y más utilizados en inglés, emplea algoritmos basados ​​en reglas.

Principio

El etiquetado de partes de la oración es más difícil que simplemente tener una lista de palabras y sus partes de la oración, porque algunas palabras pueden representar más de una parte de la oración en diferentes momentos, y porque algunas partes de la oración son complejas. Esto no es raro: en los lenguajes naturales (a diferencia de muchos lenguajes artificiales ), un gran porcentaje de las formas de las palabras son ambiguas . Por ejemplo, incluso "perros", que generalmente se considera un sustantivo plural, también puede ser un verbo.

El marinero se esconde tras la escotilla.

El etiquetado gramatical correcto reflejará que "dogs" se usa aquí como verbo, no como sustantivo plural más común. El contexto gramatical es una forma de determinar esto; el análisis semántico también puede usarse para inferir que "sailor" y "hatch" implican a "dogs" como 1) en el contexto náutico y 2) una acción aplicada al objeto "hatch" (en este contexto, "dogs" es un término náutico que significa "sujeta (una puerta estanca) de forma segura").

Conjuntos de etiquetas

Las escuelas suelen enseñar que en inglés existen 9 categorías gramaticales : sustantivo , verbo , artículo , adjetivo , preposición , pronombre , adverbio , conjunción e interjección . Sin embargo, existen muchas más categorías y subcategorías. En el caso de los sustantivos, se distinguen las formas plural, posesiva y singular. En muchos idiomas, las palabras también se marcan según su caso (su función como sujeto, objeto, etc.), género gramatical , etc.; mientras que los verbos se marcan según el tiempo , el aspecto y otras características. En algunos sistemas de etiquetado, las diferentes inflexiones de la misma raíz reciben distintas categorías gramaticales, lo que resulta en un gran número de etiquetas. Por ejemplo, NN para sustantivos comunes singulares, NNS para sustantivos comunes plurales y NP para nombres propios singulares (véanse las etiquetas POS utilizadas en el Corpus Brown). Otros sistemas de etiquetado utilizan un número menor de etiquetas e ignoran las diferencias sutiles o las modelan como características algo independientes de la categoría gramatical. [ 2 ]

En el etiquetado de partes de la oración por computadora, es típico distinguir de 50 a 150 partes de la oración separadas para el inglés. El trabajo sobre métodos estocásticos para etiquetar el griego koiné (DeRose 1990) ha utilizado más de 1000 partes de la oración y encontró que casi tantas palabras eran ambiguas en ese idioma como en inglés. Un descriptor morfosintáctico en el caso de lenguas morfológicamente ricas se expresa comúnmente usando mnemotecnias muy cortas, como Ncmsan para Categoría = Sustantivo, Tipo = común, Género = masculino, Número = singular, Caso = acusativo, Animado = no.

El conjunto de etiquetas más popular para el etiquetado POS en inglés americano es probablemente el conjunto de etiquetas Penn, desarrollado en el proyecto Penn Treebank. Es muy similar a los conjuntos de etiquetas anteriores de Brown Corpus y LOB Corpus, aunque mucho más pequeño. En Europa, los conjuntos de etiquetas de Eagles Guidelines son ampliamente utilizados e incluyen versiones para varios idiomas.

Se ha trabajado en el etiquetado de partes de la oración (POS tagging) en diversos idiomas, y el conjunto de etiquetas POS utilizadas varía considerablemente según el idioma. Las etiquetas suelen diseñarse para incluir distinciones morfológicas explícitas, aunque esto genera inconsistencias como la marcación de casos para pronombres pero no para sustantivos en inglés, y diferencias interlingüísticas mucho mayores. Los conjuntos de etiquetas para lenguas con una fuerte flexión, como el griego y el latín, pueden ser muy extensos; etiquetar palabras en lenguas aglutinantes , como las lenguas inuit, puede resultar prácticamente imposible. En el otro extremo, Petrov et al. [ 3 ] propusieron un conjunto de etiquetas "universal", con 12 categorías (por ejemplo, sin subtipos de sustantivos, verbos, signos de puntuación, etc.). La preferencia entre un conjunto muy pequeño de etiquetas generales o uno mucho mayor de etiquetas más precisas depende del propósito. El etiquetado automático es más sencillo con conjuntos de etiquetas más pequeños.

Historia

El corpus marrón

La investigación sobre el etiquetado de partes de la oración ha estado estrechamente ligada a la lingüística de corpus . El primer corpus importante de inglés para análisis informático fue el Corpus Brown, desarrollado en la Universidad de Brown por Henry Kučera y W. Nelson Francis a mediados de la década de 1960. Consta de aproximadamente 1.000.000 de palabras de texto en prosa en inglés, compuesto por 500 muestras de publicaciones elegidas al azar. Cada muestra tiene 2.000 palabras o más (terminando en el primer final de oración después de 2.000 palabras, de modo que el corpus contiene solo oraciones completas).

El Corpus Brown fue meticulosamente etiquetado con marcadores de categoría gramatical durante muchos años. Una primera aproximación se realizó con un programa de Greene y Rubin, que consistía en una enorme lista manual de las categorías que podían coexistir. Por ejemplo, un artículo seguido de un sustantivo puede ocurrir, pero un artículo seguido de un verbo (posiblemente) no. El programa obtuvo una precisión de aproximadamente el 70 %. Sus resultados fueron revisados ​​y corregidos manualmente en repetidas ocasiones, y posteriormente otros usuarios enviaron erratas, de modo que a finales de los años 70 el etiquetado era casi perfecto (teniendo en cuenta algunos casos en los que incluso los hablantes humanos podrían no estar de acuerdo).

Este corpus se ha utilizado en innumerables estudios de frecuencia de palabras y de categorías gramaticales, e inspiró el desarrollo de corpus etiquetados similares en muchos otros idiomas. Las estadísticas derivadas de su análisis constituyeron la base de la mayoría de los sistemas posteriores de etiquetado gramatical, como CLAWS y VOLSUNGA . Sin embargo, en 2005, había sido superado por corpus más grandes, como el British National Corpus de 100 millones de palabras , aunque estos últimos rara vez se someten a una curación tan exhaustiva.

Durante un tiempo, el etiquetado gramatical se consideró una parte inseparable del procesamiento del lenguaje natural , ya que existen casos en los que no es posible determinar la categoría gramatical correcta sin comprender la semántica o incluso la pragmática del contexto. Esto resulta extremadamente costoso, sobre todo porque analizar los niveles superiores es mucho más difícil cuando se deben considerar múltiples posibilidades de categoría gramatical para cada palabra.

Uso de modelos ocultos de Markov

A mediados de la década de 1980, investigadores europeos comenzaron a utilizar modelos ocultos de Markov (HMM) para desambiguar las partes de la oración al trabajar en el etiquetado del Corpus Lancaster-Oslo-Bergen de inglés británico. Los HMM implican contar casos (como los del Corpus Brown) y crear una tabla con las probabilidades de ciertas secuencias. Por ejemplo, una vez que se ha visto un artículo como "the", es posible que la siguiente palabra sea un sustantivo el 40% de las veces, un adjetivo el 40% y un número el 20%. Sabiendo esto, un programa puede determinar que "can" en "the can" tiene muchas más probabilidades de ser un sustantivo que un verbo o un modal. El mismo método puede, por supuesto, utilizarse para aprovechar el conocimiento sobre las palabras siguientes.

Los modelos ocultos de Markov (HMM) más avanzados (de orden superior) aprenden las probabilidades no solo de pares, sino también de tríos o secuencias aún más largas. Por ejemplo, si acabas de ver un sustantivo seguido de un verbo, es muy probable que el siguiente elemento sea una preposición, un artículo o un sustantivo, pero mucho menos probable que sea otro verbo.

Cuando aparecen varias palabras ambiguas juntas, las posibilidades se multiplican. Sin embargo, es fácil enumerar todas las combinaciones y asignar una probabilidad relativa a cada una, multiplicando sucesivamente las probabilidades de cada opción. A continuación, se elige la combinación con la mayor probabilidad. El grupo europeo desarrolló CLAWS, un programa de etiquetado que hacía precisamente esto y alcanzaba una precisión de entre el 93 % y el 95 %.

Eugene Charniak señala en Statistical techniques for natural language parsing (1997) [ 4 ] que simplemente asignar la etiqueta más común a cada palabra conocida y la etiqueta " nombre propio " a todas las desconocidas se acercará al 90% de precisión porque muchas palabras no son ambiguas y muchas otras rara vez representan sus partes de la oración menos comunes.

CLAWS fue pionero en el campo del etiquetado de partes del discurso basado en HMM, pero era bastante costoso ya que enumeraba todas las posibilidades. A veces tenía que recurrir a métodos de respaldo cuando simplemente había demasiadas opciones (el Corpus Brown contiene un caso con 17 palabras ambiguas seguidas, y hay palabras como "still" que pueden representar hasta 7 partes del discurso distintas. [ 5 ]

Los HMM son la base del funcionamiento de los etiquetadores estocásticos y se utilizan en varios algoritmos, siendo uno de los más utilizados el algoritmo de inferencia bidireccional. [ 6 ]

Métodos de programación dinámica

En 1987, Steven DeRose [ 7 ] y Kenneth W. Church [ 8 ] desarrollaron de forma independiente algoritmos de programación dinámica para resolver el mismo problema en mucho menos tiempo. Sus métodos eran similares al algoritmo de Viterbi, conocido desde hacía tiempo en otros campos. DeRose utilizó una tabla de pares, mientras que Church empleó una tabla de tríos y un método para estimar los valores de los tríos que eran raros o inexistentes en el Corpus Brown (una medición real de las probabilidades de los tríos requeriría un corpus mucho mayor). Ambos métodos alcanzaron una precisión superior al 95%. La tesis doctoral de DeRose de 1990 en la Universidad de Brown incluyó análisis de los tipos de error específicos, las probabilidades y otros datos relacionados, y replicó su trabajo para el griego, donde demostró ser igualmente eficaz.

Estos hallazgos resultaron sorprendentemente revolucionarios para el campo del procesamiento del lenguaje natural. La precisión obtenida fue superior a la típica de algoritmos muy sofisticados que integraban la clasificación gramatical con diversos niveles de análisis lingüístico: sintaxis, morfología, semántica, etc. Si bien los métodos de CLAWS, DeRose y Church fallaron en algunos casos conocidos donde se requiere semántica, estos resultaron ser insignificantes. Esto convenció a muchos expertos en el campo de que la clasificación gramatical podía separarse de los demás niveles de procesamiento; esto, a su vez, simplificó la teoría y la práctica del análisis lingüístico computarizado y animó a los investigadores a buscar formas de separar también otros componentes. Los modelos de Markov se convirtieron en el método estándar para la clasificación gramatical.

Etiquetadores no supervisados

Los métodos ya mencionados implican trabajar con un corpus preexistente para aprender las probabilidades de las etiquetas. Sin embargo, también es posible realizar un aprendizaje inicial mediante el etiquetado no supervisado. Las técnicas de etiquetado no supervisado utilizan un corpus sin etiquetar como datos de entrenamiento y generan el conjunto de etiquetas por inducción. Es decir, observan patrones en el uso de las palabras y derivan las categorías gramaticales por sí mismas. Por ejemplo, las estadísticas revelan fácilmente que "the", "a" y "an" aparecen en contextos similares, mientras que "eat" aparece en contextos muy diferentes. Con suficientes iteraciones, surgen clases de palabras similares que son notablemente parecidas a las que esperarían los lingüistas humanos; y las diferencias mismas a veces sugieren nuevas e importantes perspectivas.

Estas dos categorías pueden subdividirse a su vez en enfoques basados ​​en reglas, estocásticos y neuronales.

Otros etiquetadores y métodos

Algunos de los principales algoritmos actuales para el etiquetado de partes de la oración incluyen el algoritmo de Viterbi , el etiquetador de Brill , la gramática de restricciones y el algoritmo de Baum-Welch (también conocido como algoritmo de avance-retroceso). Tanto los etiquetadores de modelos ocultos de Markov como los de modelos visibles de Markov pueden implementarse utilizando el algoritmo de Viterbi. El etiquetador de Brill, basado en reglas, es inusual porque aprende un conjunto de patrones de reglas y luego aplica esos patrones en lugar de optimizar una cantidad estadística.

También se han aplicado numerosos métodos de aprendizaje automático al problema del etiquetado POS. Se han probado métodos como SVM , clasificador de máxima entropía , perceptrón y vecino más cercano , y la mayoría logra una precisión superior al 95%.

En la wiki de ACL se presenta una comparación directa de varios métodos (con referencias). [ 9 ] Esta comparación utiliza el conjunto de etiquetas Penn en algunos de los datos de Penn Treebank, por lo que los resultados son directamente comparables. Sin embargo, no se incluyen muchos etiquetadores importantes (quizás debido al trabajo que implica reconfigurarlos para este conjunto de datos en particular). Por lo tanto, no debe asumirse que los resultados aquí presentados son los mejores que se pueden lograr con un enfoque determinado, ni siquiera los mejores que se han logrado con dicho enfoque.

En 2014, un artículo informó sobre el uso del método de regularización de estructura para el etiquetado de partes del discurso, logrando un 97,36 % en un conjunto de datos de referencia estándar. [ 10 ]

Véase también

Referencias

  1. "Etiquetas POS" . Sketch Engine . Lexical Computing. 27-03-2018 . Consultado el 06-04-2018 .
  2. Etiquetas POS universales
  3. Petrov, eslavo; Das, Dipanjan; McDonald, Ryan (11 de abril de 2011). "Un conjunto de etiquetas universales de parte del discurso". arXiv : 1104.2086 [ cs.CL ].
  4. Eugene Charniak
  5. DeRose 1990, pág. 82.
  6. Etiquetador POS de CLL
  7. DeRose, Steven J. (1988). "Desambiguación de categorías gramaticales mediante optimización estadística". Lingüística Computacional . 14 (1): 31– 39.
  8. Kenneth Ward Church (1988). "Un programa estocástico de partes y analizador de frases nominales para texto sin restricciones". En Norm Sondheimer (ed.). ANLC '88: Actas de la Segunda Conferencia sobre Procesamiento Aplicado del Lenguaje Natural . Asociación de Lingüística Computacional. pág. 136. doi : 10.3115/974235.974260 . 
  9. Etiquetado POS (Estado del arte)
  10. Xu Sun (2014). Regularización de la estructura para la predicción estructurada (PDF) . Sistemas de procesamiento de información neuronal (NIPS). págs. 2402–2410 . Recuperado el 20 de agosto de 2021 . 

Obras citadas

  • Charniak, Eugene. 1997. " Técnicas estadísticas para el análisis del lenguaje natural ". AI Magazine 18(4):33 44.
  • Hans van Halteren, Jakub Zavrel, Walter Daelemans . 2001. Mejora de la precisión en PLN mediante la combinación de sistemas de aprendizaje automático. Lingüística Computacional . 27(2): 199-229 . PDF
  • DeRose, Steven J. 1990. "Métodos estocásticos para la resolución de la ambigüedad de la categoría gramatical en lenguas flexionadas y no flexionadas." Tesis doctoral. Providence, RI: Departamento de Ciencias Cognitivas y Lingüísticas de la Universidad de Brown. Edición electrónica disponible enArchivado el 19 de agosto de 2018 en Wayback Machine.
  • DQ Nguyen, DQ Nguyen, DD Pham y SB Pham (2016). «Un enfoque de aprendizaje robusto basado en transformaciones que utiliza reglas de propagación descendente para el etiquetado de partes del discurso». AI Communications , vol. 29, n.º 3, páginas 409-422. [ .pdf ]