Articulo de referencia

Diccionario morfológico

En los campos de la lingüística computacional y la lingüística aplicada , un diccionario morfológico es un recurso lingüístico que contiene correspondencias entre la forma super...

En los campos de la lingüística computacional y la lingüística aplicada , un diccionario morfológico es un recurso lingüístico que contiene correspondencias entre la forma superficial y las formas léxicas de las palabras. Las formas superficiales de las palabras son aquellas que se encuentran en el texto en lenguaje natural. La forma léxica correspondiente a una forma superficial es el lema seguido de información gramatical (por ejemplo, la categoría gramatical , el género y el número ). En inglés , give , give , giving , gave y given son formas superficiales del verbo give . La forma léxica sería "give", verbo. Existen dos tipos de diccionarios morfológicos: diccionarios alineados por morfema y diccionarios de forma completa (no alineados).

Ejemplos y formalismos notables

Morfologías universales

Inspirados por el éxito de las Dependencias Universales para la anotación interlingüística de dependencias sintácticas, han surgido esfuerzos similares para la morfología, por ejemplo, UniMorph [ 1 ] y UDer. [ 2 ] Estos presentan formatos tabulares simples ( separados por tabulaciones ) con una forma en una fila y su derivación (UDer), o bien, información de flexión (UniMorph):

aalen aalend V.PTCP;PRS

aalen aalen V;IND;PRS;1;PL

aalen aalen V;IND;PRS;3;PL

aalen aalen V;NFIN

(UniMorph, alemán. Las columnas son LEMA, FORMA, CARACTERÍSTICAS)

En UDer, la información adicional (categoría gramatical) se codifica dentro de las columnas:

abändern_V Abänderung_Nf dVN07>

Abarbeiten_Nn abarbeiten_V dNV09>

abartig_A Abartigkeit_Nf dAN03>

Abart_Nf abartig_A dNA05>

abbaggern_V Abbaggern_Nn dVN09>

(UDer, alemán DErivBase 0.5. Las columnas son BASE, DERIVED, RULE)

En el momento de redactar este texto (2021), todos ellos son diccionarios morfológicos no alineados (véase más abajo). Su formato sencillo resulta especialmente adecuado para la aplicación de técnicas de aprendizaje automático, y UniMorph, en particular, ha sido objeto de numerosas tareas compartidas.

Transductores de estado finito

Los transductores de estados finitos (FST) son una técnica popular para el manejo computacional de la morfología, especialmente la morfología flexiva. En los analizadores morfológicos basados ​​en reglas, tanto el léxico como las reglas se formalizan normalmente como autómatas de estados finitos y posteriormente se combinan. Por lo tanto, requieren diccionarios morfológicos con instrucciones de procesamiento específicas (que a menudo tienen una interpretación lingüística, pero, técnicamente, se tratan como símbolos de cadena arbitrarios). [ 3 ] Los paquetes FST populares, como SFST [ 4 ] (disponible en el paquete fst de Debian y Ubuntu), permiten definir formatos de archivo específicos de la aplicación para léxicos morfológicos, que agrupan diferentes piezas de información morfológica con cada morfema individual. Estos son, por lo tanto, diccionarios morfológicos alineados, pero muy ricos (y también idiosincrásicos) en estructura.

Datos de muestra de SMOR [ 5 ] (gramática alemana SFST):

<Base_Stems>Aachen<NN><base><nativ><Nombre-Neut_s>

<Base_Stems>Aal<NN><base><nativ><NMasc_es_e>

<Base_Stems>Aarau<NN><base><nativ><Name-Neut_s>

<Suff_Stems><suffderiv><gebunden><kompos><NN>nom<>:e<>:n<NN><SUFF><kompos><frei>

<Suff_Stems><suffderiv><gebunden><kompos><NN>nom<NN><SUFF><base><frei><NMasc_en_en>

<Suff_Stems><suffderiv><gebunden><kompos><NN>nom<NN><SUFF><deriv><frei>

Editores de texto interlineales glosados

El texto glosado interlineal (IGT) es un formalismo popular en la documentación de lenguas , la tipología lingüística y otras ramas de la lingüística y la filología. Aunque el IGT se puede crear sin software especializado (simplemente con un editor convencional), se ha desarrollado software especializado, con ejemplos notables como Toolbox, [ 6 ] FieldWorks Language Explorer (FLEx) [ 7 ] o alternativas de código abierto como Xigt. [ 8 ] Toolbox y FLEx admiten la anotación semiautomática mediante un diccionario morfológico interno. Cuando se encuentra un segmento morfológico para el que existe una anotación en el diccionario, esta se aplica. Cuando se anota un nuevo segmento morfológico, la anotación se almacena en el diccionario. FLEx y Toolbox ofrecen diferentes funcionalidades de edición para anotar texto y editar diccionarios, de modo que se puede añadir información adicional más allá de la que se encuentra en las anotaciones, pero en esencia, sus formatos proporcionan diccionarios morfológicos alineados.

FLEx y Xigt se basan en formatos XML, mientras que Toolbox utiliza un formato de texto plano con marcadores específicos. FLEx y Toolbox no son directamente interoperables, pero existe un convertidor semiautomático de Toolbox a FLEx. Xigt incluye importadores de FLEx y Toolbox, pero su uso es menos extendido que el de cualquiera de ellos. Sus formatos no están pensados ​​para el procesamiento humano ni cuentan con un buen soporte por parte de otros programas de procesamiento, salvo sus herramientas nativas.

OntoLex-Morph: Un estándar comunitario para diccionarios morfológicos

OntoLex es un estándar comunitario para diccionarios legibles por máquina en la web. En 2019, se propuso el módulo OntoLex-Morph para facilitar el modelado de datos de morfología en lexicografía , así como para proporcionar un modelo de datos para diccionarios morfológicos para el procesamiento del lenguaje natural . [ 9 ] OntoLex-Morph admite diccionarios morfológicos tanto alineados como no alineados. Un objetivo específico es establecer la interoperabilidad entre diccionarios IGT, léxicos FST y diccionarios morfológicos utilizados para el aprendizaje automático.

Tipos y estructura de los diccionarios morfológicos

Diccionarios morfológicos alineados

En un diccionario morfológico alineado, la correspondencia entre la forma superficial y la forma léxica de una palabra se alinea a nivel de caracteres, por ejemplo:

(h,h) (o,o) (u,u) (s,s) (e,e) (s, n ), (θ, pl )

Donde θ es el símbolo vacío y n significa "sustantivo", y pl significa "plural".

En el ejemplo, el lado izquierdo corresponde a la forma superficial (entrada) y el lado derecho a la forma léxica (salida). Este orden se utiliza en el análisis morfológico, donde se genera una forma léxica a partir de una forma superficial. En la generación morfológica, este orden se invertiría.

Formalmente, si Σ es el alfabeto de los símbolos de entrada, yΓ{\displaystyle \Gamma }es el alfabeto de los símbolos de salida, un diccionario morfológico alineado es un subconjuntoA2(L){\displaystyle A\subset 2^{(L^{*})}}, dónde:

L=((Σθ)×Γ)(Σ×(Γθ)){\displaystyle L=((\Sigma \cup {\theta })\times \Gamma )\cup (\Sigma \times (\Gamma \cup {\theta }))}

es el alfabeto de todas las posibles alineaciones, incluido el símbolo vacío. Es decir, un diccionario morfológico alineado es un conjunto de cadenas enL{\displaystyle L^{*}}.

Diccionarios morfológicos no alineados (diccionarios de forma completa)

Un diccionario morfológico no alineado (o diccionario de forma completa) es simplemente un conjuntoU2(Γ×Σ){\displaystyle U\subset 2^{(\Gamma ^{*}\times \Sigma ^{*})}}de pares de cadenas de entrada y salida. Un diccionario morfológico no alineado representaría el ejemplo anterior como:

(casas, casa n pl )

Es posible convertir un diccionario no alineado en uno alineado. Además de las alineaciones simples a la izquierda o a la derecha, también son posibles alineaciones con fundamento lingüístico que alinean los caracteres con sus morfemas correspondientes.

Ambigüedades léxicas

Con frecuencia, una palabra puede tener más de una forma léxica asociada a su forma superficial. Por ejemplo, «casa» puede ser un sustantivo en singular, /haʊs/ , o un verbo en presente, /haʊz/ . Por consiguiente, es necesario contar con una función que relacione las cadenas de entrada con sus correspondientes cadenas de salida.

Si definimos el conjuntomiΣ{\displaystyle E\subset \Sigma ^{*}}de palabras de entrada tales quemi=w:(w,w)U{\displaystyle E={w:(w,w')\en U}}, la función de correspondencia seríaτ:mi2Γ{\displaystyle \tau :E\rightarrow 2^{\Gamma ^{*}}}definido comoτ(w)=w:(w,w)U{\displaystyle \tau (w)=w':(w,w')\in U}.

Referencias

  1. Kirov, Christo, Ryan Cotterell, John Sylak-Glassman, Géraldine Walther, Ekaterina Vylomova, Patrick Xia, Manaal Faruqui et al. "UniMorph 2.0: morfología universal." En LREC (2018).
  2. Kyjánek, L., Žabokrtský, Z., Ševčíková, M., & Vidra, J. (2019, septiembre). Inicio de las derivaciones universales: una colección de recursos derivacionales armonizados para once idiomas. En Actas del Segundo Taller Internacional sobre Recursos y Herramientas para la Morfología Derivativa (págs. 101-110).
  3. "Una breve historia de la morfología de dos niveles" . www.ling.helsinki.fi . Consultado el 30 de noviembre de 2021 .
  4. Schmid, Helmut. "Un lenguaje de programación para transductores de estados finitos." En FSMNLP , vol. 4002, pp. 308-309. 2005.
  5. Schmid, Helmut, Arne Fitschen y Ulrich Heid. «SMOR: Una morfología computacional alemana que abarca la derivación, la composición y la inflexión». En LREC , págs. 1-263. 2004.
  6. "Caja de herramientas del lingüista de campo" . software.sil.org . 10 de mayo de 2017. Consultado el 27 de noviembre de 2021 .
  7. "FieldWorks" . software.sil.org . 9 de diciembre de 2014. Consultado el 27 de noviembre de 2021 .
  8. "XIGT" . XIGT . Consultado el 27/11/2021 .
  9. Klimek, B., McCrae, JP, Bosque-Gil, J., Ionov, M., Tauber, JK, & Chiarcos, C. (2019). Desafíos para la representación de la morfología en los léxicos de ontología. Actas de eLex .