La lematización (o, menos comúnmente, lematización ) en lingüística es el proceso de agrupar las formas flexionadas de una palabra para que puedan analizarse como un solo elemento, identificado por el lema de la palabra o su forma de diccionario. [ 1 ]
En lingüística computacional , la lematización es el proceso algorítmico de determinar el lema de una palabra a partir de su significado previsto. A diferencia de la derivación , la lematización depende de la correcta identificación de la categoría gramatical y el significado previsto de una palabra en una oración, así como dentro del contexto más amplio que la rodea, como las oraciones adyacentes o incluso un documento completo. Por consiguiente, el desarrollo de algoritmos de lematización eficientes es un área de investigación abierta. [ 2 ] [ 3 ] [ 4 ]
Descripción
En muchos idiomas, las palabras aparecen en diversas formas flexionadas . Por ejemplo, en inglés, el verbo «to walk» puede aparecer como «walk», «walked», «walks» o «walking». La forma base, «walk», que se puede consultar en un diccionario, se denomina lema de la palabra. La asociación de la forma base con una categoría gramatical se conoce como lexema .
La lematización está estrechamente relacionada con el stemming . La diferencia radica en que un stemmer opera sobre una sola palabra sin conocimiento del contexto y, por lo tanto, no puede discriminar entre palabras con diferentes significados según su categoría gramatical. Sin embargo, los stemmers suelen ser más fáciles de implementar y más rápidos. La menor precisión puede no ser relevante para algunas aplicaciones. De hecho, cuando se utiliza en sistemas de recuperación de información, el stemming mejora la precisión de la recuperación de consultas , o tasa de verdaderos positivos, en comparación con la lematización. No obstante, el stemming reduce la precisión , o la proporción de instancias etiquetadas positivamente que son realmente positivas, para dichos sistemas. [ 5 ]
Por ejemplo:
- La palabra "better" tiene como lema "good". Este vínculo no se detecta mediante la derivación, ya que requiere una consulta al diccionario.
- La palabra "walk" es la forma base de la palabra "walking" (caminar), y por lo tanto, esto coincide tanto en la derivación como en la lematización.
- La palabra "meeting" puede ser la forma base de un sustantivo o una forma de un verbo ("to meet"), según el contexto; por ejemplo, "in our last meeting" o "We are meeting again tomorrow". A diferencia de la derivación, la lematización intenta seleccionar el lema correcto según el contexto.
El software de indexación de documentos como Lucene [ 6 ] puede almacenar el formato base lematizado de la palabra sin conocer su significado, sino considerando únicamente las reglas gramaticales de formación de palabras. La palabra lematizada en sí misma podría no ser una palabra válida: «lazy», como se ve en el ejemplo a continuación, es lematizada por muchos lematizadores a «lazi». Esto se debe a que el propósito de la lematización no es producir el lema apropiado ; esa es una tarea más compleja que requiere conocimiento del contexto. El propósito principal de la lematización es asignar diferentes formas de una palabra a una sola forma. [ 7 ] Como algoritmo basado en reglas, que depende únicamente de la ortografía de una palabra, sacrifica la precisión para asegurar que, por ejemplo, cuando «lazyness» se lematiza a «lazi», tenga la misma raíz que «lazy».
Algoritmos
Una forma sencilla de realizar la lematización es mediante una simple consulta al diccionario. Esto funciona bien para formas flexionadas simples, pero se necesitará un sistema basado en reglas para otros casos, como en lenguas con palabras compuestas largas . Dichas reglas pueden crearse manualmente o aprenderse automáticamente a partir de un corpus anotado .
Uso en biomedicina
El análisis morfológico de la literatura biomédica publicada puede arrojar resultados útiles. El procesamiento morfológico de textos biomédicos puede ser más eficaz mediante un programa de lematización especializado para biomedicina, y puede mejorar la precisión de las tareas prácticas de extracción de información . [ 8 ]
Véase también
- Canonización : Proceso para convertir datos a una forma "estándar", "normal" o canónica.
Referencias
- ↑ Diccionario inglés Collins , entrada para "lemmatizar"
- ↑ "WebBANC: Creación de corpus anotados semánticamente ricos a partir de anotaciones de usuarios web de lenguas minoritarias" .
- ↑ Müller, Thomas; Cotterell, Ryan; Fraser, Alexander; Schütze, Hinrich (2015). Joint Lemmatization and Morphological Tagging with LEMMING (PDF) . 2015 Conference on Empirical Methods in Natural Language Processing. Lisboa: Association for Computational Linguistics. pp. 2268–2274 . doi : 10.18653/v1/D15-1272 . Archivado del original (PDF) el 31-10-2017 . Recuperado el 31-10-2016 .
- ↑ Bergmanis, Toms; Goldwater, Sharon . "Lematización neuronal sensible al contexto con Lematus" (PDF) . Archivado del original (PDF) el 31-12-2019 . Recuperado el 09-06-2018 .
- ^ Manning, Christopher D.; Raghavan, Prabhakar; Schütze, Hinrich. "Introducción a la Recuperación de Información" . Prensa de la Universidad de Cambridge.
- ↑ "Lucene Snowball" . Proyecto Apache.
- ^ Martín Porter. "Porter Stemmer" .
- ↑ Liu, H.; Christiansen, T.; Baumgartner, WA; Verspoor, K. (2012). "BioLemmatizer: Una herramienta de lematización para el procesamiento morfológico de texto biomédico" . Journal of Biomedical Semantics . 3 : 3. doi : 10.1186/2041-1480-3-3 . PMC 3359276. PMID 22464129 .
Enlaces externos
- Lingüística computacional
- Tareas del procesamiento del lenguaje natural