IndoWordNet [ 1 ] es una base de conocimiento léxico enlazada de wordnets de 18 lenguas oficiales de la India , a saber: asamés, bengalí, bodo, gujarati, hindi, kannada, cachemir, konkani, malayalam, meitei (manipuri), marathi, nepalí, odia, punjabi, sánscrito, tamil, telugu y urdu. Los wordnets son bases de datos computacionales de palabras utilizadas para el procesamiento del lenguaje natural , la extracción de información , la desambiguación del sentido de las palabras y otras formas de procesamiento computacional que involucran texto.
Dravidian WordNet es un WordNet para idiomas dravidianos. [ 2 ]
Fondo
A principios de la década de 1990, se creó en la Universidad de Princeton la red léxica original para el inglés, llamada Princeton WordNet , en un proyecto liderado por George Miller y Christiane Fellbaum, quienes posteriormente recibieron el prestigioso Premio Zampoli en 2006. [ 3 ] Luego le siguió EuroWordNet , la agrupación de redes léxicas de lenguas europeas, que se estableció en 1998. [ 4 ]
Importancia de las lenguas indias
Las lenguas indias constituyen un componente significativo del panorama lingüístico mundial. En el subcontinente indio existen cuatro familias lingüísticas: indoeuropea, dravídica, tibetano-birmana y austroasiática. [ 5 ] Varias lenguas indias se encuentran entre las más habladas del mundo, especialmente el hindi-urdu (5.º), el bengalí (7.º), el maratí (12.º), etc., según la Lista de lenguas por número de hablantes nativos . Por lo tanto, la creación de redes léxicas para las lenguas indias representa una valiosa labor tecnocientífica y lingüística.
Génesis de las redes de palabras de las lenguas indias
El trabajo inicial comenzó en el año 2000 con la creación de Hindi WordNet por el grupo de Procesamiento del Lenguaje Natural del Centro de Tecnología del Lenguaje Indio (CFILT) en el Departamento de Ciencias de la Computación e Ingeniería del IIT Bombay . [ 6 ] Se puso a disposición del público en 2006 bajo la licencia GNU. Hindi WordNet se creó con el apoyo del proyecto TDIL del Ministerio de Comunicación y Tecnología de la Información de la India y también con apoyo parcial del Ministerio de Desarrollo de Recursos Humanos de la India.
En los años siguientes, se crearon redes léxicas para otros idiomas de la India. El gran proyecto nacional de creación de redes léxicas para idiomas indios se denominó proyecto IndoWordNet. IndoWordNet [ 1 ] es una base de conocimiento léxico enlazada de redes léxicas de 18 idiomas oficiales de la India , a saber: asamés, bengalí, bodo, gujarati, hindi, kannada, cachemir, konkani, malayalam, meitei, marathi, nepalí, oriya, punjabi, sánscrito, tamil, telugu y urdu. Las redes léxicas se crean utilizando un enfoque de expansión a partir de la Red Lédica del Hindi. La Red Lédica del Hindi se creó a partir de principios fundamentales (mencionados más adelante) y fue la primera red léxica para un idioma indio. El método adoptado fue el mismo que el de la Red Lédica de Princeton para el inglés.
IndoWordNet es, por lo tanto, muy similar a EuroWordNet . [ 7 ] Sin embargo, el idioma pivote es el hindi, que, por supuesto, está vinculado a WordNet en inglés.
Los esfuerzos de creación de redes léxicas en lenguas indias que conforman los subcomponentes del proyecto IndoWordNet son: el proyecto North East WordNet, el proyecto Dravidian WordNet y el proyecto Indradhanush, todos ellos financiados por el proyecto TDIL.
Principios de construcción de WordNet
Las redes de palabras siguen los principios de minimalidad, cobertura y reemplazabilidad para los conjuntos de sinónimos. Esto significa que debe haber al menos un conjunto "central" de lexemas en el conjunto de sinónimos que definan de forma única el concepto representado por el conjunto (minimalidad), por ejemplo, {casa, familia} representando el concepto de "familia" ("ella es de una casa noble"). Luego, el conjunto de sinónimos debe abarcar todas las palabras que representan el concepto en el idioma (cobertura), por ejemplo, la palabra "ménage" tendrá que aparecer en el conjunto de sinónimos "familia", aunque hacia el final del conjunto, ya que su uso es poco frecuente. Finalmente, las palabras hacia el principio del conjunto de sinónimos deben poder reemplazarse entre sí en una cantidad razonable de contextos del corpus (reemplazabilidad), por ejemplo, "casa" y "familia" pueden reemplazarse entre sí en la oración "ella es de una casa noble".
El proyecto IndoWordNet se diferencia de otros proyectos similares en que captura fenómenos típicos del lenguaje indio, como predicados complejos y verbos causativos .
Datos
IndoWordNet es de acceso público. El número de conjuntos de sinónimos (a agosto de 2014) en los idiomas y las instituciones que crean las WordNets de cada idioma son los siguientes:
Referencias
- 1 2 Pushpak Bhattacharyya, IndoWordNet, Conferencia de Ingeniería de Recursos Léxicos 2010 (LREC 2010), Malta, mayo de 2010.
- ↑ https://www.amrita.edu/publication/building-a-wordnet-for-dravidian-languages/
- ^ Christiane Fellbaum (ed.), WordNet: una base de datos léxica electrónica, MIT Press, 1998.
- ↑ P. Vossen (ed.), EuroWordNet: Una base de datos multilingüe con redes semánticas léxicas, Kluwer Pub., 1998.
- ↑ Joseph E. Schwartzberg, Encyclopædia Britannica , India — Linguistic Composition , 2007.
- ↑ Dipak Narayan, Debasri Chakrabarty, Prabhakar Pande y P. Bhattacharyya Una experiencia en la construcción de Indo WordNet: una WordNet para el hindi, Conferencia Internacional sobre Global WordNet (GWC 02), Mysore, India, enero de 2002.
- ^ Guión, Niladri Sekhar (2017). WordNet en idiomas indios . Singapur: Springer Nature. págs.275 +. ISBN 978-981-10-1907-4.
Enlaces externos
- Sitio web oficial
- semántica léxica