Articulo de referencia

UBY

UBY [ 1 ] es un recurso léxico-semántico a gran escala para el procesamiento del lenguaje natural (PLN) desarrollado en el Ubiquitous Knowledge Processing Lab (UKP) del departam...

UBY [ 1 ] es un recurso léxico-semántico a gran escala para el procesamiento del lenguaje natural (PLN) desarrollado en el Ubiquitous Knowledge Processing Lab (UKP) del departamento de Ciencias de la Computación de la Technische Universität Darmstadt . UBY se basa en el estándar ISO Lexical Markup Framework (LMF) y combina información de varios recursos creados por expertos y de forma colaborativa para inglés y alemán.

UBY aplica un enfoque de alineación del sentido de las palabras (subcampo de la desambiguación del sentido de las palabras ) para combinar información sobre sustantivos y verbos. [ 2 ] Actualmente, UBY contiene 12 recursos integrados en inglés y alemán.

Recursos incluidos

Formato

UBY-LMF [ 3 ] [ 4 ] es un formato para estandarizar recursos léxicos para el procesamiento del lenguaje natural (PLN). [ 5 ] UBY-LMF se ajusta al estándar ISO para léxicos: LMF , diseñado dentro del ISO-TC37 , y constituye una llamada serialización de este estándar abstracto. [ 6 ] De acuerdo con LMF, todos los atributos y otros términos lingüísticos introducidos en UBY-LMF hacen referencia a descripciones estandarizadas de su significado en ISOCat .

Disponibilidad y versiones

UBY está disponible como parte del repositorio de recursos abiertos DKPro. DKPro UBY es un marco de trabajo Java para crear y acceder a recursos léxicos vinculados por sentido, de acuerdo con el modelo léxico UBY-LMF . Si bien el código de UBY está licenciado bajo una combinación de licencias libres como GPL y CC BY-SA , algunos de los recursos incluidos están bajo licencias diferentes, como solo para uso académico .

También existe una versión de UBY para la Web Semántica llamada lemonUby. [ 7 ] lemonUby se basa en el modelo lemon propuesto en el proyecto Monnet. lemon es un modelo para modelar léxicos y diccionarios legibles por máquina, vinculado a la Web Semántica y a la nube de datos enlazados.

UBY contra BabelNet

BabelNet es un recurso semántico léxico automático que vincula Wikipedia con los léxicos computacionales más populares, como WordNet . A primera vista, UBY y BabelNet parecen proyectos idénticos y competitivos; sin embargo, ambos recursos siguen filosofías diferentes. En su etapa inicial, BabelNet se basaba principalmente en la alineación de WordNet y Wikipedia, lo que, por la propia naturaleza de Wikipedia, implicaba un fuerte enfoque en los sustantivos, y especialmente en las entidades nombradas. Posteriormente, el enfoque de BabelNet se desplazó hacia otras partes de la oración. UBY, en cambio, se centró desde el principio en la información verbal, especialmente en la información sintáctica, que se encuentra en recursos como VerbNet o FrameNet . Otra diferencia principal es que UBY modela otros recursos de forma completa e independiente entre sí, de modo que puede utilizarse como reemplazo total de cada uno de los recursos que contiene. El acceso colectivo a múltiples recursos se proporciona a través de las alineaciones de recursos disponibles. Además, el modelo LMF en UBY permite un acceso unificado tanto para todos los recursos como para los individuales. Mientras tanto, BabelNet sigue un enfoque similar al de WordNet e integra tipos de información seleccionados en los denominados Babel Synsets. Esto facilita el acceso y el procesamiento del conocimiento, aunque difumina los límites entre las bases de conocimiento vinculadas. Además, BabelNet enriquece los recursos originales, por ejemplo, proporcionando traducciones generadas automáticamente para conceptos que no están lexicalizados en un idioma determinado. Si bien esto supone una gran mejora en la cobertura para aplicaciones multilingües, la inferencia automática de información siempre está sujeta a cierto grado de error.

En resumen, debido a las diferencias entre ambos recursos, el uso de uno u otro podría ser preferible según el escenario de aplicación específico. De hecho, ambos recursos pueden utilizarse para proporcionar un amplio conocimiento lexicográfico, especialmente si se combinan. La estructura abierta y bien documentada de ambos recursos constituye un hito fundamental para lograr este objetivo.

Aplicaciones

UBY se ha utilizado con éxito en diferentes tareas de PLN, como la desambiguación del sentido de las palabras , [ 8 ] la agrupación del sentido de las palabras, [ 9 ] el etiquetado del sentido de los verbos [ 10 ] y la clasificación de textos . [ 11 ] UBY también inspiró otros proyectos sobre la construcción automática de recursos semánticos léxicos. [ 12 ] Además, lemonUby se utilizó para mejorar los resultados de la traducción automática , especialmente, para encontrar traducciones de palabras desconocidas. [ 13 ]

Véase también

  • Sitio web de UBY
  • Navegador UBY
  • Proyecto DKPro UBY en Github
  • lemonUBY

Referencias

  1. Iryna Gurevych ; Judith Eckle-Kohler; Silvana Hartmann; Michael Matuschek; Christian M. Meyer; Christian Wirth (abril de 2012). UBY - Un recurso léxico-semántico unificado a gran escala basado en LMF . Actas de la Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional. págs. 580–590 . ISBN  978-1-937284-19-0. S2CID 9692934 . Wikidata Q51752742 .  {{cite book}}: |journal=ignorado ( ayuda )
  2. ^ Matuschek, Michael: Alineación del sentido de las palabras de los recursos léxicos. Technische Universität, Darmstadt [Disertación], (2015)
  3. Judith Eckle-Kohler, Iryna Gurevych, Silvana Hartmann, Michael Matuschek, Christian M Meyer: UBY-LMF: explorando los límites de los modelos léxicos independientes del idioma, en Gil Francopoulo, LMF Lexical Markup Framework, ISTE / Wiley 2013 ( ISBN) 978-1-84821-430-9)
  4. Judith Eckle-Kohler, Iryna Gurevych, Silvana Hartmann, Michael Matuschek y Christian M. Meyer. UBY-LMF: un modelo uniforme para estandarizar recursos léxico-semánticos heterogéneos en ISO-LMF. En: Nicoletta Calzolari, Khalid Choukri, Thierry Declerck, Mehmet Uğur Doğan, Bente Maegaard, Joseph Mariani, Jan Odijk y Stelios Piperidis: Actas de la 8.ª Conferencia Internacional sobre Recursos y Evaluación del Lenguaje (LREC), págs. 275-282, mayo de 2012.
  5. Gottfried Herzog, Laurent Romary, Andreas Witt: Estándares para recursos lingüísticos. Presentación de póster en el META-FORUM 2013 – Exposición META, septiembre de 2013, Berlín, Alemania.
  6. Laurent Romary: TEI y LMF (referencias cruzadas). CoRR abs/1301.2444 (2013)
  7. Judith Eckle-Kohler, John Philip McCrae y Christian Chiarcos: lemonUby: un recurso léxico amplio, interconectado y sintácticamente rico para ontologías. En: Semantic Web Journal, vol. 6, n.º 4, págs. 371-378, 2015.
  8. Christian M. Meyer e Iryna Gurevych: Exhibir no es merodear: un wikcionario multilingüe con desambiguación de sentidos para medir la similitud verbal, en: Actas de la 24.ª Conferencia Internacional sobre Lingüística Computacional (COLING), vol. 4, págs. 1763-1780, diciembre de 2012. Bombay, India.
  9. ^ Michael Matuschek, Tristan Miller e Iryna Gurevych: un enfoque de agrupación de sentidos independiente del lenguaje para mejorar el WSD. En: Josef Ruppert y Gertrud Faaß: Actas de la 12.ª Konferenz zur Verarbeitung natürlicher Sprache (KONVENS 2014), p. 11-21, Universitätsverlag Hildesheim, octubre de 2014.
  10. Kostadin Cholakov, Judith Eckle-Kohler e Iryna Gurevych : Etiquetado automático del sentido verbal basado en recursos léxicos vinculados. En: Actas de la 14.ª Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional (EACL 2014), págs. 68-77, Asociación de Lingüística Computacional.
  11. Lucie Flekova e Iryna Gurevych: Perfilado de personalidad de personajes de ficción mediante vínculos a nivel de sentido entre recursos léxicos, en: Actas de la Conferencia de 2015 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural (EMNLP), septiembre de 2015.
  12. José Gildo de A. Júnior, Ulrich Schiel y Leandro Balby Marinho. 2015. Un enfoque para la construcción de recursos léxico-semánticos basados ​​en fuentes de información heterogéneas. En Actas del 30.º Simposio Anual de la ACM sobre Computación Aplicada (SAC '15). ACM, Nueva York, EE. UU., 402-408. DOI=10.1145/2695664.2695896 http://doi.acm.org/10.1145/2695664.2695896
  13. JP McCrae, P. Cimiano: Minería de traducciones de la web de datos abiertos enlazados, en: Actas del Taller Conjunto sobre PLN y LOD y SWAIE: Web Semántica, Datos Abiertos Enlazados y Extracción de Información, pp. 9-13 (2013).