Articulo de referencia

Vinculación de entidades

En el procesamiento del lenguaje natural , la vinculación de entidades , también conocida como desambiguación de entidades nombradas (NED), reconocimiento y desambiguación de en...

En el procesamiento del lenguaje natural , la vinculación de entidades , también conocida como desambiguación de entidades nombradas (NED), reconocimiento y desambiguación de entidades nombradas (NERD), normalización de entidades nombradas (NEN), [ 1 ] o reconocimiento de conceptos , es la tarea de asignar una identidad única a entidades (como personas famosas, lugares o empresas) mencionadas en un texto. [ 2 ] Por ejemplo, dada la oración "París es la capital de Francia" , la idea principal es primero identificar "París" y "Francia" como entidades nombradas , y luego determinar que "París" se refiere a la ciudad de París y no a Paris Hilton ni a ninguna otra entidad que pudiera ser denominada "París" y "Francia" al país francés .

La tarea de vinculación de entidades se compone de 3 subtareas.

  1. Reconocimiento de entidades nombradas : Extracción de entidades nombradas a partir de un texto.
  2. Generación de candidatos: Para cada entidad nombrada, seleccione posibles candidatos de una base de conocimiento (por ejemplo , Wikipedia , Wikidata , DBPedia , ...).
  3. Desambiguación: Elija la entidad correcta de este conjunto de candidatos.

En la vinculación de entidades, cada entidad nombrada se vincula a un identificador único. A menudo, este identificador corresponde a una página de Wikipedia.

Introducción

En la vinculación de entidades, las palabras de interés (nombres de personas, lugares y empresas) se asignan desde un texto de entrada a entidades únicas correspondientes en una base de conocimiento de destino . Las palabras de interés se denominan entidades nombradas (EN), menciones o formas superficiales. La base de conocimiento de destino depende de la aplicación prevista, pero para los sistemas de vinculación de entidades diseñados para funcionar con texto de dominio abierto, es común utilizar bases de conocimiento derivadas de Wikipedia (como Wikidata o DBpedia ). [ 1 ] [ 3 ] En este caso, cada página individual de Wikipedia se considera una entidad separada. Las técnicas de vinculación de entidades que asignan entidades nombradas a entidades de Wikipedia también se denominan wikificación . [ 4 ]

Retomando la oración de ejemplo "París es la capital de Francia" , el resultado esperado de un sistema de vinculación de entidades será París y Francia . Estos localizadores uniformes de recursos (URL) pueden utilizarse como identificadores uniformes de recursos (URI) únicos para las entidades en la base de conocimiento. El uso de una base de conocimiento diferente devolverá URI diferentes, pero para las bases de conocimiento construidas a partir de Wikipedia existen asignaciones de URI uno a uno. [ 5 ]

En la mayoría de los casos, las bases de conocimiento se construyen manualmente, [ 6 ] pero en aplicaciones donde se dispone de grandes corpus de texto , la base de conocimiento se puede inferir automáticamente a partir del texto disponible . [ 7 ]

La vinculación de entidades es un paso crítico para conectar los datos web con las bases de conocimiento, lo cual es beneficioso para anotar la enorme cantidad de datos brutos y a menudo ruidosos en la Web y contribuye a la visión de la Web Semántica . [ 8 ] Además de la vinculación de entidades, hay otros pasos críticos que incluyen, pero no se limitan a, la extracción de eventos, [ 9 ] y la vinculación de eventos [ 10 ] etc.

Aplicaciones

La vinculación de entidades es beneficiosa en campos que necesitan extraer representaciones abstractas del texto, como ocurre en el análisis de texto, los sistemas de recomendación , la búsqueda semántica y los chatbots. En todos estos campos, los conceptos relevantes para la aplicación se separan del texto y otros datos sin significado. [ 11 ] [ 12 ]

Por ejemplo, una tarea común de los motores de búsqueda es encontrar documentos similares a uno introducido o información adicional sobre las personas mencionadas en él. Consideremos una frase que contenga la expresión "la capital de Francia" : sin la vinculación de entidades, el motor de búsqueda que analiza el contenido de los documentos no podría recuperar directamente aquellos que contengan la palabra "París" , lo que daría lugar a los llamados falsos negativos (FN). Peor aún, el motor de búsqueda podría generar coincidencias erróneas (o falsos positivos (FP)), como la recuperación de documentos que se refieren a "Francia" como país.

Existen muchos enfoques ortogonales al enlace de entidades para recuperar documentos similares a un documento de entrada. Por ejemplo, el análisis semántico latente (LSA) o la comparación de incrustaciones de documentos obtenidas con doc2vec . Sin embargo, estas técnicas no permiten el mismo control preciso que ofrece el enlace de entidades, ya que devuelven otros documentos en lugar de crear representaciones de alto nivel del original. Por ejemplo, obtener información esquemática sobre "París" , tal como se presenta en las infoboxes de Wikipedia , sería mucho menos sencillo, o incluso inviable en ocasiones, dependiendo de la complejidad de la consulta. [ 13 ]

Además, la vinculación de entidades se ha utilizado para mejorar el rendimiento de los sistemas de recuperación de información [ 1 ] y para mejorar el rendimiento de búsqueda en bibliotecas digitales . [ 14 ] La vinculación de entidades también es una entrada clave para la búsqueda semántica . [ 15 ] [ 16 ]

Desafíos

Existen diversas dificultades para realizar la vinculación de entidades. Algunas son intrínsecas a la tarea, [ 17 ] como la ambigüedad del texto. Otras son relevantes para su uso en el mundo real, como la escalabilidad y el tiempo de ejecución.

  • Variaciones de nombre : la misma entidad puede aparecer con representaciones textuales. Las fuentes de estas variaciones incluyen abreviaturas ( Nueva York , NY ), alias ( Nueva York , Gran Manzana ) o variaciones ortográficas y errores ( Nueva York ).
  • Ambigüedad : una misma mención puede referirse a muchas entidades diferentes, dependiendo del contexto, ya que muchos nombres de entidades tienden a ser homónimos (la misma secuencia de letras se aplica a conceptos diferentes con significados distintos, por ejemplo, "banco" puede referirse a una institución financiera o al terreno inmediatamente adyacente a un río) o polisémicos . (La polisemia es un subtipo de homonimia donde los significados están relacionados por un origen histórico o lingüístico). La palabra París , entre otras cosas, podría referirse a la capital francesa o a Paris Hilton . En algunos casos, puede que no haya similitud textual entre una mención en el texto (por ejemplo, "Visitamos la capital de Francia el mes pasado") y la entidad objetivo real ( París ).
  • Ausencia : es posible que las entidades nombradas no tengan una entidad correspondiente en la base de conocimiento de destino. Esto puede ocurrir si la entidad es muy específica o inusual, o si está relacionada con eventos recientes y la base de conocimiento está desactualizada, o si la base de conocimiento es específica de un dominio (por ejemplo, una base de conocimiento de biología). En estos casos, probablemente se espera que el sistema devuelva un NILenlace a la entidad. Saber cuándo devolver una NILpredicción no es sencillo, y se han propuesto muchos enfoques. Algunos ejemplos son establecer un umbral de puntuación de confianza en el sistema de vinculación de entidades e incluir una NILentidad en la base de conocimiento, que se trata como cualquier otra entidad. Sin embargo, en algunos casos, vincular a una entidad incorrecta pero relacionada puede ser más útil para el usuario que no obtener ningún resultado. [ 17 ]
  • Escala y velocidad : es deseable que un sistema de vinculación de entidades industriales proporcione resultados en un tiempo razonable, y a menudo en tiempo real. Este requisito es fundamental para los motores de búsqueda, los chatbots y los sistemas de vinculación de entidades que ofrecen las plataformas de análisis de datos. Garantizar un tiempo de ejecución bajo puede ser un desafío al usar grandes bases de conocimiento o al procesar documentos extensos. [ 18 ] Por ejemplo, Wikipedia contiene casi 9 millones de entidades y más de 170 millones de relaciones entre ellas.
  • Información en evolución : un sistema de vinculación de entidades también debe gestionar la información en evolución e integrar fácilmente las actualizaciones en la base de conocimiento. El problema de la información en evolución a veces está relacionado con el problema de las entidades faltantes, por ejemplo, al procesar artículos de noticias recientes en los que se mencionan eventos que no tienen una entrada correspondiente en la base de conocimiento debido a su novedad. [ 19 ]
  • Múltiples idiomas : un sistema de vinculación de entidades podría admitir consultas realizadas en varios idiomas. Idealmente, la precisión del sistema de vinculación de entidades no debería verse afectada por el idioma de entrada, y las entidades en la base de conocimiento deberían ser las mismas en diferentes idiomas. [ 20 ]

La vinculación de entidades está relacionada con otros conceptos. Las definiciones suelen ser imprecisas y varían ligeramente entre autores.

  • La desambiguación de entidades nombradas (NED) generalmente se considera lo mismo que la vinculación de entidades, pero algunos autores (Alhelbawy et al. [ 21 ] ) la consideran un caso especial de vinculación de entidades que asume que la entidad está en la base de conocimiento. [ 22 ] [ 23 ]
  • La wikifacción es la tarea de vincular las menciones textuales con entidades en Wikipedia (generalmente, limitando el alcance a la Wikipedia en inglés en el caso de la wikifacción multilingüe).
  • La vinculación de registros (RL) encuentra la misma entidad en conjuntos de datos múltiples y a menudo heterogéneos. [ 24 ] Se considera un concepto más amplio que la vinculación de entidades y es un proceso clave en la digitalización de archivos y la unión de bases de conocimiento. [ 14 ]
  • El reconocimiento de entidades nombradas (NER) localiza y clasifica entidades nombradas en texto no estructurado en categorías predefinidas como nombres, organizaciones, ubicaciones y más. Por ejemplo, la siguiente oración:

París es la capital de Francia.

Sería procesado por un sistema NER para obtener la siguiente salida:

[ París ] La ciudad es la capital de [ Francia ] País .

El reconocimiento de entidades nombradas (NER) suele ser un paso de preprocesamiento de un sistema de vinculación de entidades, ya que puede ser útil saber de antemano qué palabras deben vincularse a las entidades de la base de conocimiento.
  • La resolución de correferencia permite determinar si varias palabras en un texto se refieren a la misma entidad. Puede ser útil, por ejemplo, para comprender a qué palabra se refiere un pronombre. Consideremos el siguiente ejemplo:

París es la capital de Francia. También es la ciudad más grande de Francia.

En este ejemplo, un algoritmo de resolución de correferencias identificaría que el pronombre «It» se refiere a París , y no a Francia ni a otra entidad. Una distinción importante con respecto a la vinculación de entidades es que la resolución de correferencias no asigna ninguna identidad única a las palabras que encuentra, sino que simplemente indica si se refieren a la misma entidad o no. En ese sentido, las predicciones de un sistema de resolución de correferencias podrían ser útiles para un componente posterior de vinculación de entidades.

Aproches

La vinculación de entidades ha sido un tema candente en la industria y la academia durante la última década. Muchos desafíos siguen sin resolverse, pero se han propuesto numerosos sistemas de vinculación de entidades, con fortalezas y debilidades muy diversas. [ 25 ]

En términos generales, los sistemas modernos de vinculación de entidades se pueden dividir en dos categorías:

A menudo, los sistemas de vinculación de entidades utilizan tanto grafos de conocimiento como características textuales extraídas, por ejemplo, de los corpus de texto utilizados para construir los propios grafos de conocimiento. [ 22 ] [ 23 ]

Pasos típicos para vincular entidades: 1. NER: encontrar entidades nombradas en el texto (en este caso, París y Francia); 2. vincular las entidades nombradas encontradas con los identificadores únicos correspondientes (en este caso, páginas de Wikipedia). El paso (2) se suele realizar de la siguiente manera: 2.1. definir una métrica para comparar candidatos en el sistema; 2.2. crear un pequeño conjunto de identificadores candidatos para cada entidad nombrada; y 2.3. puntuar los candidatos con la métrica y elegir el que tenga la puntuación más alta.

Basado en texto

El trabajo fundamental de Cucerzan en 2007 publicó uno de los primeros sistemas de vinculación de entidades. Específicamente, abordó la tarea de la wikifacción, es decir, la vinculación de menciones textuales con páginas de Wikipedia. [ 26 ] Este sistema clasifica las páginas en páginas de entidades, de desambiguación o de listas. El conjunto de entidades presentes en cada página de entidad se utiliza para construir el contexto de la entidad. El paso final es una desambiguación colectiva mediante la comparación de vectores binarios de características creadas manualmente con el contexto de cada entidad. El sistema de Cucerzan todavía se utiliza como base para trabajos recientes. [ 28 ]

Rao et al. [ 17 ] propusieron un algoritmo de dos pasos para vincular entidades nombradas con entidades en una base de conocimiento objetivo. Primero, se seleccionan entidades candidatas mediante la coincidencia de cadenas, acrónimos y alias conocidos. Luego, se elige el mejor vínculo entre los candidatos con una máquina de vectores de soporte (SVM) de clasificación que utiliza características lingüísticas.

Los sistemas recientes, como el de Tsai et al. [ 24 ] , utilizan incrustaciones de palabras obtenidas con un modelo skip-gram como características del lenguaje y pueden aplicarse a cualquier idioma para el que se disponga de un corpus extenso para construir dichas incrustaciones. Al igual que la mayoría de los sistemas de vinculación de entidades, consta de dos pasos: una selección inicial de candidatos y una clasificación mediante SVM lineal.

Se han intentado diversos enfoques para abordar el problema de la ambigüedad de las entidades. El enfoque pionero de Milne y Witten utiliza el aprendizaje supervisado con los textos de anclaje de las entidades de Wikipedia como datos de entrenamiento. [ 29 ] Otros enfoques también recopilaron datos de entrenamiento basados ​​en sinónimos inequívocos. [ 30 ]

Basado en grafos

Los sistemas modernos de vinculación de entidades también utilizan grandes grafos de conocimiento creados a partir de bases de conocimiento como Wikipedia, además de características textuales generadas a partir de documentos de entrada o corpus de texto. Además, la vinculación de entidades multilingües basada en el procesamiento del lenguaje natural (PLN) es difícil, ya que requiere grandes corpus de texto, inexistentes para muchos idiomas, o reglas gramaticales elaboradas manualmente, que varían considerablemente entre idiomas. La vinculación de entidades basada en grafos utiliza características de la topología del grafo o conexiones de múltiples saltos entre entidades, que resultan ocultas para el análisis de texto simple.

Han et al. proponen la creación de un grafo de desambiguación (un subgrafo de la base de conocimiento que contiene entidades candidatas). [ 3 ] Este grafo se utiliza para la clasificación colectiva con el fin de seleccionar la mejor entidad candidata para cada mención textual.

Otro enfoque famoso es AIDA, [ 31 ] que utiliza una serie de algoritmos de grafos complejos y un algoritmo voraz que identifica menciones coherentes en un subgrafo denso considerando también similitudes de contexto y características de importancia de vértices para realizar una desambiguación colectiva. [ 27 ]

Alhelbawy et al. presentaron un sistema de vinculación de entidades que utiliza PageRank para realizar la vinculación colectiva de entidades en un grafo de desambiguación y para comprender qué entidades están más fuertemente relacionadas entre sí y, por lo tanto, representarían una mejor vinculación. [ 21 ] Los algoritmos de clasificación de grafos (o clasificación de vértices), como PageRank (PR) y Hyperlink-Induced Topic Search (HITS), tienen como objetivo puntuar los nodos según su importancia relativa en el grafo.

Matemático

Las expresiones matemáticas (símbolos y fórmulas) pueden vincularse a entidades semánticas (p. ej., artículos de Wikipedia [ 32 ] o elementos de Wikidata [ 33 ] ) etiquetadas con su significado en lenguaje natural. Esto es esencial para la desambiguación, ya que los símbolos pueden tener diferentes significados (p. ej., "E" puede ser "energía" o "valor esperado", etc.). [ 34 ] [ 33 ] El proceso de vinculación de entidades matemáticas puede facilitarse y acelerarse mediante recomendaciones de anotaciones, p. ej., utilizando el sistema "AnnoMathTeX" alojado por Wikimedia. [ 35 ] [ 36 ] [ 37 ]

Para facilitar la reproducibilidad de los experimentos de Enlace de Entidades Matemáticas (MathEL), se creó el conjunto de datos de referencia MathMLben. [ 38 ] [ 39 ] Contiene fórmulas de Wikipedia, arXiv y la Biblioteca Digital de Funciones Matemáticas (DLMF) del NIST. Las entradas de fórmulas en el conjunto de datos de referencia están etiquetadas y ampliadas con marcado Wikidata . [ 33 ] Además, para dos grandes corpus de los repositorios arXiv [ 40 ] y zbMATH [ 41 ] se examinaron las distribuciones de notación matemática . Los Objetos Matemáticos de Interés (MOI) se identifican como candidatos potenciales para MathEL. [ 42 ]

Además de enlazar a Wikipedia, Schubotz [ 39 ] y Scharpf et al. [ 33 ] describen cómo enlazar el contenido de fórmulas matemáticas a Wikidata, tanto en MathML como en marcado LaTeX . Para extender las citas clásicas por fórmulas matemáticas, proponen un desafío de Descubrimiento de Conceptos de Fórmula (FCD) y Reconocimiento de Conceptos de Fórmula (FCR) para elaborar MathEL automatizado. Su enfoque FCD produce una recuperación del 68% para recuperar representaciones equivalentes de fórmulas frecuentes y del 72% para extraer el nombre de la fórmula del texto circundante en el conjunto de datos NTCIR [ 43 ] arXiv. [ 37 ]

Véase también

Referencias

  1. 1 2 3 M. A. Khalid, V. Jijkoun y M. de Rijke (2008). El impacto de la normalización de entidades nombradas en la recuperación de información para la respuesta a preguntas . Proc. ECIR.
  2. Ferré, Arnaud; Langlais, Philippe (2023). "Análisis de los sesgos en la evaluación de la normalización de entidades en dominios especializados" ( PDF) . BMC Bioinformatics . 24 (1): 227. doi : 10.1186/s12859-023-05350-9 . PMC 10236701. PMID 37268890 .  Error de cita: Parámetro desconocido """ en <ref>la etiqueta; los parámetros admitidos son dir, follow, group, name (consulte la página de ayuda ).
  3. 1 2 3 Han, Xianpei; Sun, Le; Zhao, Jun (2011). "Enlace de entidades colectivas en texto web" . Actas de la 34.ª conferencia internacional ACM SIGIR sobre investigación y desarrollo en recuperación de información . ACM. págs. 765–774 . doi : 10.1145/2009916.2010019 . ISBN  9781450307574. S2CID 14428938 . 
  4. Rada Mihalcea y Andras Csomai (2007) ¡Wikify! Vinculando documentos al conocimiento enciclopédico . Proc. CIKM.
  5. "Enlaces de Wikipedia" . 4 de mayo de 2023.
  6. Wikidata
  7. Aaron M. Cohen (2005). Normalización no supervisada de entidades nombradas de genes/proteínas mediante diccionarios extraídos automáticamente. Actas del Taller ACL -ISMB sobre la vinculación de literatura biológica, ontologías y bases de datos: minería de semántica biológica, págs. 17-24.
  8. Shen W, Wang J, Han J. Vinculación de entidades con una base de conocimiento: Problemas, técnicas y soluciones[J]. IEEE Transactions on Knowledge and Data Engineering, 2014, 27(2): 443-460.
  9. Chang YC, Chu CH, Su YC, et al. PIPE: un módulo de extracción de pasajes de interacción proteína-proteína para el desafío BioCreative[J]. Base de datos, 2016, 2016.
  10. Lou P, Jimeno Yepes A, Zhang Z, et al. BioNorm: normalización de eventos basada en aprendizaje profundo para la curación de bases de datos de reacciones[J]. Bioinformatics, 2020, 36(2): 611-620.
  11. Slawski, Bill (16 de septiembre de 2015). "Cómo utiliza Google la desambiguación de entidades nombradas para entidades con los mismos nombres" .
  12. Zhou, Ming; Lv, Weifeng; Ren, Pengjie; Wei, Furu; Tan, Chuanqi (2017). "Entity Linking for Queries by Searching Wikipedia Sentences" . Actas de la Conferencia de 2017 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . págs. 68–77 . arXiv : 1704.02788 . doi : 10.18653/v1/D17-1007 . S2CID 1125678 .  
  13. Le, Quoc; Mikolov, Tomas (2014). "Representaciones distribuidas de oraciones y documentos" . Actas de la 31.ª Conferencia Internacional sobre Aprendizaje Automático . 32 : II–1188–II–1196. arXiv : 1405.4053 .
  14. 1 2 Hui Han, Hongyuan Zha, C. Lee Giles, "Desambiguación de nombres en citas de autores mediante un método de agrupamiento espectral K-way", Conferencia Conjunta ACM/IEEE sobre Bibliotecas Digitales 2005 (JCDL 2005): 334-343, 2005
  15. "STICS" . Archivado del original el 1 de septiembre de 2021. Consultado el 16 de noviembre de 2015 .
  16. Hoffart, Johannes; Milchevski, Dragan; Weikum, Gerhard (2014-07-03). "STICS: Búsqueda con cadenas, cosas y gatos" . Actas de la 37.ª conferencia internacional ACM SIGIR sobre investigación y desarrollo en recuperación de información . SIGIR '14. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 1247–1248 . doi : 10.1145/2600428.2611177 . ISBN  978-1-4503-2257-7.
  17. 1 2 3 4 Rao, Delip; McNamee, Paul; Dredze, Mark (2013). "Entity Linking: Finding Extracted Entities in a Knowledge Base". Extracción y resumen de información multilingüe y de múltiples fuentes . Teoría y aplicaciones del procesamiento del lenguaje natural. Springer Berlin Heidelberg. pp. 93–115 . doi : 10.1007/978-3-642-28569-1_5 . ISBN  978-3-642-28568-4. S2CID 6420241 . 
  18. Parravicini, Alberto; Patra, Rhicheek; Bartolini, Davide B.; Santambrogio, Marco D. (2019). "Enlace rápido y preciso de entidades mediante incrustación de grafos" . Actas del 2.º Taller Internacional Conjunto sobre Experiencias y Sistemas de Gestión de Datos de Grafos (GRADES) y Análisis de Datos de Red (NDA) . ACM. págs. 10:1–10:9. doi : 10.1145/3327964.3328499 . hdl : 11311/1119019 . ISBN  9781450367899. S2CID 195357229 . 
  19. Hoffart, Johannes; Altun, Yasemin; Weikum, Gerhard (2014). «Descubriendo entidades emergentes con nombres ambiguos» . Actas de la 23.ª conferencia internacional sobre la World Wide Web . ACM. págs. 385–396 . doi : 10.1145/2566486.2568003 . ISBN  9781450327442. S2CID 7562986 . 
  20. McNamee, Paul; Mayfield, James; Lawrie, Dawn; Oard, Douglas W.; Doermann, David (8–13 de noviembre de 2011). Vinculación de entidades entre idiomas (PDF) . 5.ª Conferencia Internacional Conjunta sobre Procesamiento del Lenguaje Natural. Chiang Mai, Tailandia: AFNLP . págs. 255–263 . 
  21. 1 2 Alhelbawy, Ayman; Gaizauskas, Robert (23–29 de agosto de 2014). Desambiguación colectiva de entidades nombradas mediante enfoques de clasificación de grafos y partición de cliques (PDF) . COLING 2014, XXV Conferencia Internacional sobre Lingüística Computacional: Documentos Técnicos. Dublín, Irlanda: COLING. págs. 1544–1555 . 
  22. 1 2 Zwicklbauer, Stefan; Seifert, Christin; Granitzer, Michael (2016). "Desambiguación robusta y colectiva de entidades mediante incrustaciones semánticas" . Actas de la 39.ª Conferencia Internacional ACM SIGIR sobre Investigación y Desarrollo en Recuperación de Información (PDF) . ACM. págs. 425–434 . doi : 10.1145/2911451.2911535 . ISBN  9781450340694. S2CID 207237647 . 
  23. 1 2 Hachey, Ben; Radford, Will; Nothman, Joel; Honnibal, Matthew; Curran, James R. (2013). "Evaluating Entity Linking with Wikipedia" . Artif. Intell . 194 : 130–150 . doi : 10.1016/j.artint.2012.04.005 . ISSN 0004-3702 . 
  24. 1 2 Tsai, Chen-Tse; Roth, Dan (2016). "Wikificación interlingüística mediante incrustaciones multilingües" . Actas de la Conferencia de 2016 del Capítulo Norteamericano de la Asociación de Lingüística Computacional: Tecnologías del Lenguaje Humano . Vol. Actas de NAACL-HLT 2016. págs. 589–598 . doi : 10.18653/v1/N16-1072 . S2CID 15156124 .   
  25. Ji, Heng; Nothman, Joel; Hachey, Ben; Florian, Radu (2015). "Descripción general del descubrimiento y vinculación de entidades trilingües de TAC-KBP2015". TAC .
  26. 1 2 Cucerzan, Silviu (junio de 2007). "Desambiguación de entidades nombradas a gran escala basada en datos de Wikipedia" . Actas de la Conferencia Conjunta de 2007 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural y Aprendizaje Computacional del Lenguaje Natural (EMNLP-CoNLL) . Asociación de Lingüística Computacional. págs. 708–716 . 
  27. 1 2 Weikum, Gerhard; Thater, Stefan; Taneva, Bilyana; Spaniol, Marc; Pinkal, Manfred; Fürstenau, Hagen; Bordino, Ilaria; Yosef, Mohamed Amir; Hoffart, Johannes (2011). "Desambiguación robusta de entidades nombradas en texto" . Actas de la Conferencia de 2011 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural : 782–792 .
  28. Kulkarni, Sayali; Singh, Amit; Ramakrishnan, Ganesh; Chakrabarti, Soumen (2009). Anotación colectiva de entidades de Wikipedia en texto web . Actas de la 15.ª Conferencia Internacional ACM SIGKDD sobre Descubrimiento de Conocimiento y Minería de Datos (KDD). CiteSeerX 10.1.1.151.1904 . doi : 10.1145/1557019.1557073 . ISBN  9781605584959.
  29. David Milne e Ian H. Witten (2008). Aprender a enlazar con Wikipedia. Proc. CIKM.
  30. Zhang, Wei; Jian Su; Chew Lim Tan (2010). "Entity Linking Leveraging Automatically Generated Annotation". Actas de la 23.ª Conferencia Internacional sobre Lingüística Computacional (Coling 2010) .
  31. Yosef, Mohamed Amir; Hoffart, Johannes; Bordino, Ilaria; Spaniol, Marc; Weikum, Gerhard (2011). "AIDA: Una herramienta en línea para la desambiguación precisa de entidades nombradas en texto y tablas". Actas de la 37.ª Conferencia Internacional sobre Bases de Datos Muy Grandes . VLDB 2011: 1450–1453 .
  32. Giovanni Yoko Kristianto; Goran Topic; Akiko Aizawa; et al. (2016). «Entity Linking for Mathematical Expressions in Scientific Documents». Bibliotecas digitales: conocimiento, información y datos en una sociedad de acceso abierto . Lecture Notes in Computer Science. Vol. 10075. Springer. pp. 144–149 . doi : 10.1007/978-3-319-49304-6_18 . ISBN    978-3-319-49303-9.
  33. 1 2 3 4 Philipp Scharpf; Moritz Schubotz; et al. (2018). Representación de fórmulas matemáticas en contenido MathML usando Wikidata . Conferencia ACM SIGIR sobre investigación y desarrollo en recuperación de información (SIGIR 2018). 
  34. Moritz Schubotz; Philipp Scharpf; et al. (2018). "Introducción a MathQA: un sistema de respuesta a preguntas con conocimientos matemáticos". Information Discovery and Delivery . 46 (4). Emerald Publishing Limited: 214– 224. arXiv : 1907.01642 . doi : 10.1108/IDD-06-2018-0022 . S2CID 49484035 .  
  35. "Sistema recomendador de anotaciones de fórmulas/identificadores AnnoMathTeX" .
  36. Philipp Scharpf; Ian Mackerracher; et al. (17 de septiembre de 2019). « AnnoMathTeX : un sistema recomendador de anotaciones de identificadores de fórmulas para documentos STEM». Actas de la 13.ª Conferencia ACM sobre Sistemas de Recomendación (PDF) . págs. 532–533 . doi : 10.1145/3298689.3347042 . ISBN   9781450362436. S2CID 202639987 . 
  37. 1 2 Philipp Scharpf; Moritz Schubotz; Bela Gipp (14 de abril de 2021). «Enlace rápido de entidades matemáticas de Wikidata en artículos de Wikipedia mediante recomendación de anotaciones». Actas complementarias de la Web Conference 2021 (PDF) . págs. 602–609 . arXiv : 2104.05111 . doi : 10.1145/3442442.3452348 . ISBN  9781450383134. S2CID 233210264 . 
  38. "Prueba comparativa de fórmulas MathMLben" .
  39. 1 2 Moritz Schubotz; André Greiner-Petter; Philipp Scharpf; Norman Meuschke; Howard Cohl; Bela Gipp (2018). "Mejora de la representación y conversión de fórmulas matemáticas considerando su contexto textual". Actas de la 18.ª Conferencia Conjunta ACM/IEEE sobre Bibliotecas Digitales (PDF) . Vol. 39. págs. 233–242 . arXiv : 1804.04956 . doi : 10.1145/3197026.3197058 . ISBN   9781450351782. PMC 8474120 . PMID 34584342 . S2CID 4872257 .   
  40. "repositorio de preimpresiones de arXiv" .
  41. "biblioteca de documentos matemáticos zbMath" .
  42. André Greiner-Petter; Moritz Schubotz; Fabian Mueller; Corinna Breitinger; Howard S. Cohl; Akiko Aizawa; Bela Gipp (2020). «Descubriendo objetos matemáticos de interés: un estudio de notaciones matemáticas». Actas de la Conferencia Web 2020 (PDF) . págs. 1445–1456 . arXiv : 2002.02712 . doi : 10.1145/3366423.3380218 . ISBN  9781450370233. S2CID 211066554 . 
  43. Akiko Aizawa; Michael Kohlhase; Iadh Ounis; Moritz Schubotz. "Descripción general de la tarea NTCIR-11 Math-2". Actas de la 11.ª Conferencia NTCIR sobre evaluación de tecnologías de acceso a la información .