Articulo de referencia

Extracción de información

La extracción de información ( EI ) es la tarea de extraer automáticamente información estructurada de documentos legibles por máquina, no estructurados o semiestructurados, y o...

La extracción de información ( EI ) es la tarea de extraer automáticamente información estructurada de documentos legibles por máquina, no estructurados o semiestructurados, y otras fuentes representadas electrónicamente. Por lo general, esto implica el procesamiento de textos en lenguaje humano mediante el procesamiento del lenguaje natural (PLN). [ 1 ] Las actividades recientes en el procesamiento de documentos multimedia , como la anotación automática y la extracción de contenido de imágenes, audio, video y documentos, podrían considerarse como extracción de información.

Los recientes avances en las técnicas de PLN han permitido un rendimiento significativamente mejorado en comparación con años anteriores. [ 2 ] Un ejemplo es la extracción de informes de agencias de noticias sobre fusiones corporativas, como se indica mediante la relación formal:

FusiónEntre(doometropaganortey1,doometropaganortey2,datmi){\displaystyle \operatorname {Fusión entre} (\mathrm {empresa} _{1},\mathrm {empresa} _{2},\mathrm {fecha} )},

de una frase de noticias en línea como por ejemplo:

"Ayer, Foo Inc., con sede en Nueva York, anunció la adquisición de Bar Corp."

Un objetivo general de la IE es permitir realizar cálculos sobre datos previamente no estructurados. Un objetivo más específico es permitir el razonamiento automatizado sobre la forma lógica de los datos de entrada. Los datos estructurados son datos semánticamente bien definidos de un dominio objetivo elegido, interpretados con respecto a la categoría y el contexto .

La extracción de información es parte de un rompecabezas más grande que aborda el problema de idear métodos automáticos para la gestión de textos, más allá de su transmisión, almacenamiento y visualización. La disciplina de recuperación de información (RI) [ 3 ] ha desarrollado métodos automáticos, generalmente de carácter estadístico, para indexar grandes colecciones de documentos y clasificarlos. Otro enfoque complementario es el del procesamiento del lenguaje natural (PLN), que ha resuelto el problema de modelar el procesamiento del lenguaje humano con considerable éxito al tener en cuenta la magnitud de la tarea. En términos de dificultad y énfasis, la RI aborda tareas intermedias entre la RI y el PLN. En términos de entrada, la RI asume la existencia de un conjunto de documentos en los que cada documento sigue una plantilla, es decir, describe una o más entidades o eventos de manera similar a los de otros documentos, pero con detalles diferentes. Por ejemplo, consideremos un grupo de artículos de agencias de noticias sobre terrorismo latinoamericano, donde se presume que cada artículo se basa en uno o más actos terroristas. También definimos para cada tarea de extracción de información una plantilla, que consiste en uno o varios marcos de casos para almacenar la información contenida en un único documento. En el ejemplo del terrorismo, una plantilla tendría campos correspondientes al autor, la víctima y el arma del acto terrorista, así como la fecha en que ocurrió el suceso. Un sistema de extracción de información para este problema solo necesita comprender un artículo sobre un ataque lo suficiente como para encontrar los datos correspondientes a los campos de esta plantilla.

Historia

La extracción de información se remonta a finales de la década de 1970, en los inicios del PLN. [ 4 ] Un sistema comercial temprano de mediados de la década de 1980 fue JASPER, construido para Reuters por Carnegie Group Inc. con el objetivo de proporcionar noticias financieras en tiempo real a los operadores financieros. [ 5 ]

A partir de 1987, la IE fue impulsada por una serie de Conferencias de Comprensión de Mensajes . MUC es una conferencia basada en competencias [ 6 ] que se centró en los siguientes dominios:

  • MUC-1 (1987), MUC-3 (1989): Mensajes de operaciones navales.
  • MUC-3 (1991), MUC-4 (1992): El terrorismo en los países latinoamericanos.
  • MUC-5 (1993): Empresas conjuntas y el sector de la microelectrónica.
  • MUC-6 (1995): Artículos de noticias sobre cambios en la dirección.
  • MUC-7 (1998): Informes de lanzamiento del satélite.

La Agencia de Proyectos de Investigación Avanzada de Defensa de Estados Unidos ( DARPA ) brindó un apoyo considerable , ya que deseaba automatizar tareas rutinarias realizadas por analistas gubernamentales, como el escaneo de periódicos en busca de posibles vínculos con el terrorismo.

Importancia actual

La importancia actual de la IE radica en la creciente cantidad de información disponible en formato no estructurado. Tim Berners-Lee , inventor de la World Wide Web , se refiere a Internet como la web de documentos [ 7 ] y aboga por que se ponga a disposición más contenido como una web de datos [ 8 ] . Hasta que esto ocurra, la web consiste principalmente en documentos no estructurados que carecen de metadatos semánticos . El conocimiento contenido en estos documentos puede hacerse más accesible para el procesamiento automático mediante su transformación a formato relacional o mediante el marcado con etiquetas XML . Un agente inteligente que monitoriza un flujo de noticias requiere IE para transformar los datos no estructurados en algo con lo que se pueda razonar. Una aplicación típica de IE es escanear un conjunto de documentos escritos en lenguaje natural y poblar una base de datos con la información extraída [ 9 ] .

Tareas y subtareas

La aplicación de la extracción de información a textos está vinculada al problema de la simplificación textual, con el fin de crear una vista estructurada de la información presente en texto libre. El objetivo general es crear un texto más fácilmente legible por máquina para procesar las oraciones. Las tareas y subtareas típicas de la extracción de información incluyen:

  • Relleno de plantillas: Extracción de un conjunto fijo de campos de un documento, por ejemplo, extraer los autores, las víctimas, la fecha, etc., de un artículo periodístico sobre un atentado terrorista.
    • Extracción de eventos: Dado un documento de entrada, generar cero o más plantillas de eventos. Por ejemplo, un artículo periodístico podría describir varios ataques terroristas.
  • Población de la base de conocimiento : Rellenar una base de datos de hechos a partir de un conjunto de documentos. Normalmente, la base de datos tiene la forma de tríos (entidad 1, relación, entidad 2), por ejemplo ( Barack Obama , cónyuge, Michelle Obama ).
    • Reconocimiento de entidades nombradas : reconocimiento de nombres de entidades conocidas (para personas y organizaciones), nombres de lugares, expresiones temporales y ciertos tipos de expresiones numéricas, empleando el conocimiento existente del dominio o información extraída de otras oraciones. [ 10 ] Normalmente, la tarea de reconocimiento implica asignar un identificador único a la entidad extraída. Una tarea más simple es la detección de entidades nombradas , que tiene como objetivo detectar entidades sin tener ningún conocimiento previo sobre las instancias de la entidad. Por ejemplo, al procesar la oración "M. Smith likes fishing" (A M. Smith le gusta pescar), la detección de entidades nombradas denotaría detectar que la frase "M. Smith" se refiere a una persona, pero sin tener necesariamente (o usar) ningún conocimiento sobre un M. Smith específico que sea (o "podría ser") la persona específica de la que habla esa oración.
    • Resolución de correferencias : detección de correferencias y vínculos anafóricos entre entidades de texto. En tareas de extracción de información, esto generalmente se limita a encontrar vínculos entre entidades nombradas previamente extraídas. Por ejemplo, "International Business Machines" e "IBM" se refieren a la misma entidad del mundo real. Si tomamos las dos oraciones "A M. Smith le gusta pescar, pero no le gusta andar en bicicleta", sería útil detectar que "él" se refiere a la persona "M. Smith" detectada previamente.
    • Extracción de relaciones : identificación de relaciones entre entidades, [ 10 ] tales como:
      • PERSONA trabaja para ORGANIZACIÓN (extraído de la oración "Bill trabaja para IBM.")
      • PERSONA ubicada en UBICACIÓN (extraído de la oración "Bill está en Francia.")
  • La extracción de información semiestructurada puede referirse a cualquier IE que intente restaurar algún tipo de estructura de información que se haya perdido a través de la publicación, como por ejemplo:
    • Extracción de tablas: búsqueda y extracción de tablas de documentos. [ 11 ] [ 12 ]
    • Extracción de información de tablas  : extracción de información de tablas de forma estructurada. Esta tarea es más compleja que la extracción de tablas, ya que esta última es solo el primer paso, mientras que comprender las funciones de las celdas, filas y columnas, vincular la información dentro de la tabla y comprender la información presentada en ella son tareas adicionales necesarias para la extracción de información de tablas. [ 11 ] [ 13 ] [ 14 ]
    • Extracción de comentarios  : extracción de comentarios del contenido real de los artículos para restablecer el vínculo entre los autores de cada una de las oraciones.
  • Análisis del lenguaje y del vocabulario
  • Extracción de audio
    • Extracción de música basada en plantillas: encontrar características relevantes en una señal de audio tomada de un repertorio dado; por ejemplo [ 15 ] se pueden extraer índices de tiempo de ocurrencias de sonidos de percusión para representar el componente rítmico esencial de una pieza musical.

Cabe señalar que esta lista no es exhaustiva y que el significado exacto de las actividades de IE no es universalmente aceptado. Además, muchos enfoques combinan diversas subtareas de IE para lograr un objetivo más amplio. El aprendizaje automático, el análisis estadístico y/o el procesamiento del lenguaje natural se utilizan con frecuencia en IE.

La extracción de información en documentos no textuales se está convirtiendo en un tema de investigación cada vez más interesante, y la información extraída de documentos multimedia ahora puede expresarse en una estructura de alto nivel, al igual que se hace con el texto. Esto conduce naturalmente a la fusión de información extraída de múltiples tipos de documentos y fuentes.

Aplicaciones de la World Wide Web

La extracción de información (IE) ha sido el tema central de las conferencias MUC. Sin embargo, la proliferación de la web intensificó la necesidad de desarrollar sistemas de IE que ayuden a las personas a gestionar la enorme cantidad de datos disponibles en línea. Los sistemas que realizan IE a partir de texto en línea deben cumplir con los requisitos de bajo costo, flexibilidad en el desarrollo y fácil adaptación a nuevos dominios. Los sistemas MUC no cumplen con estos criterios. Además, el análisis lingüístico realizado para texto no estructurado no aprovecha las etiquetas HTML/ XML ni los formatos de diseño disponibles en los textos en línea. Como resultado, se han desarrollado enfoques menos intensivos lingüísticamente para la IE en la web mediante el uso de wrappers , que son conjuntos de reglas altamente precisas que extraen el contenido de una página en particular. El desarrollo manual de wrappers ha demostrado ser una tarea laboriosa que requiere un alto nivel de experiencia. Se han utilizado técnicas de aprendizaje automático , tanto supervisadas como no supervisadas , para generar dichas reglas automáticamente.

Los envoltorios suelen manejar colecciones de páginas web altamente estructuradas, como catálogos de productos y guías telefónicas. Sin embargo, fallan cuando el texto es menos estructurado, algo común en la web. Los recientes esfuerzos en la extracción adaptativa de información impulsan el desarrollo de sistemas de extracción de información capaces de manejar diferentes tipos de texto, desde texto bien estructurado hasta texto casi libre —donde fallan los envoltorios comunes—, incluyendo textos mixtos. Estos sistemas pueden aprovechar el conocimiento básico del lenguaje natural y, por lo tanto, también pueden aplicarse a textos menos estructurados.

Un desarrollo reciente es la extracción de información visual, [ 16 ] [ 17 ] que se basa en la representación de una página web en un navegador y la creación de reglas basadas en la proximidad de regiones en la página web representada. Esto ayuda a extraer entidades de páginas web complejas que pueden presentar un patrón visual, pero carecen de un patrón discernible en el código fuente HTML.

Aproches

Actualmente, se aceptan ampliamente los siguientes enfoques estándar:

Existen muchos otros enfoques para la ingeniería inversa, incluidos enfoques híbridos que combinan algunos de los enfoques estándar mencionados anteriormente.

Software y servicios gratuitos o de código abierto

Véase también

Referencias

  1. nombre=Kariampuzha2023 Kariampuzha, William; Alyea, Gioconda; Qu, Sue; Sanjak, Jaleal; Mathé, Ewy; Sid, Eric; Chatelaine, Haley; Yadaw, Arjun; Xu, Yanji; Zhu, Qian (2023). "Extracción de información de precisión para la epidemiología de enfermedades raras a gran escala" . Journal of Translational Medicine . 21 (1): 157. doi : 10.1186 / s12967-023-04011-y . PMC 9972634. PMID 36855134 .  
  2. Christina Niklaus, Matthias Cetto, André Freitas y Siegfried Handschuh. 2018. Un estudio sobre la extracción de información abierta. En Actas de la 27.ª Conferencia Internacional sobre Lingüística Computacional , páginas 3866–3878, Santa Fe, Nuevo México, EE. UU. Asociación de Lingüística Computacional.
  3. FREITAG, DAYNE. "Aprendizaje automático para la extracción de información en dominios informales" (PDF) . 2000 Kluwer Academic Publishers. Impreso en los Países Bajos .
  4. Cowie, Jim; Wilks, Yorick (1996). Extracción de información (PDF) . pág. 3. CiteSeerX 10.1.1.61.6480 . S2CID 10237124. Archivado del original (PDF) el 20 de febrero de 2019.   
  5. Andersen, Peggy M.; Hayes, Philip J.; Huettner, Alison K.; Schmandt, Linda M.; Nirenburg, Irene B.; Weinstein, Steven P. (1992). "Extracción automática de hechos de comunicados de prensa para generar noticias" . Actas de la tercera conferencia sobre procesamiento del lenguaje natural aplicado . pp. 170–177 . CiteSeerX 10.1.1.14.7943 . doi : 10.3115/974499.974531 . S2CID 14746386 .   
  6. ^ Marco Costantino, Paolo Coletti, Extracción de información en finanzas, Wit Press, 2008. ISBN 978-1-84564-146-7
  7. "Datos vinculados: la historia hasta ahora" (PDF) .
  8. "Tim Berners-Lee en la próxima Web" . Archivado del original el 10 de abril de 2011. Consultado el 27 de marzo de 2010 .
  9. RK Srihari , W. Li, C. Niu y T. Cornell,"InfoXtract: Un motor de extracción de información de nivel intermedio personalizable", Journal of Natural Language Engineering ,Cambridge U. Press, 14(1), 2008, pp.33-69.
  10. 1 2 Nguyen, Dat Quoc; Verspoor, Karin (2019). "Extracción de relaciones neuronales de extremo a extremo mediante atención biafín profunda". Actas de la 41.ª Conferencia Europea sobre Recuperación de Información (ECIR) . arXiv : 1812.11275 . doi : 10.1007/978-3-030-15712-8_47 .
  11. 1 2 Milosevic N, Gregson C, Hernandez R, Nenadic G (febrero de 2019). "Un marco para la extracción de información de tablas en la literatura biomédica". Revista Internacional sobre Análisis y Reconocimiento de Documentos . 22 (1): 55– 78. arXiv : 1902.10031 . Bibcode : 2019arXiv190210031M . doi : 10.1007/s10032-019-00317-0 . S2CID 62880746 . 
  12. Milosevic, Nikola (2018). Un enfoque multicapa para la extracción de información de tablas en documentos biomédicos (PDF) (Tesis doctoral). Universidad de Manchester.
  13. Milosevic N, Gregson C, Hernandez R, Nenadic G (junio de 2016). «Desentrañando la estructura de las tablas en la literatura científica» . Procesamiento del lenguaje natural y sistemas de información . Notas de clase en informática. Vol. 21. págs. 162–174 . doi : 10.1007/978-3-319-41754-7_14 . ISBN   978-3-319-41753-0. S2CID 19538141 . 
  14. Milosevic, Nikola (2018). Un enfoque multicapa para la extracción de información de tablas en documentos biomédicos (PDF) (Tesis doctoral). Universidad de Manchester.
  15. A.Zils, F.Pachet, O.Delerue y F. Gouyon, Extracción automática de pistas de batería a partir de señales musicales polifónicas. Archivado el 29 de agosto de 2017 en Wayback Machine , Actas de WedelMusic, Darmstadt, Alemania, 2002.
  16. ^ Chenthamarakshan, Vijil; Desphande, Prasad M; Krishnapuram, Raghu; Varadarajan, Ramakrishnan; Stolze, Knut (2015). "WYSIWYE: un álgebra para expresar reglas espaciales y textuales para la extracción de información". arXiv : 1506.08454 [ cs.CL ].
  17. Baumgartner, Robert; Flesca, Sergio; Gottlob, Georg (2001). "Extracción de información web visual con Lixto". pp. 119– 128. CiteSeerX 10.1.1.21.8236 .  
  18. Peng, F.; McCallum, A. (2006). "Extracción de información de artículos de investigación mediante campos aleatorios condicionales☆". Information Processing & Management . 42 (4): 963. doi : 10.1016/j.ipm.2005.09.002 .
  19. Shimizu, Nobuyuki; Hass, Andrew (2006). "Extracción de la representación del conocimiento basada en marcos a partir de instrucciones de ruta" (PDF) . Archivado del original (PDF) el 1 de septiembre de 2006. Recuperado el 27 de marzo de 2010 .
  • Página de "competencia" de Alias-I: Un listado de herramientas académicas e industriales para la extracción de información en lenguaje natural.
  • Página de Gabor Melli sobre IE: Descripción detallada de la tarea de extracción de información.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Information_extraction&oldid=1359999182 "