Articulo de referencia

Extracción de tablas

La extracción de tablas es el proceso de identificar y separar una tabla de un documento extenso, pudiendo también identificar filas, columnas o elementos individuales. Puede co...

La extracción de tablas es el proceso de identificar y separar una tabla de un documento extenso, pudiendo también identificar filas, columnas o elementos individuales. Puede considerarse una forma especial de extracción de información .

La extracción de tablas de páginas web puede aprovechar los elementos HTML especiales que existen para las tablas, como la etiqueta "table", y las bibliotecas de programación pueden implementar esta función. La biblioteca de software pandas de Python puede extraer tablas de páginas web HTML mediante su función read_html().

Más difícil resulta la extracción de tablas de archivos PDF o imágenes escaneadas , donde generalmente no existe un marcado legible por máquina específico para tablas. [ 1 ] Se han descrito sistemas que extraen datos de tablas en archivos PDF científicos. [ 2 ] [ 3 ]

Wikipedia presenta parte de su información en tablas y, por ejemplo, se pueden extraer 3,5 millones de tablas de la Wikipedia en inglés . [ 4 ] Algunas de las tablas tienen un formato específico, por ejemplo, las llamadas infoboxes . La extracción a gran escala de tablas de infoboxes de Wikipedia constituye una de las fuentes de DBpedia . [ 5 ]

Existen servicios web comerciales para la extracción de tablas, por ejemplo, Amazon Textract, Google Document AI , IBM Watson Discovery y Microsoft Form Recognizer. [ 1 ] También existen herramientas de código abierto, por ejemplo, PDFFigures 2.0 que se ha utilizado en Semantic Scholar . [ 6 ] En una comparación publicada en 2017, los investigadores encontraron que el programa propietario ABBYY FineReader produjo el mejor rendimiento de extracción de tablas de PDF entre seis herramientas diferentes evaluadas. [ 7 ] En una evaluación de referencia de 2023, [ 8 ] Adobe Extract, [ 9 ] una API basada en la nube que emplea la plataforma de IA Sensei de Adobe , [ 10 ] tuvo el mejor desempeño entre cinco herramientas evaluadas para la extracción de tablas.

Referencias

  1. 1 2 Douglas Burdick; Marina Danilevsky; Alexandre V Evfimievski; Yannis Katsis; Nancy Wang (agosto de 2020). "Extracción y comprensión de tablas para aplicaciones científicas y empresariales". Actas de la VLDB Endowment. Conferencia Internacional sobre Bases de Datos Muy Grandes . 13 (12): 3433– 3436. doi : 10.14778/3415478.3415563 . ISSN 2150-8097 . Wikidata Q108170445 .  
  2. Wenhao Yu; Wei Peng; Yu Shu; Qingkai Zeng; Meng Jiang (19 de abril de 2020). Sistema experimental de extracción de evidencia en ciencia de datos con características de tabla híbridas y aprendizaje de conjuntos . págs. 951–961 . doi : 10.1145/3366423.3380174 . ISBN  978-1-4503-7023-3. Wikidata Q108172460 . {{cite book}}: |journal=ignorado ( ayuda )
  3. Benno Kruit; Hongyu He; Jacopo Urbani (1 de noviembre de 2020). Tab2Know: Creación de una base de conocimiento a partir de tablas en artículos científicos . Lecture Notes in Computer Science . págs. 349–365 . arXiv : 2107.13306 . doi : 10.1007/978-3-030-62419-4_20 . ISBN  978-3-030-62419-4. Wikidata Q101086651 . {{cite book}}: |journal=ignorado ( ayuda )
  4. Tobias Bleifuß; Leon Bornemann; Dmitri V. Kalashnikov; Felix Naumann; Divesh Srivastava (17 de agosto de 2021). "La vida secreta de las tablas de Wikipedia" (PDF) . Actas del 2.º Taller sobre búsqueda, exploración y análisis en almacenes de datos heterogéneos . CEUR Workshop Proceedings: 20–26 . Wikidata Q108215401 . 
  5. Sören Auer; Christian Bizer; Georgi Kobilarov; Jens Lehmann ; Richard Cyganiak; Zachary Ives (2007). DBpedia: Un núcleo para una web de datos abiertos . Lecture Notes in Computer Science . págs. 722–735 . doi : 10.1007/978-3-540-76298-0_52 . ISBN  978-3-540-76297-3. Wikidata Q27910422 . {{cite book}}: |journal=ignorado ( ayuda )
  6. Christopher Clark; Santosh Divvala (2016), PDFFigures 2.0: Minería de figuras a partir de artículos de investigación , Actas de la 16.ª Conferencia Conjunta ACM/IEEE-CS sobre Bibliotecas Digitales - JCDL ' 16, Wikidata Q108172042 
  7. Andreiwid Sheffer Corrêa; Pär-Ola Zander (7 de junio de 2017), Liberando el contenido tabular para datos abiertos: un estudio sobre métodos y herramientas de extracción de tablas PDF , Association for Computing Machinery , doi : 10.1145/3085228.3085278 , Wikidata Q108173686 
  8. Meuschke, Norman; Jagdale, Apurva; Spinde, Timo; Mitrović, Jelena; Gipp, Bela (2023), "A Benchmark of PDF Information Extraction Tools Using a Multi-task and Multi-domain Evaluation Framework for Academic Documents" , en Sserwanga, Isaac; Goulding, Anne; Moulaison-Sandy, Heather; Du, Jia Tina (eds.), Information for a Better World: Normality, Virtuality, Physicality, Inclusivity , vol. 13972, Cham: Springer Nature Switzerland, pp. 383–405 , arXiv : 2303.09957 , doi : 10.1007/978-3-031-28032-0_31 , ISBN   978-3-031-28031-3
  9. "API de extracción de PDF de Adobe" . Adobe . Consultado el 15 de marzo de 2024 .
  10. "Experimente los servicios de IA en la nube con Adobe Sensei" . Adobe . Consultado el 15 de marzo de 2024 .
Obtenido de " https://en.wikipedia.org/w/index.php?title=Table_extraction&oldid=1360740344 "