Articulo de referencia

Indexación automática

La indexación automática es el proceso computarizado de escanear grandes volúmenes de documentos contra un vocabulario controlado , taxonomía , tesauro u ontología , y utilizar ...

La indexación automática es el proceso computarizado de escanear grandes volúmenes de documentos contra un vocabulario controlado , taxonomía , tesauro u ontología , y utilizar esos términos controlados para indexar de forma rápida y eficaz grandes repositorios de documentos electrónicos . Estas palabras clave o lenguaje se aplican entrenando un sistema con las reglas que determinan qué palabras deben coincidir. Hay partes adicionales a esto, como la sintaxis, el uso, la proximidad y otros algoritmos basados ​​en el sistema y lo que se requiere para la indexación. Esto se tiene en cuenta utilizando sentencias booleanas para recopilar y capturar la información de indexación del texto. [ 1 ] A medida que el número de documentos aumenta exponencialmente con la proliferación de Internet , la indexación automática se volverá esencial para mantener la capacidad de encontrar información relevante en un mar de información irrelevante . Los sistemas de lenguaje natural se utilizan para entrenar un sistema basado en siete métodos diferentes para ayudar con este mar de información irrelevante. Estos métodos son morfológico, léxico, sintáctico, numérico, fraseológico, semántico y pragmático. Cada uno de estos elementos, junto con diferentes partes de velocidad y términos, se utiliza para construir un dominio para la información específica que se está indexando. Esto se emplea en el proceso automatizado de indexación. [ 1 ]

El proceso automatizado puede encontrar problemas, causados ​​principalmente por dos factores: 1) la complejidad del lenguaje; y 2) la falta de intuición y la dificultad de extrapolar conceptos a partir de enunciados por parte de la tecnología informática. [ 2 ] Estos son principalmente desafíos lingüísticos y problemas específicos que involucran aspectos semánticos y sintácticos del lenguaje. [ 2 ] Estos problemas ocurren en función de palabras clave definidas. Con estas palabras clave, se puede determinar la precisión del sistema en función de aciertos, fallos y ruido. Estos términos se refieren a coincidencias exactas, palabras clave que un sistema computarizado omitió pero que un humano no habría detectado, y palabras clave que la computadora seleccionó pero que un humano no habría seleccionado. La estadística de precisión basada en esto debería ser superior al 85 % para aciertos sobre el 100 % para la indexación humana. Esto sitúa los fallos y el ruido combinados en un 15 % o menos. Esta escala proporciona una base para lo que se considera un buen sistema de indexación automática y muestra dónde se encuentran los problemas. [ 1 ]

Historia

La indexación automática atrajo la atención ya en la década de 1950, particularmente con la demanda de un acceso más rápido y completo a la literatura científica y de ingeniería. [ 3 ] Esta atención en la indexación comenzó con el procesamiento de texto entre 1957 y 1959 por HP Lunh a través de una serie de artículos que se publicaron. Lunh propuso que una computadora podría manejar la coincidencia de palabras clave, la clasificación y el análisis de contenido . Este fue el comienzo de la indexación automática y la fórmula para extraer palabras clave del texto basándose en el análisis de frecuencia. Más tarde se determinó que la frecuencia por sí sola no era suficiente para buenos descriptores, sin embargo, esto inició el camino hacia donde estamos ahora con la indexación automática. [ 4 ] Esto se destacó por la explosión de la información , que se predijo en la década de 1960 [ 5 ] y que se produjo a través del surgimiento de la tecnología de la información y la World Wide Web. La predicción fue preparada por Mooers, quien creó un esquema con el papel esperado que la computación tendría para el procesamiento de texto y la recuperación de información . Esta predicción decía que las máquinas se usarían para almacenar documentos en grandes colecciones y que usaríamos estas máquinas para realizar búsquedas. Mooers también predijo el aspecto en línea y el entorno de recuperación para indexar bases de datos. Esto llevó a Mooers a predecir una Máquina de Inferencia Inductiva que revolucionaría la indexación. [ 4 ] Este fenómeno requirió el desarrollo de un sistema de indexación que pudiera hacer frente al desafío de almacenar y organizar grandes cantidades de datos y que pudiera facilitar el acceso a la información. [ 6 ] [ 7 ] El nuevo hardware electrónico impulsó aún más la indexación automatizada, ya que superó la barrera impuesta por los antiguos archivos en papel, permitiendo la codificación de la información a nivel molecular. [ 5 ] Con este nuevo hardware electrónico se desarrollaron herramientas para ayudar a los usuarios. Estas se usaban para administrar archivos y se organizaban en diferentes categorías, como suites PDM como Outlook o Lotus Notes y herramientas de mapas mentales como MindManager y Freemind. Estas permiten a los usuarios centrarse en el almacenamiento y la construcción de un modelo cognitivo. [ 8 ] La indexación automática también está impulsada en parte por el surgimiento del campo llamado lingüística computacional , que orientó la investigación que finalmente produjo técnicas como la aplicación del análisis computacional a la estructura y el significado de los lenguajes. [ 3 ] [ 9 ]La indexación automática se ve impulsada además por la investigación y el desarrollo en el área de la inteligencia artificial y los sistemas autoorganizados, también conocidos como máquinas pensantes. [ 3 ]

Medicamento

La indexación automática tiene muchas aplicaciones prácticas, como por ejemplo en el campo de la medicina. En una investigación publicada en 2009, los investigadores hablan sobre cómo se puede utilizar la indexación automática para crear un portal de información donde los usuarios puedan encontrar información fiable sobre un medicamento. CISMeF es uno de esos portales de salud diseñado para proporcionar información sobre medicamentos. El sitio web utiliza el tesauro MeSH para indexar los artículos científicos de la base de datos MEDLINE y los metadatos Dublin Core. El sistema crea un metatérmino "medicamento" y lo utiliza como criterio de búsqueda para encontrar toda la información sobre un medicamento específico. El sitio web ofrece búsqueda simple y avanzada. La búsqueda simple permite buscar por nombre comercial o por cualquier código asignado al medicamento. La búsqueda avanzada permite una búsqueda más específica al permitir introducir cualquier descripción del medicamento que se busca. [ 10 ]

Véase también

Referencias

  1. 1 2 3 Hlava, Marjorie M. (31 de enero de 2005). "Indexación automática: una cuestión de grado" . Boletín de la Sociedad Estadounidense de Ciencia y Tecnología de la Información . 29 (1): 12– 15. doi : 10.1002/bult.261 .
  2. 1 2 Cleveland, Ana; Cleveland, Donald (2013). Introducción a la indexación y la elaboración de resúmenes: Cuarta edición . Santa Bárbara, CA: ABC-CLIO. pág. 289. ISBN  9781598849769.
  3. 1 2 3 Riaz, Muhammad (1989). Prácticas avanzadas de indexación y resumen . Delhi: Atlantic Publishers & Distributors. pág. 263. 
  4. 1 2 Nota histórica: Los últimos treinta años en la recuperación de información Salton, Gerard Journal of the American Society for Information Science (1986-1998); septiembre de 1987; 38, 5; ProQuest pág. 375
  5. 1 2 Torres-Moreno, Juan-Manuel (2014). Resumen automático de texto . Hoboken, NJ: John Wiley & Sons. págs. xii. ISBN  9781848216686.
  6. Kapetanios, Epaminondas; Sugumaran, Vijayan; Spiliopoulou, Myra (2008). Lenguaje natural y sistemas de información: 13.ª Conferencia Internacional sobre Aplicaciones del Lenguaje Natural a los Sistemas de Información, NLDB 2008, Londres, Reino Unido, 24-27 de junio de 2008, Actas . Berlín: Springer Science & Business Media. pág. 350. ISBN  978-3-540-69857-9.
  7. Basch, Reva (1996). Secretos de los superinvestigadores de la red: Reflexiones, revelaciones y sabiduría adquirida con esfuerzo de 35 de los mejores investigadores de Internet del mundo . Medford, NJ: Information Today, Inc. pp . 271. ISBN  0910965226.
  8. ^ Jayaweera, YD; Johar, Dr. Gapar MD; Perera, SN "Sistemas de revistas abiertas" .
  9. Armstrong, Susan (1994). Uso de grandes corpus . Cambridge, MA: MIT Press. pág. 291. ISBN  0262510820.
  10. Sakji, Saoussen; Letord, Catherine; Dahamna, Badisse; Kergourlay, Ivan; Pereira, Suzanne; Joubert, Michel; Darmoni, Stéfan (2009). "Indexación automática en un portal de información sobre medicamentos". Estudios en Tecnología e Informática de la Salud . 148 : 112–122 . ISSN 0926-9630 . PMID 19745241 .  
Obtenido de " https://en.wikipedia.org/w/index.php?title=Automatic_indexing&oldid=1324006098 "