En informática , un motor de búsqueda es un sistema de software de recuperación de información diseñado para ayudar a encontrar información almacenada en uno o más sistemas informáticos . Los motores de búsqueda descubren, rastrean, transforman y almacenan información para su recuperación y presentación en respuesta a las consultas del usuario. Los resultados de la búsqueda se presentan generalmente en una lista y se denominan comúnmente " hits" . El tipo de motor de búsqueda más utilizado es el motor de búsqueda web , que busca información en la World Wide Web .
Un motor de búsqueda normalmente consta de cuatro componentes: una interfaz de búsqueda, un rastreador (también conocido como araña o bot), un indexador y una base de datos. El rastreador recorre una colección de documentos, descompone el texto de los documentos y asigna marcadores para su almacenamiento en el índice del motor de búsqueda. Los motores de búsqueda en línea almacenan imágenes, datos de enlaces y metadatos de los documentos.
Cómo funcionan los motores de búsqueda
Los motores de búsqueda proporcionan una interfaz a un grupo de elementos que permite a los usuarios especificar criterios sobre un elemento de interés y que el motor encuentre los elementos coincidentes. Los criterios se denominan consulta de búsqueda . En el caso de los motores de búsqueda de texto, la consulta de búsqueda se expresa normalmente como un conjunto de palabras que identifican el concepto deseado que uno o más documentos pueden contener. [ 1 ] Existen varios estilos de sintaxis de consulta de búsqueda que varían en rigor. También puede cambiar de nombre dentro de los motores de búsqueda con respecto a sitios anteriores. Mientras que algunos motores de búsqueda de texto requieren que los usuarios introduzcan dos o tres palabras separadas por espacios en blanco , otros motores de búsqueda pueden permitir a los usuarios especificar documentos completos, imágenes, sonidos y diversas formas de lenguaje natural . Algunos motores de búsqueda aplican mejoras a las consultas de búsqueda para aumentar la probabilidad de proporcionar un conjunto de elementos de calidad a través de un proceso conocido como expansión de consultas . Los métodos de comprensión de consultas pueden utilizarse como lenguaje de consulta estandarizado.

La lista de elementos que cumplen los criterios especificados por la consulta suele estar ordenada o clasificada. Clasificar los elementos por relevancia (de mayor a menor) reduce el tiempo necesario para encontrar la información deseada. Los motores de búsqueda probabilísticos clasifican los elementos en función de medidas de similitud (entre cada elemento y la consulta, normalmente en una escala de 1 a 0, donde 1 es la mayor similitud) y, a veces, de la popularidad o la autoridad (véase Bibliometría ) o utilizan retroalimentación de relevancia . Los motores de búsqueda booleanos suelen devolver solo los elementos que coinciden exactamente, sin tener en cuenta el orden, aunque el término motor de búsqueda booleano puede referirse simplemente al uso de la sintaxis de estilo booleano (el uso de los operadores AND , OR , NOT y XOR ) en un contexto probabilístico.
Para proporcionar rápidamente un conjunto de elementos coincidentes ordenados según ciertos criterios, un motor de búsqueda suele recopilar metadatos sobre el grupo de elementos en consideración mediante un proceso denominado indexación . El índice generalmente requiere una menor cantidad de almacenamiento informático , razón por la cual algunos motores de búsqueda solo almacenan la información indexada y no el contenido completo de cada elemento, y en su lugar proporcionan un método para navegar a los elementos en la página de resultados del motor de búsqueda . Alternativamente, el motor de búsqueda puede almacenar una copia de cada elemento en una caché para que los usuarios puedan ver el estado del elemento en el momento en que se indexó, para fines de archivo o para que los procesos repetitivos funcionen de manera más eficiente y rápida. [ 2 ]
Otros tipos de motores de búsqueda no almacenan un índice. Los motores de búsqueda de tipo rastreador o araña (también conocidos como motores de búsqueda en tiempo real) pueden recopilar y evaluar elementos en el momento de la consulta, considerando dinámicamente elementos adicionales en función del contenido de un elemento inicial (conocido como semilla o URL semilla en el caso de un rastreador de Internet). Los metabuscadores no almacenan ni un índice ni una caché; en su lugar, simplemente reutilizan el índice o los resultados de uno o más motores de búsqueda para proporcionar un conjunto final de resultados agregados.
El tamaño de la base de datos, que había sido una característica de marketing importante a principios de la década de 2000, fue desplazado por el énfasis en la clasificación por relevancia, los métodos mediante los cuales los motores de búsqueda intentan ordenar primero los mejores resultados. La clasificación por relevancia se convirtió en un tema importante alrededor de 1996 , cuando se hizo evidente que era poco práctico revisar listas completas de resultados. En consecuencia, los algoritmos para la clasificación por relevancia han mejorado continuamente. El método PageRank de Google para ordenar los resultados ha recibido la mayor atención mediática, pero todos los principales motores de búsqueda perfeccionan continuamente sus metodologías de clasificación con el objetivo de mejorar el orden de los resultados. A partir de 2006, las clasificaciones de los motores de búsqueda son más importantes que nunca, tanto que se ha desarrollado una industria (" optimizadores de motores de búsqueda " o "SEO") para ayudar a los desarrolladores web a mejorar su posicionamiento en los resultados de búsqueda, y se ha desarrollado todo un cuerpo de jurisprudencia en torno a asuntos que afectan a las clasificaciones de los motores de búsqueda, como el uso de marcas registradas en las metaetiquetas . La venta de clasificaciones de búsqueda por parte de algunos motores de búsqueda también ha generado controversia entre bibliotecarios y defensores de los consumidores. [ 3 ]

La experiencia de búsqueda para los usuarios sigue mejorando. La incorporación del Google Knowledge Graph ha tenido repercusiones más amplias en internet, pudiendo incluso limitar el tráfico de ciertos sitios web, como Wikipedia. Algunos argumentan que, al recopilar información y presentarla en la página de Google, esto puede afectar negativamente a otros sitios. Sin embargo, no se han registrado preocupaciones importantes. [ 4 ]
Categorías de motores de búsqueda
motores de búsqueda web
Los motores de búsqueda diseñados específicamente para buscar páginas web, documentos e imágenes se desarrollaron para facilitar la búsqueda en un vasto y complejo conjunto de recursos no estructurados. Están diseñados para seguir un proceso de varias etapas: rastrear el infinito inventario de páginas y documentos para extraer la información irrelevante de su contenido, indexar esa información y las palabras clave en una especie de base de datos semiestructurada y, finalmente, resolver las consultas de los usuarios para devolver resultados y enlaces a los documentos o páginas extraídos del inventario, en su mayoría relevantes.
Gatear
En el caso de una búsqueda exclusivamente textual, el primer paso para clasificar las páginas web es encontrar un elemento indexado que se relacione directamente con el término de búsqueda. Antiguamente, los motores de búsqueda comenzaban con una pequeña lista de URL, denominada lista semilla, obtenían el contenido y analizaban los enlaces de esas páginas en busca de información relevante, lo que posteriormente generaba nuevos enlaces. Este proceso era altamente cíclico y continuaba hasta encontrar suficientes páginas para el usuario. Actualmente, se emplea un método de rastreo continuo en lugar de un descubrimiento incidental basado en una lista semilla. El método de rastreo es una extensión del método de descubrimiento mencionado anteriormente.
La mayoría de los motores de búsqueda utilizan algoritmos de programación sofisticados para decidir cuándo volver a visitar una página web, priorizando así su relevancia. Estos algoritmos varían desde intervalos de visita fijos, con mayor prioridad para las páginas que se actualizan con frecuencia, hasta intervalos adaptativos basados en diversos criterios como la frecuencia de los cambios, la popularidad y la calidad general del sitio. La velocidad del servidor web que aloja la página, así como las limitaciones de recursos como la cantidad de hardware o el ancho de banda, también influyen.
Mapa de enlaces
Las páginas que se descubren mediante rastreos web suelen distribuirse y enviarse a otro ordenador que crea un mapa de los recursos encontrados. Este conjunto de datos se asemeja a un grafo, donde las distintas páginas se representan como pequeños nodos conectados por enlaces. El exceso de datos se almacena en múltiples estructuras de datos que permiten un acceso rápido a dichos datos mediante algoritmos que calculan la popularidad de las páginas web en función del número de enlaces que apuntan a una página web determinada, lo que permite acceder a diversos recursos relacionados con el diagnóstico de la psicosis. Otro ejemplo sería la accesibilidad/clasificación de las páginas web con información sobre Mohamed Morsi frente a las mejores atracciones turísticas de El Cairo tras introducir simplemente «Egipto» como término de búsqueda. Un algoritmo de este tipo, PageRank , propuesto por los fundadores de Google, Larry Page y Sergey Brin, es muy conocido y ha atraído mucha atención porque pone de manifiesto la monotonía de las búsquedas web realizadas por estudiantes que no saben investigar correctamente en Google.
La idea de realizar análisis de enlaces para calcular un ranking de popularidad es anterior a PageRank. Sin embargo, en octubre de 2014, John Mueller de Google confirmó que Google no lo actualizaría (PageRank) en el futuro. Actualmente se utilizan otras variantes de la misma idea; por ejemplo, los niños de primaria realizan cálculos similares al elegir equipos de kickball. Estas ideas se pueden clasificar en tres categorías principales: el ranking de páginas individuales y la naturaleza del contenido del sitio web. Los motores de búsqueda suelen diferenciar entre enlaces internos y externos, ya que los creadores de contenido web no son ajenos a la autopromoción descarada. Las estructuras de datos de mapas de enlaces también suelen almacenar el texto ancla incrustado en los enlaces, ya que este texto a menudo proporciona un resumen de "muy buena calidad" del contenido de una página web.
Motores de búsqueda de bases de datos
La búsqueda de contenido textual en bases de datos presenta algunos desafíos particulares que dan lugar a numerosos motores de búsqueda especializados. Las bases de datos pueden ser lentas al resolver consultas complejas (con múltiples argumentos lógicos o de coincidencia de cadenas). Permiten consultas pseudológicas, algo que las búsquedas de texto completo no utilizan. No es necesario rastrear una base de datos, ya que los datos están estructurados. Sin embargo, a menudo es necesario indexar los datos de forma más eficiente para facilitar una búsqueda más rápida.
Motores de búsqueda mixtos
A veces, los datos buscados contienen tanto contenido de bases de datos como páginas web o documentos. La tecnología de los motores de búsqueda se ha desarrollado para responder a ambos conjuntos de requisitos. La mayoría de los motores de búsqueda mixtos son grandes motores de búsqueda web, como Google. Buscan tanto en fuentes de datos estructuradas como no estructuradas . Tomemos como ejemplo la palabra "pelota". En su forma más simple, arroja más de 40 variaciones solo en Wikipedia. ¿Te referías a una pelota, como en una reunión social o un baile? ¿Un balón de fútbol? ¿La parte delantera del pie? Las páginas y los documentos se rastrean e indexan en un índice separado. Las bases de datos también se indexan desde diversas fuentes. Los resultados de búsqueda se generan para los usuarios consultando estos múltiples índices en paralelo y combinando los resultados según "reglas".
Historia de la tecnología de búsqueda
El Memex
El concepto de hipertexto y extensión de memoria tiene su origen en un artículo publicado en The Atlantic Monthly en julio de 1945, escrito por Vannevar Bush y titulado " Como podríamos pensar ". En este artículo, Vannevar instó a los científicos a colaborar para construir un cuerpo de conocimiento para toda la humanidad. Luego propuso la idea de un sistema de almacenamiento y recuperación de memoria asociativa, prácticamente ilimitado, rápido, fiable y extensible. Denominó a este dispositivo memex . [ 5 ]
Bush consideraba la noción de “indexación asociativa” como su principal contribución conceptual. Como explicó, se trataba de “una disposición mediante la cual cualquier elemento puede seleccionar, a voluntad, otro de forma inmediata y automática. Esta es la característica esencial del memex. Lo importante es el proceso de vincular dos elementos”. [ 6 ]
Todos los documentos utilizados en el Memex estarían en formato de microfilm, adquiridos como tales o, en el caso de registros personales, transformados a microfilm por la propia máquina. El Memex también emplearía nuevas técnicas de recuperación basadas en un nuevo tipo de indexación asociativa, cuya idea básica consiste en permitir que cualquier elemento seleccione de forma inmediata y automática otro para crear "rutas" personales a través de documentos vinculados. Estos nuevos procedimientos, que Bush preveía que facilitarían el almacenamiento y la recuperación de información, darían lugar al desarrollo de formas totalmente nuevas de enciclopedia.
El mecanismo más importante, ideado por Bush, es el rastro asociativo. Este permitiría crear una nueva secuencia lineal de fotogramas de microfilm a partir de cualquier secuencia arbitraria de fotogramas de microfilm, mediante la creación de una secuencia encadenada de enlaces como se acaba de describir, junto con comentarios personales y ramificaciones.
En 1965, Bush participó en el proyecto INTREX del MIT, cuyo objetivo era desarrollar tecnología para la mecanización del procesamiento de información para uso bibliotecario. En su ensayo de 1967 titulado "Memex Revisited", señaló que el desarrollo de la computadora digital, el transistor, el video y otros dispositivos similares habían aumentado la viabilidad de dicha mecanización, pero que los costos retrasarían sus logros. [ 7 ]
ELEGANTE
Gerard Salton , fallecido el 28 de agosto de 1995, fue considerado el padre de la tecnología de búsqueda moderna. Sus equipos en Harvard y Cornell desarrollaron el sistema de recuperación de información SMART. El sistema Magic Automatic Retriever of Text de Salton incluía conceptos importantes como el modelo de espacio vectorial , la frecuencia inversa de documentos (IDF), la frecuencia de términos (TF), los valores de discriminación de términos y los mecanismos de retroalimentación de relevancia.
Fue autor de un libro de 56 páginas titulado " Una teoría de la indexación" , en el que explicaba muchas de sus pruebas, en las que todavía se basa en gran medida la búsqueda.
Motores de búsqueda de cadenas
En 1987, se publicó un artículo que detallaba el desarrollo de un motor de búsqueda de cadenas de caracteres (SSE) para la recuperación rápida de texto en un circuito de estado sólido CMOS de pozo n de doble metal de 1,6 μm con 217.600 transistores dispuestos en un área de chip de 8,62 x 12,76 mm. El SSE incorporaba una novedosa arquitectura de búsqueda de cadenas que combinaba una lógica de autómata de estados finitos (FSA) de 512 etapas con una memoria direccionable por contenido (CAM) para lograr una comparación aproximada de 80 millones de cadenas por segundo. La celda CAM constaba de cuatro celdas de RAM estática (SRAM) convencionales y un circuito de lectura/escritura. Se logró la comparación concurrente de 64 cadenas almacenadas de longitud variable en 50 ns para un flujo de texto de entrada de 10 millones de caracteres/s, lo que permitió un buen rendimiento a pesar de la presencia de errores de un solo carácter en forma de códigos de caracteres. Además, el chip permitía la búsqueda de cadenas sin ancla y la búsqueda de cadenas de longitud variable "no importa" (VLDC). [ 8 ]
Véase también
Según la fuente
Por tipo de contenido
Mediante interfaz
- Búsqueda incremental
- Respuesta instantánea
- Búsqueda semántica
- Búsqueda basada en selección
- Búsqueda por voz
Por tema
Otros
- Resumen automático
- Emanuel Goldberg (inventor de los primeros motores de búsqueda)
- Índice (motor de búsqueda)
- Índice invertido
- Lista de motores de búsqueda
- Búsqueda como servicio
- Indexación de motores de búsqueda
- Optimización para motores de búsqueda
- Lista desplegable de sugerencias de búsqueda
- Solucionador (informática)
- Spamdexing
- SQL
- Minería de texto
- Rastreador web
- Desambiguación del sentido de las palabras (cómo abordar la ambigüedad )
Referencias
- ↑ "Comprender las consultas de búsqueda: cómo los motores de búsqueda relacionan tus palabras con documentos relevantes " . paulandre.com
- ↑ "Conceptos básicos de Internet: Uso de motores de búsqueda" . GCFGlobal.org . Consultado el 11 de julio de 2022 .
- ↑ Stross, Randall (22 de septiembre de 2009). Planeta Google: El audaz plan de una empresa para organizar todo lo que sabemos . Simon and Schuster. ISBN 978-1-4165-4696-2Consultado el 9 de diciembre de 2012 .
- ↑ "¿Qué podemos decir de la disminución del tráfico de Wikipedia?" . The Daily Dot . 8 de enero de 2014 . Consultado el 1 de noviembre de 2020 .
- ↑ Yeo, Richard (30 de enero de 2007). "Antes de Memex: Robert Hooke, John Locke y Vannevar Bush sobre la memoria externa". Science in Context . 20 (1): 21. doi : 10.1017/S0269889706001128 . hdl : 10072/15207 . S2CID 2378301 .
- ↑ Yeo, Richard (30 de enero de 2007). "Antes de Memex: Robert Hooke, John Locke y Vannevar Bush sobre la memoria externa". Science in Context . 20 (1): 21– 47. doi : 10.1017/S0269889706001128 . hdl : 10072/15207 . S2CID 2378301 El ejemplo que da Bush es una búsqueda para encontrar información sobre los méritos relativos del arco corto turco y el arco largo inglés en las cruzadas.
{{cite journal}}: CS1 mantenimiento: postscript ( enlace ) - ↑ "El MEMEX de Vannevar Bush" . 4 de enero de 2021. Archivado del original el 7 de enero de 2021. Consultado el 12 de agosto de 2023 .
- ↑ Yamada, H.; Hirata, M.; Nagai, H.; Takahashi, K. (octubre de 1987). "Un motor de búsqueda de cadenas de alta velocidad". IEEE Journal of Solid-State Circuits . 22 (5). IEEE: 829– 834. Bibcode : 1987IJSSC..22..829Y . doi : 10.1109/JSSC.1987.1052819 .
- Sistemas de recuperación de información