Articulo de referencia

Motor de metabúsqueda

Arquitectura de un motor de metabúsqueda Un metabuscador (o agregador de búsqueda ) es una herramienta de recuperación de información en línea que utiliza los datos de un motor ...

Arquitectura de un motor de metabúsqueda

Un metabuscador (o agregador de búsqueda ) es una herramienta de recuperación de información en línea que utiliza los datos de un motor de búsqueda web para generar sus propios resultados. [ 1 ] [ 2 ] Los metabuscadores reciben información del usuario y consultan inmediatamente a los motores de búsqueda [ 3 ] para obtener resultados. Se recopilan, clasifican y presentan a los usuarios los datos suficientes.

Problemas como el spam reducen la exactitud y precisión de los resultados. [ 4 ] El proceso de fusión tiene como objetivo mejorar la ingeniería de un motor de metabúsqueda. [ 5 ]

Ejemplos de motores de metabúsqueda incluyen Skyscanner y Kayak.com , que agregan resultados de búsqueda de agencias de viajes en línea y sitios web de proveedores. SearXNG es un software de búsqueda genérico, gratuito y de código abierto que agrega resultados de motores de búsqueda de internet y otras fuentes como Wikipedia, y es ofrecido gratuitamente por más de 70 proveedores de SearXNG. [ 6 ]

Historia

La primera persona en incorporar la idea de la metabúsqueda fue Eric Selberg, estudiante de la Universidad de Washington , [ 7 ] quien publicó un artículo sobre su experimento MetaCrawler en 1995. El motor de búsqueda sigue siendo utilizable en 2026. [ 8 ]

El 20 de mayo de 1996, HotBot , entonces propiedad de Wired , era un motor de búsqueda cuyos resultados provenían de las bases de datos Inktomi y Direct Hit. Era conocido por su rapidez y por permitir la búsqueda dentro de los propios resultados. Tras ser adquirido por Lycos en 1998, el desarrollo del motor de búsqueda se estancó y su cuota de mercado cayó drásticamente. Después de sufrir algunas modificaciones, HotBot se rediseñó con una interfaz de búsqueda simplificada, y sus funciones se incorporaron al rediseño del sitio web de Lycos. [ 9 ]

En 1997, Daniel Dreilinger publicó un artículo sobre su motor de metabúsqueda experimental, SavvySearch, que era capaz de seleccionar automáticamente el motor de búsqueda correcto para priorizar en función de la experiencia previa. [ 10 ]

En 1999, Bo Shu y Subhash Kak desarrollaron un metabuscador llamado Anvish ; los resultados de la búsqueda se ordenaban mediante redes neuronales entrenadas instantáneamente . [ 11 ] Posteriormente, este sistema se incorporó a otro metabuscador llamado Solosearch. [ 12 ]

En agosto de 2000, India obtuvo su primer metabuscador con el lanzamiento de HumHaiIndia.com. [ 13 ] Fue desarrollado por Sumeet Lamba, quien entonces tenía 16 años. [ 14 ] Posteriormente, el sitio web fue renombrado como Tazaa.com. [ 15 ]

Ixquick es un motor de búsqueda conocido por su declaración de política de privacidad. Desarrollado y lanzado en 1998 por David Bodnick, es propiedad de Surfboard Holding BV. En junio de 2006, Ixquick comenzó a eliminar los datos privados de sus usuarios siguiendo el mismo proceso que Scroogle . La política de privacidad de Ixquick incluye no registrar las direcciones IP de los usuarios, no usar cookies de identificación, no recopilar datos personales y no compartir datos personales con terceros. [ 16 ] También utiliza un sistema de clasificación único donde un resultado se clasifica por estrellas. Cuantas más estrellas tenga un resultado, mayor será la concordancia de los motores de búsqueda con dicho resultado.

En abril de 2005, Dogpile , entonces propiedad de InfoSpace , Inc., colaboró ​​con investigadores de la Universidad de Pittsburgh y la Universidad Estatal de Pensilvania para medir la superposición y las diferencias de clasificación de los principales motores de búsqueda web con el fin de evaluar los beneficios de usar un metabuscador para buscar en la web. Los resultados mostraron que, de 10.316 consultas aleatorias definidas por el usuario en Google , Yahoo! y Ask Jeeves , solo el 3,2 % de los resultados de la primera página eran iguales en todos esos motores de búsqueda para una consulta dada. Otro estudio realizado ese mismo año, utilizando 12.570 consultas aleatorias definidas por el usuario en Google , Yahoo!, MSN Search y Ask Jeeves, encontró que solo el 1,1 % de los resultados de la primera página eran iguales en todos esos motores de búsqueda para una consulta dada. [ 17 ]

Ventajas

Al enviar múltiples consultas a varios motores de búsqueda, se amplía la cobertura de datos del tema y se puede encontrar más información. Estos motores utilizan los índices creados por otros motores de búsqueda, agregando y, a menudo, procesando los resultados de maneras únicas. Un metabuscador tiene una ventaja sobre un motor de búsqueda individual, ya que se pueden obtener más resultados con el mismo esfuerzo. [ 2 ] También reduce el trabajo de los usuarios, quienes ya no tienen que escribir individualmente búsquedas en diferentes motores para encontrar recursos. [ 2 ]

La metabúsqueda también resulta útil si el objetivo de la búsqueda es obtener una visión general del tema o respuestas rápidas. En lugar de tener que consultar varios motores de búsqueda como Yahoo! o Google y comparar los resultados, los metabuscadores pueden recopilarlos y combinarlos rápidamente. Pueden hacerlo listando los resultados de cada motor consultado sin ningún procesamiento posterior (Dogpile) o analizando los resultados y clasificándolos según sus propios criterios (IxQuick, Metacrawler y Vivismo).

Un metabuscador también puede ocultar la dirección IP del usuario a los motores de búsqueda consultados, lo que proporciona privacidad a la búsqueda.

Desventajas

Los motores de metabúsqueda no son capaces de analizar las consultas ni de traducir completamente su sintaxis . El número de hipervínculos generados por los motores de metabúsqueda es limitado y, por lo tanto, no proporcionan al usuario los resultados completos de una consulta. [ 18 ]

La mayoría de los metabuscadores no proporcionan más de diez archivos enlazados desde un único motor de búsqueda y, por lo general, no interactúan con motores de búsqueda más grandes para obtener resultados. Los enlaces de pago por clic tienen prioridad y normalmente se muestran primero. [ 19 ]

La metabúsqueda también da la ilusión de que existe una mayor cobertura del tema consultado, especialmente si el usuario busca información popular o común. Es frecuente obtener múltiples resultados idénticos de los motores de búsqueda consultados. Además, resulta más difícil para los usuarios realizar búsquedas con sintaxis avanzada, por lo que los resultados pueden no ser tan precisos como cuando un usuario utiliza una interfaz de búsqueda avanzada en un motor específico. Esto lleva a que muchos motores de metabúsqueda utilicen búsquedas simples. [ 20 ]

Operación

Un metabuscador acepta una única solicitud de búsqueda del usuario . Esta solicitud se transfiere a la base de datos de otro motor de búsqueda . Un metabuscador no crea una base de datos de páginas web , sino que genera un sistema de base de datos federada para la integración de datos de múltiples fuentes. [ 21 ] [ 22 ] [ 23 ]

Dado que cada motor de búsqueda es único y tiene algoritmos diferentes para generar datos clasificados, también se generarán duplicados. Para eliminarlos, un metabuscador procesa estos datos y aplica su propio algoritmo. El resultado es una lista revisada que se muestra al usuario. Cuando un metabuscador contacta con otros motores de búsqueda, estos responden de tres maneras:

  • Ambas partes cooperarán y proporcionarán acceso completo a la interfaz del motor de metabúsqueda, incluido el acceso privado a la base de datos de índices, e informarán al motor de metabúsqueda de cualquier cambio realizado en la base de datos de índices;
  • Los motores de búsqueda pueden comportarse de manera poco cooperativa, sin denegar ni proporcionar acceso a las interfaces;
  • El motor de búsqueda puede ser completamente hostil y negarle al motor de metabúsqueda el acceso total a su base de datos y, en circunstancias graves, recurrir a métodos legales . [ 24 ]

Arquitectura de clasificación

Las páginas web que se posicionan bien en muchos motores de búsqueda suelen ser más relevantes a la hora de proporcionar información útil. [ 24 ] Sin embargo, todos los motores de búsqueda asignan puntuaciones diferentes a cada sitio web y, en la mayoría de los casos, estas puntuaciones no coinciden. Esto se debe a que los motores de búsqueda priorizan distintos criterios y métodos de puntuación; por lo tanto, un sitio web puede aparecer bien posicionado en un motor de búsqueda y mal posicionado en otro. Esto supone un problema, ya que los metabuscadores dependen en gran medida de la coherencia de estos datos para generar informes fiables. [ 24 ]

Fusión

Modelo de fusión de datos

Un metabuscador utiliza el proceso de fusión para filtrar datos y obtener resultados más eficientes. Los dos métodos principales de fusión que se utilizan son: fusión de colecciones y fusión de datos.

  • Collection Fusion, también conocida como recuperación distribuida, se centra específicamente en motores de búsqueda que indexan datos no relacionados. Para determinar el valor de estas fuentes, Collection Fusion analiza el contenido y clasifica los datos según la probabilidad de que proporcionen información relevante para la consulta. A partir de los resultados, Collection Fusion selecciona los mejores recursos de la clasificación. Estos recursos elegidos se combinan en una lista. [ 24 ]
  • Fusión de datos: se ocupa de la información recuperada de los motores de búsqueda que indexan conjuntos de datos comunes. El proceso es muy similar. Las puntuaciones de clasificación iniciales de los datos se combinan en una sola lista, tras lo cual se analizan las clasificaciones originales de cada uno de estos documentos. Los datos con puntuaciones altas indican un alto nivel de relevancia para una consulta particular y, por lo tanto, se seleccionan. Para generar una lista, las puntuaciones deben normalizarse utilizando algoritmos como CombSum. Esto se debe a que los motores de búsqueda adoptan diferentes políticas de algoritmos, lo que da como resultado puntuaciones incomparables. [ 25 ] [ 26 ]

Spamdexing

El spamdexing es la manipulación deliberada de los índices de los motores de búsqueda. Utiliza diversos métodos para alterar la relevancia o la prominencia de los recursos indexados de una manera que no se ajusta a la intención del sistema de indexación. El spamdexing puede resultar muy molesto para los usuarios y problemático para los motores de búsqueda, ya que los resultados de las búsquedas tienen poca precisión. Esto, a la larga, provoca que el motor de búsqueda se vuelva poco fiable para el usuario. Para combatir el spamdexing, los algoritmos de los robots de búsqueda se vuelven más complejos y se modifican casi a diario para eliminar el problema. [ 27 ]

Es un problema importante para los motores de metabúsqueda porque altera los criterios de indexación del rastreador web , en los que se basa gran parte de la información para formatear las listas de clasificación. El spamdexing manipula el sistema de clasificación natural de un motor de búsqueda y coloca sitios web en posiciones más altas en la lista de clasificación de las que ocuparían naturalmente. [ 28 ] Existen tres métodos principales para lograr esto:

Spam de contenido

El spam de contenido son técnicas que alteran la visión lógica que un motor de búsqueda tiene sobre el contenido de la página. Las técnicas incluyen:

  • Relleno de palabras clave: colocación calculada de palabras clave dentro de una página para aumentar la cantidad, variedad y densidad de palabras clave de la página.
  • Texto oculto/invisible: texto no relacionado que se disfraza haciéndolo del mismo color que el fondo, usando un tamaño de fuente diminuto o ocultándolo dentro del código HTML.
  • Relleno de metaetiquetas: Repetición de palabras clave en las metaetiquetas y/o uso de palabras clave no relacionadas con el contenido del sitio.
  • Páginas de entrada: páginas web de baja calidad con poco contenido, pero con palabras clave o frases relevantes.
  • Sitios web de extracción de contenido: programas que permiten a los sitios web copiar contenido de otros sitios web y crear contenido para un sitio web.
  • Reescritura de artículos: reescribir artículos existentes en lugar de copiar contenido de otros sitios.
  • Traducción automática: utiliza la traducción automática para reescribir el contenido en varios idiomas diferentes, lo que da como resultado un texto ilegible.

El spam de enlaces consiste en enlaces entre páginas que se presentan por razones distintas a su valor. Las técnicas incluyen:

  • Software de creación de enlaces: automatización del proceso de optimización para motores de búsqueda (SEO).
  • Grupos de enlaces: páginas que se referencian entre sí (también conocidos como sociedades de admiración mutua).
  • Enlaces ocultos: colocar hipervínculos donde los visitantes no los vean o no puedan verlos.
  • Ataque Sybil: falsificación de múltiples identidades con fines maliciosos.
  • Blogs de spam: blogs creados exclusivamente para promoción comercial y transferencia de autoridad de enlace a sitios web objetivo.
  • Secuestro de página: crea una copia de un sitio web popular con contenido similar, pero redirige a los usuarios a sitios web no relacionados o incluso maliciosos.
  • Comprar dominios caducados: comprar dominios a punto de caducar y reemplazar las páginas con enlaces a sitios web no relacionados.
  • Relleno de cookies: Colocar una cookie de seguimiento de afiliados en el ordenador de un visitante de un sitio web sin su conocimiento.
  • Spam en foros: sitios web que los usuarios pueden editar para insertar enlaces a sitios de spam.

Encubierto

Esta es una técnica de SEO en la que se envían diferentes materiales e información al rastreador web y al navegador web . [ 29 ] Se usa comúnmente como una técnica de spamdexing porque puede engañar a los motores de búsqueda para que visiten un sitio que es sustancialmente diferente de la descripción del motor de búsqueda o para que le den a un sitio determinado una clasificación más alta.

Véase también

Referencias

  1. Berger, Sandy (2005). "La gran guía de Sandy Berger para la era de Internet" (Documento). Que Publishing.ISBN 0-7897-3442-7.
  2. 1 2 3 "Arquitectura de un motor de metabúsqueda que satisface las necesidades de información del usuario" . 1999.
  3. Ride, Onion (2021). "Cómo funcionan los motores de búsqueda" . onionride.
  4. Lawrence, Stephen R.; Lee Giles, C. (10 de octubre de 1997). "Patente US6999959 - Motor de metabúsqueda" vía Google Books .
  5. Voorhees, Ellen M. ; Gupta, Narendra; Johnson-Laird, Ben (abril de 2000). "El problema de la fusión de colecciones" .
  6. "Instancias de SearXNG" . 3 de febrero de 2025.
  7. Selberg, Erik; Etzioni, Oren (1995-12-11). "Búsqueda y comparación multi-motor utilizando MetaCrawler" . Actas de la Cuarta Conferencia Internacional sobre la World Wide Web . WWW4. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 195–208 . doi : 10.1145/3592626.3592641 . ISBN  978-1-56592-169-6.
  8. "Metacrawler" . www.metacrawler.com . Consultado el 15 de julio de 2026 .
  9. "Clasificación de resultados en HotBot: una breve historia del motor de búsqueda HotBot" .
  10. Howe, Adele E.; Dreilinger, Daniel (15 de junio de 1997). "SavvySearch: un motor de metabúsqueda que aprende qué motores de búsqueda consultar" . AI Magazine . 18 (2): 19. doi : 10.1609/aimag.v18i2.1290 . ISSN 2371-9621 . 
  11. Shu, Bo; Kak, Subhash (1999). "Un motor de metabúsqueda inteligente basado en redes neuronales". Information Sciences . 120 (4): 1– 11. CiteSeerX 10.1.1.84.6837 . doi : 10.1016/S0020-0255(99)00062-6 . 
  12. Kak, Subhash (noviembre de 1999). "Mejores búsquedas web y predicción con redes neuronales entrenadas instantáneamente" (PDF) . IEEE Intelligent Systems.
  13. "El chico nuevo de la ciudad" . India Today . 6 de julio de 2012. Consultado el 14 de marzo de 2024 .
  14. "¿Qué es un motor de metabúsqueda?" . GeeksforGeeks . 1 de agosto de 2020 . Consultado el 14 de marzo de 2024 .
  15. "www.metaseek.nl" . www.metaseek.nl . Consultado el 14 de marzo de 2024 .
  16. "Sobre nosotros – Nuestra historia" .
  17. Spink, Amanda; Jansen, Bernard J.; Kathuria, Vinish; Koshman, Sherry (2006). "Superposición entre los principales motores de búsqueda web" (PDF) . Emerald.
  18. "Departamento de Informática" . Universidad de Friburgo .
  19. "Explotación de la inteligencia en Internet" (PDF) . 2002.
  20. Hennegar, Anne (16 de septiembre de 2009). "Los motores de metabúsqueda amplían tus horizontes" .
  21. ^ Meng, Weiyi (5 de mayo de 2008). «Metabuscadores» (PDF) .
  22. Selberg, Erik; Etzioni, Oren (1997). "La arquitectura MetaCrawler para la agregación de recursos en la Web" . IEEE Expert. págs. 11–14 . 
  23. Manoj, M; Jacob, Elizabeth (julio de 2013). "Diseño y desarrollo de un motor de metabúsqueda programable" (PDF) . Fundamentos de la informática. págs. 6–11 . 
  24. 1 2 3 4 Manoj, M.; Jacob, Elizabeth (octubre de 2008). "Recuperación de información en Internet mediante motores de metabúsqueda: una revisión" (PDF) . Consejo de Investigación Científica e Industrial .
  25. Wu, Shengli; Crestani, Fabio; Bi, Yaxin (2006). "Evaluación de métodos de normalización de puntuación en la fusión de datos". Information Retrieval Technology . Lecture Notes in Computer Science. Vol. 4182. pp. 642–648 . CiteSeerX 10.1.1.103.295 . doi : 10.1007/11880592_57 . ISBN    978-3-540-45780-0.
  26. Manmatha, R.; Sever, H. (2014). "Un enfoque formal para la normalización de puntuaciones para la metabúsqueda" (PDF) . Archivado del original (PDF) el 30 de septiembre de 2019. Recuperado el 27 de octubre de 2014 .
  27. Najork, Marc (2014). "Detección de spam web" . Microsoft .
  28. ^ Vandendriessche, Gerrit (febrero de 2009). "Algunos comentarios legales sobre spamdexing" .
  29. ^ Wang, Yi-Min; Mamá, Ming; Niu, Yuan; Chen, Hao (8 de mayo de 2007). "Conectar a los spammers web con los anunciantes" (PDF) .