TrustRank es un algoritmo que analiza los enlaces para distinguir las páginas web útiles del spam y ayuda a los motores de búsqueda a posicionarlas en las SERP (páginas de resultados). Es un proceso semiautomático, lo que significa que requiere intervención humana para funcionar correctamente. Los motores de búsqueda utilizan diversos algoritmos y factores de clasificación para medir la calidad de las páginas web. TrustRank es uno de ellos.
Dado que la revisión manual de Internet es poco práctica y muy costosa, se introdujo TrustRank para facilitar esta tarea de forma mucho más rápida y económica. Fue presentado por primera vez por los investigadores Zoltan Gyongyi y Hector Garcia-Molina de la Universidad de Stanford y Jan Pedersen de Yahoo! en su artículo "Combating Web Spam with TrustRank" en 2004. [ 1 ] Actualmente, este algoritmo forma parte de los principales motores de búsqueda web como Yahoo! y Google. [ 2 ]
Uno de los factores más importantes que ayudan a los motores de búsqueda a determinar la calidad de una página web al mostrar resultados son los backlinks . Los motores de búsqueda toman en cuenta la cantidad y la calidad de los backlinks al asignar una posición a una página web en las SERP. Muchas páginas de spam se crean con la única intención de engañar a los motores de búsqueda . Estas páginas, creadas principalmente con fines comerciales, utilizan diversas técnicas para lograr posiciones superiores a las merecidas en las páginas de resultados . Si bien los expertos humanos pueden identificar fácilmente el spam, los motores de búsqueda se perfeccionan constantemente para poder hacerlo sin intervención humana.
Un método popular para mejorar el posicionamiento consiste en aumentar la importancia percibida de un documento mediante complejos esquemas de enlaces. El PageRank de Google y otros algoritmos de clasificación de búsqueda han sido objeto de este tipo de manipulación.
TrustRank busca combatir el spam filtrando la web según su fiabilidad. El método consiste en seleccionar un pequeño conjunto de páginas semilla para que un experto las evalúe. Una vez identificadas manualmente las páginas semilla de buena reputación, se realiza un rastreo que se extiende desde este conjunto en busca de páginas igualmente fiables y dignas de confianza. La fiabilidad de TrustRank disminuye a medida que aumenta la distancia entre los documentos y el conjunto semilla.
La lógica también funciona en sentido contrario, lo que se denomina Clasificación Anti-Confianza. Cuanto más cerca esté un sitio de los recursos de spam, mayor será la probabilidad de que también sea spam. [ 3 ]
Los investigadores que propusieron la metodología TrustRank han seguido perfeccionando su trabajo evaluando temas relacionados, como la medición de la cantidad de spam .
Véase también
- PageRank : algoritmo utilizado por la Búsqueda de Google para clasificar las páginas web.
- CheiRank : métrica utilizada para clasificar páginas web.
- Recuperación de información adversaria : estrategias de recuperación de información en conjuntos de datos
- Algoritmo Hilltop : algoritmo de búsqueda de noticias
- Algoritmo HITS : algoritmo de análisis de enlaces para páginas web.
- Spamdexing : manipulación deliberada de los índices de los motores de búsqueda.
Referencias
- ↑ Gyongyi, Zoltan; Garcia-Molina, Hector (2004). Combatiendo el spam web con TrustRank (PDF) . Actas de la 30.ª Conferencia VLDB. Toronto, Canadá . Recuperado el 26 de mayo de 2022 .
- ↑ 7603350 , Guha, Ramanathan, "Patente de Estados Unidos: 7603350 - Clasificación de resultados de búsqueda basada en la confianza", publicado el 13 de octubre de 2009
- ↑ Krishnan, Vijay; Raj, Rashmi. "Detección de spam web con clasificación de confianza" (PDF) . Universidad de Stanford . Consultado el 11 de enero de 2015 .
Enlaces externos
- Z. Gyöngyi, H. García-Molina, J. Pedersen: Combatir el spam web con TrustRank
- Detección de spam basada en enlaces. Yahoo! obtuvo una solicitud de patente que utiliza TrustRank.
- Gestión de la reputación
- Análisis de enlaces