Una trampa para rastreadores web (o arañas web ) es un conjunto de páginas web que, intencionalmente o no, pueden usarse para provocar que un rastreador web o un bot de búsqueda realice un número infinito de solicitudes o para causar el bloqueo de un rastreador mal diseñado. Los rastreadores web también se denominan arañas web , de donde proviene el nombre. Las trampas para rastreadores web pueden crearse para "atrapar" bots de spam u otros rastreadores que consumen en exceso el ancho de banda de un sitio web. También pueden crearse involuntariamente por calendarios que utilizan páginas dinámicas con enlaces que apuntan continuamente al día o año siguiente.
Entre las técnicas más utilizadas se incluyen:
- Creación de estructuras de directorios de profundidad indefinida, como por ejemplo:
http://example.com/abc/def/abc/def/abc/def/abc/... - Páginas dinámicas que producen un número ilimitado de documentos para que un rastreador web los siga. Algunos ejemplos son los calendarios [ 1 ] y la poesía en lenguaje generado algorítmicamente [ 2 ] .
- Los documentos con muchos caracteres provocan que el analizador léxico que procesa el documento falle.
- Documentos con identificadores de sesión basados en cookies obligatorias.
No existe ningún algoritmo universal capaz de detectar todas las trampas para arañas. Si bien ciertas categorías de trampas pueden identificarse mediante métodos automatizados, siguen apareciendo rápidamente trampas nuevas y hasta ahora desconocidas.
Cortesía
Una trampa para arañas provoca que un rastreador web entre en algo parecido a un bucle infinito , [ 3 ] lo que desperdicia los recursos de la araña, [ 4 ] reduce su productividad y, en el caso de un rastreador mal programado, puede provocar que el programa falle. Las arañas educadas alternan las solicitudes entre diferentes hosts y no solicitan documentos del mismo servidor más de una vez cada pocos segundos, [ 5 ] lo que significa que un rastreador web "educado" se ve afectado en mucha menor medida que un rastreador "descortés".
Además, los sitios con trampas para arañas suelen tener un archivo robots.txt que les indica a los bots que no vayan a la trampa, por lo que un bot legítimo y "educado" no caería en ella, mientras que un bot "descortés" que ignore la configuración de robots.txt se vería afectado por la trampa. [ 6 ]
Véase también
Referencias
- ↑ ""¿Qué es una trampa para arañas?"" . Techopedia . 27 de noviembre de 2017 . Consultado el 29 de mayo de 2018 .
- ↑ Neil M Hennessy. " El veneno más dulce, o el descubrimiento de la poesía L=A=N=G=U=A=G=E en la web ". Consultado el 26 de septiembre de 2013.
- ↑ "Presagio" . Presagio . 3 de febrero de 2016. Consultado el 16 de octubre de 2019 .
- ↑ "Cómo configurar un archivo robots.txt para controlar los rastreadores de los motores de búsqueda (thesitewizard.com)" . www.thesitewizard.com . Consultado el 16 de octubre de 2019 .
- ↑ "Creando un rastreador web educado" . La comunidad DEV . 13 de abril de 2019. Consultado el 16 de octubre de 2019 .
- ↑ "Cerrando una trampa de arañas: corrigiendo ineficiencias de rastreo" . J Media Group . 12 de octubre de 2017. Consultado el 16 de octubre de 2019 .
- Búsqueda en Internet
- Fragmentos de la World Wide Web