Articulo de referencia

web profunda

La web profunda , [ 1 ] también conocida como web invisible [ 2 ] o web oculta , [ 3 ] son ​​las partes de la World Wide Web cuyo contenido no está indexado por los programas es...

La web profunda , [ 1 ] también conocida como web invisible [ 2 ] o web oculta , [ 3 ] son ​​las partes de la World Wide Web cuyo contenido no está indexado por los programas estándar de motores de búsqueda web . [ 4 ] Esto contrasta con la web superficial , que es accesible para cualquier persona que use Internet. [ 5 ] Se le atribuye al científico informático Michael K.  Bergman la invención del término en 2001 como término de indexación de búsqueda. [ 6 ]

Se puede acceder a los sitios de la web profunda mediante una URL o dirección IP directa , pero es posible que se requiera ingresar una contraseña u otra información de seguridad para acceder al contenido. [ 7 ] [ 8 ] Entre los usos de los sitios de la web profunda se incluyen el correo web , la banca en línea , el almacenamiento en la nube , las páginas y perfiles de redes sociales de acceso restringido y los foros web que requieren registro para ver el contenido. También incluye servicios de pago como el vídeo bajo demanda y algunas revistas y periódicos en línea.

Terminología

La primera fusión de los términos "web profunda" y " web oscura " ocurrió en 2009, cuando se discutió la terminología de búsqueda de la web profunda junto con las actividades ilegales que ocurrían en Freenet y darknet . [ 9 ] Estas actividades delictivas incluyen el comercio de contraseñas personales , documentos de identidad falsos , drogas , asesinatos , tortura , pornografía de violación , armas de fuego y pornografía infantil . [ 10 ]

Desde entonces, tras su uso en los reportajes de los medios sobre el sitio web del mercado negro Silk Road , los medios de comunicación han utilizado generalmente "web profunda" como sinónimo de web oscura o darknet , una comparación que algunos rechazan por inexacta [ 11 ] y que, en consecuencia, se ha convertido en una fuente constante de confusión. [ 12 ] Los reporteros de Wired, Kim Zetter [ 13 ] y Andy Greenberg [ 14 ], recomiendan que los términos se utilicen de forma distinta. Mientras que la web profunda se refiere a cualquier sitio al que no se puede acceder mediante un motor de búsqueda tradicional, la web oscura es una parte de la web profunda que se ha ocultado intencionadamente y es inaccesible mediante navegadores y métodos estándar. [ 15 ] [ 16 ]

Contenido no indexado

Bergman, en un artículo sobre la web profunda publicado en The Journal of Electronic Publishing , mencionó que Jill Ellsworth usó el término Web Invisible en 1994 para referirse a sitios web que no estaban registrados en ningún motor de búsqueda. [ 17 ] Bergman citó un artículo de enero de 1996 de Frank Garcia: [ 18 ]

Se trata de una página web con un diseño aceptable, pero no se molestaron en registrarla en ningún buscador. ¡Así que nadie puede encontrarla! Estás oculta. A eso le llamo la web invisible.

Otro uso temprano del término Web Invisible fue por Bruce Mount y Matthew B.  Koll de Personal Library Software , en una descripción del  programa No. 1 de la Deep Web que se encuentra en un comunicado de prensa de diciembre de 1996. [ 19 ]

El primer uso del término específico web profunda , ahora generalmente aceptado, se produjo en el estudio de Bergman de 2001 mencionado anteriormente. [ 17 ]

Métodos de indexación

Los métodos que impiden que las páginas web sean indexadas por los motores de búsqueda tradicionales pueden clasificarse en una o más de las siguientes categorías:

  1. Web contextual : páginas con contenido que varía según los diferentes contextos de acceso (por ejemplo, rangos de direcciones IP de los clientes o la secuencia de navegación anterior).
  2. Contenido dinámico : páginas dinámicas , que se devuelven en respuesta a una consulta enviada o a las que solo se accede a través de un formulario, especialmente si se utilizan elementos de entrada de dominio abierto (como campos de texto); dichos campos son difíciles de navegar sin conocimiento del dominio .
  3. Contenido de acceso restringido : sitios que restringen el acceso a sus páginas de forma técnica (por ejemplo, mediante el uso del Estándar de Exclusión de Robots o CAPTCHA , o la directiva no-store, que prohíbe a los motores de búsqueda navegar por ellas y crear copias en caché ). [ 20 ] Los sitios pueden incluir un motor de búsqueda interno para explorar dichas páginas. [ 21 ] [ 22 ]
  4. Contenido que no es HTML/texto : contenido textual codificado en archivos multimedia (imagen o vídeo) o en formatos de archivo específicos no reconocidos por los motores de búsqueda.
  5. Sitios web privados : sitios que requieren registro e inicio de sesión (recursos protegidos con contraseña).
  6. Contenido programado : páginas a las que solo se puede acceder mediante enlaces generados por JavaScript , así como contenido descargado dinámicamente de servidores web mediante soluciones Flash o Ajax .
  7. Software : ciertos contenidos se ocultan intencionalmente de la Internet convencional, siendo accesibles únicamente mediante software especializado, como Tor , I2P u otro software de la dark web. Por ejemplo, Tor permite a los usuarios acceder a sitios web utilizando la dirección del servidor .onion de forma anónima, ocultando su dirección IP.
  8. Contenido sin enlaces : páginas que no están enlazadas desde otras páginas, lo que puede impedir que los programas de rastreo web accedan a su contenido. Este contenido se conoce como páginas sin enlaces entrantes (o inlinks). Además, los motores de búsqueda no siempre detectan todos los enlaces entrantes de las páginas web indexadas.
  9. Archivos web : Los servicios de archivo web, como Wayback Machine, permiten a los usuarios ver versiones archivadas de páginas web a lo largo del tiempo, incluyendo sitios web que se han vuelto inaccesibles y no están indexados por motores de búsqueda como Google. [ 6 ] Wayback Machine puede considerarse un programa para visualizar la web profunda, ya que los archivos web que no son del presente no pueden indexarse, dado que las versiones pasadas de los sitios web son imposibles de ver mediante una búsqueda. Todos los sitios web se actualizan en algún momento, razón por la cual los archivos web se consideran contenido de la web profunda. [ 23 ]

Tipos de contenido

Si bien no siempre es posible descubrir directamente el contenido de un servidor web específico para poder indexarlo, potencialmente se puede acceder a un sitio de forma indirecta (debido a vulnerabilidades informáticas ).

Para descubrir contenido en la web, los motores de búsqueda utilizan rastreadores web que siguen hipervínculos a través de números de puerto virtual de protocolo conocidos . Esta técnica es ideal para descubrir contenido en la web superficial, pero suele ser ineficaz para encontrar contenido de la web profunda. Por ejemplo, estos rastreadores no intentan encontrar páginas dinámicas que son el resultado de consultas a bases de datos debido al número indeterminado de consultas posibles. [ 6 ] Se ha observado que esto se puede superar (parcialmente) proporcionando enlaces a los resultados de las consultas, pero esto podría inflar involuntariamente la popularidad de un sitio de la web profunda.

DeepPeep , Intute , Aleph Open Search , Deep Web Technologies , Scirus y Ahmia.fi son algunos motores de búsqueda que han accedido a la web profunda. Intute se quedó sin financiación y ahora es un archivo estático temporal desde julio de 2011. [ 24 ] Scirus se retiró a finales de enero de 2013. [ 25 ]

Los investigadores han estado explorando cómo se puede rastrear la web profunda de forma automática, incluyendo contenido al que solo se puede acceder mediante software especial como Tor . En 2001, Sriram Raghavan y Hector Garcia-Molina (Departamento de Ciencias de la Computación de Stanford, Universidad de Stanford) [ 26 ] [ 27 ] presentaron un modelo arquitectónico para un rastreador de la web oculta que utilizaba términos importantes proporcionados por los usuarios o recopilados de las interfaces de consulta para consultar un formulario web y rastrear el contenido de la web profunda. Alexandros Ntoulas, Petros Zerfos y Junghoo Cho de UCLA crearon un rastreador de la web oculta que generaba automáticamente consultas significativas para emitir contra formularios de búsqueda. [ 28 ] Se han propuesto varios lenguajes de consulta de formularios (por ejemplo, DEQUEL [ 29 ] ) que, además de emitir una consulta, también permiten la extracción de datos estructurados de las páginas de resultados. Otro esfuerzo es DeepPeep, un proyecto de la Universidad de Utah patrocinado por la National Science Foundation , que recopiló fuentes web ocultas (formularios web) en diferentes dominios basándose en novedosas técnicas de rastreo focalizado. [ 30 ] [ 31 ]

Los motores de búsqueda comerciales han comenzado a explorar métodos alternativos para rastrear la web profunda. El Protocolo de Mapa del Sitio (desarrollado e introducido por primera vez por Google en 2005) y OAI-PMH son mecanismos que permiten a los motores de búsqueda y otras partes interesadas descubrir recursos de la web profunda en servidores web específicos. Ambos mecanismos permiten a los servidores web anunciar las URL accesibles en ellos, lo que permite el descubrimiento automático de recursos que no están vinculados directamente a la web superficial. El sistema de Google para la web profunda calcula los envíos para cada formulario HTML y agrega las páginas HTML resultantes al índice del motor de búsqueda de Google. Los resultados mostrados representan mil consultas por segundo al contenido de la web profunda. [ 32 ] En este sistema, el preprocesamiento de los envíos se realiza utilizando tres algoritmos:

  1. seleccionar valores de entrada para campos de búsqueda de texto que acepten palabras clave,
  2. identificar entradas que acepten solo valores de un tipo específico (por ejemplo, fecha) y
  3. seleccionar un pequeño número de combinaciones de entrada que generen URL adecuadas para su inclusión en el índice de búsqueda web.

En 2008, para facilitar a los usuarios de los servicios ocultos de Tor el acceso y la búsqueda de un sufijo oculto .onion , Aaron Swartz diseñó Tor2web , una aplicación proxy capaz de proporcionar acceso mediante navegadores web comunes. [ 33 ] Usando esta aplicación, los enlaces de la web profunda aparecen como una secuencia aleatoria de letras seguida del dominio de nivel superior .onion .

Véase también

Referencias

  1. ^ Hamilton, Nigel (2019-2020). "La mecánica de un metabuscador de Deep Net" . En Isaías, Pedro; Palma dos Reis, António (eds.). Actas de la Conferencia Internacional de IADIS sobre e-Sociedad . Prensa IADIS. págs. 1034–1036 . CiteSeerX 10.1.1.90.5847 . ISBN   978-972-98947-0-1.
  2. Devine, Jane; Egger-Sider, Francine (julio de 2004). "Más allá de Google: la web invisible en la biblioteca académica". The Journal of Academic Librarianship . 30 (4): 265– 269. doi : 10.1016/j.acalib.2004.04.010 .
  3. Raghavan, Sriram; Garcia-Molina, Hector (11-14 de septiembre de 2001). "Rastreando la web oculta" . 27.ª Conferencia Internacional sobre Bases de Datos Muy Grandes .
  4. Maor, Etay. "Publicación del Consejo: Lecciones aprendidas al rastrear la evolución del cibercrimen en la web oscura" . Forbes . Consultado el 22 de septiembre de 2024 .
  5. "Web superficial" . Computer Hope . Consultado el 20 de junio de 2018 .
  6. 1 2 3 Wright, Alex (22 de febrero de 2009). "Explorando una 'web profunda' que Google no puede comprender" . The New York Times . Recuperado el 2 de septiembre de 2019. [...] Mike Bergman, un científico informático y consultor a quien se le atribuye haber acuñado el término web profunda.
  7. ^ Madhavan, J., Ko, D., Kot, Ł., Ganapathy, V., Rasmussen, A., Halevy, A. (2008). El rastreo de la web profunda de Google. Actas del VLDB Endowment, 1(2), 1241–1252.
  8. Shedden, Sam (8 de junio de 2014). "¿Cómo quieres que lo haga? ¿Tiene que parecer un accidente? – Un asesino a sueldo que vende un asesinato por internet; revelado en la web profunda" . Sunday Mail . Archivado del original el 1 de marzo de 2020.
  9. Beckett, Andy (26 de noviembre de 2009). "El lado oscuro de internet" . Recuperado el 9 de agosto de 2015 .
  10. Día D. La captura más fácil: No seas otro pez en la red oscura . Wake Forest University: Charlas TEDx . Archivado del original el 13 de noviembre de 2021.
  11. "Aclarando la confusión: la web profunda frente a la web oscura" . BrightPlanet . 27 de marzo de 2014.
  12. Solomon, Jane (6 de mayo de 2015). "La Deep Web vs. La Dark Web" . Archivado del original el 14 de agosto de 2017. Recuperado el 26 de mayo de 2015 .
  13. Personal de NPR (25 de mayo de 2014). "Going Dark: The Internet Behind The Internet" . Recuperado el 29 de mayo de 2015 .
  14. Greenberg, Andy (19 de noviembre de 2014). "Léxico hacker: ¿Qué es la web oscura?" . Recuperado el 6 de junio de 2015 .
  15. "El impacto de la web oscura en la gobernanza de Internet y la ciberseguridad" (PDF) . 20 de enero de 2014. Archivado del original (PDF) el 16 de enero de 2017. Consultado el 15 de enero de 2017 .
  16. "La web profunda frente a la web oscura" . Blog del diccionario. 6 de mayo de 2015. Archivado del original el 14 de agosto de 2017. Consultado el 15 de enero de 2017 .
  17. 1 2 Bergman, Michael K. (agosto de 2001). "La web profunda: revelando valor oculto" . The Journal of Electronic Publishing . 7 (1). doi : 10.3998/3336451.0007.104 . hdl : 2027/spo.3336451.0007.104 .
  18. García, Frank (enero de 1996). "Negocios y marketing en Internet" . Cabecera . 15 (1). Archivado del original el 5 de diciembre de 1996. Recuperado el 24 de febrero de 2009 .
  19. @1 comenzó con 5,7 terabytes de contenido, estimado en 30 veces el tamaño de la naciente World Wide Web; PLS fue adquirida por AOL en 1998 y @1 fue abandonada. "PLS presenta AT1, el primer servicio de búsqueda de Internet de 'segunda generación'" (Comunicado de prensa). Personal Library Software. Diciembre de 1996. Archivado del original el 21 de octubre de 1997. Recuperado el 24 de febrero de 2009 .
  20. Fielding, R.; Nottingham, M.; Reschke, J. (2014). Fielding, R.; Nottingham, M.; Reschke, J. (eds.). "Protocolo de transferencia de hipertexto (HTTP/1.1): Almacenamiento en caché" . Grupo de trabajo de ingeniería de Internet . doi : 10.17487/RFC7234 . Consultado el 30 de julio de 2014 .
  21. Especial: Búsqueda
  22. "Búsqueda en Internet Archive" .
  23. Wiener-Bronner, Danielle (10 de junio de 2015). "La NASA está indexando la 'Deep Web' para mostrarle a la humanidad lo que Google no mostrará" . Fusion. Archivado del original el 30 de junio de 2015. Recuperado el 27 de junio de 2015. Ya hay otras versiones más simples de Memex disponibles. "Si alguna vez has usado la Wayback Machine del Archivo de Internet", que te da versiones pasadas de un sitio web no accesible a través de Google, entonces técnicamente has buscado en la Deep Web, dijo Chris Mattmann .
  24. "Preguntas frecuentes de Intute, enlace roto" . Consultado el 13 de octubre de 2012 .
  25. "Elsevier retirará su popular motor de búsqueda científica" . library.bldrdoc.gov . Diciembre de 2013. Archivado del original el 23 de junio de 2015. Recuperado el 22 de junio de 2015. A finales de enero de 2014 , Elsevier dejará de ofrecer Scirus, su motor de búsqueda científica gratuito. Scirus ha sido una herramienta de investigación muy completa, con más de 575 millones de elementos indexados para su búsqueda, incluyendo páginas web, artículos preimpresos, patentes y repositorios.
  26. Sriram Raghavan; Garcia-Molina, Hector (2000). "Explorando la web oculta" (PDF) . Informe técnico de las Bibliotecas Digitales de Stanford. Archivado del original (PDF) el 8 de mayo de 2018. Recuperado el 27 de diciembre de 2008 .
  27. Raghavan, Sriram; Garcia-Molina, Hector (2001). "Rastreando la web oculta" (PDF) . Actas de la 27.ª Conferencia Internacional sobre Bases de Datos Muy Grandes (VLDB) . págs. 129–38 . Archivado del original (PDF) el 28 de julio de 2019. Recuperado el 24 de mayo de 2006 . 
  28. Alexandros, Ntoulas; Zerfos, Petros; Cho, Junghoo (2005). "Descarga de contenido web oculto" (PDF) . Ciencias de la Computación de UCLA . Archivado del original (PDF) el 5 de junio de 2020. Recuperado el 24 de febrero de 2009 .
  29. Shestakov, Denis; Bhowmick, Sourav S.; Lim, Ee-Peng (2005). "DEQUE: Consultando la Deep Web" (PDF) . Data & Knowledge Engineering . 52 (3): 273– 311. doi : 10.1016/S0169-023X(04)00107-7 .
  30. Barbosa, Luciano; Freire, Juliana (2007). Un rastreador adaptativo para localizar puntos de entrada ocultos en la web (PDF) . Conferencia WWW 2007. Archivado del original (PDF) el 5 de junio de 2011. Recuperado el 20 de marzo de 2009 .
  31. Barbosa, Luciano; Freire, Juliana (2005). Búsqueda de bases de datos de la web oculta (PDF) . WebDB 2005. Archivado del original (PDF) el 5 de junio de 2011. Recuperado el 20 de marzo de 2009 .
  32. Madhavan, Jayant; Ko, David; Kot, Łucja; Ganapathy, Vignesh; Rasmussen, Alex; Halevy, Alon (2008). Rastreo de la Deep Web de Google (PDF) . PVLDB '08, 23-28 de agosto de 2008, Auckland, Nueva Zelanda. VLDB Endowment, ACM. Archivado del original (PDF) el 16 de septiembre de 2012. Recuperado el 17 de abril de 2009 .
  33. Aaron, Swartz. "En defensa del anonimato" . Consultado el 4 de febrero de 2014 .

Lecturas adicionales

  • Barker, Joe (enero de 2004). "La web invisible: qué es, por qué existe, cómo encontrarla y su ambigüedad inherente" . University of California, Berkeley, Teaching Library Internet Workshops. Archivado del original el 29 de julio de 2005. Recuperado el 26 de julio de 2011 ..
  • Basu, Saikat (14 de marzo de 2010). "10 motores de búsqueda para explorar la web invisible" . MakeUseOf.com..
  • Ozkan, Akin (noviembre de 2014). "Deep Web /Derin İnternet" . Archivado del original el 8 de noviembre de 2014. Recuperado el 6 de noviembre de 2014 ..
  • Gruchawka, Steve (junio de 2006). "Guía práctica para la Deep Web" . Archivado del original el 5 de enero de 2014. Recuperado el 28 de febrero de 2007 ..
  • Hamilton, Nigel (2003). "La mecánica de un motor de metabúsqueda de la red profunda" . XII Conferencia Mundial de la Web..
  • He, Bin; Chang, Kevin Chen-Chuan (2003). "Coincidencia de esquemas estadísticos en interfaces de consulta web" (PDF) . Actas de la Conferencia Internacional ACM SIGMOD de 2003 sobre Gestión de Datos . Archivado del original (PDF) el 20 de julio de 2011.
  • Howell O'Neill, Patrick (octubre de 2013). "Cómo buscar en la Deep Web" . The Daily Dot ..
  • Ipeirotis, Panagiotis G.; Gravano, Luis; Sahami, Mehran (2001). "Sondeo, recuento y clasificación: categorización de bases de datos de la web oculta" (PDF) . Actas de la Conferencia Internacional ACM SIGMOD de 2001 sobre Gestión de Datos . págs. 67–78 . Archivado del original (PDF) el 12 de septiembre de 2006. Recuperado el 26 de septiembre de 2006 . 
  • King, John D.; Li, Yuefeng; Tao, Daniel; Nayak, Richi (noviembre de 2007). "Extracción de conocimiento mundial para el análisis del contenido de los motores de búsqueda" (PDF) . Web Intelligence and Agent Systems . 5 (3): 233– 53. Archivado del original (PDF) el 3 de diciembre de 2008. Recuperado el 26 de julio de 2011 .
  • McCown, Frank; Liu, Xiaoming; Nelson, Michael L.; Zubair, Mohammad (marzo-abril de 2006). "Cobertura de motores de búsqueda del corpus OAI-PMH" (PDF) . IEEE Internet Computing . 10 (2): 66–73 . Bibcode : 2006IIC....10b..66M . doi : 10.1109/MIC.2006.41 . S2CID 15511914 . 
  • Price, Gary; Sherman, Chris (julio de 2001). La web invisible: Descubriendo fuentes de información que los motores de búsqueda no pueden ver . CyberAge Books. ISBN 978-0-910965-51-4.
  • Shestakov, Denis (junio de 2008). Interfaces de búsqueda en la web: consulta y caracterización . Disertaciones doctorales TUCS 104, Universidad de Turku.
  • Whoriskey, Peter (11 de diciembre de 2008). "Las empresas presionan para que la web federal sea más fácil de buscar" . The Washington Post . pág.  D01.
  • Wright, Alex (marzo de 2004). "En busca de la web profunda" . Salon . Archivado del original el 9 de marzo de 2007..
  • Científicos al Desnudo (diciembre de 2014). "Internet: lo bueno, lo malo y lo feo: una exploración en profundidad de Internet y la Dark Web por los Científicos al Desnudo de la Universidad de Cambridge" (Podcast).
  • King, John D. (julio de 2009). Análisis de contenido de motores de búsqueda (PDF) (Tesis). Universidad Tecnológica de Queensland.
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con la Deep Web en Wikimedia Commons