Articulo de referencia

DeepPeep

DeepPeep era un motor de búsqueda que pretendía rastrear e indexar todas las bases de datos de la web pública. [ 1 ] [ 2 ] A diferencia de los motores de búsqueda tradicionales,...

DeepPeep era un motor de búsqueda que pretendía rastrear e indexar todas las bases de datos de la web pública. [ 1 ] [ 2 ] A diferencia de los motores de búsqueda tradicionales, que rastrean las páginas web existentes y sus hipervínculos, DeepPeep pretendía permitir el acceso a la llamada Deep Web , contenido de la World Wide Web disponible solo mediante consultas escritas en bases de datos. [ 3 ] El proyecto comenzó en la Universidad de Utah y fue supervisado por Juliana Freire , profesora asociada del grupo WebDB de la Escuela de Informática de la universidad. [ 4 ] [ 5 ] El objetivo era hacer accesible el 90% de todo el contenido de la WWW, según Freire. [ 6 ] [ 7 ] El proyecto ejecutó un motor de búsqueda beta y fue patrocinado por la Universidad de Utah y una subvención de 243 000 dólares de la National Science Foundation . [ 8 ] Generó interés mundial. [ 9 ] [ 10 ] [ 11 ] [ 12 ] [ 13 ]

Cómo funciona

Al igual que Google , Yahoo y otros motores de búsqueda, DeepPeep permite a los usuarios escribir una palabra clave y devuelve una lista de enlaces y bases de datos con información relacionada con dicha palabra clave.

Sin embargo, lo que diferenciaba a DeepPeep de otros motores de búsqueda es que DeepPeep utiliza el rastreador ACHE , la " Identificación jerárquica de formularios ", la " Agrupación de formularios sensible al contexto " y "LabelEx" para localizar, analizar y organizar formularios web y permitir un fácil acceso a los usuarios. [ 14 ]

Rastreador ACHE

El rastreador ACHE se utiliza para recopilar enlaces y emplea una estrategia de aprendizaje que aumenta la tasa de recopilación de enlaces a medida que continúa la búsqueda. Lo que distingue al rastreador ACHE de otros rastreadores es que estos últimos son rastreadores especializados que recopilan páginas web con propiedades o palabras clave específicas. En cambio, el rastreador ACHE incluye un clasificador de páginas que le permite descartar las páginas irrelevantes de un dominio, así como un clasificador de enlaces que los clasifica según su relevancia para un tema. Como resultado, el rastreador ACHE descarga primero los enlaces web más relevantes y ahorra recursos al no descargar datos irrelevantes. [ 15 ]

Identificación de formas jerárquicas

Para eliminar aún más los enlaces y resultados de búsqueda irrelevantes, DeepPeep utiliza el marco de Identificación Jerárquica de Formularios (HIFI) , que clasifica los enlaces y resultados de búsqueda según la estructura y el contenido del sitio web. [ 14 ] A diferencia de otras formas de clasificación que se basan únicamente en las etiquetas del formulario web para su organización, HIFI utiliza tanto la estructura como el contenido del formulario web para la clasificación. Mediante estos dos clasificadores, HIFI organiza los formularios web de forma jerárquica, lo que clasifica la relevancia de un formulario web para la palabra clave objetivo. [ 16 ]

Agrupación sensible al contexto

Cuando no hay un dominio de interés o el dominio especificado tiene múltiples tipos de definición, DeepPeep debe separar el formulario web y agruparlo en dominios similares. El motor de búsqueda utiliza la agrupación sensible al contexto para agrupar enlaces similares en el mismo dominio, modelando el formulario web en conjuntos de hipervínculos y utilizando su contexto para la comparación. A diferencia de otras técnicas que requieren una extracción de etiquetas compleja y un preprocesamiento manual de los formularios web, la agrupación sensible al contexto se realiza automáticamente y utiliza metadatos para gestionar formularios web con contenido extenso y múltiples atributos. [ 14 ]

LabelEx

DeepPeep extrae información adicional denominada metadatos de estas páginas, lo que permite una mejor clasificación de enlaces y bases de datos mediante LabelEx, un método para la descomposición y extracción automática de metadatos. Los metadatos son datos de enlaces web que proporcionan información sobre otros dominios. LabelEx identifica la correspondencia entre elementos y etiquetas y la utiliza para extraer metadatos con precisión, a diferencia de los métodos convencionales que empleaban reglas de extracción manuales específicas. [ 14 ]

Categoría

Cuando aparecen los resultados de búsqueda después de que el usuario introduce su palabra clave, DeepPeep clasifica los enlaces según tres características: contenido del término, número de backlinks y PageRank . En primer lugar, el contenido del término se determina simplemente por el contenido del enlace web y su relevancia. Los backlinks son hipervínculos o enlaces que dirigen al usuario a otro sitio web. PageRank es la clasificación de los sitios web en los resultados de los motores de búsqueda y funciona contando la cantidad y la calidad de los enlaces a un sitio web para determinar su importancia. La información de PageRank y backlinks se obtiene de fuentes externas como Google , Yahoo y Bing . [ 14 ]

Lanzamiento de la versión beta

DeepPeep Beta se lanzó y solo cubría siete dominios: automoción, billetes de avión, biología, libros, hoteles, empleo y alquiler. Bajo estos siete dominios, DeepPeep ofrecía acceso a 13 000 formularios web. [ 17 ] Se podía acceder al sitio web en DeepPeep.org , pero el sitio web ha estado inactivo desde que se retiró la versión beta.

Referencias

  1. Wright, Alex (22 de febrero de 2009). "Explorando una 'web profunda' que Google no puede comprender" . The New York Times . Recuperado el 23 de febrero de 2009 .
  2. ^ Franke, Susanne (24 de febrero de 2009). "DeepPeep: Forscher wollen verborgene Datenbanken im Web zugänglich machen" [ DeepPeep: Los investigadores quieren que las bases de datos ocultas sean accesibles en la web ] . comp. Ztg. Consultado el 25 de febrero de 2009 a través de lanline.de.
  3. Warwick, Martyn (25 de febrero de 2009). "DeepPeep deja entrar luz en la web oculta" . TelecomTV . Recuperado el 25 de febrero de 2009 .
  4. Sawant, Nimish (2010-03-09). "Rastreando la web profunda" . LiveMint . Mint . Recuperado el 2010-12-13 .
  5. "Página principal" . WebDB . Facultad de Informática de la Universidad de Utah. 4 de octubre de 2008. Archivado del original el 27 de febrero de 2009. Consultado el 23 de febrero de 2009 .
  6. ^ Pichler, Thomas (23 de febrero de 2009). "Suchansätze dringen in die Tiefen des Internets: Erforschen von Datenbanken als wichtiger Schritt" [ Las frases de búsqueda penetran en las profundidades de Internet: la investigación en bases de datos como un paso importante ] (en alemán). Texto de prensa . Consultado el 23 de febrero de 2009 .
  7. "Suchansätze dringen in die Tiefen des Internets" [ Las frases de búsqueda penetran en las profundidades de Internet ] . nachrichten.ch (en alemán). 24 de febrero de 2009. Archivado del original el 7 de julio de 2011. Consultado el 13 de diciembre de 2010 .
  8. "Resumen del premio n.° 0713637: III-COR: Descubrimiento y organización de fuentes ocultas en la web" . Búsqueda de premios de la NSF . Fundación Nacional de Ciencias . Consultado el 23 de febrero de 2009 .
  9. "Esplorando il DeepWeb, i fondali della Rete dove Google non arriva" [ Exploring the DeepWeb, the depths of the Net where Google does not arrive ] . Liberta di Stampa Diritto all'Informazione (Esta es una traducción al italiano del artículo del New York Times "Exploring a 'Deep Web' That Google Can't Grasp" de Alex Wright) (en italiano). Italia. 2009-04-05 . Recuperado el 2009-03-05 .
  10. ^ Sándor, Berta (24 de febrero de 2009). "Az internet mélyét kutatja a DeepPeep" [ Internet investiga las profundidades de DeepPeep ] . sg.hu (en húngaro). SG (Hungría) . Consultado el 5 de marzo de 2009 .
  11. "Niet alles is te vinden met Google" [ No todo se puede encontrar con Google ] (en neerlandés). Dutch Cowboys. 4 de marzo de 2009. Consultado el 5 de marzo de 2009 .
  12. ^ "探索谷歌尚未把持的'深层网络'" [ Explorando la 'red profunda' aún no dominada por Google ] (Esta es una traducción al chino del artículo del New York Times "Explorando una 'web profunda' que Google no puede comprender" de Alex Wright) (en chino). 3 de marzo de 2006. Archivado del original el 7 de julio de 2011. Consultado el 5 de marzo de 2009 .
  13. «Sfida al deep web: la Kosmix prova a svelare le pagine nascoste di internet» [ Desafío a la deep web: Kosmix intenta revelar las páginas ocultas de internet ] . Mensaje. 2009-02-23 . Consultado el 13 de diciembre de 2010 .{{cite news}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  14. 1 2 3 4 5 Barbosa, Luciano; Nguyen, Hoa; Nguyen, Thanh; Pinnamaneni, Ramesh; Freire, Juliana (2010-01-01). "Creación y exploración de repositorios de formularios web". Actas de la Conferencia Internacional ACM SIGMOD 2010 sobre Gestión de Datos . SIGMOD '10. Nueva York, NY, EE. UU.: ACM. págs. 1175–1178 . doi : 10.1145/1807167.1807311 . ISBN  9781450300322. S2CID 15471440 . 
  15. ^ "ViDA-NYU/ache" . GitHub . Consultado el 6 de noviembre de 2016 .
  16. Duygulu, Pinar (1999-12-22). Lopresti, Daniel P.; Zhou, Jiangying (eds.). "Representación jerárquica de documentos de formulario para identificación y recuperación" . Actas de SPIE . Reconocimiento y recuperación de documentos VII. 3967 (1): 128. Bibcode : 1999SPIE.3967..128D . doi : 10.1117/12.373486 . ISSN 0277-786X . S2CID 28128295 .  
  17. Beckett, Andy (25 de noviembre de 2009). "El lado oscuro de internet" . The Guardian . ISSN 0261-3077 . Consultado el 6 de noviembre de 2016 . 
  • El sitio DeepPeep.org fue encontrado inactivo en noviembre de 2016 y aparece vinculado a Register.com . Su último título era "DeepPeep: Descubre la web oculta" . Archivado del original el 9 de mayo de 2012. Consultado el 23 de febrero de 2009 .{{cite web}}: CS1 maint: bot: estado de la URL original desconocido ( enlace ) .
Obtenido de " https://en.wikipedia.org/w/index.php?title=DeepPeep&oldid=1337090530 "