Articulo de referencia

Rastreador de tormentas

StormCrawler es una colección de recursos de código abierto para crear rastreadores web escalables y de baja latencia en Apache Storm . Se proporciona bajo la licencia Apache y ...

StormCrawler es una colección de recursos de código abierto para crear rastreadores web escalables y de baja latencia en Apache Storm . Se proporciona bajo la licencia Apache y está escrito principalmente en Java (lenguaje de programación) .

StormCrawler es modular y consta de un módulo principal, que proporciona los componentes básicos de un rastreador web, como la obtención, el análisis y el filtrado de URL. Además de los componentes principales, el proyecto también proporciona recursos externos, como por ejemplo spout y bolts para Elasticsearch y Apache Solr o un ParserBolt que utiliza Apache Tika para analizar varios formatos de documentos.

El proyecto es utilizado por varias organizaciones, [1] especialmente Common Crawl [2] para generar un conjunto de datos de noticias grande y disponible públicamente.

En octubre de 2016, Linux.com publicó una sesión de preguntas y respuestas con el autor de StormCrawler. [3] InfoQ realizó una en diciembre de 2016. [4] En enero de 2017, se publicó en dzone.com una evaluación comparativa con Apache Nutch . [5]

Varios artículos de investigación mencionaron el uso de StormCrawler, en particular:

  • Explorando la red de salud alemana: estudio exploratorio y análisis de gráficos. [6]
  • La generación de un corpus de varios millones de páginas para el idioma persa. [7]
  • El motor de recuperación y extracción de información de seguridad SIREN. [8]

El Wiki del proyecto contiene una lista de vídeos y diapositivas disponibles en línea. [9]

Véase también

Referencias

  1. ^ "Desarrollado por · DigitalPebble/storm-crawler Wiki · GitHub". Github.com . 2017-03-02 . Consultado el 2017-04-19 .
  2. ^ "Conjunto de datos de noticias disponible – Common Crawl".
  3. ^ "StormCrawler: un SDK de código abierto para crear rastreadores web con ApacheStorm | Linux.com | La fuente de información sobre Linux". Linux.com . 2016-10-12 . Consultado el 2017-04-19 .
  4. ^ "Julien Nioche habla sobre StormCrawler, un sistema de rastreo de código abierto respaldado por Apache Storm". Infoq.com . 2016-12-15 . Consultado el 2017-04-19 .
  5. ^ "La batalla de los Crawlers: Apache Nutch contra StormCrawler - DZone Big Data". Dzone.com . Consultado el 19 de abril de 2017 .
  6. ^ Zowalla, Richard; Wetter, Thomas; Pfeifer, Daniel (2020). "Rastreo de la red de salud alemana: estudio exploratorio y análisis de gráficos". Revista de investigación médica en Internet . 22 (7): e17853. doi : 10.2196/17853 . PMC 7414401 . PMID  32706701. 
  7. ^ "MirasText: un corpus de texto generado automáticamente para el persa".
  8. ^ Sanagavarapu, Lalit Mohan; Mathur, Neeraj; Agrawal, Shriyansh; Reddy, Y. Raghu (2018). "SIREN - Motor de extracción y recuperación de información de seguridad". Avances en la recuperación de información . Apuntes de clase en informática. Vol. 10772. págs. 811–814. doi :10.1007/978-3-319-76941-7_81. ISBN  978-3-319-76940-0.
  9. ^ "Presentaciones · Wiki DigitalPebble/storm-crawler · GitHub". Github.com . 2017-04-04 . Consultado el 2017-04-19 .
Retrieved from "https://en.wikipedia.org/w/index.php?title=StormCrawler&oldid=1225740752"