StormCrawler es una colección de recursos de código abierto para crear rastreadores web escalables y de baja latencia en Apache Storm . Se proporciona bajo la licencia Apache y está escrito principalmente en Java (lenguaje de programación) .
StormCrawler es modular y consta de un módulo principal, que proporciona los componentes básicos de un rastreador web, como la obtención, el análisis y el filtrado de URL. Además de los componentes principales, el proyecto también proporciona recursos externos, como por ejemplo spout y bolts para Elasticsearch y Apache Solr o un ParserBolt que utiliza Apache Tika para analizar varios formatos de documentos.
El proyecto es utilizado por varias organizaciones, [1] especialmente Common Crawl [2] para generar un conjunto de datos de noticias grande y disponible públicamente.
En octubre de 2016, Linux.com publicó una sesión de preguntas y respuestas con el autor de StormCrawler. [3] InfoQ realizó una en diciembre de 2016. [4] En enero de 2017, se publicó en dzone.com una evaluación comparativa con Apache Nutch . [5]
Varios artículos de investigación mencionaron el uso de StormCrawler, en particular:
- Explorando la red de salud alemana: estudio exploratorio y análisis de gráficos. [6]
- La generación de un corpus de varios millones de páginas para el idioma persa. [7]
- El motor de recuperación y extracción de información de seguridad SIREN. [8]
El Wiki del proyecto contiene una lista de vídeos y diapositivas disponibles en línea. [9]
Véase también
Referencias
- ^ "Desarrollado por · DigitalPebble/storm-crawler Wiki · GitHub". Github.com . 2017-03-02 . Consultado el 2017-04-19 .
- ^ "Conjunto de datos de noticias disponible – Common Crawl".
- ^ "StormCrawler: un SDK de código abierto para crear rastreadores web con ApacheStorm | Linux.com | La fuente de información sobre Linux". Linux.com . 2016-10-12 . Consultado el 2017-04-19 .
- ^ "Julien Nioche habla sobre StormCrawler, un sistema de rastreo de código abierto respaldado por Apache Storm". Infoq.com . 2016-12-15 . Consultado el 2017-04-19 .
- ^ "La batalla de los Crawlers: Apache Nutch contra StormCrawler - DZone Big Data". Dzone.com . Consultado el 19 de abril de 2017 .
- ^ Zowalla, Richard; Wetter, Thomas; Pfeifer, Daniel (2020). "Rastreo de la red de salud alemana: estudio exploratorio y análisis de gráficos". Revista de investigación médica en Internet . 22 (7): e17853. doi : 10.2196/17853 . PMC 7414401 . PMID 32706701.
- ^ "MirasText: un corpus de texto generado automáticamente para el persa".
- ^ Sanagavarapu, Lalit Mohan; Mathur, Neeraj; Agrawal, Shriyansh; Reddy, Y. Raghu (2018). "SIREN - Motor de extracción y recuperación de información de seguridad". Avances en la recuperación de información . Apuntes de clase en informática. Vol. 10772. págs. 811–814. doi :10.1007/978-3-319-76941-7_81. ISBN 978-3-319-76940-0.
- ^ "Presentaciones · Wiki DigitalPebble/storm-crawler · GitHub". Github.com . 2017-04-04 . Consultado el 2017-04-19 .