Scrapy ( / ˈ s k r eɪ p aɪ / [ 2 ] SKRAY -peye ) es un framework de rastreo web gratuito y de código abierto escrito en Python. Originalmente diseñado para el web scraping , también se puede usar para extraer datos mediante API o como un rastreador web de propósito general. [ 3 ] Actualmente, su mantenimiento corre a cargo de Zyte (anteriormente Scrapinghub ), una empresa de desarrollo y servicios de web scraping.
La arquitectura de proyectos de Scrapy se basa en "arañas", que son rastreadores autónomos a los que se les proporciona un conjunto de instrucciones. Siguiendo el espíritu de otros frameworks que priorizan la simplicidad , como Django , [ 4 ] facilita la creación y escalabilidad de grandes proyectos de rastreo al permitir que los desarrolladores reutilicen su código.
Algunas empresas y productos conocidos que utilizan Scrapy son: Lyst, [ 5 ] [ 6 ] Parse.ly , [ 7 ] Sayone Technologies , [ 8 ] Sciences Po Medialab, [ 9 ] el sitio de datos del gobierno mundial de Data.gov.uk. [ 10 ]
Historia
Scrapy nació en Mydeco, una empresa de agregación web y comercio electrónico con sede en Londres, donde fue desarrollado y mantenido por empleados de Mydeco e Insophia (una empresa de consultoría web con sede en Montevideo , Uruguay). La primera versión pública se lanzó en agosto de 2008 bajo la licencia BSD , y la versión 1.0 se lanzó en junio de 2015. [ 11 ] En 2011, Zyte (anteriormente Scrapinghub) se convirtió en el nuevo mantenedor oficial. [ 12 ] [ 13 ]
Referencias
- ↑ "Versión 2.17.0" . 7 de julio de 2026. Consultado el 8 de julio de 2026 .
- ↑ "Commit 975f150" . GitHub . Archivado del original el 18 de octubre de 2021. Consultado el 18 de octubre de 2021 .
- ↑ Scrapy de un vistazo Archivado el 17/09/2018 en Wayback Machine .
- ↑ "Preguntas frecuentes" . Preguntas frecuentes, documentación de Scrapy 2.8.0 . Archivado del original el 11 de noviembre de 2020. Consultado el 28 de julio de 2015 .
- ↑Bell, Eddie; Heusser, Jonathan. "Scalable Scraping Using Machine Learning". Archived from the original on 4 June 2016. Retrieved 28 July 2015.
- ↑"Scrapy | Companies using Scrapy". Archived from the original on 2020-11-12. Retrieved 2015-07-28.
- ↑Montalenti, Andrew (October 27, 2012). "Web Crawling & Metadata Extraction in Python". Web Crawling & Metadata Extraction in Python - Speaker Deck. Archived from the original on September 19, 2020. Retrieved May 11, 2015.
- ↑"Scrapy Companies". Scrapy | Companies using Scrapy. Archived from the original on 2020-11-12. Retrieved 2017-11-09.
- ↑"Hyphe v0.0.0: the first release of our new webcrawler is out!". 17 November 2013. Archived from the original on 2016-06-13. Retrieved 2015-07-28.
- ↑Ben Firshman [@bfirsh] (21 January 2010). "World Govt Data site uses Django, Solr, Haystack, Scrapy and other exciting buzzwords http://bit.ly/5jU3La #opendata #datastore" (Tweet) – via Twitter.
- ↑Medina, Julia (19 June 2015). "Scrapy 1.0 official release out!". scrapy-users (Mailing list). Archived from the original on 25 January 2010. Retrieved 28 July 2015.
- ↑Hoffman, Pablo (2013). List of the primary authors & contributors. Archived from the original on 29 May 2017. Retrieved 18 November 2013.
- ↑Interview Scraping HubArchived 2020-10-29 at the Wayback Machine.
- Web crawlers
- Web scraping
- Free software programmed in Python
- Software using the BSD license