部署爬虫

本节介绍部署 Scrapy 爬虫以定期运行的各种选项。在本地机器上运行 Scrapy 爬虫对于(早期)开发阶段非常方便,但当您需要执行长时间运行的爬虫或将爬虫移动到生产环境持续运行时就不那么方便了。这就是部署 Scrapy 爬虫解决方案发挥作用的地方。

部署 Scrapy 爬虫的流行选择有

部署到 Scrapyd 服务器

Scrapyd 是一个运行 Scrapy 爬虫的开源应用程序。它提供一个带有 HTTP API 的服务器,能够运行和监控 Scrapy 爬虫。

要将爬虫部署到 Scrapyd,您可以使用 scrapyd-client 包提供的 scrapyd-deploy 工具。请参阅 scrapyd-deploy 文档以获取更多信息。

Scrapyd 由一些 Scrapy 开发者维护。

部署到 Zyte Scrapy Cloud

Zyte Scrapy Cloud 是 Scrapy 背后的公司 Zyte 提供的一项托管式云服务。

Zyte Scrapy Cloud 消除了设置和监控服务器的需要,并提供了一个友好的用户界面来管理爬虫,审查抓取到的数据项、日志和统计信息。

要将爬虫部署到 Zyte Scrapy Cloud,您可以使用 shub 命令行工具。请参阅 Zyte Scrapy Cloud 文档以获取更多信息。

Zyte Scrapy Cloud 与 Scrapyd 兼容,可以根据需要进行切换 — 配置像 scrapyd-deploy 一样从 scrapy.cfg 文件中读取。