19.基于scrapy-redis两种形式的分布式爬虫
Posted my-share
tags:
篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了19.基于scrapy-redis两种形式的分布式爬虫相关的知识,希望对你有一定的参考价值。
redis分布式部署
1.scrapy框架是否可以自己实现分布式?
- 不可以。原因有二。
其一:因为多台机器上部署的scrapy会各自拥有各自的调度器,这样就使得多台机器无法分配start_urls列表中的url。(多台机器无法共享同一个调度器)
其二:多台机器爬取到的数据无法通过同一个管道对数据进行统一的数据持久出存储。(多台机器无法共享同一个管道)
2.基于scrapy-redis组件的分布式爬虫
- scrapy-redis组件中为我们封装好了可以被多台机器共享的调度器和管道,我们可以直接使用并实现分布式数据爬取。
- 实现方式:
1.基于该组件的RedisSpider类
2.基于该组件的RedisCrawlSpider类
以上是关于19.基于scrapy-redis两种形式的分布式爬虫的主要内容,如果未能解决你的问题,请参考以下文章