scrapy框架爬虫的暂停和启动

Posted youxiu123

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了scrapy框架爬虫的暂停和启动相关的知识,希望对你有一定的参考价值。

 

scrapy的每一个爬虫,暂停时可以记录暂停状态以及爬取了哪些url,重启时可以从暂停状态开始爬取过的URL不在爬取

实现暂停与重启记录状态

方法一:

技术图片
1、首先cd进入到scrapy项目里(当然你也可以通过编写脚本Python文件直接在pycharm中运行)

2、在scrapy项目里创建保存记录信息的文件夹

3、执行命令:

  scrapy crawl 爬虫名称 -s JOBDIR=保存记录信息的路径

  如:scrapy crawl cnblogs -s JOBDIR=zant/001

  执行命令会启动指定爬虫,并且记录状态到指定目录

爬虫已经启动,我们可以按键盘上的ctrl+c停止爬虫,停止后我们看一下记录文件夹,会多出3个文件,其中的requests.queue文件夹里的p0文件就是URL记录文件,这个文件存在就说明还有未完成的URL,当所有URL完成后会自动删除此文件

当我们重新执行命令:scrapy crawl cnblogs -s JOBDIR=zant/001  时爬虫会根据p0文件从停止的地方开始继续爬取。
技术图片

技术图片

 

方法二:

在settings.py文件里加入下面的代码: 

JOBDIR=‘sharejs.com‘

使用命令scrapy crawl 爬虫名,就会自动生成一个sharejs.com的目录,然后将工作列表放到这个文件夹里 

技术图片

 

以上是关于scrapy框架爬虫的暂停和启动的主要内容,如果未能解决你的问题,请参考以下文章

应用scrapy爬虫框架

scrapy的暂停与重启

Web漏洞扫描这件事爬虫2-scrapy框架

scrapy01-scrapy的项目的创建和启动

python爬虫随笔-scrapy框架——scrapy框架的安装和结构介绍

Python编程基础之(五)Scrapy爬虫框架