【百度云搜寻,搜各种材料:http://www.lqkweb.com】
【搜网盘,搜各种材料:http://www.swpan.cn】

scrapy的每一个爬虫,暂停时能够记录暂停状态以及爬取了哪些url,重启时能够从暂停状态开始爬取过的URL不在爬取

实现暂停与重启记录状态

1、首先cd进入到scrapy我的项目里

2、在scrapy我的项目里创立保留记录信息的文件夹

3、执行命令:

  scrapy crawl 爬虫名称 -s JOBDIR=保留记录信息的门路

  如:scrapy crawl cnblogs -s JOBDIR=zant/001

  执行命令会启动指定爬虫,并且记录状态到指定目录

爬虫曾经启动,咱们能够按键盘上的ctrl+c进行爬虫

进行后咱们看一下记录文件夹,会多出3个文件

其中的requests.queue文件夹里的p0文件就是URL记录文件,这个文件存在就阐明还有未实现的URL,当所有URL实现后会主动删除此文件

当咱们从新执行命令:scrapy crawl cnblogs -s JOBDIR=zant/001  时爬虫会依据p0文件从进行的中央开始持续爬取,