共计 475 个字符,预计需要花费 2 分钟才能阅读完成。
【百度云搜寻,搜各种材料:http://www.lqkweb.com】
【搜网盘,搜各种材料:http://www.swpan.cn】
scrapy 的每一个爬虫,暂停时能够记录暂停状态以及爬取了哪些 url,重启时能够从暂停状态开始爬取过的 URL 不在爬取
实现暂停与重启记录状态
1、首先 cd 进入到 scrapy 我的项目里
2、在 scrapy 我的项目里创立保留记录信息的文件夹
3、执行命令:
scrapy crawl 爬虫名称 -s JOBDIR= 保留记录信息的门路
如:scrapy crawl cnblogs -s JOBDIR=zant/001
执行命令会启动指定爬虫,并且记录状态到指定目录
爬虫曾经启动,咱们能够按键盘上的 ctrl+ c 进行爬虫
进行后咱们看一下记录文件夹,会多出 3 个文件
其中的 requests.queue 文件夹里的 p0 文件就是 URL 记录文件,这个文件存在就阐明还有未实现的 URL,当所有 URL 实现后会主动删除此文件
当咱们从新执行命令:scrapy crawl cnblogs -s JOBDIR=zant/001 时爬虫会依据 p0 文件从进行的中央开始持续爬取,
正文完