百度图片爬虫

Posted gqymy

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了百度图片爬虫相关的知识,希望对你有一定的参考价值。

爬虫工具:webmagic

爬取百度图片,不能通过获取html然后通过匹配标签的形式,而是要找到对应的提供json数据的请求,这个坑我踩了两三个小时,最初自信满满的按官方文档注解形式写了model,pipeline,然后就运行时就发现问题很大。

开始是获取不到html,然后通过调试发现可以获得rayText,但是这里只有简单的外层标签和数据,并没有图片相关数据。

我将代码放到下面,processor中定义了一个静态变量Set,用来保存图片url,剩下的就根据需求自己扩展了。

下面是pageProcessor的实现方法

技术分享图片

 

接着是开启线程

技术分享图片

 

以上是关于百度图片爬虫的主要内容,如果未能解决你的问题,请参考以下文章

Python_爬虫_百度图片

python 百度图片爬虫

百度图片爬虫

python写的百度图片爬虫

爬虫爬取百度搜狗图片持久化存储

Python网络爬虫四多线程爬取多张百度图片的图片