码迷,mamicode.com
首页 > 其他好文 > 详细

百度图片爬虫

时间:2018-10-13 15:43:09      阅读:180      评论:0      收藏:0      [点我收藏+]

标签:不能   需求   技术   pipe   工具   简单   16px   alt   text   

爬虫工具:webmagic

爬取百度图片,不能通过获取html然后通过匹配标签的形式,而是要找到对应的提供json数据的请求,这个坑我踩了两三个小时,最初自信满满的按官方文档注解形式写了model,pipeline,然后就运行时就发现问题很大。

开始是获取不到html,然后通过调试发现可以获得rayText,但是这里只有简单的外层标签和数据,并没有图片相关数据。

我将代码放到下面,processor中定义了一个静态变量Set,用来保存图片url,剩下的就根据需求自己扩展了。

下面是pageProcessor的实现方法

技术分享图片

 

接着是开启线程

技术分享图片

 

百度图片爬虫

标签:不能   需求   技术   pipe   工具   简单   16px   alt   text   

原文地址:https://www.cnblogs.com/gqymy/p/9782886.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!