web scraper——简单的爬取数据【二】

时间：2019-01-30 17:10:56 阅读：249 评论：0 收藏：0 [点我收藏+]

标签：hot 默认文本鼠标移动 ima 技术 EDA 分享图片 mep

web scraper——安装【一】

在上文中我们已经安装好了web scraper现在我们来进行简单的爬取，就来爬取百度的实时热点吧。

http://top.baidu.com/buzz?b=1&fr=20811

文本太长,大部分是图片,所以上下操作视频吧,视频爬取的是昵称不是百度热点数据

链接：https://pan.baidu.com/s/1W-8kGDznZZjoQIk1e6ikfQ
提取码：3dj7

爬取步骤

创建站点

打开百度热点，ctrl+shit+i进入检测工具,打开web scraper创建站点

技术分享图片

进入创建站点页面站点名称和爬取地址点击创建站点即可

如果要爬取分页数据那就将参数写成范围的如:

想要爬取微博某博主关注列表的1-5页的粉丝信息,通过url的跳转发现微博关注列表和<number>数字有关

https://weibo.com/p/1003061752021340/follow?relate=fans&page=<number>

所以只要把<number>写成一个范围的即可

https://weibo.com/p/1006051234552257/follow?relate=fans&page=[1-5]

技术分享图片

爬取数据

首先创建一个element的select

技术分享图片

创建element信息

技术分享图片

select选择最外层的盒子,确认无误后点击Done selecting!

技术分享图片

然后回到web scraper控制台,查看信息无误后勾选multiple确认无误后,创建element的select

技术分享图片

爬取自己想要的信息,点击进入hotList里面,然后继续创建select选择

技术分享图片

填写具体的select信息,并继续通过select来进行选择需要的数据

技术分享图片

这时候页面的范围会变为黄色,鼠标移动到自己需要的信息处会有绿框将信息圈出来

技术分享图片

点击确认后会变为红色的,再次选择相同的会自动识别将同样标签下的包围起来,确认是自己需要的信息后直接Done selecting!

技术分享图片

再次转到web scraper的控制台后,确认无误即可保存

技术分享图片

运行脚本,进行采集

技术分享图片

默认配置即可,想修改也可以的,我一般直接默认的

技术分享图片

点击开始脚本后,会将采集的页面弹出,采集完成右下角会出现提示,采集过程中点击refresh可以查看采集的数据

技术分享图片

采集的数据

技术分享图片

导出数据

确认数据没有错误,是自己需要的即可,进行下载,以csv格式导出

技术分享图片

点击Downolad now!即可下载

技术分享图片

数据内容

技术分享图片

到这里使用web scraper进行数据采集就结束了

web scraper——简单的爬取数据【二】

标签：hot 默认文本鼠标移动 ima 技术 EDA 分享图片 mep

原文地址：https://www.cnblogs.com/wangyang0210/p/10338574.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行