码迷,mamicode.com
首页 > 编程语言 > 详细

python爬取猫眼电影top100

时间:2019-04-09 23:27:38      阅读:299      评论:0      收藏:0      [点我收藏+]

标签:实现   多进程   解析   python   项目   创建   sts   一个   就是   

最近想研究下python爬虫,于是就找了些练习项目试试手,熟悉一下,猫眼电影可能就是那种最简单的了。

1 看下猫眼电影的top100页面

技术图片

分了10页,url为:https://maoyan.com/board/4?offset=0

我们发起请求,得到相应:

技术图片我们

我使用的是requests库,这是一个第三方的库。

2 利用正则解析爬取下的页面

当然你也可以使用xpath和bs4。

我们先看一下网页的源代码:

技术图片

然后根据代码写出要匹配的正则,然后对匹配出来的数据做解析:

技术图片

3 将抓到的数据写入本地文件

技术图片

4 最后得到的页面

技术图片

5 一点小扩充

虽然实现了爬取的功能,但是其实这个程序还可以扩充

普通版:利用for循环实现爬取

技术图片

多线程版:利用进程池创建多进程

python爬取猫眼电影top100

标签:实现   多进程   解析   python   项目   创建   sts   一个   就是   

原文地址:https://www.cnblogs.com/xiaozx/p/10680548.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!