码迷,mamicode.com
首页 > 编程语言 > 详细

团队-张文然-需求分析-python爬虫分类爬取豆瓣电影信息

时间:2017-09-07 19:22:08      阅读:137      评论:0      收藏:0      [点我收藏+]

标签:网页   网站   模拟   pid   运行   通过   spider   爬取   应该   

首先要明白爬网页实际上就是:
找到包含我们需要的信息的网址(URL)列表
通过 HTTP 协议把页面下载回来
从页面的 HTML 中解析出需要的信息
找到更多这个的 URL,回到 2 继续
其次还要明白:
一个好的列表应该:
包含足够多的电影的 URL
通过翻页,可以遍历到所有的电影
一个按照更新时间排序的列表,可以更快抓到最新更新的电影
最后模拟过程知道豆瓣网站不能一次性爬取所有信息,只能分类爬取
使用工具pyspider
分析完成实现代码,测试模拟运行,按照时间列表爬取每类最新电影资讯

代码分解,便于加入团队后组员理解代码


团队成员:张文然,张宸

团队-张文然-需求分析-python爬虫分类爬取豆瓣电影信息

标签:网页   网站   模拟   pid   运行   通过   spider   爬取   应该   

原文地址:http://www.cnblogs.com/zwran/p/7491123.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!