码迷,mamicode.com
首页 > 编程语言 > 详细

Python开发简单爬虫(二)---爬取百度百科页面数据

时间:2017-07-12 21:24:04      阅读:192      评论:0      收藏:0      [点我收藏+]

标签:xxx   抓取策略   分析   emma   src   nbsp   分享   alt   技术   

一、开发爬虫的步骤

技术分享

1.确定目标抓取策略:

打开目标页面,通过右键审查元素确定网页的url格式、数据格式、和网页编码形式。

①先看url的格式, F12观察一下链接的形式;
② 再看目标文本信息的标签格式, 比如文本数据为div class="xxx",
③ 容易看到编码为utf-8


2.分析目标
目标: 百度百科python词条
入口页: http://baike.baidu.com/item/Python
词条页面url格式:/item/****
数据格式:
标题: <dd class="lemmaWgt-lemmaTitle-title"><h1>****</h1></dd>

简介: <div class = "lemma-summary">****</div>
页面编码: utf-8

3.实例代码

爬取百度百科Python词条以及相关的1000个页面数据

 

Python开发简单爬虫(二)---爬取百度百科页面数据

标签:xxx   抓取策略   分析   emma   src   nbsp   分享   alt   技术   

原文地址:http://www.cnblogs.com/Josiah-Lin/p/7126886.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!