码迷,mamicode.com
首页 > 其他好文 > 详细

互联网数据的挖掘和分析

时间:2015-09-30 12:45:34      阅读:175      评论:0      收藏:0      [点我收藏+]

标签:

基本上使用python语言完成

一、抓取
列表页
详细页

授权(API)&未授权(爬虫)
普通抓取&需登录

二、html解析
1. BeautifulSoup
2. 正则


三、文本分析&自然语言处理

四、性能优化
1. 反抓取屏蔽 http代理
2. 性能优化
多线程抓取

互联网数据的挖掘和分析

标签:

原文地址:http://www.cnblogs.com/gaotianpu/p/4848635.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!