码迷,mamicode.com
首页 > Web开发 > 详细

Atitit.数据采集器 dataspider

时间:2016-09-28 01:30:21      阅读:423      评论:0      收藏:0      [点我收藏+]

标签:

 

 

 

 

Atitit.数据采集器 dataspider

 

 

/atiplat_cms/src/com/attilax/WebInfoX.java  @dep

 

 

http://cl.cmcher.com/thread0806.php?fid=16&search=&page=2

 

 

/atiplat_cms/src/com/attilax/dataspider/TsaolyoNetDataSpider.java

 

爬虫注意事项

设置useragent as ff

https的注意。。

 

 

主要是因为Java自己的HttpURLConnection对SSL支持的不好,而且控制起来不太方便,而且HttpClient还支持抓取非信任的站点,别的实现方式貌似需要在代码中显式导入证书。

 

作者:: 绰号:老哇的爪子 ( 全名::Attilax Akbar Al Rapanui 阿提拉克斯 阿克巴 阿尔 拉帕努伊 ) 汉字名:艾龙,  EMAIL:1466519819@qq.com

转载请注明来源: http://www.cnblogs.com/attilax/

 

 

需要override打三个函数

 

public List<String> getpageUrls() 

public List getArtListByPagehtml(String html) {

public List<String> getPics_byHtml

 

使用方法与参数

 

 

TsaolyoNetDataSpider x = new TsaolyoNetDataSpider();

// x.fileName=args[0];// "c:\\r2.csv";

 

x.picSaveDir = "c:\\0picSaveDir";

x.startPage = Integer.parseInt(System.getProperty("startPage", "1"));

x.endPage = Integer.parseInt(System.getProperty("endPage"));

;

 

 x.exec();

 

Atitit.数据采集器 dataspider

标签:

原文地址:http://www.cnblogs.com/attilax/p/5914777.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!