首页
Web开发
Windows程序
编程语言
数据库
移动开发
系统相关
微信
其他好文
会员
首页
>
编程语言
> 详细
java调用phantomjs采集ajax加载生成的网页
时间:
2016-01-11 00:00:14
阅读:
364
评论:
0
收藏:
0
[点我收藏+]
标签:
java调用phantomjs采集ajax加载生成的网页
日前有采集需求,当我把所有的对应页面的链接都拿到手,准备开始根据链接去采集(写爬虫爬取)对应的终端页的时候,发觉用程序获取到的数据根本没有对应的内容,可是我的浏览器看到的内容明明是有的,于是浏览器查看源代码也发觉没有,此时想起该网页应该是ajax加载的。不知道ajax的小朋友可以去学下web开发啦。
采集ajax生成的内容手段不外乎两种。一种是通过http观察加载页面时候的请求,然后我们模仿该请求去得到对应的内容,第二种则是模仿浏览器行为去渲染这个页面得到内容。我在这里决定采用第二种方式,之前一直玩webkit,不过一直要加载页面太浪费资源了,此时了解到有一个好玩的玩意phantomjs,这是个可以用命令行来操作webkit的玩意,然后也可以直接在里面用js的api去操作页面(当然,我这边比较简单就懒得用了)。
下载
完phantomjs之后直接解压就可以使用,然后在path目录加入phantomjs的路径(以便直接在命令行就可以执行phantomjs命令)。
接下来要完成个代码,一个是用phantomjs去获取页面(采用js编写行为),一个是采用java去调用phantomjs来达到获取内容的作用,接下来直接贴代码。
//codes.js
system = require(
‘system‘)
address = system.args[1];
//获得命令行第二个参数 接下来会用到
//console.log(‘Loading a web page‘);
var page = require(
‘webpage‘).create();
var url = address;
//console.log(url);
page.open(url,
function (status) {
//Page is loaded!
if (status !==
‘success‘) {
console.log(
‘Unable to post!‘);
}
else {
//console.log(page.content);
//var title = page.evaluate(function() {
// return document.title;//示范下如何使用页面的jsapi去操作页面的 www.oicqzone.com
// });
//console.log(title);
console.log(page.content);
}
phantom.exit();
});
上述的js代码估计应该没几个看不懂的。。。
接下来贴java代码!
import org.apache.commons.io.IOUtils;
import java.io.*;
/**
* Created with IntelliJ IDEA.
* User: lsz
* Date: 14-4-22
* Time: 下午1:17
* utils for http
*/
public
class HttpUtils {
public
static String getAjaxCotnent(String url)
throws IOException {
Runtime rt = Runtime.getRuntime();
Process p = rt.exec(
"phantomjs.exe c:/phantomjs/codes.js "+url);
//这里我的codes.js是保存在c盘下面的phantomjs目录
InputStream is = p.getInputStream();
BufferedReader br =
new BufferedReader(
new InputStreamReader(is));
StringBuffer sbf =
new StringBuffer();
String tmp =
"";
while((tmp = br.readLine())!=
null){
sbf.append(tmp);
}
//System.out.println(sbf.toString());
return sbf.toString();
}
public
static
void main(String[] args)
throws IOException {
getAjaxCotnent(
"http://www.oicqzone.com");
}
}
其实原理很简单,就是通过进程间通信用java调用phantomjs这个组件去请求渲染页面,不过这种做法因为每次都要重新启动phantomjs进程,所以比较慢,还有另外一种直接用phantomjs加载页面后,把内容post给我们自定义的一个http后端接收数据,会更快一点。
java调用phantomjs采集ajax加载生成的网页
标签:
原文地址:http://www.cnblogs.com/firstdream/p/5119720.html
踩
(
0
)
赞
(
0
)
举报
评论
一句话评论(
0
)
登录后才能评论!
分享档案
更多>
2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)
周排行
更多
Spring Cloud 从入门到精通(一)Nacos 服务中心初探
2021-07-29
基础的排序算法
2021-07-29
SpringBoot|常用配置介绍
2021-07-29
关于 .NET 与 JAVA 在 JIT 编译上的一些差异
2021-07-29
C语言常用函数-toupper()将字符转换为大写英文字母函数
2021-07-29
《手把手教你》系列技巧篇(十)-java+ selenium自动化测试-元素定位大法之By class name(详细教程)
2021-07-28
4-1 YAML配置文件 注入 JavaBean中
2021-07-28
【python】 用来将对象持久化的 pickle 模块
2021-07-28
马拉车算法
2021-07-28
用Python进行冒泡排序
2021-07-28
友情链接
兰亭集智
国之画
百度统计
站长统计
阿里云
chrome插件
新版天听网
关于我们
-
联系我们
-
留言反馈
© 2014
mamicode.com
版权所有 联系我们:gaon5@hotmail.com
迷上了代码!