首页
Web开发
Windows程序
编程语言
数据库
移动开发
系统相关
微信
其他好文
会员
首页
>
Web开发
> 详细
利用Lucene和 XPDF 来处理pdf文件
时间:
2015-04-05 17:33:30
阅读:
143
评论:
0
收藏:
0
[点我收藏+]
标签:
/*
* 利用Lucene和 XPDF 来处理pdf文件
* */
package pdfbox;
import java.io.File;
import java.io.IOException;
public class Pdf2Test {
//PDF文件名
private File pdffile;
//转换器的存放位置,默认为E:\\xpdf下
private String CONVERTOR_STORED_PATH = "E:\\xpdf";
//转换器的名称, 默认为pdftotext
private String CONVERTOR_NAME = "pdftotext";
//构造函数,参数为pdf文件的路径
public Pdf2Test(String pdffile) throws IOException {
this(new File(pdffile));
}
//构造函数,参数为PDF文件对象
public Pdf2Test(File file){
this.pdffile = pdffile;
}
//将PDF转化为文本文档
public void toTextFile() throws IOException{
toTextFile(pdffile, true);
}
//将PDF转化为文本文档,参数为目标文件的路径,默认使用PDF文件的布局
public void toTextFile(String targetfile) throws IOException{
toTextFile(new File(targetfile), true);
}
//将PDF转化为文本文,参数一维目标文件的路径
//参数2位true,则表示使用PDF文件中的布局
public void toTestFile(String targetfile, boolean isLayout) throws IOException{
toTextFile(new File(targetfile), isLayout);
}
//将PDF转化为文本文档,参数为目标文件
public void toTextFile(File targetfile) throws IOException{
toTextFile(targetfile, true);
}
//将PDF转换为文档,参数一维目标文件
//参数二位true,表示使用了PDF文件中的布局
public void toTextFile(File targetfile, boolean isLayout) throws IOException{
String[] cmd = getCmd(targetfile, isLayout);
Process p = Runtime.getRuntime().exec(cmd);
}
//获取转换器
public String getCONVERTOR_STORED_PATH(){
return CONVERTOR_STORED_PATH;
}
//设置PDF转换器的路径
public void setCONVERTOR_STORED_PATH(String path){
if(!path.trim().endsWith("\\"))
path = path.trim() + "\\";
this.CONVERTOR_STORED_PATH = path;
}
//解析命令行参数
private String[] getCmd(File targetfile, boolean isLayout){
//命令字符
String command = CONVERTOR_STORED_PATH + CONVERTOR_NAME;
//PDF文件的绝对路劲
String source_absolutePath = pdffile.getAbsolutePath();
//输出文本文件的绝对路径
String target_absolutePath = targetfile.getAbsolutePath();
//保持原来的layout
String layout = "-layout";
//设置编码方式
String encoding = "-enc";
String character = "GBK";
//设置不打印任何消息和错误
String mistake = "-q";
//页面之间不加入分页
String nopagebrk = "-nopgbrk";
//如果isLayout为false,则设置不保持原来的layout
if(!isLayout)
layout = "";
return new String[]{
command, layout, encoding, character, mistake, nopagebrk, source_absolutePath, target_absolutePath
};
}
public static void main(String[] args) {
// TODO Auto-generated method stub
try{
//参数输入PDF文件的存放位置
Pdf2Test p2t = new Pdf2Test("E:\\Lucene项目\\C语言代码.pdf");
//设定转换器的位置
p2t.setCONVERTOR_STORED_PATH("E:\\xpdftest\\xpdf");
//设置文本文件存放的位置
p2t.toTextFile("E:\\Lucene项目\\XPDF\\");
}catch(Exception e){
e.printStackTrace();
}
}
}
利用Lucene和 XPDF 来处理pdf文件
标签:
原文地址:http://blog.csdn.net/u012965373/article/details/44888857
踩
(
0
)
赞
(
0
)
举报
评论
一句话评论(
0
)
登录后才能评论!
分享档案
更多>
2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)
周排行
更多
36.VUE — 认识 Webpack 和 安装
2021-07-28
【PHP】上传图片翻转问题
2021-07-28
php对数字进行万。亿的转化
2021-07-28
五个 .NET 性能小贴士
2021-07-28
Three.js中显示坐标轴、平面、球体、四方体
2021-07-28
.net 5+ 知新:【1】 .Net 5 基本概念和开发环境搭建
2021-07-27
1.html,css
2021-07-27
基于Docker搭建 Php-fpm + Nginx 环境
2021-07-27
nginx + http + svn
2021-07-27
kubernets kube-proxy的代理 iptables和ipvs
2021-07-26
友情链接
兰亭集智
国之画
百度统计
站长统计
阿里云
chrome插件
新版天听网
关于我们
-
联系我们
-
留言反馈
© 2014
mamicode.com
版权所有 联系我们:gaon5@hotmail.com
迷上了代码!