Apache-Tika解析JPEG文档

时间：2015-11-18 21:13:19 阅读：218 评论：0 收藏：0 [点我收藏+]

标签：

通常在使用爬虫时，爬取到网上的文章都是各式各样的格式处理起来比较麻烦，这里我们使用Apache-Tika来处理JPEG格式的图片，如下：

package com.mengyao.tika.app;

import java.io.File;
import java.io.FileInputStream;

import org.apache.tika.metadata.Metadata;
import org.apache.tika.parser.ParseContext;
import org.apache.tika.parser.jpeg.JpegParser;
import org.apache.tika.sax.BodyContentHandler;

public class JpegApp {

    public static void main(final String[] args) throws Exception {
        // Tika默认是10*1024*1024，这里防止文件过大导致Tika报错
        BodyContentHandler handler = new BodyContentHandler(1024 * 1024 * 10);
        Metadata metadata = new Metadata();
        FileInputStream inputstream = new FileInputStream(new File("D:/无标题.jpg"));
        ParseContext pcontext = new ParseContext();

        // 解析JPEG文件时应由超类AbstractParser的派生类JpegParser实现
        JpegParser msofficeparser = new JpegParser();
        msofficeparser.parse(inputstream, handler, metadata, pcontext);
        // 获取JPEG文件的内容
        System.out.println("JPEG文件内容:" + handler.toString());

        // 获取JPEG文件的元数据
        System.out.println("JPEG文件元数据:");
        String[] metadataNames = metadata.names();

        for (String name : metadataNames) {
            System.out.println(name + " : " + metadata.get(name));
        }
    }

}

Apache-Tika解析JPEG文档

标签：

原文地址：http://www.cnblogs.com/mengyao/p/4975677.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行