码迷,mamicode.com
首页 > 其他好文 > 详细

Lucene41PostingWriter源码分析

时间:2014-06-16 22:35:40      阅读:355      评论:0      收藏:0      [点我收藏+]

标签:lucene   源码   

原来看lucene4.0的posting格式(http://blog.csdn.net/jollyjumper/article/details/30017581),发现这还是比较简单的VInt格式,据说VInt压缩解压都不错(medium),但解压时分支太多打乱CPU流水线因而不够高效,流行的索引压缩有很多,for,simple9,simple16,PForDelta是比较流行的一种,发现lucene 4.1就实现了一个for编码的postings format。从lucene nightly build(lucene ci)结果上看,这个change对于常见的boolean and query qps有大约20%的提升。

tip文件中保存的TermState有以下几个状态:

docStartFP和上个termstate.docStartFP的差值,

payStartFP的差值,

singletonDocID(只有一个doc时才保存,不然是-1),

lastPosBlockOffset(上一个pos块的位置),

skipoffset

4.0中除了向tip,tim文件中写入内容外,就是向freq和prox两个文件输出。doc delta,doc freq是往doc文件输出,pos向pos文件中输出,payload,offset向pay文件中输出。

doc文件中每加128个doc,缓存对应doc delta buffer和freq buffer,使用for encoding写入doc文件(ForUtil),最后生育的不足128个的doc按照vint写入。

添加position时,同样时每128个position一个block,posDeltaBuffer写入pos文件中,payloadLengthbuffer同样一个block写入payload文件中,接着跟着payload长度(vint)和payload数组,然后是offsetStartDeltaBuffer和offsetLengthBuffer,因此offset在这个版本中归入payload中。

Lucene41PostingWriter源码分析,布布扣,bubuko.com

Lucene41PostingWriter源码分析

标签:lucene   源码   

原文地址:http://blog.csdn.net/jollyjumper/article/details/31068423

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!