原来看lucene4.0的posting格式(http://blog.csdn.net/jollyjumper/article/details/30017581),发现这还是比较简单的VInt格式,据说VInt压缩解压都不错(medium),但解压时分支太多打乱CPU流水线因而不够高效,流行的索引压缩有很多,for,simple9,simple16,PForDelta是比较流行的一种,发现lucene 4.1就实现了一个for编码的postings format。从lucene nightly build(lucene
ci)结果上看,这个change对于常见的boolean and query qps有大约20%的提升。
tip文件中保存的TermState有以下几个状态:
docStartFP和上个termstate.docStartFP的差值,
payStartFP的差值,
singletonDocID(只有一个doc时才保存,不然是-1),
lastPosBlockOffset(上一个pos块的位置),
skipoffset
4.0中除了向tip,tim文件中写入内容外,就是向freq和prox两个文件输出。doc delta,doc freq是往doc文件输出,pos向pos文件中输出,payload,offset向pay文件中输出。
doc文件中每加128个doc,缓存对应doc delta buffer和freq buffer,使用for encoding写入doc文件(ForUtil),最后生育的不足128个的doc按照vint写入。
添加position时,同样时每128个position一个block,posDeltaBuffer写入pos文件中,payloadLengthbuffer同样一个block写入payload文件中,接着跟着payload长度(vint)和payload数组,然后是offsetStartDeltaBuffer和offsetLengthBuffer,因此offset在这个版本中归入payload中。
Lucene41PostingWriter源码分析,布布扣,bubuko.com
原文地址:http://blog.csdn.net/jollyjumper/article/details/31068423