码迷,mamicode.com
首页 > 其他好文 > 详细

sphinx索引分析续

时间:2017-01-05 09:54:40      阅读:146      评论:0      收藏:0      [点我收藏+]

标签:属性   bsp   head   连接数据库   synonym   tmp   odi   add   byte   

4.10 同义词文件/Synonym

同义词文件格式
from=>to
AT &T => AT&T
AT & T => AT & T
standarten fuehrer => Standartenfuehrer
standarten fuhrer => Standartenfuehrer
Ms-Dos => MS-DOS
MS DOS => MS-DOS

5 算法

5.1 字典

double array trie 检索树

5.2 分词算法

5.3 文档id压缩 – Variable Byte Coding

5.4 索引存储 – 多路归并排序

7 创建索引过程

  • 扫描配置文件。
  • 创建程序内部数据结构,schema, mva attr等。
  • 第一次遍历文档记录,连接数据库读取创建索引的记录。
  • 循环分词创建spa, spp文件(临时格式)(如果inline模式只创建spp文件), 如果非inplace模式,那么创建对应 tmp->spa, tmp->spp对应文件。
  • 第二次遍历文档记录,创建mva属性(非field mva attributes)。
  • 多路归并创建spm文件。
  • 更新并创建最终的spa文件,更新mva的位置信息到spa文件。
  • 读取临时格式的spp文件,多路归并创建spi,spd,spp文件。
  • 创建索引头文件sph。
  • 更新索引创建后的信息(例如存储当前已经简历索引的)释放资源

sphinx索引分析续

标签:属性   bsp   head   连接数据库   synonym   tmp   odi   add   byte   

原文地址:http://www.cnblogs.com/bonelee/p/6251094.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!