码迷,mamicode.com
首页 > 其他好文 > 详细

ES中的分词器研究

时间:2020-12-16 12:35:37      阅读:2      评论:0      收藏:0      [点我收藏+]

标签:进一步   过滤   dex   rac   分词   ted   分析器   分析   index   

全文搜索引擎会用某种算法对要建索引的文档进行分析, 从文档中提取出若干Token(词元), 这些算法称为Tokenizer(分词器), 这些Token会被进一步处理, <br>  比如转成小写等, 这些处理算法被称为Token Filter(词元处理器), 被处理后的结果被称为Term(词), 文档中包含了几个这样的Term被称为Frequency(词频)。 <br>  引擎会建立Term和原文档的Inverted Index(倒排索引), 这样就能根据Term很快到找到源文档了。 文本被Tokenizer处理前可能要做一些预处理,<br>   比如去掉里面的HTML标记, 这些处理的算法被称为Character Filter(字符过滤器), 这整个的分析算法被称为Analyzer(分析器)。

ES中的分词器研究

标签:进一步   过滤   dex   rac   分词   ted   分析器   分析   index   

原文地址:https://www.cnblogs.com/maowuyu-xb/p/14118967.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!