码迷,mamicode.com
首页 > 编程语言 > 详细

四十 Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)倒排索引

时间:2018-01-03 14:11:08      阅读:142      评论:0      收藏:0      [点我收藏+]

标签:arch   通过   body   权重   pos   str   .com   log   位置   

 

倒排索引

倒排索引源于实际应用中需要根据属性的值来查找记录。这种索引表中的每一项都包括一个属性值和具有该属性值的各记录的地址。由于不是由记录来确定属性值,而是由属性值来确定记录的位置,因而称为倒排索引(inverted index)。带有倒排索引的文件我们称为倒排索引文件,简称倒排文件(inverted file)。

 

 

倒排索引原理

就是将一句话进行分词并记录分词所存在的文章,当用户搜索词时可以直接查找到当前词所存在的文章

技术分享图片

 

 

 

倒排索引分词权重记录(词瓶)

技术分享图片

 分词权重记录,是通过(TF-IDF)来实现的,详情https://baike.so.com/doc/433640-459181.html

 

 

倒排索引待解决的问题

这些问题elasticsearch(搜索引擎)已经解决

技术分享图片

 

四十 Python分布式爬虫打造搜索引擎Scrapy精讲—elasticsearch(搜索引擎)倒排索引

标签:arch   通过   body   权重   pos   str   .com   log   位置   

原文地址:https://www.cnblogs.com/meng-wei-zhi/p/8182874.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!