分词原理

时间：2018-10-28 15:00:57 阅读：175 评论：0 收藏：0 [点我收藏+]

1. 分词的基本原理

　　现代分词都是基于统计的分词，而统计的样本内容来自于一些标准的语料库。假如有一个句子：“小明来到荔湾区”，我们期望语料库统计后分词的结果是："小明/来到/荔湾/区"，而不是“小明/来到/荔/湾区”。那么如何做到这一点呢？

　　从统计的角度，我们期望"小明/来到/荔湾/区"这个分词后句子出现的概率要比“小明/来到/荔/湾区”大。如果用数学的语言来说说，如果有一个句子 $S$

技术分享图片

　　其中下标n_i $n_{i}$

$n_{i}$

　　其中 $f r e q (w_{1}, w_{2})$

　　利用语料库建立的统计概率，对于一个新的句子，我们就可以通过计算各种分词方法对应的联合分布概率，找到最大概率对应的分词方法，即为最优分词。

　　当然，你会说，只依赖于前一个词太武断了，我们能不能依赖于前两个词呢？即：

技术分享图片

　　这样也是可以的，只不过这样联合分布的计算量就大大增加了。我们一般称只依赖于前一个词的模型为二元模型(Bi-Gram model)，而依赖于前两个词的模型为三元模型。以此类推，我们可以建立四元模型，五元模型,...一直到通用的 $N$

$N$

　　为了简化原理描述，我们本节的讨论都是以二元模型为基础。

　　　　对于一个有很多分词可能的长句子，我们当然可以用暴力方法去计算出所有的分词可能的概率，再找出最优分词方法。但是用维特比算法可以大大简化求出最优分词的时间。

　　　　大家一般知道维特比算法是用于隐式马尔科夫模型HMM解码算法的，但是它是一个通用的求序列最短路径的方法，不光可以用于HMM，也可以用于其他的序列最短路径算法，比如最优分词。

　　　　维特比算法采用的是动态规划来解决这个最优分词问题的，动态规划要求局部路径也是最优路径的一部分，很显然我们的问题是成立的。首先我们看一个简单的分词例子："人生如梦境"。它的可能分词可以用下面的概率图表示：

技术分享图片

　　图中的箭头为通过统计语料库而得到的对应的各分词位置BEMS（开始位置，结束位置，中间位置，单词）的条件概率。比如P(生|人)=0.17。有了这个图，维特比算法需要找到从Start到End之间的一条最短路径。对于在End之前的任意一个当前局部节点，我们需要得到到达该节点的最大概率 $δ$

$δ$

　　对于节点"生"，它只有一个前向节点，因此有：

技术分享图片

　　对于节点"如"，就稍微复杂一点了，因为它有多个前向节点，我们要计算出到“如”概率最大的路径：

技术分享图片

　　类似的方法可以用于其他节点如下：

技术分享图片

　　最后我们看看最终节点End:

技术分享图片

　　由于最后的最优解为“梦境”，现在我们开始用 $Ψ$

$Ψ$

　　从而最终的分词结果为"人生/如/梦境"。是不是很简单呢。

　　由于维特比算法我会在后面讲隐式马尔科夫模型HMM解码算法时详细解释，这里就不归纳了。

原文地址：https://www.cnblogs.com/callyblog/p/9865499.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

周排行