码迷,mamicode.com
首页 > 其他好文 > 详细

kenlm的使用

时间:2018-08-22 18:20:34      阅读:2094      评论:0      收藏:0      [点我收藏+]

标签:com   path   temp   bubuko   src   -o   分词   install   test   

1.训练模型

install_path/bin/lmplz -o 3 -S 80% -T /temp <text >text.arpa 
  •     -o  表示n_gram 中的n(必选)
  •     -S  内存使用(可选)
  •     -T  临时文件(可选)
  •     -text  待训练语料,必须分词
  •     -text.arpa  输出为arpa格式的n_gram结果,如下图所示:

         技术分享图片

2.查询模型

    为了更快的加载将 text.arpa 转换为 binary 文件

install_path/bin/build_binary text.arpa text.binary 

    测试

install_path/bin/query text.binary <test.txt >result.txt

    结果如下图所示,输出每个句子的混淆度和未登录词,以及整个测试语料的混淆度和未登录词。

     技术分享图片

 

kenlm的使用

标签:com   path   temp   bubuko   src   -o   分词   install   test   

原文地址:https://www.cnblogs.com/Climbing-Snail/p/9519079.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!