# e: W7 U' c8 E: n. G因为,只需要对字组频率进行计算,不需要使用词典,所以叫做无词典分词方法,或者说统计分词方法。2 C5 x. ?, _% i9 I0 D
缺点:经常会抽出一些高频,但不是词的常用词组,如:“我们”“共同”“有的”等。; }& s& `3 l7 v f9 o$ H( ^ A0 k
" B2 m3 l. E7 c% ^% z所以在正常使用中,统计分词法,都会使用一部基本的分词词典(常用词词典),通过字符串分词系统,识别出常用词组,同时通过统计分词系统,识别出新词,生词,两者结合,即发挥出字符串匹配分词系统的速度快,效率高,又可以利用统计分词系统识别生词,自动消除歧义的优点。/ O+ q; c* ~4 N6 O E
: f$ A0 J* W" _: p9 t! B; t# O. G / h7 N" l. L# S' O $ J, q( S/ k* Y3 F4 b( ^2 ]& ~6 X. ?原文链接:http://seo论坛simple-chen站长技术论坛/ssyqyl/273.html,点击可查看更多SEO必备的搜索引擎原理知识哦! ; F' W+ Q6 L. f+ C4 D搜外作者:陈晨$ w! H6 @% [/ V" d/ b3 M. R
日期:2015-6-23 9:50:08