分词算法是文本挖掘的基础,通常对整个模型的效果起着较大的决定作用。

分词算法常用的两种运行方式:
1、用户搜索及匹配。
例如:我们在百度搜索一个词 “手机回收”,那么百度会先把这个词分为手机和回收两个词这个时候呢百度会先在库中搜索手机这个词然后进行第一轮的筛选。把网页当中没有手机这个词的去除,只保留带有手机这个词的结果,之后再从已筛选出来的网页中,筛选出带有回收这个词的页面。然后在所得结果里面根据页面评分给用户进行排序。
2、网页主题计算。
前面启蒙博客也讲过,百度蜘蛛只是一个机器,并不能向人一样去思考,而在处理文章的时候,百度蜘蛛则会把文章也进行分词去处理,如过文章里 手机 这个词出现频率比较多,也就是所说的关键词密度,那么这个页面也就会定性为手机方面的文章。
