营销分享
详解搜索引擎最常用的中文分词方法
2014-07-11 12:29  浏览:683162  搜索引擎搜索“手机晒展网”
温馨提示:信息一旦丢失不一定找得到,请务必收藏信息以备急用!本站所有信息均是注册会员发布如遇到侵权请联系文章中的联系方式或客服删除!
联系我时,请说明是在手机晒展网看到的信息,谢谢。
展会发布 展会网站大全 报名观展合作 软文发布

  中文分词技术是搜索引擎对于用户提交查询的关键词,搜索引擎用中文分词把词按照肯定的规格,将一个长尾词分割成几个部分,从而概括一段话的主要内容,让用户能更快速度的找到想要的内容。

  搜索引擎最常用的几种分词方法有三种:

  一、字符串匹配的方法

  字符串匹配的分词一般为3种:

  1.正向最大匹配法;

  2.逆向最大匹配法;

  3.最少切分

  字符串匹配方法:在百度中搜索“我喜欢玩宠物连连看”而在百度排名第一位的是以标题和搜索的长尾词相符合,说明在网站条件相当的情况下,先显示标题匹配的网页。这样文章标题中的长尾是在排名中特别重要的。而在百度第二页“我喜欢玩宠物连连看”用百度快照查看,很显然长尾词已经被分成“我喜欢,玩,宠物连连看”而在外后已经被分成:“我,喜欢玩,宠物,连连看”,这种匹配方法是最少切分方式。

  二、理解分词方法:

  当输入的字符串中包含≤3个中文字符的话百度分词就会直接接到数据库索引词汇;而当字符串长度>4个中文字符的时分,百度中分词会会把这个词分成若干个字符。如:百度搜索“电动车”。

  三、统计分词方法。

  相邻的字同时出现的次数越多,中文分词就会可能把出现相邻的字当成你一个词。例如在百度中输入一个字符“网”而在下面百度也把“网站”标红了,这样可以看得出“网”与“站”这两个字符相邻出现的次数特别多,统计分词已经把“网站”纳入了词库。

  对于百度中文分词的理解:

  中文分词中强调一点:“按照不同长度优先匹配的情况,可以分为最大(最长)匹配和最小(最短)匹配”;长尾词在文章中的间距也是决定文章排名的因素。如:“我喜欢玩宠物连连看”在百度第十三页的时分已经被分词成“我,喜欢,玩,宠物,连连,看”

  全字匹配得到的词的权重会高于分开的词的权重。

  根据自己的观察现在百度大部分都是运用的是正向匹配。

  百度分词对于一句话分词之后,还会去掉句子中的没有意义的词语。

    IP:113.118.50.***     举报/删稿
展会推荐
让朕来说2句
评论
收藏
点赞
转发