下载此文档

网站优化中的“伪原创”到“原创”.doc

文档分类：IT计算机 | 页数：约2页举报非法文档有奖

1/2

下载提示

1.该资料是网友上传的，本站提供全文预览，预览什么样，下载就什么样。
2.下载该文档所得收入归上传者、原创者。
3.下载的文档，不会出现我们的网址水印。

同意并开始全文预览

(约 1-6 秒)

1/2 下载此文档

文档列表 文档介绍

网站优化中的“伪原创”到“原创”我现在要讲的是:网页查重算法,也就是搜索引擎是怎么检查两个网页的相似性的?这应该是大家应该比较关心的问题吧,因为这有助于让你的“伪原创”更像一个“原创”首先我跟大家讲有名的I—MATCH算法。我们在比较两件事物的相似性时,往往都会拿能均衡的反应这事物本质的东西来比较,就像比赛时,要去除一个最高分和最低分,然后再变算总分一样~~ I—MATCH算法基于的依据是,在文挡中,特别高频的词和特别低频的词无法反应这一个文挡的真实内容,所以在比较之前,先将文挡中高频词和低频词去掉(注意:这里的高频和低频指的是文档频率,并非关键词在你网页中的密度!) 我们来看一个例子: 这里有两段网页文字: ,新浪体育播报。 ,搜狐体育播报。(嘿嘿,看到这两句很熟吧?) 文档(一)中去掉高频:中国,在,的,获得,比赛,资格,新浪,体育,播报去掉低频:米卢则剩下中频词有:足球队,率领,首次,世界杯,决赛,阶段文档(二)中去掉高频:中国,搜狐,体育,播报去掉低频:米卢,杀入则剩下中频词有:率领,足球队,首次,世界杯,决赛,阶段看到了吧?剩下的,两者是一模一样这就是相似性的存在呵呵,其实这个例子很早就有过的。。综上所述:搜索引擎要检测相似性,主要就是要分词和词频的比较!!

网站优化中的“伪原创”到“原创” 来自淘豆网www.taodocs.com转载请标明出处.