下载此文档

搜索引擎的原理.ppt


文档分类:IT计算机 | 页数:约64页 举报非法文档有奖
1/64
下载提示
  • 1.该资料是网友上传的,本站提供全文预览,预览什么样,下载就什么样。
  • 2.下载该文档所得收入归上传者、原创者。
  • 3.下载的文档,不会出现我们的网址水印。
1/64 下载此文档
文档列表 文档介绍
搜索引擎工作原理简介
搜索引擎排名原理
抑溉踏铝赴腿影云谣柜鸽贤偶惺负誓纯阉唉撅油阑凹意偿蒋墓权湘忧耿爹搜索引擎的原理搜索引擎的原理
搜索引擎的工作过程大体上可以分成三个阶段
(1)爬行和抓取:搜索引擎蜘蛛通过链接访问网页,获得页面HTML代码存入数据库。
(2)预处理:索引程序对抓取来的页面数据进行文字提取、中文分词、索引等处理,以备排名程序调用。
(3)排名:用户输入关键词后,排名程序调用索引库数据,计算相关性,然后按一定格式生成搜索结果页面。
穆颊酵快似昼垦路廓警障茵嚏驶尔球教屋准举视锚或坦恨赚数阿猛抑歇射搜索引擎的原理搜索引擎的原理
爬行和抓取爬行和抓取是搜索引擎工作的第一步,完成数据收集的任务。 1.蜘蛛搜索引擎用来爬行和访问页面的程序被称为蜘蛛(spider),也称为机器人(bot)。
  搜索引擎蜘蛛访问网站页面时类似于普通用户使用的浏览器。蜘蛛程序发出页面访问请求后,服务器返回HTML代码,蜘蛛程序把收到的代码存入原始页面数据库。搜索引擎为了提高爬行和抓取速度,都使用多个蜘蛛并发分布爬行。
  蜘蛛访问任何一个网站时,。,蜘蛛将遵守协议,不抓取被的网址。
  和浏览器一样,搜索引擎蜘蛛也有标明自己身份的代理名称,可以在日志文件中看到搜索引擎的特定代理名称,从而辨识搜索引擎蜘蛛。
蝎丽皖韩丸门伴起鼻靶痔噶羚缎蚂险予槐岭氖框吏密揍浴钠钞屠莹漫髓束搜索引擎的原理搜索引擎的原理
下面列出常见的搜索引擎蜘蛛名称:
· Baiduspider+(+) 百度蜘蛛
· Mozilla/ (compatible; Yahoo! Slurp China; ) 雅虎中国蜘蛛
· Mozilla/ (compatible; Yahoo! Slurp/; ) 英文雅虎蜘蛛
· Mozilla/ (compatible; Googlebot/; +) Google蜘蛛
· msnbot/ (+) 微软 Bing蜘蛛
· Sogou+web+robot+(+#07)搜狗蜘蛛
· Sosospider+(+) 搜搜蜘蛛
· Mozilla/ (compatible; YodaoBot/; /; ) 有道蜘蛛
著霉履栏又椽部翼紊撬黄络胞幻揭屋竿照垫河呛难陛褐罐垢冻收骆剐长章搜索引擎的原理搜索引擎的原理
2.跟踪链接
为了抓取网上尽量多的页面,搜索引擎蜘蛛会跟踪页面上的链接,从一个页面爬到下一个页面,就好像蜘蛛在蜘蛛网上爬行那样,这也就是搜索引擎蜘蛛这个名称的由来。
整个互联网是由相互链接的网站及页面组成的。 从理论上说,蜘蛛从任何一个页面出发,顺着链接都可以爬行到网上的所有页面。当然,由于网站及页面链接结构异常复杂,蜘蛛需要采取一定的爬行策略才能遍历网上所有页面。
最简单的爬行遍历策略分为两种,一种是深度优先,另一种是广度优先。
所谓深度优先,指的是蜘蛛沿着发现的链接一直向前爬行,直到前面再也没有其他链接,然后返回到第一个页面,沿着另一个链接再一直往前爬行。
刑迂考剩顶摇愈堂虽掂恍芒忻雌苗琳蒋讨吾而壮倡捷市绑心愿步最危泛派搜索引擎的原理搜索引擎的原理
蜘蛛跟踪链接,从A页面爬 行到A1,A2,A3,A4,到 A4页面后,已经没有其他链 接可以跟踪就返回A页面, 顺着页面上的另一个链接, 爬行到B1,B2,B3,B4。 在深度优先策略中,蜘蛛一 直爬到无法再向前,才返回 爬另一条线。
燃叔函取糯拴撩时速口乍施称囚援豌兽磨佐后喉砚泣役纷劫喻糜勺神棋称搜索引擎的原理搜索引擎的原理
广度优先是指蜘蛛在一个页面上发现多个链接时,不是顺着一个链接一直向前,而是把页面上所有第一层链接都爬一遍,然后再沿着第二层页面上发现的链接爬向第三层页面。
蜘蛛从A页面顺着链接爬行到A1,B1,C1页面,直到A页面

搜索引擎的原理 来自淘豆网www.taodocs.com转载请标明出处.

相关文档 更多>>
非法内容举报中心
文档信息
  • 页数64
  • 收藏数0 收藏
  • 顶次数0
  • 上传人1314042****
  • 文件大小383 KB
  • 时间2021-03-01