下载此文档

2.2.1搜索引擎 (2).ppt


文档分类:IT计算机 | 页数:约66页 举报非法文档有奖
1/66
下载提示
  • 1.该资料是网友上传的,本站提供全文预览,预览什么样,下载就什么样。
  • 2.下载该文档所得收入归上传者、原创者。
  • 3.下载的文档,不会出现我们的网址水印。
1/66 下载此文档
文档列表 文档介绍
搜索引擎教学
王晓云
(2) (2)
The web creates new challenges for information retrieval. Sergey Brin and Lawrence Page 《The Anatomy of a Large-Scale Hypertextual Web Search Engine》 1998年4月在WWW年度大会上发表,引起全球学术界广泛关注。目前该文被引用309次。
(2) (2)
内容: 网络资源的特点 搜索引擎 医学搜索引擎 实例
(2) (2)
网络资源的特点(与传统数据库相比)
内容丰富,应有尽有。
更新变化太快,不确定性高。
有待于规范化、标准化。(能规范化吗?)
检索没有定式,没有标准答案。
(2) (2)
搜索引擎介绍
(2) (2)
起 源:
所有搜索引擎的祖先,是1990年由Montreal的McGill University三名学生(Alan Emtage、Peter Deutsch、Bill Wheelan)发明的Archie(Archie FAQ)。Alan Emtage等想到了开发一个可以用文件名查找文件的系统,于是便有了Archie。Archie是第一个自动索引互联网上匿名FTP网站文件的程序,但它还不是真正的搜索引擎。Archie是一个可搜索的FTP文件名列表,用户必须输入精确的文件名搜索,然后Archie会告诉用户哪一个FTP地址可以下载该文件。
(2) (2)
起 源:
由于Archie深受欢迎,受其启发,Nevada System Computing Services大学于1993年开发了一个Gopher(Gopher FAQ)搜索工具Veronica(Veronica FAQ)。Jughead是后来另一个Gopher搜索工具。
(2) (2)
发 展:
世界上第一个Spider程序,是MIT Matthew Gray的World wide Web Wanderer,用于追踪互联网发展规模。刚开始它只用来统计互联网上的服务器数量,后来则发展为也能够捕获网址(URL) 。
搜索引擎一般由以下三部分组成:
爬行器(机器人、蜘蛛)
索引生成器
查询检索器
(2) (2)
发 展:
改进:假设所有网页都可能有连向其他网站的链接,那么从一个网站开始,跟踪所有网页上的所有链接,就有可能检索整个互联网。
1993年底,一些基于此原理的搜索引擎开始纷纷涌现,其中最负盛名的三个是:The World Wide Web Worm、NASA的Repository-Based Software Engineering (RBSE) spider。
RBSE是第一个索引Html文件正文的搜索引擎,也是第一个在搜索结果排列中引入关键字串匹配程度概念的引擎。
杉逾滤钝宰义旬赎狡哥*** (2) (2)
发 展:
Excite 的历史可以上溯到1993年2月,6个Stanford University(斯坦福大学)大学生的想法是分析字词关系,以对互联网上的大量信息作更有效的检索。到1993年中,这已是一个完全投资项目Architext,他们还发布了一个供webmasters在自己网站上使用的搜索软件版本,后来被叫做Excite for Web Servers。(注:Excite后来曾以概念搜索闻名,2002年5月,被Infospace收购的Excite停止自己的搜索引擎,改用元搜索引擎Dogpi

2.2.1搜索引擎 (2) 来自淘豆网www.taodocs.com转载请标明出处.

相关文档 更多>>
非法内容举报中心
文档信息
  • 页数66
  • 收藏数0 收藏
  • 顶次数0
  • 上传人1652129****
  • 文件大小353 KB
  • 时间2021-05-19