下载此文档

毕业设计(论文)-计算机网络毕业设计(终稿).docx


文档分类:论文 | 页数:约28页 举报非法文档有奖
1/28
下载提示
  • 1.该资料是网友上传的,本站提供全文预览,预览什么样,下载就什么样。
  • 2.下载该文档所得收入归上传者、原创者。
  • 3.下载的文档,不会出现我们的网址水印。
1/28 下载此文档
文档列表 文档介绍
毕业设计(论文)-计算机网络毕业设计(终稿).docx太原城市职业技术学院信息工程系
毕业设计任务书
类别:三年制大专 专业:计算机网络 班级:网络0811 姓名:莫履
毕业设计题目:网络搜索引擎的服务设计
指导教师姓名: 李卫星
2011年 5 月22日
网络搜索引擎的服务设计
摘要
网络中的资源非常丰富,但是如何有效的搜索信息却是一件困难的事情。建 立搜索引擎就是解决这个问题的最好方法。本文首先详细介绍了基于英特网的搜 索引擎的系统结构,然后从网络机器人、索引引擎、Web服务器三个方面进行详 细的说明。为了更加深刻的理解这种技术,本人还亲自实现了一个自己的搜索引 擎一新闻搜索引擎。
新闻搜索引擎是从指定的Web页面中按照超连接进行解析、搜索,并把搜 索到的每条新闻进行索引后加入数据库。然后通过Web服务器接受客户端请求 后从索引数据库中搜索出所匹配的新闻。
本人在介绍搜索引擎的章节中除了详细的阐述技术核心外还结合了新闻搜 索引擎的实现代码来说明,图文并茂、易于理解。
目录
第一章引言 5
第二章搜索引擎的结构 7
2搜索引擎的构成 7
2. 1网络机器人 7
2. 2索引与搜索 7
2. 3 Web 服务器 8
3搜索引擎的主要指标及分析 8
4小节 8
第三章网络机器人 9
1什么是网络机器人 9
2网络机器人的结构分析 9
2. 1如何解析HTML 9
2. 2 Spider 程序结构 10
2. 3如何构造Spider程序 11
2. 4如何提高程序性能 14
2. 5网络机器人的代码分析 15
3小节 17
第四章 基于LUCENE的索引与搜索 18
1什么是LUCENE全文检索 18
2 LUCENE的原理分析 18
2. 1全文检索的实现机制 18
2. 2 Lucene的索引效率 18
可以通过一下表格对比一下数据库的模糊查询: 19
19
3 Lucene 与 Spider 的结合 21
首先构造一个Index类用来实现对内容进行索引。 21
然后构造一个HTML解析类,把通过B0T程序收集的新闻内容进行索引。 21
4小节 24
第五章 基于TOMCAT的WEB服务器 25
25
2用户接口设计 25
3. 1客户端设计 25
3. 2服务端设计 26
3在Tomcat上部署项目 28
4小节 29
第六章搜索引擎策略 30
1简介 30
2面向主题的搜索策略 30
3小节 32
参考文献 33
第一章引言
面对浩瀚的网络资源,搜索引擎为所有网上冲浪的用户提供了一个入口,毫 不夸张的说,所有的用户都可以从搜索出发到达自己想去的网上任何一个地方。 因此它也成为除了电子邮件以外最多人使用的网上服务。
搜索引擎技术伴随着WWW的发展是引人注目的。搜索引擎大约经历了三 代的更新发展:
第一代搜索引擎出现于1994年。这类搜索引擎一般都索引少于1, 000, 000 个网页,极少重新搜集网页并去刷新索引。而且其检索速度非常慢,一般都要等 待10秒甚至更长的时间。在实现技术上也基本沿用较为成熟的IR (Information Retrieval网络、数据库等技术,相当于利用一些已有技术实现的一个WWW 上的应用。在1994年3月到4月,网络爬虫World Web Worm (WWWW)平均每 天承受大约1500次查询。
大约在1996年出现的第二代搜索引擎系统大多采用分布式方案(多个微型 计算机协同工作)来提高数据规模、响应速度和用户数量,它们一般都保持一个 大约50, 000, 000网页的索引数据库,每天能够响应10, 000, 000次用户检索 请求。:1997年11月,当时最先进的几个搜索引擎号称能建立从2, 000, 000到 100, 000, 000的网页索引。Altavista搜索引擎声称他们每天大概要承受20, 000, 000次查询。
2000年搜索引擎2000年大会上,按照Google公司总裁Larry Page的演讲, Google正在用3,000台运行Linux系统的个人电脑在搜集Web上的网页,而且 以每天30台的速度向这个微机集群里添加电脑,以保持与网络的发展相同步。 每台微机运行多个爬虫程序搜集网页的峰值速度是每秒100个网页,平均速度是 ,一天可以搜集超过4, 000, 000网页
搜索引擎一词在国内外因特网领域被广泛使用,然而他的含义却不尽相同。 在美国搜索引擎通常指的是基于因特网的搜索引擎,他们通过网络机器人程序收 集上千万到几亿个网页,并且每一个词都被搜索引擎索引,也就是我们说的全文 检索。著名的因特网搜索引擎

毕业设计(论文)-计算机网络毕业设计(终稿) 来自淘豆网www.taodocs.com转载请标明出处.

非法内容举报中心
文档信息
  • 页数28
  • 收藏数0 收藏
  • 顶次数0
  • 上传人小雄
  • 文件大小134 KB
  • 时间2021-11-01