已阅读5页,还剩35页未读, 继续免费阅读
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
浙江大学计算机系硕士论文 摘要 随着网络技术的飞速发展,因特网已经成为一种重要的信息获取媒介。但是 面对漫无边际的网络,如何迅速地获取我们所要的信息,这是随着网上信息的急 剧增长而提出的一个重要问题。 人们所要查找的信息可能存在于某个网站网页里面,也可能存在于有些网站 对外开放的网站数据库里。对于网页,我们有很多搜索引擎建立网页数据库供网 络用户查找使用。但是不同的搜索引擎具有不同的数据库、查询界面和查询法则。 为了获得自己需要的信息,用户往往需要查询多个搜索引擎,从而必须熟悉每个 搜索引擎的查询界面和查询法则。这样将给迅速获取所要的信息带来困难,元搜 索引擎的出现,很好地解决了这个问题。元搜索引擎提供用户统一的查询界面, 用户输入查询条件后调用多个搜索引擎同时进行查询,同时将各个搜索引擎的返 回结果合并返回给用户。 对于网站数据库,为了加快查询速度,和加大查询结果的覆盖面,我们有类 似元搜索引擎的策略,其实搜索引擎可以看成是一个特殊的网站数据库,它的数 据库里存放的主要是网页信息。更一般的,我们提出广域网数据库查询系统,广 域网数据库查询系统是架构于各个专业数据库系统之上的查询系统,各个专业数 据库系统存放的不再局限于网页数据库。广域网数据库查询系统提供用户关于某 一类数据库信息的统一的查询界面,它调用各个独立网站数据库系统对用户输入 的查询条件进行实时并发查询,同时合并查询结果返回给用户。 本文已经成功建立广域网数据库查询系统应用于中国农业科学院品种资源 研究所农作物信息的查询,本项目是国家科技基础性工作重点项目国家野外 试验站监测规范与数据标准化( 2 0 0 i d e a 2 0 0 1 6 ) 的子项目。 关键字:元搜索系统;广域网查询;多数据库系统 一一一 堑坚查堂笪墨垫墨堡主堕苎 a b s t r a c t w i t ht h eq u i c kd e v e l o p m e n to fn e t w o r k t e c h n o l o g y , n t e r n e th a sb e c o m e a ni m p o r t a n ta l e d a t og e tt h ei n f o r m a t i o nt h a tp e o p l en e e d e d b u th o w c a nw e g e to u rw a n t e di n f o r m a t i o na sq u i c k a s p o s s i b l eh a sb e c o m ea ni m p o r t a n ti s s u ew h e n t h ei n f o r m a t i o ni nt h ei n t e r n e ti n c r e a s i n gi ns u c ha s u r p r i s i n gs p e e d t h ei n f o r m a t i o nt h a tp e o p l ew a m e d m a y c a nb ef o u n di naw e b p a g ew i t h i naw e b s i t e ,o i t m a y c a l lb ef o u n di na no p e nw e b s i t ed a t a b a s e a sf o rw e b p a g e 。t h e r e a r em a n ys e a r c h e n g i n e sf o r u s e b u td i f f e r e n ts e a r c he n g i n eh a sd i f f e r e n td a t a b a s e ,d i f f e r e n ts e a r c hi m e f f a c ea n dd i f f e r e n t r u l e sf o rs e a r c h i n g i no r d e rt og e tw h a tw e w a n t ,p e o p l ea l w a y sn e e d t ou s em o r et h a no n es e a r c h e n g i n e ,s ot h e yn e e d t ok n o wd i f f e r e n ts e a r c hr u l e sa n db ef a m i l i a rw i t hd i f f e r e n ts e a r c hi n t e r f a c e t h i sm a d el l s i m p o s s i b l et of i n di n f o r m a t i o nq u i c k l y , b u tt h ee m e r g e n c yo fm e t a - s e a r c he n g i n e m a d ei tp o s s i b l e m e t a - e e a r c he n g i n ep r o v i d eu n i q u es e a r c hi n t e r f a c e ,i ta c c e p tq u e r yt e r m sf r o m u s e r s s e n ti tt os e v e r a ls e a r c he n g i n e sf o fq u e r ya n dt h e nc o l l e c tt h es e a r c l ir e s u l t so f e v e r ys e a r c h e n g i n e t oi l s e r s a sf o rw e b s i t ed a t a b a s e i no r d e rt oa c c e l e r a t et h es p e e do f q u e r y , a n de n l a r g et h es e a r c h r e s u l tc o v e r a g e ,w eh a v es i m i l a rs t r a t e g yl i k em e t a s e a r c he n g i d e :, a sam a t t e ro f f a c t ,m e t a - s e a r c h e l i g i n ec a nb er e c o g n i z e d a sas p e c i a l i z ew e b s i t ed a t a b a s es y s t e m , t h em a i n t y p eo ft h ed a t a b a s ei s w e b p a g e s m o r eg e n e r a l l y , i n t h i sp a p e r ,w e p r o v i d e dag l o b a ld a t a b a s eq u e r ys y s t e mw h i c hb a s e d o ns e v e r a ld a t a b a s eq u e r ys y s t e m sa n di tw a sc u r l e dw a n ( w i d aa r e an e t w o r k ) d a t a b a s eq u e r y s y s t e m , t h ed a t a b a s e sa r en om o r ec o n f i n e dt ow e bp a g e s i tp r o v i d e su s e r sau n i q u ei n t e r f a c e , a c c e p tt h eq u e r yt e r m s ,r u n a n dr e t u r nt h er e s u l t sl i k em e t a - s e a r c h e n g i n ed o i nt h i sp a p e rw eh a v ed e v e l o p e daw a ns e a r c hd a t a b a s eq u e r ys y s t e mf o rp r a c t i c eu s e ta n d t h i sp r o j e c li ss u p p o r t e d b y n a t i o n a lf u n d s k e y w o r d s :m e t a s e a r c he n g i n e ;w a nq u e r y ;, m u l t i - d a t a b a s es y s t e m ; 浙江大学计算机系硕士论文 1 序论 本项目是国家科技基础性工作重点项目国家野外试验站监测规范与数据标准化 ( 2 0 0 1 d f a 2 0 0 1 6 ) 的子项目。目标是建立广域网数据库查询系统方便网上用户查询使用, 目前已成功建立广域网数据库查询系统应用于中国农业科学院品种资源研究所作物信息网。 广域网数据库查询系统是当前流行的元搜索引擎的一般化,元搜索引擎是针对于网页数 据库的元搜索系统,而广域网数据库查询系统则是面向于一般数据库的元搜索引擎。 当前,国内外对元搜索引擎的研究已经有了相当长的时间了,在国外著名的元搜索引擎 有: d a t a w a l e ( h t l p :q u e r y s e r v e r d a t a w a r e c o m g e n e r a l h t m l ) i x q u i c k ( h t t p :w w w i x q u i c l 【c o m ) m e t o r ( h t t p :w w w m e t o r c o m ) c 4 ( h t t p :w w w c 4 c o m ) l m f o z o i d ( h ! t p :w w w i n f o z o i d e o m ) s e a r c h c o m ( h t t p :w w w s e a r c h c o m ) d o g p i l e ( h t t p :w w w d o g p i l e c o m ) m e t a c r a w l e r ( h t t p :a v w w 9 0 2 n e t c o m s e a r c h h t m l ) p r o f u s i o n ( 1 m p :w w w , p r o f u s i o n c o m ) 等。 在国内这几年也相继出现了几个中文元搜索引擎,具有代表性的有万维搜索 ( w w w w i d e w a y s e a r c h c o r n ) 萼- 目前国内外对于广域网数据库查询系统虽然有了一定的研究,但是能够做到像元搜索引 擎一样真正投入网上使用的并不多。广域网数据库查询系统其实也可以称为多数据库系统, 人们对于获取和整合多数据源数据库信息的研究已经有将近2 0 年了,期中人们做了很多尝 试,也取得了一定的成果。 本文是对多数据库系统在网上的应用所做的一些研究和谈讨,本文从信息获取技术开 始,逐步引入本文的中心广域网数据库查询系统。 2 信息获取技术 2 1 信息获取技术的相关概念 2 1 1 概述 随着计算杌技术和互联网技术的飞速发展,信息获取已经从手工获取,到计算机信息获 取,以及到现在的通过网络进行信息获取。网络的最大优点就是将大量的信息相互共享,而 且只要通过一台接入互联网的计算机就可以方便的获取信息。利用互联网络,用户一方面可 以快速、方便地接触到各种信息,但是另一方面通过普通浏览的方式很难在信息的海洋中找 到真正需要的信息。网络时代的信息量每8 个月就翻一倍,如今的网页以1 0 亿来计算,要 在浩如烟海的网络世界寻找需要的信息,作为现代信息获取技术的主要应用搜索引擎是 浙江大学计算机系硕士论文 必不可少的。搜索引擎正在不断的改变人们获取信息的方式。利用搜索引擎可以快速找到需 要的信息。信息获取技术现在广泛应用于搜索引擎、数字图书管等。 搜索引擎是仅次于门户的互联网第二大核心技术,伴随互联网的普及和网上信息的爆炸 式增长,它越来越引起人们的重视。 搜索引擎技术的市场不仅限于门户网站,专业网站同样需要快速有效的搜索,此外,各 个企业、机构自己的网站也是一个极其广阔的市场领域。 目前,国内不少企业花了很多钱构建了一个内容丰富的网站,但没有建立起一条有效的 信息提供途径,绝大多数网站都仅仅是通过浏览方式提供内容,即使是经过精心编排、组织 非常合理的网站,也会有7 0 到8 0 的网页不能被有效查阅。网民对信息的需求越来越大, 同时却越来越没有耐心。这是所有网站都必须认真对待的问题。一方面访问者找不到想看的 内容。男一方面网站精心准备的大量信息资源都没有被用户看到,形成了巨大的浪费。如果 不能很好的解决搜索问题,企业在收集信息、充实内容方面花费的人力物力越大,其浪费就 越大。这不仅对企业的发展极为不利,还在宏观上成为制约我国信息化建设健康良性发展的 一大障碍。 信息作为互联网的灵魂,它的顺畅流动是激活互联网应用并推动其发展的关键。信息检 索不但是实现这一流动最重要的方式,也是互联网最基础和核心的技术与应用。互联网产业 多元化与立体的发展,当然也包含信息获取技术在多层次的互联网企业的应用,可以预见, 曾经为大型门户网站所独享的顶级信息搜索技术,将迅速普及到专业与垂直类网站,同时向 广大的企业网站发展。 搜索引擎不是一个单纯的技术问题。在互联网时代,哪一个公司掌握了包括搜索引擎、 信息传递在内的基础软件,它就能在竞争中傲视群雄;哪一个国家掌握和普及了这些技术, 她就能在运用互联网的商业竞争中占尽先机。 2 1 2 信息获取与数据获取 信息系统中的数据获取主要就是查找那些包含用户查询中的关键词的文档。由于用户查 询常常不能够准确地表达用户的信息需求,因此获取的数据不一定能满足用户的需求。实际 上,用户更多地希望获取与某个主题相关的信息,丽非那些仅仅满足查诲的数据。数据获取 语言着重于获取那些满足明确定义的查询条件的所有对象。这些查询往往是正规表达式或者 关系代数表达式。因此,在数据获取中,如果某个对象与查询要求略有不符,将导致该对象 不被获取。在信息获取过程中,我们无法保证所获取的对象是准确无误的。这主要是由于信 息获取系统主要面对自然语言文本,而这些文本结构不一定很好,而且在语义上存在着某些 歧义性。因此应该允许而且无法不允许所获取的对象不准确和存在一些小错误,数据获取系 统主要用来处理结构化的、语义明确的数据。 通过咀上分析我们知道数据获取不能满足获取有关某一主题信息的需求。为了有效地 满足用户对信息的需求,信息获取系统必须能够“解释”信息的内容,而且能够将所获取的 信息按照与用户查询的相关性进行捧序。对文档内容的解释需要抽取文档的句法信息耜语义 信息。这样对信息获取系统来说,需要知道如何抽取信息和如何按照这些信息来计算相关性。 实际上信息获取系统的目的就是尽可能多地获取那些与用户查询相关的文档,同时尽可能少 地获取那地与查询不相关的文档。 2 浙江大学计算机系硕士论文 2 1 3 信息获取技术的发展 现在的信息获取系统已经大大超越了过去单纯地对文档进行索引和对索引进行搜索的 模式。现在的信息获取包括建模、文档分类、系统结构、用户界面、数据可视化、信息过滤 等等工作。最初,只有那些图书管理员和信息获取专家们对信息获取有兴趣;但是到了2 0 世纪9 0 年代,当基于w e b 的超文本应用兴起的时候,越来越多的人开始对信息获取技术 感兴趣,这主要是由于优秀的信息获取技术成为人们的迫切需求。 w e b 技术以其标准的用户界面、简单的数据格式、兼容的系统环境而得到迅速发展。 w e b 已经成为一种新的信息发布媒介。用户可以容易地发布自己的信息,而且这些信息又 很容易相互共享。这就使得基于w e b 的信息越来越多,而且随着时间的推移,基于w e b 的 信息将越来越多、越来越丰富。w e b 技术虽然可以使我们比较容易地获取某些信息,但是, 在浩瀚的信息海洋中,许多时候要获取自己真正需要的信息又成了非常困难的事情。用户在 查找信息的时候,可以采用在w e b 链接空间中漫游的方式。但是,由于链接空间非常巨大 而且它的大小往往是不可预知的,这种通过漫游方式查找信息的方法的效率之低是可想而知 了。对于那些初次使用网络的用户而言,这种问题将变得更尖锐。导致这种问题的主要障碍 是w e b 没有很好地定义下层的数据模型,这就使得信息的定义和结构的质量较差。 2 1 4 信息获取基本概念 信息获取技术包含信息的表示、存储、组织和对信息的访问方法,信息的表示和组织是 为了让用户更容易地访问信息。但是如何表达用户的信息需求是个比较复杂的问题,用户必 须将自己的需求用搜索引擎( 信息获取系统) 查询语言表示出来。一般说来,查询包含那些 可以表示用户需求的关键词。有了用户的查询后,信息获取系统的目标就是怎样获取对用户 有用或者相关的文档。 用户获取信息的方式与文档的逻辑表示这两者对于有效获取相关信息非常重要。用户在 使用信息获取系统的时候需要将他的信息需求以系统提供的查询语言的表示方式表示出来。 这对于信息获取系统来说,就是指定一个符合系统规则的关键词的集合。但是用户获取信息 的时候,他的兴趣有可能很难表达或者这种兴趣包含的内容太广泛,这样所获取的信息在很 多情况下就不能满足足用户的需求、用户在这种情况下宁愿先浏览一部分网页,然后在与网 页的交互过程中不断修正或更改原先模糊的兴趣概念。在他明确自己的兴趣所在时再进行 搜索,这样将会大大提高信息获取的精度。所以用户使用信息获取的方式将分为信息获取和 信息浏览。一般的信息获取系统( 基于文本的系统) 通常只提供信息的获取,而对于基于超 文本的系统来说,它可以方便地提供快速浏览。现在的信息获取系统一般将信息获取与浏览 结合起来,例如在使用y a h o o 时,用户可以直接进行信息搜索,也可以先利用它事先设置 的分类目录定位到某一个具体的信息类别然后再进行搜索,这样将保证搜索到的信息是与 该信息类别密切相关的信息。 在信息库中的文本一般是通过索引词条来表示。这些索引词条要么直接从文本中取得, 要么由人工方式事先指定。现在的信息获取系统有的采用垒文索引,有的只是提取文档信息 中的某些重要部分的信息建立索引。当信息集台非常大的时候,必须采取某种方式来压缩这 些代表关键词的集合。可以通过删除文本中的无用汇( 例如介词、连词等) 、词干提取和名 词的识别来进一步压缩这些文档。以上的这些操作统称为文本操作,文本操作可以缩小文档 表示的复杂度,而且便于将文档的逻辑视图从全文转化到索引词条的集合。 3 浙江大学计算机系硕士论文 2 1 5 信息获取系统的过去、现在和将来 据有关资料分析,大约在4 0 0 0 年前,人类为了获取与使用信息。就开始有目的地组织 信息。一个典型的例子是图书中的目录。图书中设置目录的目的是为了使得读者可以方便地 查找到正文中对应的页面。后来随着查找信息需求的发展,出现了一种从一些词和概念指向 相关信息或者文档的指针,即索引。索引现在已经成为所有信息获取系统的核心,利用它可 以快速地存取数据和加速查询过程。 在计算机问世以前,人们主要通过手工方式来建立索引并进行相关分类。使用这种方 式建立的索引与分类系统在大多数图书馆中还沿用至今、随着计算机技术的发展,出现了利 用计算机来自动建立大规模索引的方法。自动建立的索引在更大程度上依赖于系统本身的信 息,而不从用户的角度出发。这样索引可以分为以计算机为中心的索引和以人为中心自q 索引。 2 1 6 信息获取的过程 在获取信息之前,首先需要构造文本数据库。在构造文本数据库的时候,首先确定将要 使用的文档,然后确定对这些文本所做的操作,最后确定文本的模型,即文本所采用的数据 结构。文本操作将生成这些文档的逻辑视图。 在有了文档的逻辑表示以后,需要建立文档的索引。利用文档索引可以大大提高信息检 索的速度。目前有多种建立文档索引的方法,但是对于大规模的文档信息库来说,用得最多 的是倒排索引。 在信息库的文档建立索引咀后,就可以对其进行检索。用户首先给出一个查询,该查询 将披分析,然后利用文本操作进行处理( 与对文本的处理类似) 。查询操作在真正进行处理 之前还可以预先进行一些处理,如个性化调整、反馈操作等。最后根据用户的查询将获取一 些文档。 在获取对应的文档后,需要将它们按照一定的次序排序后再返回给用户。用户可以检查 那些搜索结果、然后对这些结果进行评价,这些评价信息将被用作反馈来影响用户的下一次 查询。 在用户一开始使用信息获取系统的时候,由于没有文本和查询操作的相关知识,因此他 不能很贴切地用查询语言来明确地表达他的信息需求。这就是用户在初始使用搜索引擎时不 能得到所期望结果的原因。 2 2 w e b 数据库相关技术 随着网络技术的迅速发展,因特网已经成为一种重要的储存信息的媒介和获取信息的重 要手段。在这网络技术飞速发展的时代,我们已不能离开网络来讨论信息获取技术。 2 2 1 w e b 概述 w e b 的历史: w e b 的产生是与互联网的发展密切相关的。1 9 6 5 年t e dn e l s o n 首创了“超文本”术语, 1 9 6 7 年把实现分布式的计划命名为x a n a d u 。但该项目于1 9 8 7 年才算完成,只设计出个 4 浙江大学计算机系硕士论文 运行于s u n 工作站上的粗糙的工具”。1 9 8 8 年,a u t o d e s k 公司买下了x a n a d u ,n e l s o n 继续 研究该项目。 直到1 9 8 8 年,才设计出1 9 8 1 年的目标。欧洲粒子物理实验室即c e r n 的t i m b e r r s _ k e 受到n e l s o n 的影响提出一项计划,目的是使科学家们很容易查阅同行的文章,进一步演化 成科学家能在服务器上创建文档。该项目从1 9 9 0 年1 0 月开始到1 9 9 0 年1 2 月完成,结果出 版了命令行方式浏览器和n e x t s t e p 浏览器。该浏览器可用于浏览服务器超文本文件及 c e r n 的u s e n e t 。 1 9 9 2 年7 月,w w w 在c e r n 内部得到了广泛的使用。到了1 9 9 3 年1 月全世界共有 3 0 台w e b 服务器,并有各种浏览器版本发行,包括用于m a c i n t o s h 和x w i n d o w s 的客户程 序。1 9 9 3 年伊利诺斯大学u r b a n a c h a m p a i g n 分校的国家超级计算应用中心n c s a ( n a t i o n a l c e n t e rf o rs u p e r c o m p u l i n ga p p l i c a t i o m ) 发行了一个新的浏览器软件。从此,w w w 初具规 模。 c e r n 的 l t m 和他的小组解决了文档的共享和链接问题,但是主要基于n e x t 服务器及 工作站。由l o eh a r d i n 领导的n c s a 系统开发小组开始一项旨在开发一个不仅能处理t i m 描述的超文本,而且还能支持其它的多种协议的w w w 浏览器。于是在1 9 9 3 年2 月发行了 x 。w i n d o w s 版m o s a i c l 0 。随后,m o s a i c 浏览器版本逐渐增加采用了m i m e 协议在浏览器 中能直接浏览图形甚至声音。这时w e b 基本成熟,使w w w 在i n t e r a c t 中空前火爆,也如 此产生了浏览器问的竞争。 n c s a 把服务器技术转让给了一家名为s p y g l a s s 的商业转售商,并把客户程序交给经销 商出售,随后的一段时间内出现了几十种浏览器。1 9 9 4 年3 月m a r c a n d r e e s s e n 等第一批人 员离开n c s a 与硅谷的s i l i c o ng r a p h i c s 公司的j i mc 1 a r k 成立了m o s a i c 通讯公司( 1 9 9 4 年 1 0 月更名为n e t s c a p e 通讯公司) ,并雇佣了许多m o s a i c 、w w w 、l y n x 等的设计者,很快 发布了第一代浏览器产品,实现了许多h t m l 正在讨论的特性。 w e b 及其工作模式: w e b 即万维网,就是通过使用通讯设各和线路,将处在不同地理位置、操作上相对独 立的多个计算机连接起来,再配置一定的系统软件和应用软件,在这些计算机上实现软硬件 的资源共享和信息传递,由此而构成的计算机网络。 互联网是由全球众多的计算机局域网互相连接组成的个超大规模的网络系统,在这个 系统中运行着多种应用系统,如上网使用的网页浏览系统i w w w 、上传与下载用的文件 传输系统f r p 、收发电子邮件所使用的电子邮件系统_ e m a i l 等。互联网中运行的每 种应用系统都是由互联网中相应的服务器系统、客户机系统构成,也就是说互联网从物理 连接来看是由众多的计算机组成,而从逻辑上看是由多个功能子网组成。 前面所提到的几个应用系统即是一些常见的子网,其中的w w w 由联入互联网的w e b 服务器和浏览页面的客户机构成,这种工作模式通常称为b ,s 模式( b r o w s e r s e r v e r 模式) 。 还有一种模式为c ,s 模式( c l i e n t s e r v e r 模式) ,它是通过在服务器和客户机上分别安装相应 的程序,从而达到使客户机能够与服务器进行通讯的目的。 客户机月务器的概念来源于曰常生活中常见的种工作方式。例如,在一个大餐馆中, 顾客向服务员点菜,服务员把顾客的要求通知给厨房的厨师,厨师按顾客的要求做好菜让服 务员端给顾客,这就是一种餐馆的c s 工作方式。餐馆中的服务员和厨师进行了分工:服务 员直接面向顾客,了解顾客的要求并向顾客提供最终服务;厨师看不到食客,但具体运作食 客提交的任务。 如果把餐馆看成一个系统,则服务员与厨师的分工就是一种系统的分工,c s 工作方式 就是一种系统分工、协同的工作方式。招待员与厨师的分工关系是一种系统的结构关系,所 以c s 实际上也是一种系统结构模式。 5 浙江大学计算机系硕士论文 在浏览网页时,服务器上的w w w 服务允许你用鼠标点击“超级链接”( 简言之,就是 使鼠标光标变成手形的文本词句或图形) ,你每点击一项内容,w w w 程序就执行所要求的 任务,一直到你的需要得到满足。 在这一过程中,要涉及两个不同的程序:一个程序安装在客户机上,它执行你的鼠标点 击,发出h t t p 请求,接到响应后,立即显示链接的网页内容,确保你的要求得到执行,这 个程序叫做w w w 客户机程序,比如上网所使用的浏览器( i e 或n e t s c a p e ) :另一个程序在 服务器上,如s 或“阿帕奇”( a p a c h e ) w e b 服务器软件,它对w w w 客户机所要求的一 切进行满足,也就是接到h t t p 请求后,发出响应。 2 2 2w e b 数据库 w e b 数据库的概念: 数据库是指按照一定的结构和规则组织起来的相关数据的集合,是存放数据的“仓库”, 据此将网络数据库定义为以后台数据库为基础的,加上一定的前台程序,通过浏览器完成数 据存储、查询等操作的系统。 数据库技术是计算机处理与存储数据的最有效、最成功的技术,而计算机网络的特点是 资源共享,因此数据与资源共享这两种技术的结合即成为今天广泛应用的w e b 数据库( 也 叫网络数据库) 。 一个w e b 数据库就是用户利用浏览器作为输入接口,输入所需要的数据,浏览器将这 些数据传送给网站,而网站再对这些数据进行处理,例如,将数据存入后台数据库,或者对 后台数据库进行查询操作等,最后网站将操作结果传回给浏览器,通过浏览器将结果告知用 户。网站上的后台数据库就是w e b 数据库。 通常,w e b 数据库的环境由硬件元素和软件元素组成。硬件元素包括w e b 服务器、客 户机、数据库服务器、网络。软件元素包括客户端必须有能够解释执行h t m l 代码的浏览 器( 如i e ,n e t s c a p e 等) ;在w e b 服务器中,必须具有能执行可以自动生成h t m l 代码的程 序的功能,如a s p ,c g i 等;具有能自动完成数据操作指令的数据库系统,如a c c e s s ,s q l s e r v e r 等。 w 唧网络环境下w e b 数据库: 由于w e b 的易用性、实用性它很快占据了主导地位,已经成为使用晟为广泛、最有 前途、最有魅力的信息传播技术。不过,w e b 服务只是提供了i n t e m e t 上信息交互的平台。 随着i n t e r n e t 技术的兴起与发展和w e b 技术的蓬勃发展,人们已不满足于只在w e b 浏览器 上获取静态的信息,人们需要通过它发表意见、查询数据,甚至进行网上购物,这就迫切需 要实现真正的i n t e m e t 。 w e b 与数据库的互连,将人、企业、社会与i n t e r n e t 融为一体。w e b 技术发展到今天, 人们已经可以把数据库技术引入到w e b 系统中。数据库技术发展比较成熟,特别适用于对 大量的数据进行组织管理,w e b 技术具有较佳的信息发布途径,这两种技术的天然互补性 决定相互融合是其发展的必然趋势。将w e b 技术与数据库技术融合在一起,使数据库系统 成为w e b 的重要有机组成部分,不仅可以把二者的所有优点集中在一起,而且能够充分利 用大量已有的数据库信息资源,使用户在w e b 浏览器上方便地检索和浏览数据库的内容, 这对许多软件开发者来说具有极大的吸引力。因此,将w e b 技术与数据库相结合,开发动 态的w e b 数据库应用己成为当今w e b 技术研究的热点。 关系数据库最初设计为基于主机终端方式的大型机上的应用,其应用范围较为有限, 随着客户机服务器方式的流行和应用向客户机方向的分解,关系数据库又经历了客户机 服务器时代,并获得了极大的发展。 6 浙江大学计算机系硕士论文 随着i n t e r n e t 应用的普及,由于i n t e m e t 上信息资源的复杂性和不规范性,关系数据库 初期在开发各种网上应用时显得力不从心,表现在无法管理各种网上的复杂的文档型和多媒 体型数据资源,后来关系数据库对于这些需求做出了一些适应性调整,如增加数据库的面向 对象成分以增加处理多种复杂数据类型的能力,增加各种中间件( 主要包括c g i 、i s a p i 、 o d b c 、j d b c 、a s p 等技术) 以扩展基于i n t e r n e t 的应用能力,通过应用服务器解释执行各 种h t m l 中嵌入脚本来解决i n l e r n e t 应用中数据库数据的显示、维护、输出以及到h t m l 的格式转换等。 此时关系数据库的基于i n t e r n e t 应用的模式典型表现为一种三层或四层的多层结构。在 这种多层结构体系下,关系数据库解决了数据库的i m e r n e t 应用的方法问题,使得基于关系 数据库能够开发各种网上数据库数据的发布、检索、维护、数据管理等一般性应用。 但是关系数据库从设计之初并没有也不可能考虑到以h t t p 为基础、t f f m l 为文件格式的 互联网的需求,只是在互联网出现后才做出相应的调整。 同时,关系数据库的基于中间件的解决方案又给i n l e r n e t 应用带来了新的网络瓶颈,应 用服务器端由于与数据库频繁交互,因其本身的效率和数据库检索的效率造成i n t e r n e t 应用 在应用服务器端的阻塞。 虽然关系型数据库具有完备的理论基础、简洁的数据模型、透明的查询语言和方便的操 作方法等优点,但是由于它本身并没有针对网络的特点和要求进行设计,因此并不适用于网 络环境,我们应该研究开发新的数据库技术,从开始就考虑到w e b 的信息和结构特点,使 数据库真正能与w e b 融合为一体,充分利用二者的特点,建立合理的w e b 数据库。 那么,为什么使用网络数据库昵? 简言之,因为人们在网络数据库中可以找到他们需要 的东西,包括期刊查询,检查银行账户、股票价格、利率、实现电子商务等等。这些功能是 用h t m l 编写的网页是无法做到的,因为用h t m l 无法完成交互功能,要做到这些,必须 使用网络数据库技术。 w e b 数据库可以实现方便廉价的资源共享。数据信息是资源的主体,因而网络数据库 技术自然而然成为互联网的核心技术。 几种常用w e b 数据库的比较: 当前比较流行的w e b 数据库主要有:s q ls e r v e r 、m y s q l 和o r a c l e 。这3 种数据库适 应性强,性能优异,容易使用,在国内得到了广泛的应用 1 s q l s e r v e r 是微软公司从s y s b a s e 获得基本部件的使用许可后开发出的一种关系型 数据库。目前最新的版本是s o ls e r v e r2 0 0 0 ,但s o ls e r v e r7 0 仍在广泛使用。 由于均出自微软之手,使得s o l s e r v e r 和w i n d o w s 、h s 等产品有着天然的联系。事实 上以w i n d o w s 为核心的几乎所有微软的软件产品都采用了一致的开发策略,包括界面技术、 面向对象技术、组件技术等,这样在微软的软件中很多都可以相互调用,而且配合得非常密 切。因此如果用户使用的是w i n d o w s 操作系统,那么h s 、s q l s e r v e r 就应该是最佳的选择。 2 m y s q l 是当今u n i x 或l i n u x 类服务器上广泛使用的w e b 数据库系统。它于1 9 9 6 年诞生于瑞典的t c x 公司,支持大部分的操作系统平台。m y s q l 的设计思想快捷、高效、 实用。虽然它对a n s i s o l 标准的支持并不完善,但支持所有常用的内容,完全可以胜任一 般w e b 数据库的工作。由于它不支持事务处理,m y s q l 的速度比一些商业数据库快2 3 倍,并且m y s q l 还针对很多操作平台做了优化,完全支持多c p u 系统的多线程方式。 在编程方面,m y s q l 也提供了c 、c + + 、j a v a 、p e r ! 、p y t h o n 和t c l 等a p i 接口,而 且有m y o d b c 接口,任何可以使用o d b c 接口的语言都可以使用它。更重要的是,m y s q l 的源代码是公开的可以免费使用,这就使得m y s q l 成为许多中小型网站、个人网站追捧 的明星。 浙江大学计算机系硕士论文 3 o r a c l e 是o r a c l e 公司开发出的一种面向网络计算机并支持对象关系模型的数据库 产品。它是以高级结构化查询语言为基础的大型关系数据库,是目前最流行的客户朋务器 体系机构的数据库之一。目前广泛使用的版本是o r a c l e8 i ,它之所以备受用户喜爱是因为它 具有以下突出的特点: ( 1 ) 支持大型数据库、多用户和高性能的事务处理。o r a c l e 支持最大数据库,其大小可 达到几百千兆,可充分利用硬件设备:支持大量用户同时对数据库执行各种数据操作,并使 数据征用最小,保证数据一致性;系统维护具有很高的性能,o r a c l e 每天可连续2 4 小时工 作,正常的系统操作( 后备或个别系统故障) 不会中断数据库的应用:可在数据库级或子数 据库级上控制数据的可用性。 ( 2 ) o r a c l e 遵守数据库存取语言、操作系统、用户接口、和网络通讯协议的工业标准, 所以它是一个开放系统,保护了用户的投资。美国标准化和技术研究所( n i s t ) 对o r a c l e s e r v e r 进行过检验,完全与a n s i i s os q l 8 9 标准相兼容 ( 3 ) 实施安全性控制和完整性控制。o r a c l e 为限制系统对各监控数据库存取提供可靠 的安全性,并为可接受的数据指定标准,保证数据的完整性。 ( 4 ) 支持分布式数据库和分布式处理。o r a c l e 为了充分利用计算机系统和网络,允许将 处理分为数据库服务器和客户应用程序处理,所有共享的数据管理由数据库管理系统的计算 机处理,而运行数据库应用的工作站集中于解释和显示数据。通过网络连接环境,o r a c l e 将存放在多台计算机上的数据组合成一个逻辑数据库,可被全部网络用户存取。分布式系统 像集中式数据库一样具有透明性和数据致性。 上面介绍的3 种数据库产品是目前最常用的3 种大型关系数据库系统,它们虽然在体系 结构和操作方法上有许多相似的地方,但是在应用环境上还是各有侧重的。一个应用系统在 选用数据库时,性能和价格时首先要考虑的两个因素,表1 - 1 列出了这3 种数据库在性能和 价格上的对比情况,在使用时不同的系统应针对实际情况采用台适的方案。 从用户的技术水平以及国内软件应用的现状来看,s q l s e v e r 应该是一个较好的选择, 尤其是对初学者而言。 w e b 服务器脚本: w e b 页面与数据库的连接是w e b 数据库的基本要求。目前基于w e b 数据库的连接方案 主要有两种类型:服务器端和客户端方案。服务器端方案实现技术有c g i 、s a p i 、a s p 、p h p 等;客户端方案实现技术有j d b c ( j a v ad a t a b a s ec o n n e c t i v i t y ) 、d h t m l ( d y n a m i ch t m l ) 等。其中a s p 是微软开发的脚本语言技术,它嵌入在s 中,因此a s p 也就顺理成章地成 为大部分w i n d o w s 用户首选的脚本语言。 2 2 3 脚本程序与数据库的接口 在脚本程序中连接数据库一般都需要相应的接口来完成。连接数据库的常用方法有: o d b c 、d a o 、r d o 及a d o 等。 ( 1 ) o d b co d b c ( o p e nd a t a b a s ec o n n e c t i v i t y ,即开发式数据库连接) 是微软开发 的一套统一的程序接口。通过这个接口可以存取不同厂商生产的数据库。 经过多年的改进,它已成为存取服务数据库的标准。事实上,o d b c 技术成了后来d a o 、 r d o 及a d o 等数据库访问技术的基础。 ( 2 ) d a od a o ( d a t a a c c e s so b j e c t s ,即服务器访问对象) 是微软公司开发的一套主 要应用程序及开发工具,用它可以访问数据库的标准对象,如a c c e s s 、v b 、e x c e l 、w o r d 等。 ( 3 ) r d or d o ( r e m o t ed a t ao b j e c t s ,即远程数据库访问对象) 是微软公司为增强 8 浙江大学计算机系硕士论文 d a o 的功能而推出的新产品。 该产品强化了s o l s e r v e r 的访问功能,提高了它的执行效率。 ( 4 ) a d oa d o ( a c t l v t e x d a t a o b j e c t s ,即a c t i v t e x 数据对象) 是微软在i n t e r n e t 领域采取的新举措。它本身并不是一项新技术,从对象结构的角度来看,它比d a o 提供的对 象更少;从存取s o l 服务器的角度来看它提供的功能也不如r d o 。但它汲取了d a o 和r d o 最精华的部分,成为一个更适合于i n t e r n e t 的小而精的对象群。因此,a d o 实际上是脚本 程序连接数据库最好的选择。 2 2 4 应用开发平台 由于w e b 应用开发的独特性,应用开发平台成为众多厂商的关注焦点。日前市场上存 在很多的w e b 应用标准、集成开发环境。流行的主要是a s p 、p h p 、j s p 三种。 ( 1 ) a s p a s p ( a c t i v e xs e r v e rp a g e s ) 是由微软创建的w e b 应用开发标准,a s p 服务器已经包含在 s 服务器中,a s p 服务器将w e b 请求转入解释器中,在解释器中将所有a s p 中的脚本进 行分析,然后执行,同时可以创建c o m 对象以完成更多的功能,a s p 中的脚本是v b s c r i p t 。 优点:安装配置方便,开发简单易学;开发工具功能强大。 不足:a s p 使用了组件因而将导致大量的安全问题:无法实现跨平台,只能应用于 w i n d o w sn t 2 0 0 0 。 建议采用m s 架构的网站采用a s p 应用开发平台f s + v i s u a l i n t e r d e v ) 。 ( 2 ) p h p p h p 由于其良好的性能及免费的特点,是目前互联网中应用非常流行的一种应用开发 平台。 优点:简单易学、跨平台、有良好数据库交换能力的开发语言:与a p a c h e 及其扩展库 紧密结合;良好的安全性。 不足:安装配置复杂;缺少企业级的支持;作为自由软件,缺乏正规的商业支持;无法 实现商品化的商业开发。 建议基于u n i x 类平台的应用采用a p a c h e + p h p + p h p e d 。 ( 3 ) j s p 优点:可移植性好,支持多种平台;强大的可伸缩性:多样化与强大的工具支持。 不足:安装配置管理较为复杂:运行速度较慢;建议开发大型应用系统采用j s p 2 。3 基于因特网的搜索引擎 2 3 1
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 保育师安全知识宣贯评优考核试卷含答案
- 日用五金制品制作工改进考核试卷含答案
- 中药油剂工岗前规章考核试卷含答案
- 环氧树脂装置操作工冲突解决模拟考核试卷含答案
- 印刷设备机械装调工诚信品质强化考核试卷含答案
- 列车长创新意识测试考核试卷含答案
- 左肩疼痛健康知识
- 2026年基于AI的光伏电站运维方案生成系统
- 2026年自动驾驶数据标注效率提升策略实践
- 高考英语复习语境8良好的人际关系与社会交往课件(共47张)
- 三类医疗器械经营企业负责人试题卷(附答案)
- 【语文】湖南省长沙市实验小学小学二年级下册期末试卷(含答案)
- 干熄焦安全培训课件
- 供电营业规则培训课件
- 2025年水利云播五大员考试题库(含答案)
- 配电网运维规程培训课件
- 中小企业财务管理实务操作指南
- 企业人力资源共享服务
- 物业合同履约汇报
- 胸腔穿刺术教学课件
- GB/T 13814-2025镍及镍合金焊条
评论
0/150
提交评论