已阅读5页,还剩52页未读, 继续免费阅读
(管理科学与工程专业论文)基于ldap目录服务的信息导航定位研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
国防科学技术大学研究生院学位论文 摘要 信息共享技术、信息一体化技术的发展为人们通过计算机网络存取访问各种分布、异 构、动态的信息提供了技术支持,并在此基础上实现了电子商务、数字图书馆等多种形式 的信息服务,同时也带来了新的问题:用户能够访问的信息量过于庞大而个体信息需求相 对有限,怎样从浩如烟海的信息中快速找到满足用户需求的内容? 为了解决这一问题,本文在研究总结现有各种信息资源定位方案的基础上,根据网络 信息空间的特点设计了基于l d a p l 目录服务的信息导航定位机制,并对目录索引节点的组 织结构、资源索引信息的组织存贮和信息资源定位方法三个关键问题进行了详细研究: 按节点内容的不同将目录索引节点组织成多个重叠网络,并且将每个重叠网络中 的目录索引节点组织成扩展层次结构,给出了节点加入和离开重叠网络的拓扑维护算法, 采用这种方式组织目录索引节点可以减少无关搜索的可能性,提高信息导航定位的性能。 研究分析目录索引信息的特点,设计了目录索引信息的信息模型和组织模型,并 利用l d a p 目录服务器代替关系数据库组织和管理目录索引信息,利用l d a p 高效的查询性 能实现了单目录索引节点的信息检索定位。 设计了网络信息空间中基于语义的信息导航定位方法,设计并实现了信息导航定 位的系统原型,并用一个实例说明了本文提出的信息导航定位机制在网络信息空间中的应 用。定性和定量分析表明该信息导航定位机制具有一定的动态组织特性、较强的可扩充性 和较高的查询效率。 本文对网络信息空间中的信息导航定位问题进行了深入而有意义的研究,对异构、分 布和动态环境中的信息服务研究具有一定的参考价值。 关键词:网络信息空间信息导航定位重叠网络l d a p目录服务 第1 页 里堕型兰堇查奎堂堕壅竺堕兰垡笙塞 a b s t r a c t t h ed e v e l o p m e n to fi n f o r m a t i o n s h a r i n g a n di n t e g r a t i o nt e c h n o l o g yh a sp r o v i d e d t e c h n i c a ls u p p o r t sf o rp e o p l eo na c c e s s i n gd i s t r i b u t e d ,h e t e r o g e n e o u sa n dd y n a m i ci n f o r m a t i o n i to f f e r sp e o p l ew i t hk i n d so fi n f o r m a t i o ns e r v i c e ,s u c ha se l e c t 】- o n i cb u s i n e s s ,d 谵i t a ll i b r a r ye t c a tt h es a m et i m e ,n e wp r o b l e mi sc o m i n gi n t o b e i n g ,w h i c hi sh o wu s e r sc a l lf i n d t h e i n f o r m a t i o ns a t i s f y i n gt h e i rn e e d si nf a c e o ft h el a r g en u m b e ro fi n f o 衄a t i o ns o u r c e si nt 1 1 e i n f o r m a t i o ns p a c e t os o l v et h i sp r o b l e m ,am e c h a n i s mo fi n f o r m a t i o nn a v i g a t i o na n dl o c a t i o ni sp r e s e n t e di n t h i sp a p e rb a s e do nt h ec h a r a c t e r i s t i c so fn e t w o r k i n gi n f o r m a t i o ns p a c e i ti m p l e m e n t st h e i n f o r m a t i o nn a v i g a t i o na n dl o c a t i o no nt h r e ea s p e c t s ,w h i c ha r et h eo r g a n i z a t i o no fi n d e x i n g i n f o r m a t i o n ,t h et o p o l o g yo fd i r e c t o r ys e r v i c en o d e sa n dt h el o c a t i o no fi n f o r m a t i o ns o u r c e s : t h i sp a p e ro r g a n i z e st h ed i r e c t o r ys e r v i c en o d e si n t ol m u l t i o v e r l a y s a c c o r d i n gt ot h e i r c o n t e n t sa n do r g a n i z e st h en o d e si ne a c ho v e r l a yi n t oe x t e n d e dh i b e r a r c h y t h i sp a p e ra l s o p r e s e n t st h em a i n t a i n i n ga l g o r i t h m so ft o p o l o g yw h e nn o d e sj o i na n dl e a v et h en e t w o r k l o c a t i n gi n f o r m a t i o nw i t ht h i sm e c h a n i s mc a nm i n i m i z es e a r c hs p a c ea n di m p r o v es e a r c h e f f i c i e n c y t h i sp a p e rd e s i g n st h ei n f o r m a t i o na n do r g a n i z a t i o nm o d e lo fd i r e c t o r y i n d e x i n g i n f o r m a t i o n t h ei n d e x i n gi n f o r m a t i o na r eo r g a n i z e da n ds t o r e dw i t hl d a pd i r e c t o r ys e r v e r i n s t e a do ft h er e l a t i o n a ld a t a b a s ea n dt h ei n f o r m a t i o nl o c a t i o na r ei m p l e m e n t e dt h r o u g ht h e e f f i c i e n tl d a pq u e r y i n gm e c h a n i s mi nas i n g l en o d e t h i sp a p e rp r e s e n t sa na p p r o a c ho fs e m a n t i c - b a s e di n f o r m a t i o nl o c a t i o n w ed e s i g na n d i m p l e m e n tt h es y s t e mp r o t o t y p eo fi n f o r m a t i o nn a v i g a t i o na n dl o c a t i o na n di l l u s t r a t ei t s a p p l i c a t i o nw i t ha ne x a m p l e t h eq u a l i t a t i v ea n dq u a n t i t a t i v ea n a l y s i so ft h i sm e c h a n i s m s u g g e s t st h a ti ti se f f i c i e n ta n dh a ss u p e r i o r i t yi nc o m p a r i s o nw i t ho t h e ra p p r o a c h e so ns c a l a b i l i t y a n dr e l i a b i l i t y t h i sp a p e rm a k e sas e r i e s o fr e s e a r c h e so ni n f o r m a t i o nn a v i g a t i o na n dl o c a t i o ni n n e t w o r k i n gi n f o r m a t i o ns p a c e sa n dc a nh e l p t h er e s e a r c ho fi n f o r m a t i o ns e r v i c ei nt h e h e t e r o g e n e o u s ,d i s t r i b u t e da n dd y n a m i ci n f o r m a t i o ne n v i r o n m e n t k e y w o r d s :n e t w o r k i n gi n f o r m a t i o ns p a c e ,i n f o r m a t i o nn a v i g a t i o na n dl o c a t i o n , o v e r l a yn e t w o r k s ,l d a p ,d i r e c t o r ys e r v i c e 第1 i 页 独创性声明 本人声明所呈交的学位论文是我本人在导师指导下进行的研究工作及取得 的研究成果。尽我所知,除了文中特别加以标注和致谢的地方外,论文中不包含 其他人已经发表和撰写过的研究成果,也不包含为获得国防科学技术大学或其它 教育机构的学位或证书而使用过的材料。与我一同工作的同志对本研究所做的任 何贡献均已在论文中作了明确的说明并表示谢意。 学位论文题目: 叁王坠望业亘垂自匿盘垃焦皇昱魈宝焦盟窒 学位论文作者签名: 基! 兰塞日期:童一年乡月苦日 学位论文版权使用授权书 本人完全了解国防科学技术大学有关保留、使用学位论文的规定。本人授权 国防科学技术大学可以保留并向国家有关部门或机构送交论文的复印件和电子 文档,允许论文被查阅和借阅;可以将学位论文的全部或部分内容编入有关数据 库进行检索,可以采用影印、缩印或扫描等复制手段保存、汇编学位论文。 ( 保密学位论文在解密后适用本授权书。) 学位论文题目: 基王垦旦丛旦垂月星盘尥焦! 璺昱筮塞焦盟窥 学位论文作者签名:应立! 盔 日期:毒即驴年月l a 日 作者指导教师签名 日期:p 一毋年7 月纱日 里堕型兰茎查查兰堕塞竺堕兰丝堡苎 图表目录 图1 3 信息资源定位框架5 图2 1 集中式信息定位机制9 图2 2 完全分布式的信息定位机制1 0 图2 3 全复制式的信息定位机制。1 1 图2 4 层次式的信息定位机制1 1 图2 5 坏形信息定位机制一1 2 图2 6 集中+ 纯分布式的信息定位机制1 3 图2 7l d a p 服务器作为网关1 3 图2 8l d a p 服务器作为独立的服务器1 3 图2 9 条目、属性与值的关系1 4 图2 1 0 目录信息树d i t 1 5 图2 1 il d a p 交互过程1 6 图2 1 2 带参考指针的服务器访问过程1 7 图3 1 信息导航定位机制总体框架一2 0 图3 2 系统工作过程2 2 图3 _ 3 节点索引信息组织结构2 4 图3 4 重叠网络示例2 5 图3 5 网络信息空间中的多重叠网络组织一2 6 图3 6 重叠网络内的分类层次组织2 7 图3 7 目录索引节点一2 8 图4 1 信息资源定位机制总体结构图3 8 图4 2 系统工作流程图3 9 图4 3 查询执行4 0 图4 4 基于物理组织的网络信息空间分类导航视图4 6 图4 5 信息资源查询结果。4 6 表2 1u k o l n 的元数据分类表7 表3 1 邻接表结构;2 9 表3 2 前邻接表结构3 0 表3 _ 3 附属节点表结构3 0 第i i i 页 里堕型鲎茎查查堂竺茎竺堕兰堡兰兰一一一一一 第一章绪论 1 1 研究背景 随着计算机网络和信息技术的发展,存贮在各种信息系统中的信息资源通过网络互 联,形成了巨大的网络信息空间,网络信息空间中的信息数量大、种类多,为人们通过网 络获取信息提供了方便,但同时也提出了挑战:如何在茫茫的信息海洋中找到满足自己需 求的信息? 1 1 1 网络信息空间的特点 1 信息格式多样 网络信息空间是信息存贮和传播的主要媒介之一,也是一个巨大的信息资源库,在网 络信息空间中结构化信息、半结构化信息和非结构化信息共存,其中以结构化信息和半结 构化信息为主“。结构化信息是指那些具有严格结构定义和明确语义标识的信息,如关系 数据库中韵信息等:非结构化信息是指那些完全没有严格的结构定义和明确语义标识的信 息,如声音、图像和视频信息等;半结构化信息是界于严格结构化的信息和完全无结构的 信息之间的信息形式,如h t m l 文档等。多种格式的信息共存,使网络信息资源得到了极 大地丰富,但由于网络上大量信息没有显式的模式定义、规则的结构和严格的类型约束等, 使得对这些信息的访问变得非常困难。 2 信息异构性强 由于描述、存储、管理信息的方式不同,使网络信息资源呈现出不同程度的异构性。 网络信息空间中的信息异构主要表现为:信息平台异构,如信息源的操作系统和硬件系统 各异:信息语法( 或模式) 异构,如信息描述语言和数据表示各不相同:信息结构异构, 如不同的信息源具有不同的信息模型;信息语义异构,如由于缺乏统一的语义集,使得信 息语义出现矛盾、冲突或重叠等现象m ,。 3 信息分布范围广 随着全社会信息化建设速度的提高,已经建成多种面向不同应用需求的信息系统,可 以为用户提供大量的信息资源。这些信息资源隶属于不同的部门,分布在不同的地理位置 上,网络信息空间通过统一的t c p i p 协议将这些各不相同的信息源连接成一个开放性的 分布式网络,众多的服务器采用不同的操作系统、数据结构、操作界面等,并且网上资源 没有统一的组织管理和规范结构,从局部来看网络资源是有序的,但整体却处于无序状态。 此外,信息源还具有动态、自治等特点。 综上所述,由于信息资源的来源、作用、处理方式和使用方法都不尽相同,使得各级 各类用户在这些异构、分散、海量的数据基础上,很难获取到满足自己需要的信息,主要 表现为“信息过载”( i n f o r m a t i o no v e r l o a d i n g ) 和“信息迷航”( i n f o r m a t i o nl o s t ) 。 “信息过载”表现为用户要花费漫长的时间等待信息服务返回请求结果,而且返回的结果 常常包含大量无序的杂乱的信息“噪声”;“信息迷航”表现为用户不知道该如何从这些包 含“噪声”的反馈信息中提取有用的信息。因此如何对异构环境下的海量信息进行合理地 组织管理,为用户提供综合一致的全局信息视图,使用户能快速、全面地获取到所需信息 资源是当前亟需解决的技术难题之一。 第1 页 国防科学技术大学研究生院学位论文 信息共享、信息一体化技术的飞速发展为用户跨地域、跨系统访问不同形式的信息提 供了可能,但仍然存在着用户可以访问的信息过于庞大而个体需求相对有限的矛盾,对于 怎样使用户从这些海量的信息中快速、准确地定位到所需的内容还远没有一个完美的解决 方案,这就是我们研究信息导航定位机制的由来。 1 1 2 信息导航定位 目前的i n t e r n e t 利用各种协议将分布、异构的各个信息网络联接起来,实现数据跨 网络的透明传输,它的基本功能是网络互联,以提供物理机器间的数据通信,如果把 i n t e r n e d 看成是一个协议环境,那么信息导航则是一个将信息空间互联起来的应用环境, 其目标是在分布、异构的信息空间之间提供对信息的透明操作,满足用户的信息需求,它 的基本功能是信息空间互联,以提供跨仓储的信息处理,在这样的互联信息空间中,用户 从多个信息源中将信息以多种方式关联起来。 所谓的信息导航定位就是根据用户或应用的请求,采用一定的机制获取具体的信息源 所在的位置。信息导航定位服务是在对异构、分布和动态、自治的信息资源合理组织的基 础上,为人们在信息空间中访问所需信息提供有效服务的,用户通过导航定位服务表达自 己的信息需求并利用导航机制定位到符合需求的信息。信息资源定位也是网格环境和p 2 p 系统研究中的关键问题,高效的信息定位机制可为广域环境中的信息服务提供底层的技术 支持,使得所实现的系统具有足够的可靠性、可扩充性和灵活性。 本文的主要研究目标是设计与实现网络信息空间中的信息导航定位机制,信息导航的 作用是在用户与各分布的信息资源间架起一座桥梁,使用户通过这座桥梁获取到准确、及 时的信息:该机制应具有的特点和实现的功能包括: 1 分布式信息处理。相对于集中的信息处理方式而言,分布式信息处理具有更强的 可扩充性和健壮性,更能适应网络信息空间中信息资源数量大、分布广的特点。 2 动态信息处理。底层信息资源是动态变化的,因此所设计的机制应该能反应信息 资源的动态变化特性,保证用户得到的是较新的信息。 3 基于关键字的查询。能根据用户输入的关键字定位到符合要求的信息,包括部分 关键字查询、通配符查询、范围查询等,信息资源有相应的元数据描述,查询在信息资源 的元数据集上进行,因此查询具有更强的针对性、更高的准确率。 4 辅助导航。在用户信息需求不能精确表述的情况下,为用户提供按组织、按主题 或按地域的分类检索,使用户在导航的过程中逐渐明确自己的信息需求,直至晟后定位到 所需的信息资源。 1 2 国内外研究现状 在网络信息空间中,由于信息资源的广域分布以及现有i n t e r n e t 存在的带宽和延迟 限制以及网络的不可靠性,广域范围内的信息资源定位将在很大程度上影响各种信息服务 的性能。目前国内外许多学者在分布式信息系统的拓扑结构和资源定位等方面进行了很多 的研究,有一些也已开发了相应的工具应用于特定领域的信息服务。 1 互联网上的信息资源定位一搜索引擎。” 白1 9 9 1 年问世以来,互联网( w o r l dw i d ew e b ) 一直主要利用网页的形式来表达信 息,利用网页问的超级链接形式描述信息之间的复杂联系”1 。目前互联网已经成为全球第 第2 页 旦堕型主垫查奎兰竺茎生堕兰堡笙苎 一大发布最及时、更新最便捷、交流最方便的信息发布媒体,互联网自由发展的特点决定 了网上信息分布的广泛性和无序性,随着网上共享信息的增多,人们发现在其中获取自己 所需要的信息越来越难,为了解决这种面向互联网的信息搜索难题,开发了互联网搜索引 擎。根据信息搜集方法和服务提供方式的不同,互联网搜索引擎可以分为以下三类: 目录式搜索引擎 这种搜索引擎以人工或半自动方式收集网站和网页信息,由编辑员查看信息之后,人 工形成信息摘要,并将信息置于事先确定的分类框架中,向用户提供目录浏览和信息检索 服务。此类搜索引擎的优点是由币加入了人的智能,信息准确度和导航质量高,缺点是需 要人工介入使得维护工作量大、信息量少、信息更新不及时。典型代表是y a h o o ,l o o k s m a r t , o p e nd i r e c t o r y 等。 机器人搜索引擎 这种搜索引擎由一种称为蜘蛛1 ( s p i d e r ) 的机器人程序以某种策略自动地在互联网上 搜集和发现信息,由索引器为搜集到的信息建立索引,由检索器根据用户的查询请求检索 索引库,并将匹配的查询结果返回给用户,服务方式是面向网页的全文检索服务。在这种 服务方式中,信息资源的所有索 i 信息都集中存放在中心服务器上,所有信息服务都由中 心服务器提供。此类搜索引擎的优点是信息量大、更新及时、毋需人工干预,缺点是返回 信息过多,有很多无关信息,用户不得不从众多结果中进行筛选。典型代表是a 1 t a v i s t a , e x c i t e 和g o o g l e ,国内的有百度、北大天网等。 元搜索引擎 这种搜索引擎”3 没有自己的数据,它将用户的查询请求同时向多个搜索引擎提交, 再对多个返回结果进行重复排除、重新排序等处理后。将其返回给用户。服务方式是面向 网页的全文检索。优点是返回结果的信息量大,缺点是不能够充分使用原搜索引擎的功能, 用户需要做更多的筛选。典型代表是w e b c r a w l e r ,i n f o m a r k e t 等。 搜索引擎为用户获取信息提供方便的同时也存在着不足。首先,这些传统的搜索系统 大多采用集中式的服务提供方式,由于数据都存贮在中心服务器上、客户也都向同- - n 务 器发出服务请求,极易造成服务器负载过重,因此不仅有单点失效问题而且难以扩充;其 次,由于信息源本身不会主动与服务中心发生联系,而是被动地等待服务中心对它的访问, 因此不能保证信息的及时更新,不能保证用户访问到最新的信息:最后,搜索引擎大都是 基于关键词的匹配,还没有能力提取信息内容的语义,因此会搜索到很多无关的结果,存 在着使用户再次陷入信息迷航的可能。随着网络规模的不断增长,集中式的信息服务方式 必将被分布式的信息架构所取代,提供可扩充的信息发现服务。 2 网格环境中的资源定位 网格技术是近年来国际上兴起的一种重要信息技术,它的目标是实现网络虚拟环境上 的高性能资源共享和协同工作,消除信息孤岛,网格中的资源包括计算资源、数据资源、 软件资源等,这些资源具有地理分布、系统异构等特点,因此要实现网格的资源共享、协 同工作等目标,就必须对网格环境中的资源进行有效的组织、管理,并为网格使用者提供 有效的资源定位方法。目前的在资源定位方面的研究包括计算网格中的资源定位“4 。“1 、数 据网格中的复制定位o “”1 、服务网格中的服务定位“”等。 计算网格中的资源定位 g l o b u s ”1 是由美国a r g o n n e 国家实验室和加州理工学院联合开发的一个网格计算环 境,它由一组元计算底层工具包构成,为通信、资源定位和计算以及数据访问等提供了基 第3 页 国防科学技术大学研究生院学位论文 本的接口。g l o b u s 中的元计算目录服务m d s “1 ( m e t e - c o m p u t i n gd i r e c t o r ys e r v i c e ) 所 采用的资源信息组织管理及资源定位机制能满足网格信息服务所要求的安全性、可扩充 性、健壮性和性能等要求。m d s 是由网格索引信息服务( g i i s ) 、网格信息资源服务( g r i s ) 和信息提供者( i p ) 三种组件构成的层次结构,其中g i i s 提供底层数据的聚合目录,g r i s 作为资源的代理运行在资源上层,g r i s 向g i i s 注册,而g i i s 还可以向其他的g i i s 注册, 每一层还有缓存以减轻更新数据的传输、减少网络开销,信息提供者提供的数据包括负载、 c p u 、操作系统、文件系统、内存及网络连接等方面的信息。 从1 9 9 9 年底到2 0 0 1 年初,中科院计算研究所联合十几家科研单位,承担了8 6 3 重点 项目“国家高性能计算环境“( n h p c e ) ”的研发任务,该项旧的目标是建立一个分布环境 下支持异构平台的计算网格示范系统。n h p c e 项目中的资源目录管理“”( r d m ) 在l d a p 协 议的基础上,实现了对计算资源的完备表示并实现了对资源旧录的组织和管理,为高层应 用提供了良好的资源定位功能。由于n h p c e 中资源的广域分布性,r d m 采用了分布式的目 录管理方式,使用地理分布的l d a p 服务器对资源信息进行管理,为了提高远程目录访问 的性能,r d m 使用了l d a p 的备份( r e p l i c a t i o n ) 功能,使每个l d a p 服务器实时复制其 他l d a p 服务器的资源信息,将目录的远程访问改为在本地执行,大大降低了目录访问的 时间,使整个n h p c e 的系统性能有了较大的提高。 数据网格中的复制定位 计算网格主要服务于计算密集型应用,而数据网格则起源于数据密集型的科学计算应 用,数据的分布与复制是数据网格关注的主要问题,数据网格中的复制定位研究提出了在 网格环境中定位数据文件的机制。 g d m p “是欧洲数据网格项目( e u r o p e a nd a t a g r i d ) 的数据管理工作组( w p 2 ) 和粒子物 理数据网格项目( p p d g ) 共同开发的文件复制工具,用于t b 级甚至p b 级的数据复制,应 用在p p d g 、g r i p h y n 等数据网格项目中。它只有一个复制目录服务器,是典型的集中式拓 扑结构,用户的复制定位请求服务都由这一集中的目录服务器提供。g d m p 具有实现简单、 易于管理和维护的优点,但同时由于复制定位信息仅存放在中心服务器上,可能会成为系 统的瓶颈的在,系统的健壮性和可扩展性也不好。 欧洲数据网格还在其设计框架中提出了一种复制定位机制一分层的分布式复制定位 机制。在这个机制中复制目录节点分为两类:一类是底层的复制目录,提供精确的复制定 位信息:一类是非底层复制目录,提供路由功能将复制定位请求发送到相应的复制目录站 点。低层目录按照一定的组织关系将部分目录信息向高层目录注册,目录间形成层次关系。 当在需要复制定位时,用户和网格应用程序可以从任何一个复制目录节点出发查找目标文 件,复制定位系统通过分布协作的机制完成客户的复制定位请求。 3 p 2 p 网络环境中的资源定位 p 2 p 系统是目前分布式系统研究的热点,p 2 p “矧系统主要是解决分布式环境中的资 源定位问题,即在没有集中控制的情况下如何将索引信息各分布到各站点上,并利用这些 索引信息定位满足特定需求的信息资源。p 2 p 网络按连接方式可分为无结构网络、结构化 网络和混合型网络三种。 无结构的p 2 p 网络 在无结构p 2 p 网络中,节点间的连接是随机的,各节点的连接数往往相对较大,而 整个网络的拓扑结构也是随机和不规则的,索引信息只存贮在本节点,不向其它节点复制, 无结构网络中的资源定位是通过在相邻节点间扩散定位消息完成的,分散式的文件共享系 第4 页 国防科学技术大学研究生院学位论文 统g n u t e l l a “”就采用了这种结构,在g n u t e l l a 中不存在固定的拓扑结构,没有集中的目 录服务器,在查询过程中各节点间直接交换文件信息,在资源搜索时多采用f l o o d i n g 或 随机搜索方式。这种结构的优点是天生具有可扩充性和容错性,避免了集中式结构中的单 点失效问题,缺点是信息发现速度慢,查询引发的网络通信量大。 结构化p 2 p 网络 与无结构p 2 p 网络相反,结构化p 2 p 网络中各节点的连接具有某种规则的结构,如平 面网格和环等,而且各节点的连接基本相同,结构化p 2 p 网络中的数据存储往往以与其网 络拓扑相对应的坐标系为参照,网络中的每个节点都负责这个空间中的一部分,存储相应 的资源或指针( 索引) ,因此结构化p 2 p 网络中的资源定位问题可转换为搜索所需资源对 应节点的问题:c h o r d “1 ,p a s t r y 。”,c a n “”等分布式哈希表( d h t ) 系统就属于结构化p 2 p 网 络,其中c h o r d 在节点间维护环状结构,并使用相容哈希( c o n s i s t e n th a s h i n g ) 作为从 一维环状空间到资源节点的映射方法,被视为继n a p s t e r 和g n u t e l l a 后第3 代p 2 p 网络 的代表,以c h o r d 为代表的使用d h t 作为资源定位方法的结构化p 2 p 网络具有良好的可伸 缩性和查找性能,是p 2 p 网络发展的新方向而且其优良特性也有力地推动了p 2 p 与其它网 络研究领域,如网格和w e bs e r v i c e 的结合。 无论是结构化还是非结构化的分布式p 2 p 系统都有许多的搜索策略,基于d h t 的p 2 p 网络适用于精确匹配的查询,但不能处理复杂的查询。 混合p 2 p 网络 混合p 2 p 网络“”则将传统的客户一服务器结构与纯p 2 p 系统结合起来,集中了前者的 高效性和后者的负载平衡、健壮性等优点,并初步应用于文件共享环境,具有较大的发展 潜力。如在音乐文件共享系统n a p s t e r 中所有资源的索引信息存放在一个集中的服务裂上, 所有的资源定位服务都由中心服务器提供,而文件传输则直接在两个端之间以p 2 p 的方式 进行:另一个文件共享系统m o r p h e u s 则采用部分集中的索引方式,在系统中设置多个超 级节点”“( s u p e rn o d e ) ,每个超级节点负责存贮系统中一部分节点的索引信息并代理这 些节点执行信息发现服务,超级节点之间组织成p 2 p 网络,这种方式既克服了完全分布式 索引系统性能低的缺点,又不象完全集中式的索引系统那样存在中心服务器负载过重和单 点失败问题。 根据以上的分析可以看出,所有的信息资源定位机制都有一个共同的特点,就是信息 资源以一定的方式将其描述信息发布出来,需要定位信息资源的用户或客户程序访问已发 布的元信息,获取所需信息资源的位置信息及其它的描述性信息,在这一过程中主要包括 三种角色:信息提供者、信息使用者和元信息注册中心。图1 1 给出了信息资源定位的一 般性结构框架。 图1 1 信息资源定位框架 第5 页 国防科学技术大学研究生院学位论文 在图1 1 中,信息生产者将自己拥有的信息资源按照一定的标准进行描述,然后将资 源描述信息注册到信息注册中心;信息使用者向信息注册中心发出信息资源定位请求,获 取信息源的位置及其他描述信息;信息使用者根据所获得的资源描述信息直接访问信息 源。在这一过程中我们发现,信息注册中心中资源描述信息的组织和分布”是影响信息导 航定位效率的重要因素。第二章将从定位信息分布拓扑的角度来研究信息资源定位问题。 1 3 论文的主要内容 本文对面向信息导航的信息定位机制进行了研究,主要包括以下的内容: 1 根据课题需要,对不同应用环境中的信息资源定位机制进行了深入的研究。 信息资源定位是大多数信g n 务系统所要解决的问题,要想使用信息,首先必须找到 信息,信息资源定位是实现信息服务的基础。本文对现有信息资源定位研究的现状进行了 分析,分别对集中式的定位机制、完全分布式的定位机制和混合式的定位机制进行了分析, 分析了其主要的优点与不足,对l d a p 目录服务进行了介绍,分析了其主要特点及应用。 2 提出了基于l d a p 目录服务的分布式信息导航定位机制 在分析现有信息资源定位方法的基础上,本文提出了一种基于l d a p 目录服务的信息 资源定位机制,设计了分布式信息导航定位的总体框架,从目录索引节点的组织结构、资 源索引信息的组织存贮和信息资源定位方法三个方面进行了详细研究,提出了目录索引节 点加入和离开重叠网络的算法以及信息资源的定位方法,并从可扩充性、可靠性和性能等 方面对基于l d a p 的信息导航定位机制进行了定性和定量的分析。 3 设计并实现了网络信息空间中信息导航定位机制的系统原型 根据网络信息空间的特点及用户信息服务的需求,设计并实现了网络信息空间中信息 导航定位机制的系统原型,对其中的消息结构、数据结构和主要的功能模块进行了详细设 计,并通过一个应用实例说明了本文所设计的信息导航定位机制的可行性和可用性。 1 4 论文的组织结构 全文共分五章: 第一章为绪论,分析了网络信息空间的特点、引入了信息导航定位的问题,然后介绍 了信息资源定位的研究现状、本文的研究内容和组织结构。 第二章首先介绍了网络信息空间中的元信息及其在信息导航中的作用,然后比较了当 前各种信息导航定位机制的拓扑结构,最后介绍了l d a p 目录服务的历史、模型、特点及 应用情况。 第三章详细阐述基于l d a p 的信息导航定位机制的研究框架和设计思想,提出了用基 于内容划分的多个重叠网络组织分布式目录索引节点的信息导航定位机制,并对其中的关 键技术进行了详细研究,最后从定性和定量两个方面分析了信息导航定位机制的性能。 第四章是信息导航定位机制原型系统的设计与实现,对其中的消息结构、数据结构和 主要功能模块进行了详细设计,并介绍了应用实例。 第五章是总结与展望,对已做的工作进行了总结,并提出了应进步深入研究的问题。 第6 页 国防科学技术大学研究生院学位论文 第二章信息导航定位机制及相关技术 在网络信息空间中,大量的信息资源是非结构化和半结构化的,要实现对这些信息资 源的共享和统一访问,就必须对这些信息进行统一的信息表示和封装。本章首先分析了资 源描述信息在信息定位中的作用,接着从资源描述信息分布的角度探讨了几种典型的信启 定位机制,最后讨论了实现网络信息定位的相关技术。以后的讨论中,为了表述的简洁, 在不引起混淆的情况下将资源描述信息统称为元数据。 2 1元数据及其在信息导航定位中的作用 2 1 1 元数据概述 网络环境中的信息资源具有数量多、范围广、形式多样的特点,这为人们获取各种信 息服务提供了可能性,但由于缺乏对网络资源的有效组织和管理,在实际应用中获取信息 资源并没有想象中那么容易,这是因为还缺乏一个至关重要的部分:描述信息资源的信息。 这部分信息的用途是帮助用户了解信息资源的属性和相关信息、使计算机能恰当地对信息 资源进行处理和搜索,它包括标签、编目和结构化的描述性信息等,我们称之为元数据。 元数据( m e t a d a t a ) 是关于数据的数据或关于信息的信息,它是面向某种特定应用的 用于描述资源属性的机器可理解的信息,通过规范语法结构和语义结构使得机器能够无二 义性地表现和获取信息。元数据可以用于信息资源的标识、集成、交换、检索等工作,利 用元数据机制,可以更加精确地描述信息资源的语义,从而使得网络上的数据从机器可读 转化为机器可理解。在大型复杂的信息资源空间中,对网络化信息的管理越来越依赖有效 的元数据管理,它支持一系列的功能:定位、发现、归档、评估、选择以及其他功能。 英国的图书馆和信息网络部0 3 1 ( u k o l n ) 的d e s i r e ( d e v e l o p m e n to fae u r o p e a ns e r v i c e f o ri n f o r m a t i o no nr e s e a r c ha n de d u c a t i o n ) 项目专门对现有的多种元数据类型进行 了分析和比较,并把它们分成了三个级别,如表2 1 所示。 表2 1u k o l n 的元数据分类表 级别一包括的是相对来说未经结构化的元数据,特别是从资源中自动提取并索引的, 这些数据一般是搜索引擎产生的。级别二包括的元数据已被结构化并支持字段查询,重要 的是这些简单的数据记录可以由非专业用户自己来创建,而不需要特定的学科知识。级别 三中复杂的描述格式可用于定位和发现,它们一般用于研究与学术活动,需要专业知识来 第7 页 国防科学技术大学研究生院学位论文 创建和维护。 随着网上资源的不断增长,越来越多的资源和项目采用了各种元数据作为网上资源的 描述方式,下面对几种常用元数据进行简单的介绍,包括都柏林核心、( d u b l i nc o r e ) 、 因特网内容选择平台( p i c s ) 、资源描述框架( r d f ) 和政府信息定位服务( g i l s ) 。 1 d u b h nc o r e ( d c ) d u b l i nc o r e 。”是1 9 9 5 年在都柏林召开的第一次元数据会议上被提出来的,它的目的 是生成一个简单的、并且为网络中各个团体所接受的标准化的元数据元素集。d c 由标题、 主题、日期、格式、来源等十五个核心元素构成,能较好地解决网络资源的发现、控制和 管理问题。它易于生成,不需要专业的编目人员来创造,另外为了满足比较高级的编目要 求,d c 还可被扩展或与其它元数据进行桥接,目前已成为简单描述因特网资源的首选。 2 p l a t f o r mf o ri n t e m e tc o n t e n ts e l e c t i o n ( m c s ) 因特网内容选择平台p i c s n ”最初的设计目的是为了让家长能过滤掉网上不适合儿童 阅读的内容。p i c s 把因特网资源与标签融合在一起,在p i c s 中信息加过一个标签后,计 算机就能根据标签的涵义过滤掉用户不需要的资源,或者指导用户发现他们需要的资源。 p i c s 最初的目的是内容过滤,现在涉及到了内容选择方面的更多问题,包括丰富的资源描 述方案、组织管理、发现和检索等。近两年来w 3 c 一直支持着p i c s 的开发,除了普通的 易于理解的含义外,随着越来越多的复杂结构和词忙的加入,p i c s 得到了更广泛的应用。 3 r e s o u r c ed e s c r i p t i o nf r a m e w o r k ( r d f ) 资源描述框架r d f 是一个对结构化的元数据进行编码、交换和再利用的基础结构,它 的目标是定义一种域名中立的机制来描述资源,提供各种应用之间的交互性操作,在网络 上交换可机读的信息。r d f 的基本模型是由节点、属性和它们的值组成,节点可以是任意 的网络资源( 如网页,服务器等) ,属性是节点指定的特性,它们的值可以是字符串、数 字等原子类型的值,也可以是其它资源或元数据。r d f 可被用于各种领域,如在资源发现 中提供更好的搜索引擎功能,在网页或数字图书馆的描述内容和内容关系的编目方面等。 4 g o v e r n m e n ti n f o r m a t i o nl o c a t o rs e r v i c e ( g i l s ) 政府信息定位服务g i l s 项目的目的是为公众提供可以方便地检索、定位、获取公共 联邦信息资源的服务。g i l s 体系是一个分布式信息资源利用体系,各政府机构利用g i l s 规定的标准描述自己的信息资源,建立相应的资源目录和检索系统( g i l s 定位器或g i l s 服务器) ;如果信息资源本身是数字化资源,则在资源目录和实际资源间建立链接:公众 可以通过互联网直接检索这些目录数据,并通过链接直接获得有关数字化资源。g i l s 体系 的基本构建要素是对具体资源进行描述的元数据,即g i l s 记录,它用来描述信息资源的 内容、位置、服务方式、存取方法等,描述对象主要是来自政府的公用信息资源。 2 1 2 元数据在信息导航定位中的作用 所谓的信息导航定位是指根据用户的信息需求描述来确定用户所请求的信息资源所 在的位置。网络信息空间中信息的结构、格式和内容多样,却没有一致的组织结构使用户 能方便地访问这些数据和信息,因此在网络信息空间中准确、快速地定位所需要的信息具 有相当的难度。“。传统的信息系统从体系结构到数据格式都有着封闭的特点,不同的信息 系统,它们的数据存储格式不同,针对不同的应用,人们关心的属性也不同,各信息系统 中的数据不具有互操作性,各种信息一旦离开了它的开发环境,就不被理解和识别。为了 让用户能清楚地了解网络信息空间中的信息及快速地获取到所需信息,必须首先对网络信 第8 页 国防科学技术大学研究生院学位论文 息空间中的信息资源进行基于元数据的统一描述,只有在统一描述信息的基础上,才能进 行有效的信息导航定位。7 ”“。 元数据的作用是描述信息资源在网络信息空间中的组织结构和信息资源的部分特征, 为信息导航过程中的信息资源定位和属性查询提供支持。如果把整个信息空间看作一个巨 大的图书馆,各个信息资源个体就是不同的图书,当前的网络信息空间如同一个没有索日 的、无卡片的图书馆,元数据的作用就是形成统一的索引目录,使整个网络
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026文化强国建设面试题及答案
- 2026武陟幼儿园面试题及答案
- 2026消息技术面试题及答案
- 药店员工岗前培训试题(含答案)
- 钢管租赁合同(范本)
- 【教学设计】《习作:一本书》
- 2026年AI性格匹配的用户反馈分析模型
- 上半年的学校班主任工作总结
- 眼镜验光员中级考试试题及答案
- 2026年合成生物学构建合成生物学疫苗绿色包装技术平台
- 六年级阅读题打印20篇
- GB/T 15822.2-2024无损检测磁粉检测第2部分:检测介质
- 2024年军考英语真题历年军考真题系列
- 落地式盘扣脚手架专项施工方案
- 义务教育数学课程标准(2024年版)
- 2024高考作文10个主题预测+10篇满分范文
- 架线导地线各种弧垂的含义及计算方法(附计算表格)彻底弄懂弧垂
- 建立与维护客户关系
- 专利优先审查证明文件
- 行政职业能力测验类真题及答案
- 纽卡斯尔护理满意度量表(NSNS)
评论
0/150
提交评论