已阅读5页,还剩70页未读, 继续免费阅读
(计算机系统结构专业论文)web信息集成技术研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 w e b 如同一个庞大的知识库,但其中的知识纷繁复杂、浩如烟海难以使用。 w e b 信息集成技术能够对凌乱的w e b 页面进行分析、筛选、集成,为人们提 供一个统一的知识视图和访问方式,从而实现对w e b 资源的高效利用。目前的 w e b 信息集成技术还很不成熟,尤其是缺乏自动性和智能性。我们将领域本体 引入到w e b 集成中,基于领域本体在w e b 信息集成的自动性和智能性方面作 了一系列成功的尝试,并提出了完整的解决方案。 我们回顾了信息集成系统的发展历程,总结了信息集成的基本原理和经典方 法;阐述了w e b 信息集成的功能要求和经典体系结构以及现有的各个功能部分 的实现方案;通过与传统信息集成的对比,分析了w e b 信息集成系统的新特点、 新需求和关键技术。阐述了本体的基本理论、功能和表示方法,特别分析了利用 领域本体进行知识表示、知识匹配的具体方法。为了实现信息集成系统及其构建 过程的自动化和智能化,我们为其引入了领域本体。在领域本体的基础上对传统 的m e d i a t o r w r a p p e r 体系结构作了相应的改进,并为一些功能模块设计了新的实 现方法。采用r d f 表示本体,设计了领域本体的多文件、树状的存储和访问方 法并实现了基于领域本体的知识匹配算法:设计了基于领域本体和x m l 的数据 源描述方法,并实现了数据源分析和数据源描述生成的自动化;设计了基于领域 本体的查询重写、查询分解、查询优化和查询结果处理等一系列的智能化查询处 理方法;对于动态w e b 数据源,采用类似于服务的描述和访问方式从而实现了 动态数据源的集成。基于本体的w e b 信息集成系统的集成对象将不再是特定的 某些数据源,而是随其所用的本体的变化而动态变化的,拥有某一领域的本体就 可以集成该领域的数据源,拥有多个领域本体则可以进行跨领域集成。 采用上述方法,设计并实现了一个原型系统。对该原型系统进行了充分的查 询测试,在查准率、查全率、响应时间和跨数据源查询等方面均得到了不错的性 能数据。这也证明了我们的基于本体的w e b 信息集成技术的解决方案的正确性 和有效性。 关键词:信息集成领域本体 w e b 数据源 a b s t r a c t r v n vh a sb e e nt h el a r g e s tr e p o s i t o r yo f k n o w l e d g e h u tt h ek n o w l e d g ei ni ti si nc h a o sa n d i sd i f f i c u l tt ou s e w e bi n f o r m a t i o ni n t e g r a t i o nc a l la n a l y z e ,f i l t e r , i n t e g r a t i o nt h ew e b p a g e s ,a n d p r o v i d eau n i f i e dk n o w l e d g eo v e r v i e wa n dau n i f i e da c c e s si n t e r f a c e ,s o 笛t o u s et h ew e b r e s o u r c e se f f i c i e n t l y t h et e c h n o l o g ya tt h ep r e s e n tt i m ei st o o 衙t ob em a t u r e e s p e c i a l l yl a c ko f a u t o m a t i c i t ya n di n t e l l i g e n c e w ei n t r o d u c e dt h ed o m a i no n t o l o g yi n t ot h ew e bi n f o r m a d o n i n t e g r a t i o n ,a n dt r yas e r i e so fe x p e r i m e n t so nt h ea u t o m a t i c i t y a n di n t e l l i g e n c eb a s e do nt h e d o m a i no n t o l o g y , a n d b r i n g o u tac o m p l e t er e s o l v a n t w er e v i e w e dt h eh i s t o r yo f i n f o r m a t i o ni n t e g r a t i o n ,a n ds u m m a r i z e dt h eb a s i ct h e o r ya sw e l l a st h ec l a s s i c a lm e t h o d so f i t e x p a t i a t e dt h ef u n c t i o nr e q u i r e m e n t , c l a s s i c a la r c h i t e c t u r ea n dt h e a c h i e v em e t h o do fw e bi n f o r m a t i o ni n t e g r a t i o n a n a l y z e dt h en e wc h a r a c t e r i s t i ca n dn e w r e q u i r e m e n t s a n dt h e k e yt e c h n i q u ec o n t r a s t e d w i t ht h et r a d i t i o ni n f o r m a t i o n i n t e g r a t i o n e x p a t i a t e dt h e b a s i ct h e o r y f u n c t i o na n de x p r e s sm e t h o d ,e s p e c i a l l ya n a l y z e dt h em e t h o do f k n o w l e d g er e p r e s e n t a t i o na n dm a t c h i n gb a s e d0 1 1 t h ed o m a i no n t o l o g y w ei n t r o d u c e dd o m d m o n t o l o g i e si n t ot h es y s t e ms oa st oa c h i e v ea u t o m a t i c i t ya n di n t e l l i g e n c eo f i ta n d t h ep r o c e d u r eo f c o n s t r u c t i n gi t a m e l i o r a t e dt h et r a d i t i o n a lm e d i a t o r w r a p p e ra r c h i t e c t u r eb a s e do nt h ed o m a i n o n t o l o g ya n dd e s i g n e dn e w r e a l i z a t i o nm e t h o df o rs o m ef u n c t i o nm o d e l s d e s i g n e dt h em u l t i f i l e d s t o r i n ga n da c c e s s i n gm e t h o df o rt h ed o m a i no n t o l o g ya n dt h ek n o w l e d g em a t c h i n ga l g o r i t h m b a s e do no n t o l o g y ;p r o p o s e dt h em e t h o do fd a t as o u r c er e p r e s e n t i n gb a s e do nt h eo n t o l o g ya n d x m l ,a n dr e a l i z e d a m o m a t i z a t i o no fd a t as o u r c e a n a l y z i n g ;d e s i g n e d t h em e t h o do f c o n s t r u c t i n g d e c o m p o s i n g o p t i m i z i n gt h eq u e r ya n dd i s p o s i n gt h er e s u l to fq u e r y ;i n v e n t e dt h e n e wm e t h o do ft h ed y n a m i cd a t as o u r c er e p r e s e n t a t i o na n da c c e s s ,m a k i n gi t p o s s i b l e t o i n t e g r a t i o nt h ed y n a m i c d a t as o u r c e w eb u i l tap r o t o t y p es y s t e mu s i n gt h em e t h o d sn o t e dp r e v i o u s l y b a s i n go nt h ep r o t o t y p e s y s t e mw e d i dl o t so f e x p e r i m e n t s t h ee x p e r i m e n t s r e s u l ts h o w e dt h a tt h es y s t e mw o r k s p r o p e r l y k e yw o r d s :i n f o r m a t i o n i n t e g r m i o n ,w e bd a t as o u r c e ,d o m a i no n t o l o g y 1 1 独创性声明 本人声明所呈交的学位论文是本人在导师指导下进行的研究工 作及取得的研究成果。据我所知,除了文中特别加以标注和致谢的地 方外,论文中不包含其他人已经发表或撰写过的研究成果,也不包含 为获得电子科技大学或其它教育机构的学位或证书而使用过的材料。 与我一同工作的同志对本研究所做的任何贡献均已在论文中作了明 确的说明并表示谢意。 签名:童孥丕坠一日期:川年r 月,7 ) 日 关于论文使用授权的说明 本学位论文作者完全了解电子科技大学有关保留、使用学位论文 的规定,有权保留并向国家有关部门或机构送交论文的复印件和磁 盘,允许论文被查阅和借阅。本人授权电子科技大学可以将学位论文 的全部或部分内容编入有关数据库进行检索,可以采用影印、缩印或 扫描等复制手段保存、汇编学位论文。 ( 保密的学位论文在解密后应遵守此规定) 签名:些超导师签名:! 氇坚 日期:卿瑚f1 日 第一章引言 1 1 课题研究背景 第一章引言 w w w 的快速发展,使得海量的w e b 信息资源已成为全球最大的知识库。 合理、高效地利用这一巨大的信息资源,将会带来人类认知史上的又一次飞跃。 但就目前来看,w e b 信息源纷繁复杂,浩如烟海,我们从w e b 上查找信息并 不是一件容易的事。 目前的搜索引擎技术在一定程度上能够帮助我们实现w e b 信息的查找。 但是搜索引擎仅能提供一系列基于关键字简单匹配的、具有大量冗余的页面, 我们仍然要逐个页面的去筛选合适的信息。此外,基于关键字简单匹配的搜索 并不总能查找到用户真正需要的信息。搜索引擎已经不能满足人们快速、准确 的得到信息的要求。 为了能有效的利用w e b 上的信息资源,使w e b 能真正成为人们随时可用 的知识库,人们提出了w e b 信息集成( w e bi n f o r m a t i o ni n t e g r a t i o n ) 的概念。 w e b 信息集成的一个简单定义为:w e b 信息集成就是为w e b 上分布的、自 治的、异构的数据源提供统一的访问界面,并能满足那些需要从多个w e b 数 据源抽取和合并数据的查询请求 2 1 。这一定义主要是从w e b 信息集成所需实 现的功能角度考虑的,同时也概括出了w e b 信息集成技术作用的对象和所要 达到的预期目标。 w e b 信息集成技术的作用对象是w e b 数据源,该数据源具有分布、自治、 异构三个重要特点: 分布:w e b 数据源分布在世界上任何i n t e m e t 能够触及的地方,同一 领域的相关信息有可能分布在不同的站点。 自治:w e b 上数据源是独立于信息集成系统而存在的,它们的组织、 展示、甚至存在与否都不受信息集成系统的任何影响:信息集成系统 不能预知其任何变化,即信息集成系统仅仅知道数据源当前的情况而 不知其以后会发生什么变化,也不知其还是否会存在。 异构:异构性是w e b 信息源的重要特征也是信息集成的难点【“。异构 性大致包括:1 ) 系统异构:指硬件平台、操作系统、并发控制、访问 第一章引言 方式和通信能力等的不同;2 ) 数据模型异构:指采用关系、层次或面 向对象等不同的数据模型以及查询语言等方面的差异;3 ) 逻辑异构: 包括命名异构、值异构、语义异构和模式异构等。在w e b 信息集成中 表现在:现有的各个w e b 站点的软硬件平台、后台数据库各不相同, 更重要的是对数据内容的表现方式也各不相同。w e b 上不但有各种各 样的信息源( h t m l 页面,电子邮件,各种文档,视频音频等) ,而且 即使是同一种信息源,不同的信息提供者所采用的数据模式也是各不 相同的。以h t m l 页面为例,即使表示完全相同的内容,不同的提供 者所给出的h n 亿页面的模式也可能是完全不相同的。 w e b 信息集成的目标是:屏蔽数据源的一切细节,为用户提供完全透明的、 智能的、统一的信息访问接口。在必要的情况下,使用户的查询能够被分解到 多个不同的数据源执行,然后综合所有的查询结果为用户返回完整、正确的答 案。 现阶段,w e b 信息集成引起了众多研究者的兴趣,进行了大量的工作并取 得了一定的成果,但是该领域仍然处于初级阶段,有很多关键的地方存在很多 的困难,还没有一个系统的方法和结论。 w e b 信息集成技术将为人们提供简便、快捷、准确的知识获取方法,势必 成为一项事关国计民生的重要技术。这也是我们对其进行研究的原动力。 1 2 本文所做工作 我们对w e b 信息集成所涉及的各个方面,尤其是其集成的对象一w e b 信 息源以及该集成所要达到的目标进行了有效的研究。发现所要解决的核心问题 是数据模式,以及在特定数据模式下知识的表示和处理等。所以,我们确立下 面几个问题为我们的主要研究内容。 1 o n t o l o g y ( 本体以下皆称本体) 在w e b 信息集成中的应用,领域本体的 建立,以及基于领域本体的w e b 信息集成系统的结构。 2 领域本体和w e b 数据源模型之间的语义映射和知识匹配方法。 3 基于领域本体的查询重写、查询分解及查询结果合并等技术。 4 在领域本体指导下的信息抽取和匹配技术,以及相应的m e d i a t o r ( r f 】间 2 第一章引言 层) 、w r a p p e r ( 抽取器) 的构建方法。 5 动态w e b 页面的集成技术。 6 采用上述技术实现了一个w e b 信息集成的原型系统,并通过实验对上 述技术进行了验证。 1 。3 论文组织安排 全文共分为七章,各章内容如下: 第一章简要介绍本论文的课题背景、研究目的和意义以及论文的 主要工作和论文的章节组织。 第二章详细论述了信息集成系统、w e b 信息集成系统的原理及国 内外研究现状。 第三章本体和领域本体的建立。论述了本体以及领域本体的概念, 提出了w e b 信息集成中所需的领域本体的建立方法。 第四章动态w e b 页面的集成。主要提出了对动态w e b 页面的集 成处理方法。 第五章基于本体的w e b 信息集成技术的实现。提出基于领域本 体的w e b 信息源的集成方法,包括w e b 信息源与领域本 体间的语义映射、用户查询的分解和结果的重组、w r a p p e r 的构建方法等。 第六章实现该w e b 信息集成技术的原型系统,并通过实验对所 采用的方法进行评估。 第七章结论。总结所有的工作,并对未来的工作进行展望。 第二章w e b 信息集成系统及研究现状 第二章w e b 信息集成系统及研究现状 摘要:w e b 信息集成是近些年才兴起的一个研究领域,在此之前,解决异构数 据库交互的信息集成技术已有2 0 多年的历史了。本章从最早的异构数据库集成 系统开始,详细阐述了w e b 信息集成理论及其关键技术,并全面介绍了该领 域的国内外研究现状。 2 1 信息集成系统 信息集成技术将多个分散的、异构的、领域相关的数据源集成在一起,为 用户提供一个统一的访问界面,支持用户在全局模式上对集成的多个数据源进 行全局查询。为全局应用和用户提供了统一、透明访问一组已存在的自治、分 布和异构数据源的方法。集成的数据源包括各类db m s 、电子邮件、htm l 文档、普通文件等结构化、半结构化和非结构化信息。其应用系统具有多层 体系结构( 一般包括:数据源层,中间层,用户接口层) ,根据中间层的实现方 法不同,信息集成系统可分为物化( m a t e r i a l i z e d ) 集成和虚拟( v i r t u a l ) 集成两种。 2 1 1 物化集成系统 物化集成系统的典型代表是数据仓库系统。该类信息集成系统将外部数据 源中的数据定期通过信息抽取工具进行提取,并存放到数据仓库中。所有的查 询都由数据仓库根据其保存的信息来支撑。该类系统的结构见图2 - 1 。物化集 成系统只适合用于数据刷新频率不高且集成规模不大的信息集成系统中。 图2 1 物化集成系统的体系结构 第二章w e b 信息集成系统及研究现状 2 1 2 虚拟集成技术 在用户需要获得及时的查询结果,且数据源中的数据更新频繁的情况下, 物化集成技术将不再是好的选择。这时候我们选择虚拟集成技术。虚拟集成技 术基于一个中间层,中间层保留有数据源中数据的视图,用户的查询提交给中 间层,中间层将查询进行分解并提交给相应的数据源,由数据源进行本地查询。 然后中间层搜集各个子查询的查询结果,对这些结果进行合并后返回给用户。 一般来说,虚拟集成系统中的数据源都需要一个w r a p p e r ( 包装器) 以进行数据的 提取和本地查询。虚拟集成技术有以下优点: 能够集成不同访问模式的数据源。 支持用户的实时访问,并可以针对不同的用户提供不同的中间模式。 但是,虚拟集成技术中有以下比较困难的问题: 去除冗余数据的方法比较复杂。 不同数据源之间的语义匹配难度太高。 受数据源的不确定性和网络的传输性能的影响比较大,应考虑良好的 解决方案。 图2 - 2 虚拟集成技术的典型结构 2 2 信息集成系统的发展 几十年来,许多研究人员对于多数据源的集成和交互提出了多种解决方案。 其发展历程为:从早期的多数据库系统,到基于m e d i a t o r w r a p p e r 的集成系统 以及信息a g e n t 系统。本节首先对这些方案进行简单的介绍,主要研究基于 m e d i a t o r w r a p p e r 的集成系统。 第二章w e b 信息集成系统及研究现状 2 2 1 异构多数据库集成系统 异构数据库集成主要有多数据库语言系统和模式集成两种方案。前者只提 供了统一的多数据库操作语言和公共接口以访问成员数据库,各成员数据库高 度自治,但没有解决语义异构和实现存取定位透明,用户必须指明所要访问的 数据库,数据库之间的约束或依赖关系也必须由用户和应用程序负责定义和维 护。该方法比较适合于集成少量数据库。模式集成系统提供了一个全局模式, 使客户可以透明地访问各成员数据库,成员数据库仍保持较高的自治性。模式 集成比较适合于集成大量数据库或者要求较高存取透明度的系统。早期联邦数 据库系统( f d b s ) 仅指模式集成系统,后来被引申为包括没有全局模式的松散耦 合数据库,如多数据库语言系统。s t r e t c h 和l a r s o n 提出了f d b s 的五层参考模 型,即局部模式、成员模式、输出模式、联邦模式和外部模式。 由华中科技大学计算机科学与技术学院研制的基于c o r b a x m l 的多数 据库集成的原型系统p a n o r a m a ,是一种模式集成系统。可以有效地集成o r a c l e , s y b a s e ,d m 2 等数据库,其体系结构如图2 3 所示。 图2 - 3 基于c o r b a 的多数据库系统体系结构 它采用了四级模式机构: 局部模式:由数据库的数据模型来表示 输出模式:将局部模式转换成公共数据模型得到输出模式 全局模式:多个输出模式的集成就得到全局模式,全局模式和输出模 式之间的关系体现了数据分布的映射信息 用户外模式:为一个用户或应用定义的模式,主要用来存放不能由输 出模式导出的附加信息 p a n o r a m a 系统基本上是依照s t r e t c h 和l a r s o n 提出的五层参考模型实现的。 6 第二章w e b 信息集成系统及研究现状 2 2 2m e d i a t o r w r a p p e r 信息集成系统 随着信息技术在各行业的广泛应用,人们迫切需要集成大量半结构化或非 结构化的数据源,并要求系统具有可扩展性,以便于集成新增数据源。基于模 式集成的传统数据库集成方法已不适用于这种新的要求。w i e d e r h o l d 提出了 m q s ( m e d i a t o rq u e r ys y s t e m ) 体系结构,在此基础上通过对异构信息源的封装, 就形成了m e d i a t o r w r a p p e r 结构的信息集成系统。该类系统的体系结构如图2 - 4 所示。 包装器对特定数据源进行封装,将其数据模型转换为系统所采用的通用模 型,作为其输出模式,并提供一致的物理访问机制。中间层侧重于全局查询处 理、分解和优化,有一个使用通用模型描述的全局模式。它通过调用包装器或 其它中间层来集成数据源中的信息,解决数据冗余和不一致性,提供一致协调 的数据视图和统一的查询语言。通过在中间层( m e d i a t o r ) 和包装器( w r a p p e r ) 之间 分割处理任务,可以提高查询处理的并发性,减少响应时间。包装器既可与中 间层处于同一位置,也可与数据源处于同一位置,这取决于系统的性能要求、 数据源的归属关系及其访问控制权限。 图2 - 4m e d i a t o r w r a p p e r 结构系统的体系结构 m e d i a t o r w r a p p e r 结构的信息集成系统由下列一些特点: 用户的查询提交给中间层。中间层具有一个其所集成数据源的全局视 图,该视图叫做中间模式( m e d i a t o r s c h e m a ) ,由一组虚拟的关系组成, 其对应于下属数据源中的数据信息。中间层将用户的查询分解成对多 个数据源的查询,并合并每个数据源返回的结果,形成最终的查询结 果返回给用户。另外,为了进行查询分解中间层必须包含一组信息源 第二章w e b 信息集成系统及研究现状 模型,每个信息源模型描述了该信息源的内容、属性、内容完备性约 束、可信度以及查询处理能力,查询分解的过程要以信息源的上述一 系列属性为根本依据。 中间层不直接与数据源进行联系,它直接向w r a p p e r 发送查询请求; w r a p p e r 执行收到的查询,并将结果返回给中间层。 由于采用m e d i a t o r w r a p p e r 结构,这种信息集成系统不仅能够集成结 构化数据源如关系型数据库、面向对象数据库等,而且可以集成半结 构化数据如h t m l 、x m l 和无结构的数据如纯文本文件等。 目前,很多的信息集成系统都采用了m e d i a t o r w r a p p e r 体系结构,国内外 研究开发的基于m e d i a t o r w r a p p e r 的信息集成系统很多,例如:斯坦福大 学开发的t s i m m i s 系统和i n f o m a s t e r 系统,a t & t 实验研究所研制出的 i n f o r m a t i o nm a n i f o l d ( i m ) 系统,南加利福尼亚大学的s i m s 信息系统以及在 s i m s 基础上面向i n t e f n e t 扩展形成的w e b 信息集成系统a d r i a n e 。国内的 东南大学研制的v e r s a t i l e 系统以及g a l a x y 系统等。 2 2 3 基于多a g e n t 的信息集成系统 信息集成技术与分布式人工智能领域的a g e n t 和多a g e n t 系统( m u l t i _ a g e n t s y s t e m ) 相结合产生了基于多a g e n t 的信息集成系统。它采用a g e n t 管理这些信 息源,通过多个a g e n t 之间的交互与协作来实现多信息源的集成。这种系统中, 每个a g e n t 都是一个信息中间层,通过它可以访问多个异构的信息源。 2 2 3 1 a g e n t 和多a g e n t 系统 近年来a g e n t 技术得到了空前的发展,但学术界对a g e n t 的定义尚未统一。 一般来说:a g e n t 是一个具有控制问题求解机理的计算单元,具有自治性、社 交能力、响应性、主动性等特性,并具有自决定能力。 2 2 3 2 多a g e n t 系统 多a g e n t 系统m a s ( m u l t i - a g e n ts y s t e m ) 是当今国际上人工智能中的前 沿学科,是分布式人工智能的一个重要分支。它的目标是将大而复杂的系统( 软 硬件系统) 建造成小的、彼此相互通信及协调的、易于管理的系统。m a s 可以 第二章w e b 信息集成系统及研究现状 看作是采用由下至上设计方法设计,首先定义一组分散自治的a g e n t ,然后研 究怎样完成一个或多个a g e n t 的任务求解。由于m a s 更能体现人类的社会智 能,具有更大的灵活性和适应性,更加适合开放、动态的世界环境,因而受到 越来越多人的重视。 2 2 3 - 3 基于多a g e n t 系统的信息集成 由于信息集成系统是一个庞大的对多个异构信息源进行处理的系统,对于 各种不同的信息源都要构建特定的信息处理模块,信息集成的过程就是这些信 息处理模块相互通信、相互协作的过程,很明显:信息集成系统与多a g e n t 系 统( m u l t i _ a g e n ts y s t e m ) 有着形式和本质上的相似,启发我们利用多a g e n t 系统 的理论来构建我们的信息集成系统。 微电子和计算机协会( m c o 开发的i n f o s l e u t h 就是采用多a g e n t 系统的信 息集成系统。i n f o s l e u t h 采用分布式方法来实现中间层,中间层由一组协作信息 a g e n t 组成,例如查询a g e n t 、任务执行规划a g e m 等等。对数据源进行包装的 w r a p p e r 形成一个简单的信息a g e n t 。多个a g e n t 之间利用通讯语言k q m l 进 行通讯和协作,以完成用户的查询。i n f o s l e u t h 系统的体系结构如图2 5 所示: 图2 - 5l n f o s l e u t h 系统体系结构 2 2 4 信息集成系统分类 信息集成系统历经几十年的发展,出现了各种各样的信息集成系统,其分 9 第二章w e b 信息集成系统及研究现状 类的依据有:是否有全局模式、是否实现数据提取以及集成的数据源的类型。 数据仓库系统将被集成数据源的数据提取到本地存储,具有查询速度快、 效率高、实现简单等特点,但是不适用于动态变化强烈的数据源的集成;其他 不实现数据本地存储的集成系统能够支持实时查询,但是查询处理复杂,且数 据源的维护困难。多数据库语言系统没有全局数据模式,实现与处理简单、高 效,读写能力强,但其低透明度增加了用户的负担,且容易产生数据的不一致 性;模式集成系统具有全局数据模式,具有很高的访问透明度以及较强的读写 能力和一致性控制,但全局模式的形成较难,局部模式的更改通常导致新的模 式集成过程,系统维护、演化困难。很多的信息集成系统只能集成数据库信息, 而基于m e d i a t o r w r a p p e r 的集成系统可以集成范围广泛的数据源,且高度模块 化和分布性,系统实现灵活、重用性、扩展性强,但仅支持只读查询。具体系 统可根据应用需求混合采用几种方法,比如根据透明度要求采用多数据库语言 系统或模式集成系统集成企业内的数据库,而企业间的信息集成由于数据源经 常变化,可以采用多数据库语言系统,若涉及非数据库信息的集成,就要采用 m e d i a t o r w r a p p e r 结构的信息集成系统。信息集成系统的分类树如图2 - 6 所示: 图2 - 6 信息集成系统分类树 2 2 5 基于m e d i a t o r w r a p p e r 的信息集成系统原理总结 本节我们总结了不同集成实现技术中本质上相同的东西,描述了主要的集 成步骤,给出了信息集成的基本理论。信息集成的基本步骤如下: 1 分析待集成的数据源和信息集成需求,建立合适的全局数据模型。信 息集成系统( 以后如不特殊指明,“信息集成系统”指的都是“基于 1 0 第二章w e b 信息集成系统及研究现状 m e d i a t o r w r a p p e r 的信息集成系统”) 必须有一个合适的全局数据模型,以描 述全局模式并构造一致的查询语言。模型的选择必须权衡其建模能力和查询分 解、转换的简单性,还要考虑应用需求和数据源的类型。 2 封装待集成的数据源。不同数据源有不同的数据模型和访问接口,如 w e b 等半结构、非结构化数据源甚至还没有一个良好的模式。在分析并完全了 解数据源模式的基础上,利用前面所设计的全局数据模型对其进行封装以得到 一致的输出模式和访问接口,从而将不同数据模型的集成简化成相同模型的集 成,同时定义输出模式到局部模式的语义映射。封装结果为组输出模式和与 数据源中该模式相关的实例子集。封装有直接函数调用、直接数据库访问和用 户仿真等几种方法,其数据提取规则可以手工生成或者自动生成。 3 全局模式集成与数据集成。封装后的数据源包含一个输出模式和一组实 例( 就是数据) ,相应的信息集成包括模式集成和数据集成两个方面,它们最终 分别生成全局模式和全局数据集,从而实现信息集成系统。 1 ) 模式集成:根据分析得到的模式知识,解决已封装数据源输出模式间的 差别,形成一个描述应用领域的全局模式,并定义全局模式到各个数据源输出 模式的语义映射。语义映射是一组称为语义映射关系式或查询关系断言式( q c a ) 的规则集,是查询规划的依据。语义映射是领域专家和系统设计员在系统设计 时共同定义的,一般采用类似h o r n 规则、描述逻辑等声明机制来表达,使得 所有中间件的基于规则或推理演绎的查询规划算法是一致的,便于系统的演化。 语义映射关系式有以全局作为视 ( g l o b a l a s v i e w ,g a v ) 和以局部作为视图 ( l o c a l a s v i e w ,l a y ) 两种定义方式,如图2 7 所示: 图2 7 g a v 和l a v 两种方式各有优缺点。g a v 方式将全局模式定义成数据源局部模式上视图 第二章w e b 信息集成系统及研究现状 的公式,即语义映射关系式一边为全局视图,另一边为获取该视图数据必须执 行的所有数据源子查询。对于全局查询,只要简单将该查询中的全局视图用其 定义公式展开即可得到相应的子查询,但新增数据源时必须修改大量相关中间 件的定义。l a v 方式反过来将数据源模式定义成全局模式上视图的公式,系统 必须通过推理演绎才能将全局查询转换成数据源上的子查询,计算复杂度高, 但新增数据源时只涉及对该数据源的建模和语义映射。 2 ) 数据集成:可采用虚拟( v i r t u a l ) 或具体化( m a t e r i a l i z e d ) 方式来合并各数 据源中与输出模式相对应的数据。在虚拟方式中,中问层不备份任何数据,只 是作为用户与数据源之间的接口,通过查询规划将全局查询转换成数据源上的 查询命令,其查询代价较高。具体化方式中,中间层备份全局模式的数据,全 局查询直接在集成系统本地执行,查询效率高。但同步更新备份数据困难且存 储空间需求大,比较适合于数据仓库这类实时性要求不高的应用。数据集成过 程中必须进行实体辨别和解决值冲突。实体辨别是指鉴定来自不同数据源中的 数据是否描述客观世界中的同一实体,有关键字匹配、奄表匹配、比较匹配和 历史匹配等多种方法;而解决值冲突则是在合并这些匹配数据时解决其不一致 性,后者必须在前者的基础上进行。可根据数据集成所完成的处理任务将其分 为聚集、联合、完全集成、抽象4 个级别i l j 。数据集成以模式集成的结果为根 据,其产生的错误必须反馈给模式集成部分以便修正。在具体化集成方式中, 数据集成只进行一次;而在虚拟集成系统中,对每次全局查询都要进行一次数 据集成,代价太高。因此,有些系统只完成部分数据集成,而通过增补数据的 来源等元信息,以供应用作进一步处理。 4 全局查询处理和查询规划 ( 1 ) 全局查询处理下图2 - 8 所示就是一个典型的全局查询处理结构,包 括以下处理过程。 第二章w e b 信息集成系统及研究现状 抽 图2 - 8 全局查询处理过程 查询分析:中间层首先对全局应用向其提交的全局查询进行分析和合法 性检验,以确保其语法、语义正确性。 查询规划:中间层为合法的全局查询选择数据源,并将其分解为一系列 相应数据源上的予查询和一个全局查询余项( 即包装器不能完成而必须由中间 层完成的处理) 。系统必须充分利用包装器的处理能力( 如选择、投影、连接、 聚集、分组等) 来优化查询计划( p l a n ) ,让包装器完成尽可能多的处理,减少子 查询结果的传输,也使局部查询能最大程度地并发执行。 局部子查询执行:中间层将分解得到的子查询分派到合适的包装器执 行,包装器进一步将子查询转换成可由数据源完成的查询形式,并将结果返回 给中间层。为了得到完整的全局查询结果,系统有时必须执行全部查询计划; 有的系统为了提高效率,只执行了部分查询计划直至满足某种停止条件,如数 据的质量达到要求。 计算最终结果:中间层聚集子查询结果并完成剩余的处理,得到全局查 询结果,响应全局应用。 为了完成以上工作,中间层利用全局模式和输出模式到全局模式的映射知 识来完成全局查询分解;包装器需要输出模式和输出模式到局部模式的映射, 以便完成查询的转换。 ( 2 ) 查询规划查询规划是查询处理的核心任务,也是一个大量可能数据 源和不同操作序列的复杂组合问题,其算法既要快速生成查询计划,又要有好 的执行时间、费用等计划质量。传统规划方法要么没有解决质量优化,要么通 第二章w e b 信息集成系统及研究现状 过先找到所有可能的查询计划,再优化每个计划,最后选择并执行最优的计划。 这种方法可扩展性差、效率低。将查询规划看成人工智能中的一种规划问题, 可以构造独立于领域的规划算法,不同领域具有一致的规划引擎,不同的只是 输入的领域规格说明,提高了算法的灵活性、适应性和扩展性。文献【4 j 提出基 于重写规划的规划方法,将数据源选择和基于代价的优化相结合,快速产生一 个初始计划,然后应用一组重写规则反复转换和优化当前计划,直到满足质量 要求。其中,重写规则集采用声明方式定义,分别来自于分布式环境、关系代 数理论和语义映射式。来自分布式环境的规则说明了数据源的处理能力和满足 同一查询的可选数据源组合( 通常作为修复规则,即当某个被选数据源失败时, 利用其等价组合替换,而不必重新规划和执行) ;来自关系代数理论的重写规则 主要根据关系代数操作的交换律、结合律和分配律属性,应用它们可以减少运 算的中间结果;来自语义映射式的规则用于数据源选择、异构性解决等问题。 建立合适的全局数据模型、封装待集成的数据源、全局模式集成和数据集 成、全局查询处理和查询规划这四大功能模块合理的组合在一起,就构成了如 图2 - 9 所示的功能完备的信息集成系统。 2 3w e b 信息集成系统 图2 - 9 信息集成典型过程 顾名思义,w e b 信息集成系统就是应用于w e b 的信息集成系统。w e b 信息集成系统与一般的信息集成系统在功能要求、实现方法、体系结构等方面 基本上是一样的。但是,与一般的信息集成系统的区别在于:w e b 信息集成系 第二章w e b 信息集成系统及研究现状 统的集成对象全部是w e b 上的数据源,包括h t m l 页面、电子邮件、纯文本 文件等。集成对象的不同决定了w e b 信息集成系统又有一些不同于一般信息 集成系统的特点。这一节我们就从w e b 数据源开始阐述w e b 信息集成系统的 一些新的特性。 2 3 1w e b 数据源 w w w 通过大量的w e b 页面和页面之间的超链接将网络上的信息联系了 起来。从w w w 诞生之日起,网络上w e b 页面的数量就一直处于加速膨胀之 中。正是这几乎无穷尽的w e b 页面构成了人类有史以来最庞大的知识库。w e b 信息集成技术就是对这一知识库加以处理,使其能更好的为人类服务。相比于 传统的数据源,w e b 数据源具有下述的一些特点: 1 w e b 数据源中的数据呈非结构化或半结构化特征,没有明确的模式信 息:w e b 使用h t m l 作为内容的表示语言,这种表示是面向显示而不是面向 内容的。在h t m l 页面中,数据和控制页面显示的格式标记是不加区分的,人 们通过特定的表示方式和字面内容了解页面的内容。这种方式适合人类的阅读, 但是却无法让机器理解。因为页面本身不带有关于数据内容的结构化信息, w e b 上的数据是非结构化的,也有人称之为“半结构化”的。半月# 结构化数 据的主要特征如下: 数据模式并非事先已知,而是隐含在数据中; 数据模式相对灵活,且变化频繁: 数据模式是描述性的,而非声明性的。它能解释当前数据的内容,但是 对于其他数据则有可能出现冲突; 数据类型限制弱。对于不同的对象,同一属性可能有不同的类型。 2 数据源具有更大的自治性:由于各个站点由不同人员按各自的习惯和 风格设计、实现和维护,数据源从本质上讲是不可控的。不确定其某一特定的 时间存在与否,不知道其数据是否已经更新,总之对于w e b 数据源,没有任 何东西是可以预知的。 3 数据更新和变化频繁:w e b 信息集成系统必须应付不断变化和增长的 数据,而且其数量和容量可能无法预料。 第二章w e b 信息集成系统及研究现状 2 - 3 2w e b 信息集成中的关键技术 在上一节,详细论述了w e b 数据源独有的特点。由于这些特点的存在, 使得在w e b 数据源的集成中,相对于传统的信息集成系统,有很多新的问题 需要解决,出现了很多新的研究课题,如w e b 数据的建模和处理、w e b 数据 源描述方法和访问模型、中间模式的定义和数据映射、知识的获取等。下面将 对这些新的研究课题进行详细的论述。 2 3 2 1w e b 数据的建模和处理 由于w e b 数据的半结构闫# 结构化特征,使得已有的、建立在结构化数据 模型上的各种理论和方法( 如数据挖掘、异构数据集成) 无法直接应用到w e b 环 境中。因此对于w e b 数据的研究引起了广泛的兴趣,这些研究主要集中在两 个方面:w e b 数据建模和w e b 数据查询。 1 w e b 数据建模:目前,关于w e b 数据的模型有两类。第一类是关于 w e b 结构的表示模型,这种模型采用图表示法:页面文档是节点,链接是有方 向的弧,弧的标记是u r l 。站点结构的数据模型被广泛的应用在搜索引擎中: 通过页面之间的链接计算内容的相关性并对页面进行分类。另外,站点模型也 被很多的w e b 查询语言用来快速的从站点中检索需要的信息。另一类是对 h t m l 页面中的半结构化数据建模。半结构化数据模型通常用带标号的有向图 表示,其中较有影响的是o e m ( o b j e c te x c h a n g em o d e l ) 数据模型。o e m 是l o r e l 系统基于x m l 的数据模型,它将x m l 元素表示为元组 ,其中e i d 是唯一的元素标识符,v a l u e 为字符串常量或包含子对象的复杂值。子对象可以 是x m l 标记名、属性名,值元组的有序列表、相互链接的元素的有序列表,或 者是予元素的有序列表。这种模型能方便转换成带标号的有向图,并且能同时 查看) 0 地数据的语义和字面内容。 2 w e b 数据查询:第一代的w e b 查询语言以页面为单位,目标在于将 基于内容的查询和基于结构的查询结合起来。这类语言包括:w 3 q l ,w e b s q l 和w e b l o g 。第二代的w e b 查询语言在第一代语言的基础上增加了访问w e b 对象内部结构的方法,并且能够为查询结果创建复杂的对象。这类语言的些 代表是:w e b o q l ,基于“超树”数据模型;f l o r i d ,基于框架表示逻辑。随 着x m l 规范的出台和推广,相应的出现了x m l 的查询语言,如x m lq
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年盐池县带编教师招聘考试备考题库及答案解析
- 2027届丽水市中考数学全真模拟试卷(含答案解析)
- 2026年托里县带编教师招聘笔试备考试题及答案解析
- 2026年中江县带编教师招聘考试备考题库及答案解析
- 深圳大学学位英语考试试题及答案
- 江南大学学生手册
- 2026年上蔡县带编教师招聘笔试模拟试题及答案解析
- 2026年青冈县带编教师招聘笔试备考试题及答案解析
- 2026年会昌县带编教师招聘笔试模拟试题及答案解析
- 2026年泸定县带编教师招聘考试备考题库及答案解析
- 2026电动重卡充电站投建运营与产业洞察报告
- 2026年安全生产法知识竞赛试题库及答案
- 小学五年级英语 Unit 2 Id like a hamburger(Part CD)任务型教学与跨文化交际教案
- 2026年四川泸州市江阳区社区工作者招聘考试试卷-含答案解析
- 湖南文艺出版社四年级上音乐全册教案
- 建筑工程管理专业中级职称理论考试题库判断题答案及解析(2026年)
- 2026秋新版苏教版小学科学四年级上册教学设计(附目录)适用于新课标
- 2026年浙江杭州市中考英语试题(附答案)
- 2026年度医师定期考核【执业-2】
- 秸秆及畜禽粪污肥料化利用升级改建项目可行性研究报告模板-立项备案
- 实验室安全考试试题及答案
评论
0/150
提交评论