基于语义Web的本体映射方法综述_第1页
基于语义Web的本体映射方法综述_第2页
基于语义Web的本体映射方法综述_第3页
基于语义Web的本体映射方法综述_第4页
基于语义Web的本体映射方法综述_第5页
已阅读5页,还剩2页未读 继续免费阅读

基于语义Web的本体映射方法综述.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、计算机科学2 0 0 4 V 0 1 3 1 N 7 5 基于语义W e b 的本体映射方法综述 袁洋李善平 ( 浙江大学计算机学院杭州3 1 0 0 2 7 ) 摘要 本体之间的映射是语义W e b 发展中的一4 - i t :t - 问题。事实上,语义W e b 是由多种信息源组成的,每个信息 源都以某个本体的形式表示。为了实现这些信息源的信息共事,就要用副本体映射方法。本文首先计论了本体映射的 三种体系结构。然后按照E R a h m 提出的分类标准,对现有的一些主要的本体映射方法进行归纳。最后,给出了4 种 方法的比较分析。从中可以看出各种独立匹配方法的组合将是一个板有希望的发展方向。

2、 关键词语义W e b ,本体,映射,分类,方法 T h eO v e r v i e wo fO n t o l o g yI n t e g r a t i o nA p p r o a c h e sB a s e do nS e m a n t i cW e b Y U A NY a n gL IS h a n P i n g ( T h eC o m p u t e rC o l l e g eo fZ h e j i a n gU n i v e r s i t y ,H a n g z h o u3 1 0 0 2 7 ) A b s t r a c t0 n eo ft h e

3、i m p o r t a n tp r o b l e m si nt h ed e v e l o p m e n to ft e c h n i q u e sf o rt h es e m a n t i cW e bi st h em a p p i n go f o n t o l o g i e s I n d e e d ,t h eW e bi sc o n s t i t u t e db yav a r i e t yo fi n f o r m a t i o ns o u r c e s ,e a c he x p r e s s e do v e ra c e r

4、t a i no n t o l o g y I no r d e rt os h a r et h ei n f o r m a t i o na m o n gs u c hs o u r c e s ,t h e i rs e m a n t i cm a p p i n gi sr e q u i r e d I nt h i sp a p e r ,f i r s tw e d i s c u s st h et h r e ei n t e g r a t i o na r c h i t e c t u r e s T h e nw er e f e rt ot h et a x

5、 o n o m yw h i c hi sp r e s e n t e db yE R a m h ,a n da p p l y t os u m m a r i z ev a r i o u sm a j o ro n t o l o g ym a p p i n ga p p r o a c h e s ,A tl a s t ,w ec o m p a r ef o u rt y p i c a lm a p p i n ga p p r o a c h e s f o l l o w i n gt h ec r i t e r i a a n dc o n c l u d et

6、h a tt h ec o m b i n a t i o no ft h ei n d i v i d u a lm a t c h e r si Sap r o m i s i n gd i r e c t i o n K e y w o r d sS e m a n t i cW e b ,0 n t o l o g y ,M a p p i n g ,T a x o n o m y ,A p p r o a c h 1 引言 现在,互联网已成为人们获取信息最重要的途径,其规模 也在以惊人的速度增长着。然而,当前互联网上的绝大多数信 息是以人类能理解的格式( 例如,H T M L ) 来

7、表示的,而作为智 能程序的软件代理( s o f t w a r ea g e n t ) 并不能理解和处理这些 信息,互联网的潜力还远远没有挖掘出来。 为了解决这个问题,研究者们提出了下一代互联网的概 念语义W e b t “。在语义W e b 上,信息是以结构化的形式 表示的,而本体则描述了其中的语义本体是对概念世界的显 式说明,它允许人们把领域内的知识表示成概念的分类体系 ( t a x o n o m i e so fc o n c e p t s ) ,概念有自己的属性,概念之间关系 则存在各种关系。当信息用本体来标记后,软件代理就能理解 其意义,也就可以自动地完成互联网上的信息收集

8、和集成。 由于本体的多样性,要想完成信息交流的任务就必须在 本体之间架起语义映射的桥梁。最初,这些映射过程都是由人 手工完成的。但随着语义w e b 的发展。在w e b 上用本体表示 的信息越来越多,仅仅由人来完成这些工作已经力不从心,因 而迫切需要发展一些方法,来自动地或半自动地完成这种映 射过程。 使用概念模型的信息集成领域的研究可以分成发现、表 达和执行三类【2 ,本文研究的是如何发现本体之间的语义联 系。 2 问题描述及映射框架 2 1 问题描述 由于本体的创建者不同,使用的建模方法不同,因而即使 对同一个领域内的问题建模,不同的领域专家开发出来的本 体必然存在着差别。本体映射的目的

9、就是找到这些本体之间 的语义联系。其中最简单的映射关系是一对- - ( 1 :1 ) 的映射, 如图1 所示。 F ir S t _ n a m e :t e x t L a s t n a m e :t e x t A g e :n u m b e r C o u n t r y :s t ri n g ( a )( b ) 图I 两个简单本体之间的映射关系 本体E m p l o y e e 中的属性N a t i o n a l i t y 和本体P e r s o n n e l 中的属性C o u n t r y 是1 :1 的映射关系。而属性B i r t h d a t e 和

10、A g e 之间也是1 :1 的关系,但它们并不是简单的等价关系,其 转换规则是:A g e = T h i sy e a r - - B i t h d a t e 。 其它的映射关系包括1 :n ,n :1 ,n :m ,如属性N a m e 与 F i r s t n a m e 和L a s t n a m e 之间就是1 :n 的关系。 2 2 映射框架 处理本体映射问题的基本体系结构有三种n 】:单本体结 构、多本体结构及混合结构。如图2 所示。 在单本体结构中,一个全局的本体为具体的语义说明提 供了一个共享的词汇表。所有的信息源都联系到这个全局本 体上,因而它们在语义上是一致的。

11、全局本体可以是许多模块 化的子本体的组合。 在多本体结构中,每一个信息源都有自已的本地本体,它 * ) 基金项目:国家自然科学基金资助项目( 6 0 1 7 4 0 5 3 ) 。袁洋硕士生,从事语义W e b 本体论研究李善平教授,从事嵌入式系统。人工智能 研究。 5 蒸 万方数据 们并不一定使用同样的词汇表。每个本体都是独立发展的,它 们之间有松散的联系。要完成本体之间的互操作,必须建立映 射的规则( 链接) 。 a ) 单一本体结构 本地本体。但本地本体是在一个全局共享的词汇表下发展起 来的。共享词汇表定义了领域内的基本术语,在本地本体中这 些术语可以组合起来表达复杂的语义。 总的来说单

12、本体方法建立在紧密联系的基础上,缺乏足 够的灵活性,不能适应大的开放式的应用环境。一旦加入了新 的信息源,常常会导致全局本体的变化,因而不太适合于大多 数本体映射应用环境。而多本体方法和混合方法更适合于完 b ) 多本体结构 c ) 混合本体结构 图2 三种体系结构 在混合结构中,它综合了前两种方法的基本特征以克服 它们的不足之处。像多本体方法一样,每个信息源都有自己的 这两种情况下,都需要发展一些协助映 5 1 方法分类 一般来说,完全自动地实现本体之间的映射,而不需要人 的干预,这几乎是不可能的事情。因为本体内的一些潜在的语 义关系并没有以形式化的方式显式地表示出来,必须由人借 助已有的知

13、识和经验才能识别出这些信息。因而,本体映射所 用到的匹配方法应该提供一个可能匹配的候选结果列表,然 后由人来决定是接受,拒绝,还是需要改变后再接受。在此过 程中,人还能加入一些系统没有发现的映射关系。 本体映射中用到的方法主要可以按照E R a h m 提出的 分类体系进行如图3 所示的划分n 。 独立匹配方法匹配方法组合匹配方法独立匹配方法组合匹配方法 基于模式的;:_ 基于实例的方法混合匹配匹配 元梦慧结构警方法元多级慧 手工组合自组合 手工组合蝴组合 语言学方法基于约束的方法基于约束的方法语育学方法基于约束的方法 个小小小仓 名称相织经类型相似性 圆匹配I R 方法辅助佶惠 耩椿翱弛 喀

14、 图3 方法分类 本体映射时可能会用到多种匹配算法( 匹配器) 。我们可 以根据具体的应用要求灵活地选用不同的方法及其组合。在 具体实施时有一个如何组合使用它们的问题。我们可以在匹 配过程中先后使用多个匹配标准,这是混合匹配法。我们也可 以分别执行各个匹配算法,然后再将结果合并,这是复合匹配 法。 对于单独的匹配算法,我们可以考虑以下互不相关的分 类标准。 模式级与实例级前者只考虑模式信息,而不考虑实例 数据。模式信息包括名称,描述,关系,约束,等等。后者利用了 这两方面的信息。 模式级匹配方法值考虑模式信息,不考虑实例数据。可用 的信息包括本体模式元素的一般属性,如名称,描述,数据类 型,关

15、系类型( p a r t o f ,i s a 等) ,约束和模式结构等等。一般 地,一个匹配算法会找到多个候选结果,每个候选结果都有一 个介于0 到1 的数值表示它的相似程度。 实例级方法由于利用了数据实例的信息,因而和模式级 方法互为补充。它既可以和模式级方法一起使用,互相验证, 也可以单独使用。从实例数据中提取出模式元素特征的方法 多,如规则,神经网络,机器学习等。一般的实例级方法寻找的 是模式元素之间的匹配关系,要找到模式元素组合或结构的 6 匹配就需要比较这些元素组合的数据实例。显然,这样做要遇 到的主要问题是模式元素的可能组合空间是极其巨大的。如 果不加限制,这样的任务是根本不可能

16、完成的。 元素粒度与结构拉度前者只考虑本体中独立的概念元 素,后者还要考虑这些概念元素的组合。 元素级匹配考虑的是本体中的单个概念、属性或关系,而 不考虑这些逻辑概念之间的联系。也就是说,它在匹配父概念 时,并不会去考虑其子概念或与其它概念之间的关系。 与之相反,结构级匹配不光要考察单独的对象,还要考虑 它们之间的联系。结构匹配可能是完全匹配,也可以是部分匹 配,这取决于匹配所要求的完整性和准确性。理想情况下,两 个本体中相应结构的所有组成元素都能一一对应,即完全匹 配。但实际上,一个本体中的某些元素在另一个本体中找不到 对应部分,这时就只能达到部分匹配。针对复杂的情形,为了 提高效率,我们可

17、以在数据库中存储已知的等价模式,然后在 匹配过程中直接参考这些模式。 基于语言与基于约束前者基于语言( 如名称和描述文 本) ,后者基于基本的约束信息。基于语言的方法中最常用的 信息是元素名称。度量名称相似的标准有很多如等价关系, 同义关系,上义关系( h y p e r n y m ,若Y 属于X ,则X 是Y 的上 义词,如。“出版物”是“论文”的上义词) ,以及编辑距离( e d i t 万方数据 d i s t a n c e ) ,甚至词语的发音等。为了发现这些关系,通常都要 用到词典。在这方面,自然语言词典是很有帮助的。在具体应 用领域中,领域相关的词典由于含有领域知识( 常用的专

18、业词 汇,简写等) ,因而具有特别重要的价值。但是,当前可利用的 领域词典较少,需要研究者付出更多的努力。 自然语言中的一洞多义现象会极大地干扰名称匹配的过 程。为了减少由此产生的误配情况。需要由人或词典提供失配 信息。引入上下文内容,有助于在算法中自动利用失配信息。 这样的方法很类似于基于结构的方法,这也使得两种方法之 间的分别变得模糊。 本体模式中包含的约束信息,有数据类型、取值范围、唯 一性、可选性、关系类型和可选值等。如果要比较的双方都有 这样的约束信息,就可以它为根据来决定模式元素的相似性。 如果仅使用约束信息进行匹配,得到的往往是n :m 的匹 配结果。具有相同约束条件的元素可能有

19、好几个,例如,有好 几个元素都是s t r i n g 类型。为了进一步区分这些元素,可以和 其它的匹配方法( 如名称匹配) 结合起来使用。 一些结构信息也可以认为是约束信息,如整体与部分的 关系( p a r t o f ) 。这些信息告诉我们哪些元素属于同一个更高 级别的元素,这个过程可以在多级结构上传递地进行。当然, 这些约束信息也可以看作是结构信息,用结构匹配方法来判 定相似性。这样的匹配既考虑了拓扑结构,也考虑了不同的元 素类型和可能的不同类型的结构连接。 本体模式的结构是基于一些包容关系的分级结构。在执 行基于结构的匹配时,我们既可以从上到下,也可以从下到上 地遍历整个模式结构。比

20、较起来,从上到下的算法花费的代价 较小,因为一开始所要比较的对象比较少,以后的比较也只要 用到前面的比较结果。然而,从实际来看,高层元索的差别是 很大的,而底层元素则比较相似。这样的话,从上到下的遍历 更有可能得到错误的结果。相反,如果从下到上的遍历,即使 中间层和高层结构差别很大,仍然能得到较好的匹配结果。 匹配基数一些方法只产生1 :1 的映射关系,另一些方 法会产生1 :n 或n :1 的映射关系。匹配基数又分为局部的和 全局的。如果只在一条映射规则中考虑,则是局部的。如果在 不同的映射规则中考虑,那就是全局的。例如,在两条映射规 则中,概念C 1 分别和T 1 ,T 2 相似,则其局部

21、基数是1 :1 ,全 局基数是1 :n 。 现有的匹配方法大多是把一个本体模式中的每一个元素 与另一个本体模式中具有最高相似性的元素匹配。这样产生 的结果在局部是1 :1 的匹配,在全局则是1 :1 或1 :n 的映射 关系。现有的大多数方法都不能产生局部和全局1 :1 和n :m 的映射关系,要产生这些映射关系需要在匹配算法中采用更 复杂的标准。 辅助信息大多数匹配方法不仅仅依赖所输入的本体信 息,还会用到一些辅助信息,例如字典,以前的匹配结果,还有 用户的反馈。 5 2 不同方法的结合 。每种匹配方法利用了不同的信息,对于一个给定的匹配 任务,各有不同酌适应性和价值。因而,组合使用几种方法

22、比 单单采用一种方法会产生更好的结果。组合的方式有两种:混 合方式集成了多种标准,复合方式则合并各个独立执行的匹 配方法的结果。组合多种匹配方法也为同时进行评估提供了 可能。 混合匹配方法在整个过程中采用了多个标准。和多个匹 配方法的单独执行比较起来,它可以提供更好的候选结果和 更好的性能。由于仅符合一种标准的候选结果可以在早期被 排除,以及在匹配过程中要综合考虑多种标准,混合匹配方法 效率更高。结构级匹配也能从与其它方法如名称匹配联系使 用中得到好处。一种组合结构级和元素级匹配的方法是先用 一种方法产生部分映射,然后再用另一种方法完成映射。 混合匹配方法可以提供更好的性能,因为它可以减少遍

23、历整个模式结构的次数。例如,元素级匹配的混合方法可以在 每个S 2 元素上同时测试多个标准,然后再测试下一个S 2 的 元索。 另一方面,复合匹配方法则把几个独立执行的匹配方法 的结果合并起来,这些方法中也可以包括混合方法。这种合并 多个匹配方法的能力使它比混合方法具有更大的灵活性。混 合方法通常用硬连接的方法组合同时执行或以固定次序执行 多个匹配方法。与之对比,复合方法允许我们以模块化的方法 选择所需的方法。例如,我们可以用机器学习的方法组合独立 的匹配方法。而且,复合方法在执行顺序上没有特别的要求, 我们可以让它们同时执行。也可以让它们顺序执行。在后一种 情况下,前面执行的匹配方法的结果可

24、以被后面执行的方法 利用,以取得更好的结果。 匹配方法的选择、执行次序的决定和独立运行结果的合 并,这些既可以由匹配方法本身自动决定,也可以由人来决 定。自动化的方法可以减少人的参与,但是很难获得一个适合 于不同应用领域的通用的解决办法( 虽然可以通过调整参数 来进行控制) 。作为可选的方案,可以由人来直接选择匹配方 法,决定执行次序,和如何合并结果。这样更容易实施,也给了 用户更多控制的余地。在任何情况下,用户的参与都必不可 少,因为匹配方法本身只是提供一些候选结果,最终需要用户 来决定是接收,拒绝,还是改变结果。 为了处理复杂的匹配任务,还需要在匹配过程中支持多 个用户的迭代开发。在复合方

25、法中,各个匹配算法可以按照一 定的顺序执行,用户提供的匹配结果也可以作为其中一种独 立的匹配算法。对于用户提供的匹配输入,复合匹配方法必须 意识到它的权威性,不会去改动它。而把精力放在解决不匹配 部分上。 下面,我们按照上面的分类标准讨论一些主要的匹配算 法。 4 原型方法介绍及其比较 C u p i d 5 C u p i d 是一种基于元素级匹配和结构级匹配的 昆合方 法。它可用于数据库、本体论等多种领域的匹配任务。其思想 是,如果两个概念的子概念是相似的,那么这两个概念就趋向 于相似;如果两个概念具有相似的祖先那么它们也趋于相 似。为了处理同义词、缩略语、首字母缩写,它用到了辅助的信 息

26、源,如词典。为了解决共享元素的同题它在概念树中加入 辅助节点以反映共享节点和父节点之间的多重关系。 整个算法分成三步。第一步作语言学上的元素级匹配,并 通过名称、数据类型和领域进行分类。这个过程中。复合名词 被分解成单个词( 如,C o m p a n y N a m e 变成 C o m p a n y , N a m e ) ,按照数据类型,语义内容归入不同的类别,然后在每 个类别内计算概念元素对之间的语言相似系数,计算中用到 了子串匹配和辅助信息源。第二步,把原来的模式转化成一棵 概念树。作自底向上的结构匹配。两元素之间的相似性取决于 它们的语言相似性以及它们的叶子集的相似性。如果算出的

27、 相似系数超过了阈值,那么就增加其叶子集的相似系数。之所 以关注叶子集是基于这样的假设,叶节点包含了更多的信息, 而且,与中间节点相比,在不同的本体模式中的变化较少。这 7 万方数据 一步计算出匹配概念对之间的语言相似系数和结构相似系数 的加权平均值。第三步,用这些加权平均值来选出匹配结果。 这一步是和具体的应用领域相关的,在C u p i d 算法中没有详 细研究。 S i m i l a r i t yF l o o d i n g ( S F ) 6 S F 的思想是基于相邻概念节点之间的相似传递性,也就 是说如果两个概念节点的邻近节点是相似的,那么它们趋向 于相似。S F 也是一种综合

28、使用了名称匹配和结构匹配的混合 方法。首先,它把模式信息转化成有向图( 1 a b e l e dg r a p h ) ,然 后通过简单的名字匹配得出各个节点之间的初始化相似系 数。这时的结果是相当粗略的,不能准确地反映节点之间的语 义关系。接着,它用S F 方法对初始系数进行迭代计算,直到 得到收敛值,也就是各个节点对之间最终的相似系数。最后, 它用一些过滤方法从数值最高的几个候选节点中找出最合适 的一个。与其它模式级匹配方法不同的是,它并没有使用词 典,没有利用术语之间语言学上的语法关系。 G L U E 7 G L U E 系统用机器学习的方法来完成不同本体之间的 匹配任务,其思想是多

29、策略学习。它代表了一种自动合并不同 匹配器( 1 e a r n e r ) 匹配结果的组合方法,产生的是原子级的1 : 1 的映射关系。除了名称匹配器之外,它还用到了几个在预处 理阶段经过训练的实例级匹配器。在预处理阶段,用户先给出 一些映射实例,然后用这些实例训练l e a r n e r 发现其中特有 的实例模式( p a t t e r n ) 和匹配规则。用这些模式和规则去匹配 整个本体模式,得到候选值的列表。 一个全局的匹配器用同样的机器学习方法融合这些由不 同l e a r n e r 得出的匹配候选值列表,得到一个综合的列表。在 预处理过程中它也经过了训练,以决定每个l e a

30、 r n e r 的权值。 由于是组合式的匹配方法,加入新的l e a r n e r 也很方便。 虽然此方法主要是面向实例的,但它也能利用模式信息。 此外,它还能加以扩展,利用用户提供的领域约束信息以提高 匹配准确性。 C O M A 8 C O M A 系统采用的是复合方法,可以灵活地组合不同的 匹配算法及其结果。它所应用的匹配器主要利用模式信息,如 元素和结构属性。与其他系统不同的是它可以重用以前的匹 配结果,这可显著地提高匹配效率。在匹配过程的不同阶段 C O M A 应用了不同的组合策略,如匹配结果的聚合以及匹配 候选值的选择。在匹配过程中,它把模式转化成带有根节点的 有向无环图,所

31、有算法都基于这个内部表示结构来工作。算法 产生的相似值矩阵保存在基于D B M S 的知识库中。每个模式 元素都以从根节点出发的完整的路径名称来唯一标识。 C O M A 中应用的匹配算法包括两种元素级的混合匹配 算法,N a m e 和T y p e N a m e ,以及三种结构级的混合匹配算法, N a m e P a t h ,C h i l d r e n 和L e a v e s 。其中,C h i l d r e n 和L e a v e s 在比 较元素相似性时都用到了T y p e N a m e 算法。 表1 不同方法9 比较 C u p i d S FG L U EC o

32、 M A 匹配粒度元素和结构级元素和结构级元素和结构级元素和结构级 匹配基数( 局部全部)1 :1 n :11 :1 m 2n 1 :1 n :11 :1 m :n 名称,同义关系,上义关名称简单的子串匹 基于名称名称同义关系名称,同义关系 系同形异义关系配 基于约束数据类型,应用约束 数据类型 用叶节点衡量的子树匹 方法分类结构匹配S F 方法叶节点 配 实例级方法W h i r l ,B a y w s i a nl e a r n e r 训练实例的比较查询有效 熏用信息词典。词汇表 词典以前的匹配结果 领域值 组合,用机器学习方法自动 匹配器组合方式混合混合组合 组合各个匹配器的结果

33、匹配和失配规则人机交互 用户输入用户可以调整加权系数可以交互方式影响执行过程 精化结果 结论本体是对领域知识概念的抽象和描述,其目的是 为了信息的共享和软件的重用。语义W e b 的发展为基于 I n t e r n e t 实现一个巨大的、虚拟的、分布式的知识仓库提供了 可能。而以本体形式表达的信息( 知识) 则是这个系统的基础。 为了实现在本体之间的信息交流,研究者提出了许多方法来 发展本体之间的语义联系。 在这些方法中,大多数是采用了多种匹配标准的组合方 法。这说明单一的标准并不能提供足够精确的结果。而通过匹 配算法的组合,采用多个匹配标准,可以挖掘多方面的本体信 息,从而有效地提高了匹

34、配质量。现有的方法大多数是基于模 式信息的,而对于大量的实例数据却没有考虑。未来的匹配算 法除了考虑更有效地利用模式信息外,还应该更多地挖掘实 例数据提供的信息,或者研究一些更有效地组合这些算法的 方法。 参考文献 1B e r n e r s L e eT ,H e n d l e rJ ,L a s s i l aO T h eS e m a n t i cW e b 8 S c i e n t i f i cA m e r i c a n 2 7 9 ,2 0 0 1 2 M a e d c h eA ,M o t i kB ,S i l v aN V o l zR M A F R A

35、A nO n t o l o g y M a p p i n gF r a m e w o r ki nt h eS e m a n t i cW e b I n :P r o e o ft h eE C A I W o r k s h o po nK n o w l e d g eT r a n s f o r m a t i o n L y o n ,F r a n c e ,2 0 0 2 3W a c h eH ,V 6 9 e l eT ,V i s s e rU e ta 1 O n t o l o g y B a s e dI n t e g r a t i o n o fI n

36、 f o r m a t i o n 一一AS u r v e yo fE x i s t i n gA p p r o a c h e s I n :P r o c o ft h e I J C A I 一0 1W o r k s h o p :O n t o l o g i e s a n dI n f o r m a t i o n S h a r i n g S e a t t l e W A 2 0 0 1 1 0 8 1 1 7 4R a h mE ,B e r n s t e i nP As u r v e yo fa p p r o a c h e st Oa u t o m

37、a t i c s c h e m am a t c h i n g V L D BJ o u r n a l 。2 0 0 1 ,1 0 ( 4 ) :3 3 4 3 5 0 SM a d h a v a nJ 。B e r n s t e i nPA ,R a h mE G e n e r i cs c h e m am a t c h i n g w i t hc u p i d I n :P r o e o ft h e2 7 t hI n t l C o n f o nV e r yL a r g e D a t a b a s e s ,2 0 0 1 4 9 5 8 6M e l

38、 n i kS G a r c i a M o l i n aH 。R a h mE S i m i l a r i t yF l o o d i n g :A V e r s a t i l eG r a p hM a t c h i n gA l g o r i t h m I n :P r o c o ft h e1 8 t hI n t l C o n f o nD a t aE n g i n e e r i n g ( I C D E ) S a nJ o s e C A 2 0 0 2 7D o a nA ,M a d h a v a nJ ,D o m i n g o sP ,

39、H a l e v yA L e a r n i n gt om a p b e t w e e no n t o l o g i e so nt h es e m a n t i cw e b I n :P r o c o ft h eW o r l d W i d eW e bC o n f ( W W W 一2 0 0 2 ) ,2 0 0 2 8D oHH E r h a r dR a h m :C O M A AS y s t e mf o rF l e x i b l e C o m b i n a t i o no fS c h e m aM a t c h i n gA p p

40、 r o a c h e s I n :P r o e o ft h e 2 8 t hI n t l C o n f O VV e r yL a r g eD a t a b a s e 。2 0 0 2 6 1 0 6 2 1 万方数据 基于语义Web的本体映射方法综述基于语义Web的本体映射方法综述 作者:袁洋, 李善平 作者单位:浙江大学计算机学院,杭州,310027 刊名: 计算机科学 英文刊名:COMPUTER SCIENCE 年,卷(期):2004,31(5) 被引用次数:11次 参考文献(8条)参考文献(8条) 1.Berners-Lee T.Hendler J.Lassila

41、 O The Semantic Web 2001 2.Maedche A.Motik B.Silva N.Volz R MAFRA-An Ontology Mapping Framework in the Semantic Web 2002 3.Wache H.Vogele T.Visser U Ontology-Based Integration of Information-A Survey of Existing Approaches 2001 4.Rahm E.Bernstein P A survey of approaches to automatic schema matching

42、 2001(04) 5.Madhavan J.Bernstein P A.Rahm E Generic schema matching with cupid 2001 6.Melnik S.Garcia-Molina H.Rahm E Similarity Flooding: A Versatile Graph Matching Algorithm 2002 7.Doan A.Madhavan J.Domingos P.Halevy A Learning to map between ontologies on the semantic web 2002 8.Do H H Erhard Rah

43、m: COMA-A System for Flexible Combination of Schema Matching Approaches 2002 相似文献(10条)相似文献(10条) 1.会议论文 李曼.杜小勇.王珊 面向语义Web的本体库管理系统研究 语义Web是由万维网之父TimBerners-Lee最早提出来的.语义Web是当前Web的扩展,是Web技术的未来发展方向.它通过结构化Web页面的内容,使Web上 的信息都有定义好的含义,从而实现人机以及计算机之间基于语义的信息交换,达到更加自动化和智能化的服务.本体在语义Web框架中处于承上启下的重 要地位,是构建语义Web的基础.

44、本体通过对概念的严格定义和概念与概念之间的关系来确定概念精确含义,表示共同认可的、可共享的知识.从而协助人机 和计算机之间进行语义交流.本体研究是语义Web领域的一项重要研究内容.本文将该系统应用到中国人民大学的主题语义Web建设中,并开始用它来开发和 管理经济学本体,希望在具体的应用中不断丰富和完善系统功能,并最终开发出一个通用高效的面向语义Web的本体库管理系统. 2.学位论文 宋峻峰 面向语义Web的领域本体表示、推理、集成及其应用研究 2006 现有的Web是由大量的HTML页面组成的,它的内容对于人而言,是可读、可理解的;对于计算机而言,是不可理解的,这使得Web上的内容难以由计 算

45、机做有意义的自动处理。而Web上的内容数量极其庞大且不断在增长,这又迫切要求Web上的内容是计算机可理解的,可以由计算机做有意义的自动处 理。针对上述问题,Tim Bemers-Lee提出了语义Web,它是现有Web的扩展,使得Web不仅是一个展示信息的平台,而且可以由计算机理解并做推理。 语义Web的基础之一是本体,本体的构建有赖于领域本体的表示、推理和集成。论文的研究集中在面向语义Web的领域本体表示、推理、集成及其应 用方面,做了以下几个方面的工作: 1.对常见的面向语义Web的本体语言及其形式化基础进行了研究;严格区分了本体和领域本体的定义,给出了两者间的关系介绍了面向语义Web的本

46、体语言的概况和关于描述逻辑的预备知识。重点分析研究了W3C提出的两种面向语义Web的本体语言:OWL DL、OWL Lite,详细分析了这两种语言的各个 基本元素和它们的形式化基础。领域本体是对领域概念化的显式的规格说明,一般用本体语言将这个显式的规格说明写出来。而本体是对世界概念化的 显式的规格说明,从理论上讲,关于这个世界只有一个本,但我们无法一次对整个世界建立起本体,只能逐个领域来建立领域本体,然后通过集成的方法 来形成虚拟的、惟一的、关于整个世界的本体。 2.提出了面向语义Web的领域本体表示、推理方法DORRSW和面向语义Web的多领域本体集成方法MDOISW介绍了建立本体的原则和构

47、建领域本体的一般 步骤,分析了领域本体集成的相关术语,并介绍了面向语义Web的领域本体集成的相关研究工作。基于这些预备知识,结合语义Web的特点和需求,选择 W3C制定的既能精确地刻画语义、又有高效的推理系统为之提供推理支持的OWL Lite作为面向语义Web的领域本体表示、推理和多领域本体集成中所使用 的本体语言,提出一个面向语义Web的领域本体表示、推理方法DORRSW和一个面向语义Web的多领域本体集成方法MDOISW,为创建面向语义Web的本体提供 了基础。 3.给出了信息检索模型的更为完整的定义;分析了理想化的逻辑视图生成函数下的信息检索性能;提出了语义Web上基于本体的信息检索模型

48、引入R Baeza-Yates等人对信息检索模型的定义,对该定义进行扩充和完善,从而得到了信息检索模型的更为完整的定义。通过对理想化的逻辑视图生成函数下 的信息检索性能进行分析,可知提高信息检索性能的关键是根据文档和用户信息需求的特点选取好的逻辑视图生成函数。在语义Web上,为了能够有效地 反映文档和用户信息需求的语义,即逻辑视图生成函数生成的文档逻辑视图、用户信息需求逻辑视图能有效地代表文档、用户信息需求,引入本体作为 表达语义的基础。以矢量模型为基础提出了语义Web上基于本体的信息检索模型,并从理论上验证了模型的实用性。 4.提出以战场空间本体作为网络中 心战的知识基础设施;提出了构建战场

49、空间本体的方法BOCA在网络中心战中,由于传感器网络的能力越来越强,军队可以实时地或近乎实时地获得关于 战场空间的大量信息;由于这些信息的数量太大,决策制定者越来越难以有效快速地处理这些信息,从而难以及时合理地决策。为了解决这个问题,我 们要在认知域中创建知识基础设施。网络中心战中,合适的知识基础设施是将信息优势转化为知识优势的前提。目前关于网络中心战的信息基础设施、 夺取信息优势的研究有很多,但关于构建网络中心战的知识基础设施、夺取知识优势的研究还很少。提出以战场空间本体作为网络中心战的知识基础设 施。网络中心战和语义Web都是规模巨大的分布式环境,所以构建网络中心战的战场空间本体可以采用面

50、向语义Web的本体语言,并且以面向语义Web的领 域本体表示、推理、集成方法为基础提出构建战场空间本体的方法BOCA。 3.期刊论文 沈国海.穆斌.胡学钢 语义Web本体及本体库系统设计技术 -微机发展2004,14(7) 当前的Web页面使用格式化表示语言描述信息,由于其以自然语言形式描述信息,因而不利于机器理解,为此而出现了语义Web这一研究领域,旨在实现 Web的机器理解.文中介绍了语义Web的结构,然后对语义Web模型中的本体模型作了深入的讨论,包括本体的概念、构建本体的原因以及一个本体库系统所 应具有的功能,并给出了有关功能结构图,最后讨论了未来的研究方向. 4.学位论文 鲁四喜 面

51、向语义Web服务的分布式服务发现研究基于本体图分割和前缀路由的语义Web服务发现 2008 语义Web服务(Semantic Web Serivces)技术通过使用本体为Web服务的描述提供语义信息,使Web服务能够为机器所理解成为可能,并且为Web服务的 自动发现提供了技术基础。语义Web服务通常由一系列的本体概念来描述,而现实世界中的许多领域本体由成千上万的概念组成,这些本体概念组合的数 量是海量的;同时,随着各类Web服务的涌现,如何有效、合理的管理由海量的本体概念组合所描述的海量Web服务,成为大规模服务发现系统的一个难 题。 本体图有着良好的层次结构和模块性,本文通过将本体图划分为少

52、量的语义相近的概念区域,将海量的服务描述的概念组合映射为有限的概念区域 组合,有效地将语义相似的服务进行分簇,进而构建出一个有结构的语义P2P网络来管理维护这些聚类的Web服务,从而有效地解决了由大规模本体概念 描述的大规模服务的发现问题。 本文首先给出了一种基于ROCK(A Robust Clustering Algorithm for Categorical Attributes)用于大规模本体图分割的ROCKOn2算法,该算法将本 体图划分为少量的语义相似的概念区域,为服务的分簇管理提供了基础;然后基于ROCKOn2算法提出了一种分布式服务聚类算法ROCKOn2Cluster,将服务 的

53、语义描述信息转化为概念区域序列,从而将语义相似的Web服务分类到相同的概念区域序列中,有效地将语义Web服务进行分簇;为管理这些分簇的 Web服务,本文给出了一种面向语义Web服务的分布式服务发现系统(Spring系统):Spring系统是一个有结构的融合语义P2P网络,通过本体图分割技术 (ROCKOn2算法)将本体图分割为多个区域,并为数据内容和P2P网络节点分配变长的概念区域编码;同时,它使用一种支持变长编码的基于前缀的语义路 由策略;实验及PISOMWare应用实例表明Spring系统具有稳定的路由跳数,有效的服务发现能力,适用于基于大规模本体概念的分布式Web应用。 5.期刊论文 李

54、永超.罗钧旻.LI Yong-chao.LUO Jun-min 语义Web中的本体推理研究 -计算机技术与发展 2007,17(1) 从语义Web的基本概念开始,介绍了语义Web的层次结构;介绍了本体的基本概念以及用于本体描述的几种语言.用W3C推荐的本体描述语言OWL描述了一 个本体实例,通过此实例对本体推理在本体建立中的冲突消解、描述优化、本体的合并和实例归类中的应用进行了研究,说明了本体推理在本体建立及本 体应用中的作用.本体技术是语义Web的核心技术,所以建立和维护本体是语义Web中的主要工作之一,而基于本体的推理可以帮助建立和维护本体. 6.学位论文 倪政林 基于分类查询的语义Web

55、服务本体发现研究 2006 语义Web和Web服务是WWW发展的两个重要趋势,这两种技术的结合产生了另一个新兴的研究课题语义Web服务。语义Web服务是指用语义Web标记 语言来描述服务的语义,并结合本体的思想,使Web服务成为计算机可以理解的服务本体,从而支持服务的自动发现、组合和执行等,为下一代的智能 Web服务打下基础。本文研究的是基于分类查询的语义Web服务本体发现技术,目标是使发现服务的效率及准确率得到提高。 本文对语义Web服务本体的分类、编码、系统化、查询及匹配进行了一定的研究,主要工作和成果包括以下几个方面:(1)对语义Web服务本体进行分 类研究。为提高服务本体的查询效率,对服务本体进行分类是必要的,这里把服务本体分为两类进行研究:一类本体是具有“类”特征的本体,把这 类服务本体按其层次关系再进行分类组织;另一类本体是特例,具有特例的本体可能是一个类,也可能就只有一个个体,对于前者按方法进行分类 组织,对于后者按集合关系进行组织。 (2)对分类进行编码的设计及特例组织的研究。对领域本体的类进行数字编码的介绍,提供了一个类

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论