已阅读5页,还剩53页未读, 继续免费阅读
(计算机应用技术专业论文)基于本体的信息检索的研究与应用.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 本论文是对作者毕业课题研究的一次全面论述和介绍 论文首先介绍了课题 的研究背景以及论文的结构 i n t e r a c t 已经成为当今和未来人们获取所需资源和信息交流的主要场所 随之 而来的就是网页资料呈几何级数爆炸性增长 但是由于网页的无结构性 超链接 的自 由无序 以及网页内容的海量性 多样性和动态变化 人们要搜索到真正想 要的信息不太容易 为了让网页发挥更大的潜能 万维网之父b e m e r s l e e 于2 0 0 0 年在x m l 2 0 0 0 的会议上正式提出了语义网 s e m a n t i cw e b 而本体位 于由文档描述到推理论证的层次 因此本体是实现语义网的关键层 本论文系统介绍了本体和语义网的理论和相关技术 在该理论的指导下 运 用相关技术构建了旅游领域的本体 在领域本体的构建过程中 采用了本体描述 语言o w l 作为编写语言 使用p r o t 6 9 6 3 1 构建目标领域的领域本体 本论文重点研究了基于本体语义网的检索 通过j e n a 设计了旅游领域的简单 的检索模型 本论文的研究意义在与将本体的概念引入到实际的应用层面 并结合检索研 究 尝试了将这一新概念应用到实践中的效果 关键词 本体信息检索语义网r d fo w lp r o t e 9 6 j e n a 中文图书分类号 1 1 p 3 1 1 5 2 a b s t r a c t t h i st h e s i si saf u l ld e s c r i p t i o n0 1 1a u t h o r sr e s e a r c hs u b j e c t f i r s t l y t h et h e s i s i n t r o d u c e st h er e s e a r c hb a c k g r o u n da n dt h es t r u c t u r e i n t e r n e th a sb e c o m et h em a i n w a yt og e tt h er e s o u r c ea n di n f o r m a t i o ne x c h a n g ei nt h ec o m i n gf u t u r e w i t ht h e w e b p a g ea r ei n c r e a s i n ge x p l o s i v e u s e r sh a st os e a r c ht h en e e d e di n f o r m a t i o ni ns o v a s ti n f o r m a t i o no c e a n w h i c hb el o o kl i k es e e k i n gan e e d l ei no c e a n t h i sd i f f i c u l t p r o b l e mh a sb e e nr e s o l v e df i t l yb ys e a r c he n g i n et e c h n o l o g y b u tb e c a u s eo fn o s t n l c t u r eo fw e b p a g e n oo r d e ro fs u r p a s s i n gl i n k i n g a n dg r e a tc a p a c i t ya n dd i v e r s i t y a n dd e v e l o p m e n tc h a n g eo fw e bp a g e t h eu s e i sw o u l db en o ts os e a r c hf o rt h e n e c e s s a r y f o rw e bp a g eb r i n g sb i g g e rl a t e n te n e r g y b e m e r s l e e f a t h e ro fw o r l d w i d ew e b h a sb i n l g h tf o r w a r das e m a n t i cn e to nt h ec o n v e n t i o ni ny 2 ki n x m l 2 0 0 0f o r m a l l y t h eo n t o l o g ya r el o c a t e di nt h ea r r a n g e m e n to fi d e a sd e s c r i p t i o n t h a tf r o md o c u m e n tt or e a s o n i n gd e m o n s t r a t i o n s ot h eo n t o l o g yi st h ek e yo fr e a l i z i n g t h es e m a n t i cw e b t h i st h e s i sh a si n t r o d u c e dt h et h e o r ya n dr e l e v a n c et e c h n o l o g yo fo n t o l o g ya n d s e m a n t i cw e b g u i d e db yt h a tt h e o r y t h e ns t r u c t u r e dt h et r a v e ld o m a i no n m l o g ya p p l y t h er e l e v a n c e i nt h ep r o c e s so fs t r u c t u r e d a d o p to w lo ft h eo n t o l o g yd e s c r i p 6 0 n l a n g u a g ew a sa d o p t e dt ob ew r i t i n gl a n g u a g ea n dt h ep r o t d 9 6 3 1o fc o n s t r u c tt 0 0 1 i t i s i m p o r t a n tt os t u d yt h es e m a n t i cw e br e t r i e v a lb a s e do no n t o l o g y a n d d e s i g n e das i m p l er e t r i e v a lm o d e lo ft h ed o m a i no ft r a v e lb yj e n a t h er e s e a r c hs i g n i f i c a n c eo ft h i st h e s i si st oi n t r o d u c et h ec o n c e p to fo n t o l o g yt o r e a l a p p l i c a t i o n t o g e t h e rw i t ht h er e t r i e v a l a n d r e a l i z eam i n i s y s t e mb a s e do n o n t o l o g y k e y w o r d s o n t o l o g y i n f o r m a t i o nr e t r i e v a l s e m a n t i cw e br d fo w l p r o t d 9 6 j e n a 3 原创性声明 本人郑重声明 所呈交的学位论文 是本人在导师的指导下 独立进行研究所取得的成果 除文中已经注明引用的内容外 本 论文不包含任何其他个人或集体已经发表或撰写过的科研成果 对本文的研究在做出重要贡献的个人和集体 均已在文中以明确 方式标明 本人完全意识到本声明的法律责任由本人承担 论文作者签名 监日期 姚 关于学位论文使用授权的声明 本人完全了解贵州大学有关保留 使用学位论文的规定 同 意学校保留或向国家有关部门或机构送交论文的复印件和电子 版 允许论文被查阅和借阅 本人授权贵州大学可以将本学位论 文的全部或部分内容编入有关数据库进行检索 可以采用影印 缩印或其他复制手段保存论文和汇编本学位论文 保密论文在解密后应遵守此规定 论文作者签名 盈茔垫导师签名 尘兰 堕日期 她 贵州大学硕士论文 第一章绪论 1 1 研究背景 1 1 1 本体的定义 第一章绪论 本体 o n t o l o g y 的概念起源于哲学领域 即 对世晃上客观存在物的系统 地描述 1 1 近年来 人们将本体的概念引入人工智能 知识工程和图书情报领 域 用以解决知识概念表示和知识组织体系方面的有关问题 在灿领域 斯坦 福大学的g r u b e r 1 9 9 3 最早提出本体的定义 2 i 后来b o r s tp i m 博士等 1 9 明对 g r u b e r 的定义作了少许修改 两个定义合并以后 表达如下 i ti s a l le x p u d t f o r m a ls p e c i f i c a t i o no fas h a r e dc o n c e p t u a l i z a t i o n 即本体是一套得到大多数人认 同的 关于概念体系的明确的 形式化的规范说明 3 德国卡尔斯鲁大学的s t u d c r 等学者认为本体有四大特征 本体是明确的 是指 被引用的概念所属的上位类与在使用此概念时的 限制条件应预先得到明确的定义和说明 本体是形式化的 是指 本体应该具有机器可读性 本体是共享的 是指在一个本体中 知识所表达的观念 观点应该 抓 住知识的共性 也就是说 它不只是为某小部分人接受的 而是为整个群体所接 受的 本体是概念化的 它是一个概念体系 又称概念模型 所谓概念化是指 客观世晃中某些现象的一个抽象模式 该模式是通过定义了这些现象的相关概 念形成的 1 1 2 语义检索的提出 i n t e m e t 已经成为当今和未来人们获取所需资源和信息交流的主要场所 同时 网页资料呈几何级数爆炸性增长 用户要在如此浩瀚的信息海洋里寻找需要的信 息 就像大海捞针一样 搜索引肇技术恰好解决了这一难题 搜索引擎以一定的 贵州大学硕士论文 第一童绪论 策略在互联网中搜索 发现信息 对信息进行理解 提取 组织和处理 并为用 户提供检索服务 从而起到信息导航的目的 搜索引擎提供的导航服务已经成为 互联网上非常重要的网络服务 因此在i n t e r n e t 上出现了许多方便和帮助用户查 找所需信息的搜索引擎 例如y a h o o g o o g l e 百度等 然而要找到真正满足用 户需要的信息 是一项极富挑战性的工作 全文检索是一个很成熟的技术 它能够解决对网页细节的检索问题 从理论 上说 只要网页上出现了某个关键字 就能够使用全文检索用关键字匹配把该网 页查出来 但是这又导致了它的缺陷 返回的信息太多 例如 在搜索引擎中 查询 旅游 这个词 相关网页返回5 9 1 0 0 0 0 0 个 假定一个人2 0 秒钟查看一 个查中的网页 一刻不停地看下去也需要2 0 来天了 更严重的是 除了综合性 的搜索引擎站点有这个现象之外 现在较大的站点对自身站内信息的检索也会返 回大量的网页 传统的文本信息检索一般使用查全率与查准率来对检索效果进行 量化评价 但是在海量的互联网信息检索上用查全率与查准率来衡量检索效果是 不太合适的 有时候 高的查全率带来的成千上万个命中网页 对用户实在是一 个沉重的负担 在网页爆炸性增长的今天 没有一个用户有时间和精力来一一浏 览搜索引擎查到的每一个网页 返回网页太多只是全文检索给人直观感觉到的问题 除此之外 它还有三个 不很直观的深层次的问题 也给信息检索带来了不少困难 忠实表达 问题 很多情况下 用户很难简单地用关键字或关键词串 来忠实地表达他所真正需要检索的内容 表达困难导致检索困难 表达差异 问题 人类的自然语言中 随着时间 地域或领域的改变 同一个概念可以用不同的关键字来查询 例如 计算机 和 电脑 虽然它们 指的是同一种东西 词汇孤岛 问题 人的大脑中 概念并不是孤立存在的 它总是与其 它概念之间存在各种各样的联系 在信息检索中 用户在检索一个词 表达一个 概念 时 除了希望得到含该概念的文档之外 还想得到与此概念相关的其他信 息 在传统的信息检索技术下 用户的这种愿望是实现不了的 因为检索返回的 结果肯定都是含用户输入的检索关键词 而不会涉及其他相关信息 在这种检索 模式下 用户的检索词得不到概念扩展 被系统作为一个孤立的词来处理 如果 用户要查询相关的信息 那么他必须在此输入相关词汇 造成这种困难的实质在 2 贵州大学硕士论文 第一童绪论 于传统的信息检索技术缺乏知识处理能力和理解能力 现有传统搜索引擎的局限 i n t e r a c t 上的信息资源是动态变化的 表现为信息量指数级增长 信息内 容不断更新 一个单一的搜索引擎平均只能覆盖到整个i n t e r n e t 资源的 3 0 5 0 可以看出现有传统的搜索引擎的信息覆盖率不高 用户往往为了寻 找目的数据和资源 而不断地在多个搜索引擎间切换 这常常令用户事倍功半 其次 现有传统搜索引擎对提供的检索信息没有进行综合处理 冗余和 噪声含量大 用户只能亲自从大量的反馈信息中提取自己的所需信息 最后 现有传统搜索引擎基本上都采用 一个搜索适用于所有用户 的 搜索模型 然而搜索本身是 项个性化的活动 不同的用户对所需要的信息要求 不同 传统的搜索引擎无法满足用户的个性化需求 为了让网页发挥更大的潜能 万维网之父b e m e r s l e e 于2 0 0 0 年在 x m l 2 0 0 0 的会议上正式提出了语义网 s e m a n t i c w e b 语义网的基本思想是为 w e b 上任意的资源 包括页面 数据和程序 引入清晰的语义和结构化的描述 使得计算机可以理解w e b 上的资源 当然 机器可理解并不意味着机器能够真 正像人一样理解w e b 内容 而是通过制定标准 利用标准语言描述w e b 上资源 的含义 这样计算机可以理解并根据标准去理解和自动处理 集成和重用w e b 上的内容和服务 这使得一些基于w e b 的自动服务 如电子商务 知识管理 智能信息检索和智能a g e n t 成为可能 为了语义网的应用前途 w 3 c 做了一系列的工作 首先 他们提出了语义网 的体系结构 4 如图1 1 所示 低层数名称描述 0 第一层统一字符编码整个语义网的基础 u n t c o d e 处 u n i c o d e 和统一资源理资源的编码 u r i 负责标识资源 定位 u 砌 第二层x m l n s x m ls c h e m a用于表示数据的内容和结构 高 第三层 r d f s 用于描述w e b 上的资源及其类型 第四层 本体词汇 o n t o l o g y 用于描述各种资源之间的联系 v o c a b u l a r y 第五层 逻辑 l o g i c 在下面四层的基础上进行的逻辑 贵州大学硕士论文第一章绪论 第六层证明 p r o o f 推理操作 第七层 信任 t r u s t 备注 代表核心层 用于表示w e b 信息的语义 图1 1 语义网层次结构 数据层的上层是本体层 它借鉴了人工智能领域对知识表示的研究 特别是 描述逻辑 5 引入了更加丰富的表达能力 例如 属性取值约束 基数约束 属性 的对称性和传递性等 这个w e b 本体语言的标准是o w l t 6 j o w l 定义了r d f 描述中使用的词汇的语义 使计算机理解w e b 资源的基础 因此是语义网的核 心 本体层的上方是逻辑层 目的是用更丰富的逻辑语言表达w e b 上的资源 其 中规则语言是最常用的 最上层是证明层 目的是为了让用户看到语义网上的数 据处理的过程 语义网的目标是计算机能够理解语义w e b 上的资源 虽然x m l 可以嵌入自 制标签 但是不足以用来描述w e b 资源1 7 1 因此 w 3 c 提出了一种新的语言 资源描述框架 r e s o u r c ed e s c r i p t i o nf r a m e w o r k r d f 嗍 r d f 采用三元组 资 源 属性和值 这种简单的数据模型 表述w 曲上的资源的属性的值 而新一代的基于语义网的信息检索是与人工智能技术 自然语言技术相结合 的检索 核心是用形式化本体描述背景知识 并明确化文档的语义 以便综合利 用本体的表达能力和推论机制 语义检索从语义理解的角度分析信息对象与检索 者的检索请求 是一种建立在概念及其相关关系基础上的检索技术 语义检索通 过本体 立足于对信息进行语义层次上的分析和理解 解决当前一系列的检索难 题 力图真正理解并挖掘检索者的信息请求 1 2 研究路线和方法 本文的研究重点是领域本体的构建和语义检索技术的研究 本体开发是本体 应用的前提和基础 本体应用是本体开发的目的和价值体现 无论是本体的开发 或应用 都需要理论和方法的指导 以及应用实践的检验 本文采用理论联系实 际的方法进行本体和语义网的信息检索技术的研究 首先提出研究方法和思路 然后按照预想的方法和思路进行工程实践 通过建立实验平台与实验模型进行示 4 贵州大学硕士论文 第一章绪论 范性应用 1 3 研究意义 本体虽然对于大多数人来说不是一个新鲜的词语 但是仅仅只有极少数人在 使用它 更加不用说语义检索了 首先本体位于语义网体系结构的关键层 随着 将来的语义网的推广 本体将有广泛的应用前景 其次 本体也广泛应用于专业 信息检索 机械建模 商业等领域 技术是为人类服务的 生活水平的提高必定 带动科学技术不断向前发展 本体和语义网的研究将是知识管理和w e b 网的一 次质的飞跃 能够将复杂的问题简单化 将简单的问题人性化 更好的为人类服 务 将本体的概念引入到实际的应用层面 并结合检索研究 尝试了将这一新概 念应用到实践中的效果 1 4 论文组织 本文主要进行领域本体的构建及基于本体的语义检索的研究 论文第一章对整个本体研究的背景 主要研究课题进行了介绍 提出了本文 的研究路线 方法和意义 论文第二章介绍了本体与语义网的一些相关技术 重点介绍了本体的构建方 法 语言和工具 语义网技术详细介绍了目前较为成熟的h i 公司开发的工具 j e n a 论文第三章介绍了旅游领域本体的详细构建过程 论文第四章设计了基于旅游领域本体的语义网检索模型 建立了简单的检索 结果 论文第五章总结了本论文所做的工作 指出了现有工作的局限性 有待改进 的方面 并展望了下一步的工作 5 贵州大学硕士论文第二章本体与语义网 第二章本体与语义网 2 1国内外主要研究现状 2 0 世纪8 0 年代末至9 0 年代初 哲学领域的概念 o n t o l o g y 被a i 领域所 借鉴 对本体的研究逐渐增多 近年来 国内外对本体作了大量研究并运用于知 识工程领域 2 1 1w 3 c 的研究吲 w 3 c 是一个关于信息 商业 通讯和共识的论坛 它立足于开发交互技术 如 规范 指南 软件和工具 使得w e b 得以发挥最大的潜能 w 3 c 致力于本体的研究始于2 0 0 1 年 w 3 c 制定的x m l 作为一种资源描述 语言 由于它良好的可扩展性 适合表示各种信息 现已被广泛接受为未来w e b 上的数据交换的标注 r d f 是w 3 c 推荐的用于描述和处理元数据的方案 能为 w e b 上的应用程序间的交互提供机器能理解的信息 它独立于任何语言 适合于 任何领域 是处理元数据的基础 w e b o n t o l o g y 工作组的主要贡献是从2 0 0 2 年1 月起开始制定o w l o n t o l o g y w e bl a n g u a g e 规范标准 加 2 0 0 3 年8 月1 8 日 o w l 成为w 3 c 的候选推荐标 准 2 0 0 4 年2 月1 0 日 o w l 成为w 3 c 正式 推荐标准 o w l 的设计目的 是要让软件代替人工来进行信息内容的加工 o w l 促进了由x m l r d f s 支 持的w e b 内容在机器间的互操作性 2 1 2a i f b 的研究 德国卡尔斯鲁厄大学 u n i v e r s i t yo fk a r l s r u h e 的r u d is t u d e r a l e x a n d e r m a e c h e 和以他们为首的应用情报学和规范描述方法研究所 a i f b i n s t i t u t eo f a p p l i e di n f o r m a t i c sa n df o r m a ld e s c r i p t i o nm e t h o d s 对本体基础理论 o n t o l o g y l e a m i n g 和本体的数学表达进行了深层次的研究 1 1 欧洲的o n t o w e b 就是依托a i f b 研究所的o n t o w e b 项目建立的以知识管理为 贵州大学硕士论文第二耄本体与语义同 目的的网上知识门户 o n t o w e b 的目标是集合欧洲语义网网页标准的研究人员和 产业学会的力量 加强该领域的跨学科协作 促进欧洲文化的复兴 保护欧洲语 言多元化和欧洲文化多样性 并在本体领域的研究中占据主导地位 1 1 2 2 1 3k s l 的研究 美国斯坦福大学的知识系统实验室 k s l k n o w l e d g es y s t e m sl a b o r a t o r y 以 下简称k s l 无论是在本体建模工具领域 还是在本体应用层面的研究方面 都站在了知识工程领域的最前沿 k s l 的n g r u b e r 在1 9 9 3 年最早提出了 本体 在知识工程领域的定义 g u a r i n o 博士根据整体与部分理论 同一性理论和关系理论等哲学理论成果 设 计了顶级一层本体 g u a r i n o 本体框架的设计特征是根据特殊性和普遍性两个角 度来设计 特殊性表示具体的实体 事件 物质 普遍性表示从具体事件中抽象 出的概念 属性 状态和关系等 目前 k s l 的研究主题主要有以下3 个 1 3 知识共享技术 k n o w l e d g es h a r i n gt e c h o l o g i e s 物理系统的建模与分析 m o d e l i n ga n d a n a l y s i so f p h y s i c a l s y s t e m s 应用性智能系统 a d a p t i v ei n t e l l i g e n ts y s t e m s k s l 对语义网技术的研究主要集中于语义标引和基于代理的技术两个方面 2 1 4 国内的研究 与国外相比 国内无论是理论研究或是实践应用都相对落后 与国外高水平 的研究相比存在很大差距 目前从事这方面的研究的机构不太多 能够出成果的 就更少了 目前由中国科学院的数学与系统科学研究院 数学研究所 指示处理 与人机交互实验室 管理 决策与信息系统开放实验室一直走在该领域研究的最 前沿 总之 业界基于本体的语义网的研究目前在理论和技术研究居多 应用研究 方兴未艾 7 贵州大学硕士论文第二章本体与语义网 2 2 本体的形式化模型 根据本体的定义 由于它是概念模型的明确的规范说明 在计算机领域存在 有多种形式化模型可以用于表示本体 其中 比较重要的有一阶谓词逻辑 语义 网 基于框架的系统以及从后两种方法发展而来的描述逻辑系统 下面对后三种 方法进行简要介绍 2 2 1 语义网 语义是一个意义含糊的词 它常出现在计算机科学 哲学 心理学和语言学 等领域 当这个概念被不同领域引用的时候 它的含义往往存在着一些差异 它 用语义概念 节点 与概念间的语义关联性 节点间的连线 来描述一个系统的 静态组成 有着很强的描述能力 一个语义网是由一些以有向图表示的三元组 节 点1 弧 节点2 连接而成的 语义网表示法在描述一个事物同其他各部分间 的分类知识具有优越性 这也正符合了知识发展的层次性 语义网的主要优点是 重要相关性能被明确 清晰的表示出来 相关事实可 以从其直接相连的节点推导出来 而不用遍历整个庞大的知识库 能利用i s a 和 s u b s e t 链在网络中建立的继承层次 易于对继承层次进行演绎 能够利用少量的 基本概念的记号建立状态和动作的描述 其缺点是 不能保证网络操作所得推理 的有效性以及运用推理机时的内存溢出 对于网络不存在标准的术语和约定 语 义解释取决于操作网络的程序 网络的搜索需要有力的组织原则 2 2 2 基于框架的系统 框架是把某一特殊事件或对象的所有知识存储在一起的一种复杂的数据结 构 框架中的槽 s l o t 使这种推理成为可能 利用槽的概念人们能为框架创建 的环境添加知识 框架中允许有自己的子槽 某些系统中允许一个槽有一个复杂的类框架的结 构 利用槽能说明期望信息 并且一个槽可附加一个过程 说明在需要的情况下 如何求槽的一个值 槽可以有缺省值 说明在缺乏明显相反论据的情况下槽的值 框架表示方法的主要优点是 有利于期望制导的处理 在给定的状况下 通 贵州大学硕士论文 第二章本体与语义网 过设计能决定其本身的可利用性或者提供其它框架 知识组织的方式有利于推 理 主要缺点是 许多实际情况与原型不符 对新的情况不易适应 2 2 3 描述逻辑 描述逻辑 d e s c r i p t i o nl o g i c 1 4 1 是一族以结构和形式化的方式来表示领域知 识的语言 它起源于7 0 年代的知识表示方法语义网络和框架系统 在描述逻辑 中 最基本的元素是概念 属性和个体 描述逻辑的一个显著特征就是他们装备 了一个形式的 基于逻辑的语义 另外一个特征在于以推理为中心服务作为重点 推理允许我们从知识库中的外层知识得到蕴含在其内部的知识 描述逻辑支持出现在很多智能信息处理系统的应用中的推理模式 它也是人 们用来构建和理解世界的概念和个体的分类 概念的分类确定了给定的术语 t e r m i n o l o g y 中的概念间的子概念和父概念的关系 而且分类允许我们以包含 层级的形式去构造术语 这种层级为不同概念间的联系提供了有用的信息 而且 能被用来提高其他推理服务 个体的分类确定了一个给定的个体是否总是一个概 念的实例 这样就提供了个体性质的有用信息 更为有用的是 实例关系可以触 发那些向知识库中插入附加事实的规则的应用 2 3 本体构建语言 本体构建语言是用来构建本体的 它让用户可以为某领域模型编写清晰 形 式化的概念描述 以下介绍几种重要的本体构建语言 o w l 将在后续的章节中 结合课题作详细的介绍 2 3 1x m l t l 5 x m l 技术是 系列由w 3 c 组织批准并推荐的相关协议的集合 它涵盖了从 网络底层的数据表示 数据显示 数据的处理 交换和消息的传递等各个层次的 w e b 应用 它底层的标准包括格式化标准 d o c u m e n tt y p ed e f i n i t i o n s 简称d t d 和x m ls c h e m a s 样式标准 c s s x s l 查询标准 x q l 链接查询标准 x u n k x p a t h 解析标准 d o m 等 贵州大学硕士论文 第 章本体与语义网 x m l 文档将文档的内容 结构和表现分开定义 x m l 文档结构的定义手段 通常有两种j 一种是d t d d o c u m e n t t y p ed e f i n i t i o n 一种是x m l s c h e m a x m l 对数据的语义描述通常是通过x m l 文档的结构约束来实现的 也就是 利用d t d 或x m ls c h e m a 与本体相关联 然后再利用x m l 文档结构与x m l 内容之间的关系将x m l 内容与本体相关联 从而提供对数据内容的语义描述 这个过程如图2 1 所示 图2 1x m l 通过d t d 表示本体 m e r d m a n n n 等提出了本体通过i y i d 向x m l 元素映射的基本规则 概念中的每一个属性 a t t r i b u t e 在d t d 中生成一个子元素 如果属性表示的是与其他概念的关系 属性元素的内容模型为相关的概 念元素 否则属性元素的内容模型为p c d a t a 类型 本体直接用x m l 来表示的方式是采用d t d 来描述本体中概念集合以及 概念之间关系的集合 但是有一定的局限性 在d t d 和x m l s c h e m a 的基础上 w3c 提出了采用r d f 来描述简单的本 体 2 3 2r d f t l 6 1 r e s o u r c ed e s c r i p t i o nf r a m e w o r k 以下简称r d f 中文译为资源描述框架 它是由w 3 c 自1 9 9 9 年开始着手开发的 目的是为了创建描述w e b 资源的元数 据 r d f 是表述对象及对象之间二元关系的语言规范 1 0 贵州大学硕士论文 第二章本体与语义网 一 fh 中埘 w 咀吖群卸附1 a h 暗叫 m 幻朝 d i p 砷 町砸 图2 2 是一个i f 表示法的实例 上图显示了 有一个人由h t t p w w w w 3 o r g p e o p l e e m c o n t a c t m e 标识 他 的名字是e f i c m i l l e r 他的电子邮件地址是e r a w 3 o r g 他的头衔是阢 r d f 与x m l 之间的关系非常紧密 事实上 它们之间是互补的 r d f 的作 用之一是以一种标准化的 具有互操作性的模式为基于x m l 的数据规定语义 r d f 的目标是为描述资源定义一种机制 这些资源既不是关于某一特定应用领 域的假设 也不是包含信息的一篇文档的结构 数据模型分成通用模型和专业模型 目前有很多通用模型 包括x m l i n f o r m a t i o ns e t 定义了x m l 数据模型 r d fd a t am o d e la n ds y n t a x 定义了r d f 数据模型 这两种数据模型是平级的 同样 x m ls c h e m a 和r d fs c h e m a 分别 基于不同的模型 它们不相同也没有必要合并 x v l l 是一种语言 r d fs c h e m a 是一种扩展了x m l 的符号和语法后形成的 语言 它可以表示r d f 数据模型 r d f 语言主要功能特征所描述的内容包括 r e s o u r c e 一类特定的信息条目 通常是一个w e b 站点 如图2 2 中的圆圈 表示 资源 通常以u r l 进行标识 有时 标识符不一定非要用英语或其 他自然语言表示 c l a s s s u b c l a s s 资源可以被分类 c l a s s 每个类以下都可以有许多小的下 位类 s u b c l a s s 由此形成了一个完整的分类体系 p r o p e r t y 连接两个相关资源 例如 图2 2中 h t t p w w w w 3 o r g 2 0 0 1 1 0 s w a p p i m c o n t a c t m a i l b o x 就将w e b 页面和他的邮 贵州大学硕士论文第 章本体与语义网 箱关联在一起 p r o p e r t y 也可以是u r l d o m a i n r a n g e 一个p r o p e r t y 中的2 个资源可以受到限定 一个目标 钱 t a r g e t d o m a i n 以及目的文件范围 d e s t i n a t i o n r a n g e 会受到一个特定类的限 制 c o n t a i n e i 资源集合可以组织在c o n t a i n e r 中 c o n t a i n e r 包括 集 s e t 元素集合可以出现在任何序列中 元素阿 次序 s e q u e n c e 按一定的 顺序排列 以及 其他的选择 r d f 数据模型是基于语义网络的 它包含3 种类型的元素 资源和实体 用统一资源标识符进行资源标识 例如网页 网站和书等 资 源d 是资源的唯一标识 资源d 由u r i 加上一个特定的锚 d a n c h o r 组成 属性 定义了资源的各个方面 包括特征 属性或关系 声明 拥有已被命名的属性 属性又已被赋值的特定资源就是r d f 声明 声明的作用是在一项特定的资源中为属性分配属性值 r d f 声明由3 部分组 成 类似于汉语中的主谓宾结构 1 主题 s u b j e c t 一项特定的资源 用椭圆标记 2 谓词 p r e d i c a t e s 一个被命名的属性 用箭头标记 3 客体 o b j e c t 在该资源中该属性的取值 用矩形标记 r d f 具有通用性 并不限定于某个领域的网络资源定义 而它所描述的网络 资源也可以是任意格式的 既可以是x m l 格式的 也可以不是 2 3 3r d f s r d fs c h e m a 提出了抽象世界中主要关系 由此建立类型系统 从而支持 了从客观世界到抽象世界的映射 也为知识共享打下基础 属性就是资源之间的 关系 其中内容包括 1 1 7 提出了类的概念 不但描述存在哪些主要属性 也可以描述属性可以从 属于哪些类 提出了限制的概念 用户可以依据r d fs c h e m a 定义自己的s c h e m a 通 常属于一个特定的领域 1 2 贵州大学硕士论文第二章本体与语义网 r d f s 是一种用于定义r d fs c h e m a 的声明语言 d e c l a r a t i v el a n g u a g e r d f s 的数据模型是基于框架的 它为定义属性与资源之间的关系提供了机制 核心的概念类是类 资源和属性 等级体系和类型约束也得到了定义 核心属性 是 类型 的子类 s u b c l a s s o f 的子属性 s u b p r o p e r t y o f 又 见 s e e a l s o 由 定义 有些核心约束也得到了定义 r d fs c h e m a 定 义了一个类型系统 它与其他类型系统的区别在于对 类 的定义 其他系统通 过类的属性来定义类 而r d fs c h e m a 通过从属于哪些类的资源来定义属性 r d f s 可以直接用来描述本体 虽然d t d 和r d f s 都可以用来定义本体 并 序列化为x m l 文档 但两者存在着很大的差异 d t d 是利用d t d 对x m l 文 档结构的约束作用来体现本体 而r d f s 采用r d f s 所提供的原语来描述本体 然后用r d f 的x m l 序列化机制转换为x m l 封顶 如图2 3 所示 图2 3r d f s 以 l 序列化方式来表示本体 r d fs c h e m a 机制提供了r d f 模型中使用的一个基本类型系统 从r d f s 的 原语上 可以看出r d f s 的表达能力非常有限 针对r d f s 在语义表示方面的不 足 一些研究团体提出了其他一些不同的网络环境下的本体描述语言 2 3 4 o n t o l i n g u a o n t o l i n g u a 是一种基于知识交互格式 k i f k n o w l e d g ei n t e r c h a n g ef o r m a t 的本体构建语言 它为本体的构建提供了统一规范的格式 o n t o l i n g u a 是斯坦福 大学的k s l 从1 9 9 5 年开始进行开发的 o n t o l i n g u a 是基于k i f 和框架本体 f o f r a m eo n t o l o g y 的语言 也是 o n t o l i n g u a 服务器用来进行本体构建的语言 知识交互格式的开发是为了解决知 识表示语言中语言的异构性问题 它可以用来定义对象 函数和关系 o n t o l i n g u a 的开发者指出 o n m l i n g u a 语言具有3 个特点 贵州大学硕士论文第二章本体与语义网 为构造和维护本体提供了统一的 计算机可读的方式 由于其构造的本体可以方便的转换到各种知识表示和维护系统中去 如 p r o l o g c o r b a 的i d l c l i p s l o o m e p i k i t a l g e r n o n 和标准的k i f 从 而将本体的维护与使用它的目标系统分隔开 主要用于本体服务器 2 3 5d l 气l d a t 订l o i l d a m l 的开发基于x m l 和r d f 因此也可以将d a m l 看成是x m l 和r d f 的扩展 d a m l d a r p a a g e n tm a r k u pl a n g u a g e 是由美国国防部高级研究计 划署开发研制的 它与o i l 有许多相同的特性 又添加了一些额外引人关注的 功能特性 b s c l a s s 与o i l 中的c l a s s 相同 c l a s s i d e n t i f i e r 惟一的对象名 用命名空间 n a m es p a c e s 作为限制 s u b c l a s s 与o i l 中s u b c l a s s 相同 c l a s ss y n o n y m s 同一个类的另一个替代名 s a m e c l a s s e q u i v a l e n t t o 叙述两个类是完全相同的 它们的成员相同 c o m p l e m e n t u n i o n d i s j o i n t d i s j o i n tu n i o n i n t e r s e c t i o n 将操作置于c l a s s e s 的 成员之上 i n d i v i d u a l i n s t a n c e 某个类的一个个体或一个实例 p r o p e r t y 两个个体问的关系 与o i l 中的一个s l o t 相当 p r o p e r t ys y n o n y m s 用于描述相同属性的不同名称 s u bp r o p e r t y 作为一个属性的子属性 这里引入的观念是p r o p e r t i e s 可以形 成一个分类体系 d o m a i n r a n g e 规定加入到 种特定关系中去的个体必须属于确定的类 p r o p e r t yr e s t r i c t i o n 与o i l 中的s l o tr e s t r i c t i o n 相当 c a r d i n a l i t y e x t r a c t m a x m i n a n dq u a l i f i e dc a r d i n a l i t yr a n g e u n i q u e 个p r o p e t y 可以拥有v a l u e s 的数量限制 n e c e s s a r y s u f f i c i e n tc o n d i t i o n s 与o i l 中的p r i m i t i v e d e f i n e d 特性相似 i n v e r s e t r a n s i t i v e 一个属性可以是另一个属性的逆反属性 属性具有继承性 1 4 贵州大学硕士论文 第 章本体与语义罔 c o n c r e t ed o m a i n 属性的确定值 s t r i n g 字符串 i n t e g e r 整数 f l o a t 浮点数 d o l l a r 等 v e r s i o n 本体的版本数 i m p o r t 包括从另一个本体中提取的 刚刚被输入到当前本体中的定义 t h i n g n o t h i n g 所有c l a s s e s 都是c l a s s t h i n g 它是分类体系中的根 的 s u b c l a s s e s 子集 没有任何c l a s s e s 是c l a s s n o t h i n g 它位于c l a s s 等级制度 中的底层 的子集 d a m l o i l 可以说是d a m l 的最新版本 它提供了丰富的结构组成元素和 概念集合 能够用来构建本体并为信息作标记 因此 用d a m l o i l 表示的本 体和信息就具有机器可读的特性了 1 9 2 3 6o w l t z 0 将在后续的章节中结合本课题作详细的介绍 2 4 本体构建方法 w e b 环境下实现语义检索的首要条件是有丰富的领域本体 因此 构建本体 的方法是当前本体研究中的热点问题 现行的本体构建方法都不是经权威标准化机构认证的方法 m u s c h o l d 等在 1 9 9 6 年试图制定出一套规范性的指南 只是要表示这种方法在他们的研究环境 下能很好地发挥作用 i l m a c h e s h 和b a t e m a n 都给出了各自的本体构建原则 2 1 i 2 2 1 这些原则都是研究人员在各自的系统开发经验之上提出的 实际上 几乎每一个 系统的开发都会导致一些不同的本体构建方案产生 出于对各自学科领域和具体工程的不同考虑 构建本体的过程各不相同 目 前尚没有一套标准的本体构建方法 一般认为 g r u b e r 在1 9 9 5 年提出的5 条规 则是比较有影响的 为 明确性和客观性 本体应该用自然语言对术语给出明确 客观的语义定义 完整性 所给出的定义是完整的 能表达特定术语的含义 一致性 知识推理产生的结论与术语本身的含义不会产生矛盾 最大单向可扩展性 向本体中添加通用或专用的术语时 通常不需要修改己 贵州大学硕士论文第二章本体与语义阿 有的内容 最少约束 对待建模对象应该尽可能少列出限定约束条件 以下介绍几种常见的本体构建方法 2 4 1t o v e 法 t o v e 法 又称g r u n i n g e r f o x 评价法 t o v e 是指多伦多虚拟企业 专 用于构建t o v e 本体 是关于企业建模过程本体 由多伦多大学企业集成实验 室研制 使用一阶谓词逻辑进行集成 t o v e 本体包括企业设计本体 工程本体 计划本体和服务本体 2 4 陋 t o 流程图见图2 4 铷髫断h 棚糌
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年合肥市轨道交通集团有限公司招聘考试真题
- 2025年江苏省烟草专卖局(公司)真题
- 崇州市卫生健康局下属事业单位招募医疗卫生辅助岗位考试真题2025
- 哈尔滨市绥化路学校扩建项目水土保持方案报告表
- 主题词 10 想象世界-备战2022年中考语文之“真题+模拟”主题作文专项训练(原卷版)
- 市场主体信用修复管理实施细则
- 机关干部推-荐考察不深入问题整改措施
- 教师资格证管理条例
- 关于加强机关机要工作规范化管理的指导意见
- 机关单位否定报备制度
- 校园消防隐患排查整治
- 产业园运营运作方案
- 2026成都环境投资集团有限公司下属子公司招聘工艺管理岗等岗位21人笔试题库及答案详解【真题汇编】
- 决胜分班考:2026江苏省新高一入学摸底测试全科高频考点与模拟训练
- GB/T 24026-2026环境标志和声明足迹信息交流的原则、要求和指南
- 国企中层干部竞聘测试题库(+答案)
- 施工暖通管道安装方案
- 湖北新八校2026届高三第二次联考(二模)语文试题及参考答案
- 家家悦超市成本控制策略与实践研究
- 永辉超市门店SOP标准作业流程制度规定
- 2026年基层应急管理规范考试试题及答案
评论
0/150
提交评论