(计算机应用技术专业论文)基于本体论的语义检索研究.pdf_第1页
(计算机应用技术专业论文)基于本体论的语义检索研究.pdf_第2页
(计算机应用技术专业论文)基于本体论的语义检索研究.pdf_第3页
(计算机应用技术专业论文)基于本体论的语义检索研究.pdf_第4页
(计算机应用技术专业论文)基于本体论的语义检索研究.pdf_第5页
已阅读5页,还剩34页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 为了缓解“r i c hd a t ap o o ri n f o r m a t i o n ”的危机和更好地利用w e b 上的信息资源, 急需研究一种新的智能信息检索技术。语义检索作为智能信息检索技术的两大发 展方向之一,在智能信息检索领域占有极其重要的位置。而基于本体论的语义检 索则是利用本体构建概念空间的语义检索,具有一定的语义处理能力和较好的自 然语言接口,而且可以处理有关概念关系的问题。因此,基于本体论的语义检索 具有重要的研究价值。 首先,本文提出了一种基于本体论的语义检索的模型系统框架,该框架具有 性能高、部署简单、升级维护方便等优点:其次,提出了一种新的领域本体的构 建方法面向对象构建法,此方法易学、易用,可以减少开发系统的工作量, 并且为解决本体的自动构建问题提供了一个新的思路;另外,实现了一个基于本 体论的语义检索系统农业领域的果品语义检索系统( f r u i t s r e t r i e v e ) 。验证了 提出的系统框架和面向对象构建法的可行性。系统实现过程中解决的疑难问题具 有通用性,对实现其他领域的基于本体论的语义检索系统具有重要的借鉴意义和 参考价值。 基于本体论的语义检索还存在本体形式化不够、本体评估缺乏统一的标准、 增量信息不能及时更新等问题,但随着越来越多的仁人志士关注和研究信息检索 和本体论,这些问题都会最终解决或完善。 关键词,智能信息检索本体语义检索 a b s t r a c t a b s t r a c t an e wi n t e l l i g e n ti n f o r m a t i o nr e t r i e v a lt e c h o n o l g yi sn e e dt or e s e a r c hu r g e n t l yt o l o o s et h ec r i s i so f “r i c hd a t ap o o ri n f o r m a t i o n ”a n du t h ei n f o r m a t i o nr e s o u r c ei nw e b b e t t e r s e m a n t i cr e t r i e v a la so n eo ft w ob i gd e v e l o p i n gd i r e c t i o no fi n t e l l i g e n t i n f o r m a t i o nr e t r i e v et e c h o n o l g y , o c c u p i e se x t r e m e l yi m p o r t a n tp o s i t i o ni ni n t e l l i g e n t i n f o r m a t i o nr e t r i e v a lf i e l d s e m a n t i cr e t r i e v eb a s e do nt h eo n t o l o g yt h a tt h i sp a p e r r e s e a r c h e di st h es e m a n t i cr e t r i e v eb a s e do nt h ec o n c e p tm a d eb yt h eo n t o l o g y , w h i c h n o to n l yh a v es o m es e m a n t i cp r o c e s s i n gc a p a c i t ya n dg o o dn l i ,b u ta l s oc a l lp r o c e s s t h ep r o b l e mo ft h er e l a t i o nb e t w e e nt h er e l a t e dc o n c e p t s s os e m a n t i cr e t r i e v eb a s e do n t h eo n t o l o g yh a si m p o r t a n tr e s e a r c hv a l u e 。 f i r s t ,t h i sp a p e rp r o p o s e dan e wm o d e ls y s t e mf r a m e w o r ko ft h es e m a n t i cr e t r i e v e b a s e do nt h eo n t o l o g y t h i sf r a m e w o r kh a sm a n ya d v a n t a g e ss u c ha sh i g hp e r f o r m a n c e , d e p l o y i n gs i m p l y , u p g r a d i n ga n dm a k i n gm a n t e n t a n tc o n v e n i e n t l y , e t c s e c o n d ,t h i s p a p e rp r o p o s e dau e wm e t h o dt ob u i l dd o m a i no n t o l o g yw h i c hi s n a m e do b j e c t o r i e n t e db u i l d i n gm e t h o d t h i sm e t h o do w n sm a n ym e 啊t s 。s u c ha sb e i n gs i m p l et ob e l e a r n e da n du s e d ,c a nd e c r e a s et h ew o r k l o a di nt h ep r o c e s so fd e v e l o p i n gt h es y s t e mo f t h es e m a n t i cr e t r i e v a l t h i sm e t h o da f f o r d san e wi d e at or e s o l v et h ep r o b l e mo f b u i l d i n gt h eo n t o l o g ya u t o m a t i c a l l y t h i r d ,t h i sp a p e ri m p l e m e n t e do n es y s t e mo ft h e s e m a n t i cr e t r i e v eb a s e do nt h eo n t o l o g y , w h i c hi sf r u i ts e m a n t i cr e t r i e v es y s t e m ( f m i t s r e t r i e v e ) i na g r i c u l t u r ef i e l d ,w h i c hp r o o ft h ef e a s i b i l i t yo ft h ef r a m e w o r ka n d o b j e c to r i e n t e db u i l d i n gm e t h o d i ti su n i v e r s a lt h a tt h ed i f f i c u l t i e sa l er e s o l v e di n i m p l e m e n t i n gt h i ss y s t e m ,s oi t h a si m p o r t a n tr e f e r e n c ev a l u ei nt h ep r o c e s so f i m p l e m e n t i n gs e m a n t i cr e t r i e v es y s t e mi no t h e r f i e l d s t h e r ee x i s tm a n yu n s o l v e dp r o b l e m si ns e m a n t i cr e t r i e v a lb a s e do nt h eo n t o l o g y , s u c ha so n t o l o g yf o r m a l i z a t i o nb e i n gi n c o m p l e t e ,t h ee v a l u a t i o no ft h eo n t o l o g yl a c k i n g u n i f o r ms t a n d a r d ,t h ei n c r e a s i n gi n f o r m a t i o nn o tb e i n gu p d a t e d ,e t c b u tw i t ht h em o r e a n dm o r ep e o p l ew i t hl o f t yi d e a l sp a y i n ga t t e n t a t i o nt oa n dr e s e a r c h i n gt h ek n o w l e d g e o ft h ei n f o r m a t i o nr e t r i e v a la n do n t o l o g y , t h e s ep r o b l e m sm u s tb er e s o l v e do rm o d i f i e d a t l a s t k e y w o r d :i n t e l l i g e n ti n f o r m a t i o nr e t r i e v a lo n t o l o g y s e m a n t i cr e t r i e v a l 创新性声明 秉承学校严谨的学风和优良的科学道德,本人声明所呈交的论文是我个人在 导师指导下进行的研究工作及取得的研究成果。尽我所知,除了论文中特别加以 标注和致谢中所罗列的内容以外,论文中不包含其他人已经发表或撰写过的研究 成果;也不包含为获得西安电子科技大学或其它教育机构的学位或证书而使用过 的材料。与我一同工作的同志对本研究所做的任何贡献均已在论文中做了明确的 说明并表示了谢意。 申请学位论文与资料若有不实之处,本人承担一切法律责任。 本人签名:迄! 垫i 叁日期:丝z ! :! ! 关于论文使用授权的说明 本人完全了解西安电子科技大学有关保留和使用学位论文的规定,即:研究 生在校攻读学位期间论文工作的知识产权单位属西安电子科技大学。学校有权保 留送交论文的复印件,允许查阅和借阅论文;学校可以公布论文的全部或部分内 容,可以允许采用影印、缩印或其它复制手段保存论文。同时本人保证。毕业后 结合学位论文研究课题再撰写的文章一律署名单位为西安电子科技大学( 保密的 论文在解密后遵守此规定) 。 本学位论文属于保密,在一年解密后适用本授权书。 本人签名: 导师签 维志;案 日期: 弦p7 ,| o 第一章绪论 第一章绪论 当前,w e b 信息资源呈现爆炸式增长趋势,用户对于信息检索的要求也越来 越高,传统的各种信息检索技术已经很难满足这种要求。未来的互联网作为人类 的信息库、知识库,应该支持用户以自然语言的方式表达检索请求,并且具备理 解语义和自动扩展、联想的能力,更能够支持问答式、对话式的智能化检索。而 本文研究的基于本体论的语义检索不仅能得到与检索条件精确匹配的信息资源, 而且还能查询到与检索条件具有语义相关,但在语法上并不精确匹配的隐含信息 资源,提高了检索的查全率和查准率。 1 1 信息检索研究现状及分析 1 1 1 信息检索研究现状 信息检索( i n f o r m a t i o nr e t r i e v a l ) ,通常指文本信息检索,包括信息的存储、 组织、表现、查询、存取等各个方面,其核心为文本信息的索引和检索,起源于 图书馆的参考咨询和文摘索引工作,从1 9 世纪下半叶首先开始发展,至2 0 世纪 4 0 年代,索引和检索成已为图书馆独立的工具和用户服务项目。从发展阶段上看, 信息检索经历了手工检索、计算机检索到目前网络化、智能化检索等多个阶段。 目前,信息检索已经发展到网络化的阶段。信息检索的对象从相对封闭、稳定一 致、由独立数据库集中管理的信息内容扩展到开放、动态、更新快、分布广泛、 管理松散的w e b 内容:信息检索的用户也由原来的情报专业人员扩展到包括商务 人员、管理人员、教师学生、各专业人士等在内的普通大众。 互联网技术对信息的传播方式带来了巨大的变化,也明显地促进了信息检索 技术的发展和应用,一大批检索引擎产品也随之诞生,为网民提供了快速信息获 取和网络信息导航工具。从某种程度上可以说,网络信息检索代表了当代信息检 索的发展方向,所以,本文也将网络信息检索作为主要的研究对象。检索引擎按 照一定的策略在互联网中搜集和发现信息,并对信息进行理解、提取、组织和处 理,为用户提供检索服务,从而起到信息导航的目的。 ( 1 ) 检索引擎的工作原理 包括如下3 个过程:一是在互联网中发现、搜集网页信息。利用能够从互联 网上自动收集网页的s p i d e r 系统程序,自动访问互联网,并沿着任何网页中的所 2 基于本体论的语义检索研究 有u r l 链接行走,重复这一过程,把爬过的所有网页资源收集起来,本阶段也可 以通过人手工收集来完成;二是对所搜集的信息进行提取和组织,并建立信息索 引库。由分析索引系统程序对收集回来的网页进行分析,根据一定的特征提取算 法提取网页资源对象的特征信息,主要包括网页u r l 、编码类型、页面内容包含 的关键词、关键词位置、生成时间、大小、与其它网页的链接关系等元数据信息; 三是根据资源对象的索引信息,进行信息检索和检索结果集排序等操作;信息检 索程序根据用户输入的查询关键词,从索引数据库中快速检出相关信息对象,并 对检出的结果提供多种排序操作,最终将排序后的结果返刨1j 【2 l 吼 ( 2 ) 检索引擎的分类 按照信息搜集方法和服务提供方式的不同,检索引擎系统可以分为三大类: 机器人检索引擎、目录式检索引擎和元检索引擎1 4 】1 5 j 1 6 】。 r o b o t 检索引擎由一个r o b o t ( 也称之为s p i d e r ,w e bc r a w l e r ) 程序根 据某种策略自动地在互联网中搜集和发现信息,并将r o b o t 程序搜集到的 网页信息加入到检索数据库中,供用户查询。r o b o t 检索引擎由3 个部分 组成:r o b o t 程序、索引生成器和检索程序。r o b o t 程序会定期访问互联 网,对一定范围内的网站进行检索,一旦发现新的内容信息或新的网站, 它会自动提取这些内容和网址信息,并添加至资源信息库中。索引生成器 则为所搜集的资源信息建立索引项,以方便用户检索信息。为了能反映出 网页的更新情况,r o b o t 检索引擎一般需要周期性的访问以前搜集过的网 页,及时更新索引信息库,这是基于r o b o t 的检索引擎的一个重要特征 1 7 j 【8 l 。r o b o t 检索引擎的优点是信息量大、更新及时、无需人工干预,缺 点是返回过多的无关信息,需要用户对结果集进行再次的筛选。这类检索 引擎的典型代表有:a l t a v i s t a 、n o r t h e r n l i g h t 、e x c i t e 、i n f o s e e k 、 i n k t o m i 、f a s t 、l y c o s 、g o o g l e ,其中n o r t h e r nl i g h t 和a l t av i s a 所 索引的w e b 页面都已经超过了1 0 0 ,0 0 0 ,0 0 0 。 目录式检索引擎与基于r o b o t 的检索引擎所不同的是。目录式检索引擎 的索引数据库是由编目人员通过手工方式建立起来的,例如y a h o o ,o p e n d i r e c t o r y ,s n a p 等,目录式检索引擎首先需要建立一个目录分类标准和 目录结构,编目人员在访问了某个w e b 站点后需要给出该站点的相关描 述,并根据站点的内容和性质将其归类至一个预定义好的目录中。目录式 检索引擎大多能提供目录浏览和直接检索两种服务方式。该类检索引擎由 于在信息检索中加入了人的智能,所以信息分类准确、导航质量高,缺点 是需要投入大量的人力、维护量大、信息总量较少和更新困难。这类检索 引擎的代表是:y a h o o 、l o o k s m a r t 、o p e nd i r e c t o r y 、g og u i d e 等1 9 1 埘。 元检索引擎这类检索引擎和以上两种检索引擎的工作方式不同,它并没 第一章绪论 3 有自己的数据,而是将用户提交的查询请求送到多个独立的检索引擎上去 检索,并对各检索引擎返回的检索结果集中处理,以统的格式提供给用 户,因此有元检索引擎之称。它的主要精力放在提高检索速度、智能化处 理检索结果、提供个性化的检索服务以及改善用户检索界面等方面。元检 索引擎最大的特点就是其本身并不能提供信息检索服务,而需要依赖于其 它检索引擎来共同完成检索任务。和其它两种检索系统相比较,元检索引 擎返回结果的信息量更大、更全,缺点是不能够充分发挥所使用检索引擎 的功能,也需要用户做更进一步的筛选。现行比较著名的元检索引擎有 m e t a c r a w l e r ,s a v y s e a r c h 等,其中m e t a c r a w l e r 能同时检索y a h o o , l o o k s m a r t , a l t a v i s t a 等九个主要的检索引擎i l “。 1 1 2 问题分析 传统信息检索技术都是基于关键字的语法匹配和全文检索技术,主要借助于 目录、索引和关键词等方法来实现。此技术的优点是简单、快捷和容易实现,但 其存在五个较突出的问题i 。 “忠实表达”问题。由于在大多数情况下用户很难通过简单的几个关键词 来忠实的表达其检索需要,因此表达困难也就导致了检索质量难近人意; 无法准确揭示信息的实质内容。用题名、文摘或全文中出现的关键词标识 文献的内容,常常不能充分揭示原信息的实质内涵; 检索算法采用词形匹配而非词义匹配。一义多词( 同义词) 现象的普遍存在, 导致了传统信息检索的查全率难以保证,而词多义( 多义词) 现象则导致 在检索结果中包含大量的无效信息,使得查准率也难以满足,在西文中, 还存在有词形变化的问题( 如时态、单复数等) 。这些问题都是基于关键词 匹配的检索算法中所无法避免的; “词汇孤岛”问题。在人的大脑中,概念并不是孤立存在的。它总是与其 它概念之间存在各种各样的联系,正是这种联系造就了五彩缤纷的现实世 界。而在传统信息检索中,这种概念之间的语义联系是很难描述的。 片面追求高的查全率导致了检索结果的数量过于庞大,用户根本没有时间 和精力处理检索到的所有结果。 总之,在信息快速增长的今天,传统信息检索机制由于缺乏必要的智能性, 难以适应时代发展的需要,急需新的智能信息检索机制的出现。 4 基于本体论的语义检索研究 1 1 3 智能信息检索的发展现状 以自然语言理解技术为基础的新一代信息检索,被称为智能信息检索。由于 它将信息检索从目前基于关键词层面提高到基于知识( 或概念) 层面,对知识有 一定的理解与处理能力,能够实现分词技术、同义词技术、概念检索、短语识别 以及机器翻译技术等。因而这种信息具有信息服务的智能化、人性化特征,允许 网民采用自然语言进行信息的检索,为他们提供更方便、更确切的检索服务。 目前,智能信息检索的研发主要有两大方向,其一是基于机器翻译技术,比 如g o o g l e ;其二是基于语义理解技术,国内有尤里卡、问一问,国外的主要代表是 a s kj e e v e s 。 机器翻译( m a c h i n et r a n s l a t i o n ,m d 又称机译,它是利用计算机把一种自然语 言转变成另一种自然语言的过程。智能信息检索在这一领域的研究将使得用户可 以使用母语检索非母语的网页,并以母语浏览检索结果。 语义理解通过将语言学的研究成果和信息检索技术结合在一起,实现了信息 检索对检索词在语义层次上的理解,为用户提供最确切的检索服务。 基于语义理解技术的智能信息检索,即语义检索。目前语义检索有两种,即 基于本体论的检索和基于概念的语义检索,前者是基于本体构建概念空间实现的 语义检索,而后者是根据概念词典和关系数据库构建概念空间,从而实现的语义 检索。基于概念的语义检索具有一定语义处理能力,并且具有较好的自然语言接 口。但概念信息检索的概念库中不包含概念间关系的描述,因此无法处理有关概 念关系的问题。而基于本体论的语义检索将本体融合到传统信息检索技术中,不 仅可以继承概念信息检索的优点,还可以克服概念信息检索不能对概念关系进行 处理的局限。 目前,基于本体论的语义检索还停留在概念、原理阶段,成熟的应用很少, 因此本文的研究重点为基于本体论的语义检索中用到的关键技术,如构造通用的 系统框架和领域本体的构建问题,并准备设计开发一个实际系统来验证现有的理 论。 1 2 本文工作 本文研究内容是基于本体论的语义检索。本文在总结信息检索研究现状的基 础上,针对传统信息检索的弊端研究了基于本体论的语义检索的相关概念、原理 和技术,提出了一种基于本体论的语义检索模型系统框架和一种领域本体的构建 方法,并通过一个语义检索系统验证了系统框架和本体构建方法的可行性。 第一章绪论 5 本文的工作主要体现在以下几个方面: ( 1 ) 目前本体论在语义检索中的应用很少,缺少成熟的系统框架,本文提出了 一种基于本体论的语义检索模型系统框架,此系统框架的设计思想是通用的,对 开发和设计实际的语义检索系统具有理论指导意义; 【2 ) 针对基于本体论的语义检索最关键的技术还是领域本体的构建,提出了一 种领域本体的构建方法,此方法易学、易用,减少了系统开发的工作量,并且为 解决本体的自动构建问题提供了一个新的思路; 仔) 为了验证本文提出的系统框架和领域本体的构建方法的可行性,本文设计 和开发了一个基于本体论的语义检索系统一果品语义检索系统( f m i t s r e t r i e v e ) 。 此系统对实现其他领域的基于本体论的语义检索系统也有重要的参考价值。 1 3 本文结构 全文共由五章组成。结构如下: 第一章为绪论,介绍了信息检索的研究现状并在分析了传统信息检索存在的 五个较突出的问题的基础上得出结论,即在信息快速增长的今天,传统信息检索 机制由于缺乏必要的智能性,难以适应时代发展的需要,急需新的智能信息检索 机制的出现。语义检索作为智能信息检索技术的两大发展方向之一,在智能信息 检索领域占有极其重要的位置。而本文的研究内容即基于本体论的语义检索利用 本体构建概念空间不仅具有一定的语义处理能力和较好的自然语言接口,而且可 以处理有关概念关系的问题,从两具有重要的研究价值。 第二章为全文的理论基础,介绍了有关本体论的相关理论知识,包括本体定 义、逻辑模型、建模元语、已有的本体及其分类。 第三章为基于本体论的语义检索,这一章里通过概念比较引出了基于本体论 的语义检索概念,介绍了基于本体论的语义检索模型系统运行环境及基本特点, 提出了一种模型系统框架,然后针对领域本体的构建方法问题,结合两种常见的 构建方法,提出了一种新的领域本体构建方法一面向对象构建法。 第四章,针对第三章的提出的基于本体论的语义检索模型系统框架和本体构 建方法通过实现果品语义检索系统( f r u i t s r e t r i e v e ) ,验证了提出的模型系统框架 和本体构建方法的可行性。 第五章对全文工作的特点和不足做了总结,并对基于本体论的语义检索的未 来发展作出了展望。 第二章本体论 第二章本体论 7 本体论( o n t o l o g y ) 为语义检索为语义检索提供了可共享、概念化的知识体 系。它是语义检索中实现知识理解和推理的基础,因此,本章将介绍本体论的相 关理论知识。 2 1 本体的定义 o n t o l o g y 最早属于哲学的范畴,它被定义为“客观存在的一个系统的解释和 说明,客观现实的一个抽象本质”,后来被应用到人工智能领域,研究人工智能的 n e c h e s 等人将本体定义为“给出构成相关领域词汇的基本术语和关系,以及利用 这些术语和关系构成的规定这些词汇外延的规则的定义”i ”l ;这个定义实际上给 出了构造本体的过程,即:找出基本的术语和术语间的关系及相应的规则,然后 给出这些术语和关系的定义。在计算机界,1 9 9 3 年,g m b e r 给出了本体的一个最 为流行的定义,即“本体是概念模型的明确的规范说明”l 。后来,b o r s t 对此稍 做修改,提出:“本体是共享概念模型的形式化规范说明川“。 s t u d e r 等对上述的定义进行了深入的研究,认为本体是共享概念模型的明确的 形式化规范说明。这个定义是目前为止最完善的定义,它体现了o n t o l o g y 的四层 含义1 1 6 1 1 7 l : ( 1 ) 概念模型( c o n c e p t u a l i z a t i o n ) :通过抽象出客观世界中一些现象( p h e n o m e n o n ) 的相关概念而得到的模型,概念化所表现的含义独立于具体的环境状态。 ( 2 ) 明确( e x p l i c i 0 :所使用的概念及使用这些概念的约束都有明确的定义。 ( 3 1 形式化( f o r m a l ) :本体是计算机可读的( 即能被计算机处理) 。 ( 4 ) 共享( s h a r c ) 本体中体现的是共同认可的知识,反映的是相关领域中公认 的概念集,它所针对的是社会范畴而非个体之间的共识。 除了上述定义以外,不少文献从不同的领域和角度出发对本体给出了各种各 样的定义,这些定义之问是相互补充的,并且不断的扩充了本体的应用范围,但 是它们的共同点都包含了g r u b e r 定义中所指出的事实:“本体是反映客观存在的概 念模型,是对概念模型的明确描述”。 本体的目标是捕获相关领域的知识,提供对该领域知识的共同理解,确定该 领域内共同认可的词汇,并从不同层次的形式化模式上给出这些词汇( 术语) 和词汇 之间相互关系的明确定义。目前o n t o l o g y 已经在人工智能、计算语言学以及数据 8 基于本体论的语义检索研究 库理论中占有重要的地位。并且在知识工程、知识表示、定性模型、语言工程、 数据库设计、信息模型、信息集成、基于对象的分析、信息检索和析取、知识管 理和组织、基于智能代理的系统设计等研究领域中得到认可和应用,并具体应用 到企业集成、自然语言翻译、医学、医学工程、产品信息标准化、电子商务、地 理信息系统、法律信息系统、生物信息系统等基于o n t o l o g y 的信息系统中。 2 2 本体的逻辑模型 本体模型的研究还处于起步阶段,本体模型的形式化以及模型验证问题,目 前仍是知识工程与管理领域中的一个研究热点。大多数的本体模型都是基于一阶 逻辑,如o n t o l i n g i i a 1 8 j ,c y c l 埘,l o o m l 2 0 1 等。尽管一阶逻辑具有很强的表达能 力,但其推理过程复杂,不利于本体模型的检验。描述逻辑( d e s c f i p t i o nl o g i c ,d l ) 是一族描述概念和概念层次关系的知识表示语言。相对于语义网络、框架结构, d l 具有形式化、基于逻辑的语义,还可以转换成一阶谓词逻辑。尽管d l 没有一 阶逻辑的表达能力强,但推理复杂度是可知的,更适用于本体检验。尤其是d l 的 语法容易转换成x m l r d f 形式,因此基于d l 的本体模型更适合w e b 环境下概 念建模与信息查询。 定义1 本体模型:给定术语描述语言l ,本体模型是一个4 元组,记作o = 。其中,t 是术语集。t 中的术语被称为原子术语,包括原子类术语 c ( 简称原子类) 与原子属性术语p ( 简称原子属性) ,记为t 主( c ,p 。本体的属性有 2 种类型:类属性和数值属性。类属性表示类之间的关系,而数值属性表示类的属 性;t d 是术语定义集,定义t 中的术语;x 为实例集;x d 为实例声明集,用来 声明t 的实例。图2 1 给出了一个关于家庭的本体模型。 o n - 由- i 鼬h - 山,- - i - k - 口哇一n n 畸, - 嘲c 删h a d l , a l t , a 一。 r k 白蕾- 吐_ , 眦钿i 1 - b t a m 帅1 i w - m i 辆nf i u - - p h 几1h 帕觚 几j - 咖 _ - 蹦一- _ _ nh a m o , a d h 聃曩 一- 啊时u 叫_ - 如- _ _ 一几j 嘲 _ 一 a - i - n3 1 一e m u ,岫_ 眦峨- 岫门v 嘲,1 ( l - i i l - ( t - ) ! 竺竺! 塑! :! ! 竺型! 苎苎! :型:! 苎型竺! 竺:竺型! : 图2 1 一个基丁描述逻辑的本体模型例子 定义2 本体解释:给定本体0 = ,本体解释为一个2 元组, 记为i = 。其中,i 驴为o 的论域,1 是解释函数,它将t 中的每个 原子类c 都映射为i 的一个子集d - - - a 1 ,将t 中的每个原子属性p 都映射为一 个二元关系p l 1 a i ,将x 中的每一个体a 映射为1 中的元素a i e a l 。 第二章本体论 ( 1 ) 本体模型的术语集及术语定义集 本体模型的术语集由原子术语构成。原子术语还可以通过术语构造符形成术 语公式,来定义其他术语,即复合术语。给定术语描述语言l 我们将遵循下面语 法的表达式称为基于l 的术语公式,简称k 术语公式: d ,e - + c l t i 上i 1c ld i i e ivp d ijp d ( 1 ) ( i ) 任何原子类术语c 都是一个l - - :术语公式; ( i i ) 任何原子类术语的否1c 都是一个l 广术语公式; ( i i j ) j 恿用类t 和空类上也是k 术语公式; ( i v ) 假设d 和e 为术语公式,p 为原子属性,以下形式也是l 术语公式: d i - i e ;vp d :jp ,d 由表2 1 中的构造符的本体解释可以看出,术语公式的表达能力取决于l 所支 持的术语构造符的类型。式( 1 ) 中l 仅仅支持表2 1 中的6 种基本构造符。l 又 被称为基本术语描述语言,记为l b ,相应的术语公式记为k 术语公式。为了增 强l 的术语描述能力,需要引入更复杂的术语构造符,对l 进行扩展。见表2 2 。 表2 1 对各种基本术语构造符进行的解释 构造符的名称构造符的语法构造符的本体解释 t 通用类止1 上空类 上1 西 原子否 ( c ) :。c 1 d i - i e 术语合取 ( d 丌e ) = d 1 7 e 1 vp d 属性值约束( vp d ) = a a 1 i vb ( a ,b ) pj b d 1 3p t 限定性存在约求( 3p 。t ) = a 1 1 3b ( a ,b ) e p l 表2 2 扩展的本体术语构造符及本体解释 构造符的名称构造符的语法 构造符的本体解释 d i l le术语析取( d u e ) 1 = d 1 ue | 1 d 菲原子否( 1d ) = 1 d 1 | p d非限定性存在约束( jp c ) 1 = a 1 i jb ( a b ) e p la b e c i n ,p最小数目约束 ( p c ) 1 = a e a l b i ( a ,b ) p i i n n ,p 最人数据约束 ( p c ) 1 = a 10 b i ( a ,b ) p 1 ) i n 定义3 包含关系:给定语言l 和本体o = ( t ,x ,t d ,x d ,d 、e 为2 个l _ 术语公式,若对任意本体解释,有d 1 生e i ,则称e 包含d ,记为d s e 。 定义4 等价关系:给定语言l 和本体d = ,d 、e 为2 个l - 术语公式。若对任意本体解释,有d s e 和e d ,则称d 与e 等价,记为d = e 。 性质1 :若d 、e 为2 个术语公式,p 为属性,有以下等价关系成立: ( i ) d i 1d = i ( i i ) d l i1 d _ t 1 0 基于本体论的语义检索研究 ( i i i ) d i i e = 1 ( 1d i - 1 1e ) ( i v ) jp d = - 1 ( vp 1d ) ( v ) vp d = 1 ( jp 1 d ) ( v i ) 1 ( ( n + 1 ) ,p ) = n ,p ( v i i ) 1 ( n ,p ) = ( n + 1 ) ,p ( v i i i ) p ( c ud ) = jp c ujp d ( i x ) vp ( c l i d ) = vp c uv p d 性质2 :若d 、e 为2 个术语公式,p 为属性,有以下包含关系成立: ( i ) d 兀e s d :d h e s e ( i i l d s d he ;e d 1 1e ( i i i ) vp d s vp e ,如果d 主e ( i v ) jp d ap 。e ,如果d e ( v ) = = n ,p s m ,p ,如果n m ( v i ) - - - n ,p m ,p ,如果n m ( v i i ) jp ( c 兀d ) s | p c r pp d ( v i i i ) vp ( c 兀d ) s vp c 兀v p d 定义5 术语定义项:术语定义项实际上是一个等价关系c = d ,表示c 用d 来 定义。c 称为术语定义项的前项,d 称为后项。其中,c 是原子类术语,d 是术语 公式。给定本体o : ,术语定义集t d 由若干个满足以下条件 的术语定义项组成,表示为t d = c l = d l ,c 2 = d 2 ,c n = d n 。 其中c i e t ,d i 为术语公式,d i 中的术语均来自t 。 ( i ) 对任何i ,j ( i - j ,1 i n 1 q n ) ,有c i g c j 。 ( i i ) 如果存在c i i = d 1 1 ,c 1 2 = d 1 2 ,c i m = d i m ,且c l i 出现在d l i 1 中( 1 完全非形式化:这种o n t o l o g y 完全使用自然语言来描述,其机器可理解 性最差,目的在于帮助人们阅读、理解形式化程度更高的本体。如爱丁堡 大学企业项目中的e n t e r p r i s eo n t o l o g y 自然语言版。 结构非

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论