(计算机应用技术专业论文)基于概念相似度的科技论文检索研究.pdf_第1页
(计算机应用技术专业论文)基于概念相似度的科技论文检索研究.pdf_第2页
(计算机应用技术专业论文)基于概念相似度的科技论文检索研究.pdf_第3页
(计算机应用技术专业论文)基于概念相似度的科技论文检索研究.pdf_第4页
(计算机应用技术专业论文)基于概念相似度的科技论文检索研究.pdf_第5页
已阅读5页,还剩41页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 随着信息化的迅猛发展,网络已成为人们获取信息的主要来源。但是,人们获 得个人价值偏向的信息( 知识) 表现为两种困惑:( 1 ) w e b 页面的无结构性、超链 接的无序性以及信息的海量性导致信息迷航;( 2 ) 信息资源缺少统一的语义描述, 使得用户难以查找到与需求相关的资源。如何在大量信息中找到对于用户有价值的 信息已经成为信息检索领域的一个研究热点。 近年来,本体技术的发展为这一问题的解决提供了技术支持。基于本体的信息 检索是基于知识的、语义上的检索,它弥补了传统的基于关键字信息检索技术的缺 陷,从而在查准率和查全率上有更好的保证。本体是语义网的核心,它作为一种领 域知识概念化和模型化的方法,可用来描述计算机处理数据的语义信息。语义网旨 在赋予w e b 上所有资源唯一的标识,并在资源之间建立起机器可处理的各类语义联 系。为了将无序的w e b 变成有序的计算机可理解的知识库,语义网采用多层次的表 示框架,本体位于从文档描述到知识推理转折的层次,因此本体的构建是实现语义 网的关键环节。本体是用来描述某个领域甚至更广范围内的概念以及概念之间的联 系,使得这些概念和联系在共享的范围内有着明确唯一的定义,达成一种共识,这 样人和机器之间就可以进行交流。由于概念是组成信息的最小单位,所以概念的相 似度计算研究在信息检索中显得相当重要,在推荐和过滤、数据挖掘等领域也有广 泛的应用,是当今信息技术领域研究的关键技术。而本体在信息检索和人工智能领 域的广泛应用,为概念相似度计算研究提供了新的方法。 本文围绕基于本体的概念相似度计算进行研究。首先,介绍了本体理论和技术, 包括本体的形式化定义、建模元语、描述语言、构建、分类等,为基于本体的概念 相似度计算提供了理论基础。其次,本文提出了一种基于本体的综合计算概念相似 度的模型,该计算模型综合考虑了四个因素,即属性相似度、语义距离、层次深度、 调节因子对概念相似度的影响。最后,本文利用本体建模工具p r o t 6 9 6 构建了一个科 技论文本体,利用j e n a 对科技论文本体进行解析,基于本文提出的计算概念相似度 的方法计算科技论文之间的相似度并对构建的科技论文本体o w l 文件进行扩展, 然后针对扩展论文相似度后的o w l 文件进行相关性检索,得到检索结果,并与未 扩展论文相似度的o w l 文件检索进行比较。该相关性检索不但能检索出在语法形 式上和查询条件相一致的结果,而且能检索出在语义上和检索条件相符的结果。实 验结果表明,该方法能提高检索质量,有效保证了检索结果的相关性,从而改善了 检索的查准率与查全率。 关键词:语义网;本体;概念相似度;科技论文检索 a b s t r a c t w i t ht h ed e v e l o p m e n to fi n f o r m a t i o nt e c h n o l o g y ,w e bh a sb e c o m eam a j o rs o u r c e o fi n f o r m a t i o na c c e s s i n g h o w e v e r ,t h ep e r s o n a lp r e f e r e n c ei n f o r m a t i o n ( k n o w l e d g e ) h a s t w op u z z l e s :( 1 ) n o n - s t r u c t u r a lw e b p a g e s ,t h ed i s o r d e r l yh y p e r l i n k sa n dm a s so f c o n t e n t l e a dt oi n f o r m a t i o nt r e k ;( 2 ) i n f o r m a t i o nr e s o u r c e sa r es h o r to fau n i f i e ds e m a n t i c d e s c r i p t i o na n di ti sd i f f i c u l tt of i n dr e l e v a n tr e s o u r c e sf o ru s e r s h o wt of i n dv a l u a b l e i n f o r m a t i o nh a sb e c o m eas t u d yf o c u so fi n f o r m a t i o nr e t r i e v a lt e c h n o l o g y i nr e c e n ty e a r s ,t h ed e v e l o p m e n to fo n t o l o g yt e c h n o l o g yp r o v i d es u p p o r tf o rt h i s p r o b l e m ,o n t o l o g y - b a s e di n f o r m a t i o nr e t r i e v a li sb a s e do nk n o w l e d g ea n ds e m a n t i c , w h i c hm a k eu pt h ed e f i c i e n c i e so ft r a d i t i o n a lk e y w o r d - b a s e di n f o r m a t i o nr e t r i e v a l t e c h n o l o g y ,i te n s u r et h a tr e s u l ti np r e c i s i o na n do nr e c a l li sb e t t e r o n t o l o g yi st h ec o r eo f s e m a n t i cw e b i ti sac o n c e p t u a l i z e da n dm o d e lo ff i e l dk n o w l e d g em e t h o dt h a tc a nb e u s e dt od e s c r i b es e m a n t i ci n f o r m a t i o nf o rc o m p u t e rp r o c e s s i n gd a t a s e m a n t i cw e bs e e k s t op r o v i d eu n i q u em a r kt oa l lt h er e s o u r c e so nw e b ,a n ds e tu pt h ev a r i o u st y p e s + o f s e m a n t i cc o n t a c tw h i c hc o m p u t e rc a nd e a lw i t hb e t w e e nr e s o u r c e s m a k ed i s o r d e r l yw e b t ob e c o m eo r d e r l yk n o w l e d g eb a s eo fc o m p u t e ru n d e r s t a n d a b l e s e m a n t i cw e bu s e m u l t i l e v e lr e p r e s e n t a t i o nf r a m e w o r k ,o n t o l o g yi sl o c a t e df r o mt h ed o c u m e n td e s c r i b e st o t h et u r n i n go fk n o w l e d g er e a s o n i n g ,s ot h ec o n s t r u c t i o no fo n t o l o g yi st h ek e yo f s e m a n t i cw e b o n t o l o g yi su s e dt od e s c r i b ec o n c e p t sa n dr e l a t i o n sb e t w e e nt h e s e c o n c e p t si nad o m a i no raw i d e rr a n g e ,i tm a k ec o n c e p t sa n dr e l a t i o n sh a v eac l e a r d e f i n i t i o n i ns h a r e dr a n g ea n dr e a c hac o n s e n s u st oe x c h a n g eb e t w e e nc o m p u t e ra n d p e o p l e b e c a u s ec o n c e p ti s t h es m a l l e s tu n i to fi n f o r m a t i o n ,r e s e a r c ho nc o n c e p t s s e m a n t i cs i m i l a r i t yi sv e r yi m p o r t a n ti nt h ei n f o r m a t i o nr e t r i e v a l i th a saw i d er a n g eo f a p p l i c a t i o n si nt h er e c o m m e n d a t i o na n df i l t e r i n g ,d a t am i n i n ga n do t h e rf i e l d s t o d a y ,i t i sak e yt e c h n o l o g yi nt h ef i e l do fi n f o r m a t i o nt e c h n o l o g y a n dw i d e s p r e a da p p l i c a t i o no f o n t o l o g yi nt h ef i e l do fi n f o r m a t i o nr e t r i e v a la r t i f i c i a li n t e l l i g e n c ep r o v i d e san e w a p p r o a c hf o rc o n c e p t ss i m i l a r i t yc o m p u t a t i o n i no u rw o r k ,o n t o l o g y b a s e dc o n c e p t ss i m i l a r i t yc o m p u t a t i o ni st h ef o c u so fs t u d y f i r s t l y ,i n t r o d u c t i o nt h e o r ya n dt e c h n o l o g yo fo n t o l o g y ,i n c l u d i n gt h ef o r m a ld e f i n i t i o n , m o d e l i n ge l e m e n tl a n g u a g e ,d e s c r i p t i o nl a n g u a g e ,c o n s t r u c t i o n ,c l a s s i f i c a t i o n ,i tp r o v i d e s at h e o r e t i c a lb a s i sf o ro n t o l o g y - b a s e dc o n c e p t ss i m i l a r i t yc o m p u t a t i o n s e c o n d l y ,w e p r o p o s ea no n t o l o g y - b a s e dc o m p r e h e n s i v ec o n c e p t ss i m i l a r i t yc o m p u t a t i o nm o d e l i t c o n s i d e r sf o u rf a c t o r s :p r o p e r t ys i m i l a r i t y ,s e m a n t i cd i s t a n c e ,h i e r a r c h yd e p t h ,r e g u l a t o r y f a c t o r s f i n a l l y ,w ec r e a t eap a p e ro n t o l o g yw i 付lo n t o l o g ym o d e l i n gt o o lp r o t 6 9 6 ,a n a l y z e t i p a p e ro n t o l o g y 、析吐lj e n a , a n dc o m p u t ep a p e r ss i m i l a r i t yb a s e do nt h em e t h o di no u r w o r ka n de x p a n do w ld o c u m e n t s ,c o m p a r er e t r i e v a lr e s u l to ft h ee x p a n d e do w l d o c u m e n t sa n dn o n e x p a n d e do w ld o c u m e n t s t h er e l e v a n c er e t r i e v a ln o to n l ys e a r c h i nt h ef o r mo fg r a m m a ra n dc o n s i s t e n tq u e r yr e s u l t s ,b u ta l s os e a r c hi ns e m a n t i c t h e e x p e r i m e n t a lr e s u l t ss h o wt h i sm e t h o do fc o m p u t i n gc o n c e p t ss i m i l a r i t yc a l li m p r o v et h e q u a l i t yo fs e a r c h ,a n dw o u l de f f e c t i v e l yg u a r a n t e et h er e l e v a n c eo fs e a r c hr e s u l t st o i m p r o v et h er e t r i e v a lp r e c i s i o na n dr e c a l l k e yw o r d s :s e m a n t i cw e b ;o n t o l o g y ;c o n c e p t ss i m i l a r i t y ;l i t e r a t u r er e t r i e v a l i i i 独创性声明 本人郑重声明:所提交的学位论文是本人在导师指导下独立进行研究工作所取得 的成果。据我所知,除了特别加以标注和致谢的地方外,论文中不包含其他人已经发 表或撰写过的研究成果。对本人的研究做出重要贡献的个人和集体,均已在文中作了 明确的说明。本声明的法律结果由本人承担。 学位论文作者签名: i 曼邀型日期:趔拿! 尘:丝一 学位论文使用授权书 本学位论文作者完全了解东北师范大学有关保留、使用学位论文的规定,即:东 北师范大学有权保留并向国家有关部门或机构送交学位论文的复印件和电子版,允许 论文被查阅和借阅。本人授权东北师范大学可以采用影印、缩印或其它复制手段保存、 汇编本学位论文。同意将本学位论文收录到中国优秀博硕士学位论文全文数据库 ( 中国学术期刊( 光盘版) 电子杂志社) 、中国学位论文全文数据库( 中国科学技 术信息研究所) 等数据库中,并以电子出版物形式出版发行和提供信息服务。 ( 保密的学位论文在解密后适用本授权书) 学位论文作者签名:蔓控亟鲫p 指导教师签名: e l 期:c 迦拿! s :玛。 日期: 学位论文作者毕业后去向: 工作单位: 通讯地址: 迹炉 电话: 邮编: 东北师范大学硕士学位论文 第一章绪论 1 1 问题的提出及研究意义 1 1 1 问题的提出 随着因特网技术的发展,网上的信息越来越多,发展速度极为惊人,人们获取 信息的方式也不再只局限于书本上,更多的时候是利用网上的电子资源。各类学术 论文也逐渐摆脱传统平面传媒的限制,以电子文档的形式在网上传播。整个网络正 在形成一个前所未有的超级信息数据库,面对如此海量的信息,人们往往把大量的 时间花费在筛选信息上。因此,怎样快速准确地检索出相关信息已经成为当今信息 领域的研究热点。 传统的信息检索方法只是对用户输入的关键词和w e b 文档进行机械的匹配,没 有去理解用户的查询意图【。造成这些问题的实质在于传统的信息检索技术所采用 的只是基于语法层面上字、词的简单匹配,而缺乏对知识的表示、处理和理解能力。 解决这些问题的关键是把信息检索从传统的关键字层面提高到知识( 或语义) 层面 上,理解用户的查询意图,基于更全面的用户需求来对w e b 文档进行处理,进而得 到合理的检索结果。在人的大脑中,概念并不是孤立存在的,它总是与其它概念之 间存在着各种各样的联系,正是这种网状的联系构成了现实世界。而在传统信息检 索中,这种概念之间的语义联系是很难描述的。片面追求高的查全率导致了检索结 果的数量过于庞大,用户根本没有时间和精力处理检索到的所有结果。总之,在信 息快速增长的今天,传统信息检索机制由于缺乏必要的智能性,难以适应时代发展 的需要,寻找新的方法也就成为目前研究的热点。 1 1 2 研究意义 信息检索作为信息学领域中最活跃的研究分支之一,其涉及到多学科领域的交 叉合作,主要包括:信息的组织、存储、索引,异质数据源的集成以及人工智能等 技术,信息检索技术的研究与发展和这些相关领域的发展是息息相关的。近年来, 针对传统的信息检索存在的问题,基于语义和知识的w e b 检索研究具有重大的意义。 实现语义检索的关键在于对知识的表达和基于知识的推理,具体表现为对概念、 属性及其之间关系的表达和基于特定规则的概念之间关系的推理。语义网( s e m a n t i c w e b ) 具有良好的概念层次和对逻辑推理的支持,现己被广泛应用于知识表达、知 识共享及重用。而语义网的核心本体( o n t o l o g y ) 作为一种能在语义和知识层次上 描述信息系统的概念建模工具,自被提出以来就引起了国内外众多科研人员的关注, 东北师范大学硕士学位论文 并在计算机的许多领域得到了广泛的应用,如知识表示与管理、信息系统建模、信 息集成、面向对象分析、软件复用、信息检索和w e b 上异构信息的处理、语义w e b 等。本体具有良好的概念层次结构和对逻辑推理的支持,本体作为一种知识的组织 方式,定义了组成某领域的词汇表的基本术语及其关系,并结合这些术语和关系定 义了词汇表外延的规则,它真正地反映出事物的本质特征,是真正实现基于概念及 其相互关系的语义检索的知识表达的理想之选【2 1 。由于概念是组成信息的最小单位, 所以概念之间语义的相似度计算研究在信息检索领域显得相当重要。将本体技术应 用到信息检索领域,尤其是应用到概念相似度计算的研究中对计算机智能检索有很 好的推动作用,已成为当前研究的热点,具有很好的研究意义。 1 2 国内外研究现状 随着本体在信息检索、人工智能等领域的广泛应用,利用本体来计算概念相似 度已经成为当前研究的主要方法之一。在这方面国内外学者也做了大量的工作,如: r e s n i k 3 】根据两个词的公共祖先节点的最大信息量来衡量两个词的语义相似度; a g i r r e 等 4 1 在利用w o r d n e t 计算词语的语义相似度时,除了结点间的路径长度外, 还考虑到概念层次树的深度( 即路径长度相同的两个结点,如果位于概念层次的越 底层,其语义距离较大) 和概念层次树的区域密度( 即路径长度相同的两个结点, 如果位于高密度区域,其语义距离应大于位于低密度区域的) ;l is u j i a n 掣5 j 提出了 一种词语语义相似度的计算方法,计算过程综合利用了知网和同义词词林; 刘群等【6 】贝0 利用了h o w n e t 将概念之间的相似度计算转化为对概念的义原之间的相 似度计算,通过计算义原间的距离确定概念相似度;朱礼军掣7 】引入了计算语言学 中的语义距离思想来计算领域本体中概念间的相似度;杨喜权等f 8 】基于知网对 概念匹配进行了细粒度化研究。 目前,概念语义相似度的计算主要从三个不同的角度进行研究:( 1 ) l e a c o c k 提出的基于距离的语义相似度计算模型【9 】;( 2 ) l i n 提出的基于信息内容的语义相似 度计算模型【1 0 1 ;( 3 ) t v e r s k y 等人提出的基于属性的语义相似度计算模型1 1 】。 1 3 本文的研究内容和研究目的 本文将本体技术应用到信息检索领域,使信息检索语义化、知识化,更方便用 户对信息的检索与查询,从而提高信息检索的查准率和查全率。主要从以下三个方 面进行研究: 1 领域本体的构建:通过对本体概念、本体建模元语、本体描述语言以及本体 构建方法等理论技术和方法的学习和研究,在专家的帮助下利用本体建模工具构建 一个科技论文本体,用o w l 本体描述语言对该本体的概念、属性、实例以及概念 之间的关系进行描述。 2 基于本体的概念相似度计算;本文综合考虑了四种因素对概念相似度的影响, 东北师范大学硕士学位论文 即属性相似度、语义距离、层次深度、调节因子,提出一种基于本体的综合计算概 念相似度的方法。通过实验证明,该方法对文本分类的准确率有所提高。 3 基于概念相似度的科技论文检索:利用j e n a 对已建立的科技论文本体进行 解析;基于本文提出的概念相似度计算方法计算论文之间的相似度,然后对本体 o w l 文件进行论文相似度扩展;基于科技论文本体o w l 文件进行检索,比较扩展 前后的检索结果。通过实验证明,该方法对检索的查准率、查全率和f 值都有不同 程度的提高。 本文的主要研究目的就是通过基于本体的概念相似度计算把信息检索从基于关 键字的语法匹配提升到基于知识( 或上下文) 层面的语义匹配,从而提高检索的查准 率、查全率和f 值。概念的相似度计算是语义检索过程中的重要环节,提高概念相 似度计算精度是提高检索质量的关键技术之一。 1 4 本文的结构 本文的组织结构如下: 第一章绪论。包括问题的提出及研究意义、国内外研究现状、本文的研究内容 和研究目的以及本文的结构安排。 第二章理论基础概述。首先,简要介绍了语义网及其结构,以及语义网与本体 的关系;其次,介绍了本体的概念、本体的建模元语、本体的描述语言、本体的构 建以及本体的分类;最后,阐述了本体在信息检索中的应用。 第三章基于本体的概念相似度计算。本章是本文研究的重点,首先,阐述了概 念相似度在信息检索中的应用;其次,介绍了几种传统的概念相似度计算方法及其 优缺点;最后,提出一种基于本体的综合概念相似度的计算模型,并通过实验来证 明该方法对文本分类的准确率有所提高。 第四章基于概念相似度的科技论文检索。本章是基于本体的概念相似度计算的 一个应用,首先,构建了一个科技论文本体,并对该本体进行解析;其次,利用本 文提出的综合计算概念相似度的方法计算论文之间的相似度,并对科技论文本体 o w l 文件进行论文相似度扩展;最后,对扩展论文相似度前后的o w l 文件进行相 关性检索,比较检索结果。实验证明,该方法对科技论文检索的查全率、查准率和 f 值都有不同程度的提高。 第五章总结与展望。对本文工作进行总结,指出有待改善之处,并提出对下一 步工作的展望。 东北师范大学硕士学位论文 第二章理论基础概述 2 1 语义网 2 1 1 语义网简介 万维网( w o r l dw i d ew 曲,w w w 或w e b ) 于1 9 8 9 年起源于欧洲的一个国际核能 研究院( c e r n ) 中,t i mb e m e r s l e e t l 2 】结合超文本和因特网的研究成果于1 9 9 0 年1 2 月建立了第一个万维网的原型系统。到1 9 9 6 年,w e b 上的网页主要仍是静态页面, 这段时期称为第一代w e b 。1 9 9 6 年至今,w e b 发展到第二代w e b ,其特点是动态网 页的大量使用以及基于w e b 应用的大量产生。第二代w e b 上的信息都是直接提供给 人来处理的,如页面浏览,页面交互。w e b 上的信息都是h t m l 页面的形式,而 h t m l 是一种面向表现的语言,这样计算机知道怎样去显示一个页面,但并不能真 正理解这个页面的含义,因此在w e b 上的一些应用,如信息检索、电子商务和智能 a g e n t 等无法真正实现智能化和自动化。为了让w e b 发挥更大的潜能,t i m b e m e r s l e e 于1 9 9 8 年首次提出,并在2 0 0 0 年1 2 月召开的x m l 2 0 0 0 会议上进一步 明确阐述了语义万维网l l3 】的设想,这可称为第三代w e b 。 语义万维网( 简称语义网) 期望w e b 上的数据通过另一种不同于现在的方式描 述和链接,使这些数据不仅能以各种灵活的方式展现出来,也能被不同的应用程序 所自动处理、综合、重用。在语义网中,网页所蕴含的语义信息能使计算机完成大 部分的自动化处理工作,例如软件代理程序通过网页中的语义可以为用户完成复杂 的旅行计划制定等任务,即从当前“机器可阅读”的万维网扩展为“机器可理解” 的语义万维网。根据上面的描述,人们可以给语义网下这样的定义:语义网就是机 器可以理解数据含义的下一代万维网,其上的“语义 信息蕴含在各个资源节点的 逻辑联系中。从语义网的发展起源来看,语义网是人工智能领域和互联网技术相互 结合的产物。万维网经过十几年的发展,积累的海量数据需要一种新的、机器可以 自动完成的方式来处理和管理。语义网也是以知识的概念化表示为基础展开的,语 义网中的知识就是一系列有关资源对象的建模描述,资源是一个非常广泛的概念, 它可以是网站、网页、甚至是网页的某一部分内容,通过采用某种形式化的符号表 达式对资源之间的关系进行刻画。语义网上的知识具有创建上的分散性,同时又具 有应用上的通用性,这是语义网和传统的人工智能系统的一个非常重要的区别。 2 1 2 语义网结构 信息资源根据其所处的层次不同,可以被划分为不同的“阶 或“势 ,其中, 东北师范大学硕士学位论文 现实世界中未经加丁处理的信息属于零阶,在整个信息层次结构中处于最底层:网 页资源信息处在第一阶在对h t m l 页面经过初次加工z 后,所获得的网页标引或 索引信息处在第二阶:有关信息资源对象的元数据或模式信息则是属于第i 阶的信 息;而逻辑推理、真值证明等信息应具有更高的阶值。在信息层次结构中,阶值越 低的信息越具体详实较适合于人为处理:阶值越高的信息其抽象程度越高,则更 适台于机器的自动化处理。当代万维叫上的信扈是杂乱的、无序的,将数据内容和 表现形式混在一起,其中不同“阶”的信息没有被区别对待,这就导致了人们在信 息使用k 的困难。因此,语义网首要解决的问题就是建立起合理的信息层次结构, 使其上面的信息是结构良好且柏亭的。语义网的日标是使得w e b 上的信息具有计算 机可以理解的语义,满足智能软件代理对w e bt 异构和分布信息的有效访问和检索。 下面是t i mb e m e r s l e e 为未来w e b 发展提出的语义网的体系结构,如图21 所 不。 、 r 、k 图2 1 语义同的体系结构 谚体系从低层到高层分别为:u n i c o d e 和u r i 、x m l 、r d f 、o n t o l o g y 、l o g i c 、 p r o o f 圳瑟? 而s r 。 第层u n i c o d e 和u r i ,该层是整个语义w e b 的基础,其中u n i c o d e 是处理资 源的编码,u m 负责标识资源。 第一层x m l + n s - - x m l s c h e m a ,用于表示数据的内容和结构。 第三层r d f + r d f s c h e m a ,i 扫于描述w e bk 的资源及其类型。 第【r q 层o n t o l o g yv o c a b u l a r y ,用于描述各种资源之间的联系。 第五层到第七层包括l o g i c ( 公理和推理规则) 、p r o o f ( 认证机制) 及t r u s t ( 信 任机制) ,是在下面4 层的基础上进行的逻辑推理操作。 其中,核心层为“l :r d f 、o n t o l o g y ,这三层用于表示w e b 信息的语义。 在语义网中,信息都被赋予了明确的含义,机器能够自动地处理和集成网上可 用的信息。语义网使用x m l 柬定义定制的标签格式以及用r d f 的灵活性来表达数 据下步需要的就是一种本体的网络语言柬描述网络文档中的术语的明确含义及 e 东北师范大学硕士学位论文 它们之间的关系。语义网的目的是最终得到一个可信任的网络,每个人都可以在上 面获取知识、寻求帮助。但是,语义网的实现还是一个长期的过程。从目前的情况 来看,语义网下面三层的研究已经开展了较长的时间,研究成果相对较多,并推出 了一系列的标准,可以说为语义网的实现奠定了比较坚实的理论基础。本体层和逻 辑层正在引起越来越多的关注,作为语义网中从语法处理向语义处理的转折,这两 层起着至关重要的作用,相关研究正处在探索之中,已有很多有意义的尝试和应用, 因此成为语义网领域的研究热点。顶部的两层还没有得到可靠的论证,还只是基于 逻辑系统的一个构想。 2 1 3 语义网和本体 x m l 和r d f 都能为所表述的资源提供一定的语义,但是x m l 中的标签( t a g ) 和r d f 中的属性( p r o p e r t i e s ) 集都没有任何限制。本体通过对概念的严格定义和概 念之间的关系来确定概念的含义,表示共同认可的、可共享的知识,可以解决这个 问题。因此在语义网中,本体具有非常重要的地位,是解决语义层次上w e b 信息共 享和交换的基础。本体是语义网中的核心部分,他们既有联系又有区别【1 4 j 。 联系:本体和语义网都是知识表示的形式,均可以通过带标记的有向图来表示, 适合于逻辑推理。区别:从描述的对象和范围方面来说,本体是对共享概念模型的 规范说明,即其概念在某个特定领域是公认的,是面向特定领域的概念模型。而语 义网从数学上讲是一种带有标记的有向图,最初用于表示命题信息,现广泛用于专 家系统表示知识。其节点表示物理实体、概念或状态,边表示关系,但是对节点和 边都没有特殊规定,所以描述的范围比本体广;从表示的深度方面来说,本体有5 个要素:类、关系、函数、公理和实例,它通过这5 个要素来严格、正确地刻画所 描述的对象。而语义网深度上不如本体,对建模没有特殊要求;从建模条件方面来 说,本体的建立必须有专家的参与,相对更加严格和困难,这也是本体目前的主要 缺点之一,而语义网不必有专家的参与。 2 2 本体 2 2 1 本体的概念 近年来,在计算机科学中关于本体的研究越来越多。本体最早是一个哲学的术 语,是对客观存在的一个系统、全面的解释,其核心是表示客观现实的抽象本质。 后来随着人工智能的发展,被赋予了新的定义。通俗地讲,本体是用来描述某个领 域甚至更广范围内的概念以及概念之间的关系,使得这些概念及其关系在共享范围 内具有大家共同认可的、明确的、唯一的定义。这样,人机之间以及机器之间就可 以进行交流。 最初人们对本体的理解并不完善,它的定义也处在不断的发展变化中,比较有 东北师范大学硕士学位论文 代表性的有:1 9 9 1 年,n e c h e s 【1 5 】等人给出构成相关领域词汇的基本术语和关系,以 及利用这些术语和关系构成的规定这些词汇外延的规则的定义;1 9 9 3 年,g m b e r 【l 6 j 给出本体是概念模型的明确的规范说明;1 9 9 8 年,s t u d e r 1 7 1 给出本体是共享概念模 型的明确的形式化规范说明,其体现了本体的四层含义: ( 1 ) 概念模型:通过抽象出客观世界中一些现象的相关概念而得到的模型,其 表示的含义独立于具体的环境状态。 ( 2 ) 明确:所使用的概念及使用这些概念的约束都有明确的定义。 ( 3 ) 形式化:本体是计算机可读的。 ( 4 ) 共享:本体中体现的是共同认可的知识,反映的是相关领域中公认的概念 集,它所针对的是团体而不是个体。 2 2 2 本体建模元语 p e r e z 1 8 】等人用分类法组织了本体,归纳出5 个基本的建模元语: ( 1 ) 类( c l a s s ) 或概念( c o n c e p t ) :指任何事务,如工作描述、功能、行为、 策略和推理过程。从语义上讲,它表示的是对象的集合,其定义一般采用框架结构, 包括概念的名称,与其它概念之间的关系的集合,以及用自然语言对概念的描述。 概念的含义很广泛,可以指任何事物,如工作描述、功能、行为、策略和推理过程 等。 ( 2 ) 关系( r e l a t i o n ) :在领域中概念之间的交互作用,形式上定义为n 维笛卡 儿积的子集:r :c l xc 2 - c n ,如子类关系( s u b c l a s s o f ) 。在语义上关系对应于对 象元组的集合。 ( 3 ) 函数( f u n c t i o n s ) :一类特殊的关系。该关系的前n 。1 个元素可以唯一决定 第n 个元素。形式化的定义为f :c l x c 2 x c - 1 一c 。 ( 4 ) 公理( a x i o m s ) - 代表永真断言,如概念乙属于概念甲的范围。 ( 5 ) 实例( i n s t a n c e s ) :代表元素。从语义上讲实例表示的就是对象。 另外,从语义上讲,基本的关系共有4 种:p a r t o f 表达概念之间部分与整体的 关系,例如“叶子 是“树”的部分:k i n d o f 表达概念之间的继承关系,类似于 面向对象中父类与子类之间的关系,例如“红葡萄酒”是“葡萄酒 的一种;i n s t a n c e o f 表达概念的实例与概念之间的关系,类似于面向对象中的对象和类之间的关系,例 如“老虎”是“食肉动物”这个类的一个实例;a t t r i b u t e o f 表达某个概念是另一个 概念的属性,例如“气味”是“葡萄酒 这一概念的一个属性。 概念之间的关系不仅仅限于这四种基本关系,还可以根据特定领域的具体情况 定义相应的关系,以满足应用的需要,如交( i n t e r s e c t i o n o f ) 、并( u n i o n o f ) 、差 ( d i f f e r e n c e 。o f ) 和子类关系( s u b c l a s s o f ) 等。 东北师范大学硕士学位论文 2 2 3 本体的描述语言 为了便于w e b 上应用程序使用方便,需要确一个通用的柄准语言来表示本体, 就像x m l 作为标准的数据交换语言一样。丰体捕述语言有多种,代表性的有:s h o e 、 x o l 、k d f 、r d f s 、o i l 、d a m l + o i l 和o w l 等。这些语i 除了s h o e 的语法 基于h t m l 之外,其他语言的语法都基于w e b 上信息交换的标准语言x m l 。下面 给出了w 3 c 的o n t o l o g y 语言栈描述 1 ,如图2 2 所示。 t h eo n t o l o g yl a n g u a g es t a c k 图2 2o n t o l 0 9 2 , 语i 枉描述 其中,x m l 足结构化文档的表层语法,对文档没有f t 何语义约束:x m ls c h e m a 是定义x m l 文档的结构约束的语言r d f 是对象( 或者资源) 及其之问关系的数 据模型,为数据模型提供了简单的语义,这些数据模型能够用x m l 语征进行表达; r d fs c h e m a 是描述r d f 资源的属性和类型的词汇表,提供了对这些属性和类别的 普遍层次的语义;o w l 添加了更多的用于描述属性和类型的词汇,例如类型之问 的不相交性( d i 自o i n t ) 、基数( c a r d i n a l i t y ) 、等价性( e q u a l i t y ) ,属性的史丰富的类 型,属性特征,如:对称性( s y r n m e 帆) ,以及枚举类型( e n u m e r a t e d ) 等。 o w l ( w e b o n t o l o g yl a n g u a g e ) 是由w 3 c 设计的一种针刘网上资源的语义 标记和本体描述语占,它是对d a m l + o i l 的个修订。o w l 作为w 3 c 的标准 是其所提侣的语义网的核心技术之一,意在提供一种语言,能够用于表述网络文档 和应用中同有的类和类2 】叫的关系。它通过定义类和类的属性来形式化表述一个领 域,声明和定义对象和对象的属性,以及在o w l 形式化语义允许的程度上对类和 个体进行推理。 o w l 能够被用于清晰地表达词汇表中词条的含义以及这些词条之间的关系,而 这种对词条和它们之问关系的表达就称作本体。o w l 相对x m l 、r d f 和r d f s c h e m a 拥有更多的机制来表达语义,从而超越了x m l 、r d f 和r d fs c h e m a 仅仅 能够表达网上机器可读的文档内容的能力。 8 一 东北师范大学硕士学位论文 o w l 语言的三个子语言包括:( 1 ) o w ll i t e 用于提供给那些只需要一个分类 层次和简单属性约束的用户,如支持基数( c a r d i n a l i t y ) ,只允许基数为o 或1 ;( 2 ) o w ld l 支持那些需要在推理系统上进行最大程度表达的用户,这里的推理系统能 够保证计算完全性( c o m p u t a t i o n a lc o m p l e t e n e s s ,即所有的结论都能够保证被计算出 来) 和可决定性( d e c i d a b i l i t y ,即所有的计算都在有限的时间内完成) 。它包含了 o w l 语言的所有约束,但是可以被仅仅置于特定的约束下,如当一个类可以是多个 类的子类时,它被约束不能是另外一个类的实例;( 3 ) o w l f u l l 支持那些需要在没 有计算保证的语法自由的r d f 上进行最大程度表达的用户。它允许一个本体在预定 义的( i f 、o w l ) 词汇表上增加词汇,从而任何推理软件均不能支持o w lf u l l 的所有特性,如一个类可以被同时表达为许多个体的一个集合以及这个集合中的一 个个体。 2 2 4 本体的构建 目前已经出现许多本体构建工具,从o n t o l i n g u a 、o n t o s a u r u s 、w e b o n t o 到 p r o t 6 9 6 2 0 0 0 、w e b o d e 、o i l e d 、o n t o e d i t 以及k a o n 等,本体构建工具日趋成熟。 这些工具提供了友好的图形化界面和一致性检查机制。借助这些工具,用户可以把 精力集中在本体内容的组织上,而不必了解本体描述语言的细节,而且可以避免错 误的发生,方便本体的构建【2 。 p r o t 6 9 6 f 2 2 】是由斯坦福大学开发的一种本体和知识库编辑工具,同时它又是一个 开放资源和j a v a 工具,提供一种可扩展的结构框架用于基于知识库的应用系统的开 发。p r o t 6 9 6 的主要功能是为编辑本体所涉及的类、属性、实例提供一个友好的图形 用户界面。为了支持不同的功能,许多组织和令人围绕p r o t 6 9 6 开发出了许多插件, o w l p l u g i n 2 3 】就是其中之一。用户可以使用带有o w l p l u g i n 的p r o t 6 9 6 轻松完成以 下工作:以多种不同的格式加载和保存o w l 文件;在可定制的图形界面下编辑 o n t o l o g y 实体;基于描述逻辑完成某些智能推理等。 出于对各个领域和具体工程的考虑,构建本体的过程各不相同。目前没有一个 标准的本体构建方法,不同领域的不同学者在实践中探索出不同的构建方法,比如 u s c h o l d 与飚n g 方法、g r t m i n g e r 与f o x 方法、m e t h o n t o l o g y 方法、s e n s u s 方法等。这些方法之间存在较大的差异,但它们都普遍接受g r u b e r 在1 9 9 5 年提出 的本体构建五个原则1 2 4 】: ( 1 ) 明确性和客观性:本体应该用自然语言对所定义的术语给出明确、客观的 语义定义。 ( 2 ) 完全性:所给出的定义是完整的,完全能表达所描述的术语的含义。 ( 3 ) 一致性:由术语得出的推论与术语本身的含义是相容的,不会产生矛盾。 ( 4 ) 最大单调可扩展性:向本体中添加通用或专用的术语时,不需要修改已有 东北师范大学硕士学位论文 的内容。 ( 5 ) 最小承诺:对待建模对象给出尽可能少的约束。 另外,目前大家公认在构建特定领域本体的过程中需要领域专家的参与。 2 2 5 本体的分类 目前广泛使用的本体有:( 1 ) w o r d n e t ,基于心理语言规则的英文词典,以s y n s e t s ( 在特定的上下文环境中可互换的同义词的集合) 为单位组织信息;( 2

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论