已阅读5页,还剩109页未读, 继续免费阅读
(管理科学与工程专业论文)信息检索中浅层语义模型的研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
大连理工大学博士学位论文摘要目前文本信息检索领域中普遍采用基于统计的模型,如布尔模型、向量空间模型。但是它们没有很好地解决以下几方面问题,包括:歧义词辨析、同义词扩展、概念层次关系、上下文语义关系等。为了解决以上问题,提高文本信息系统检索效力,本论文提出了两种浅层语义检索模型浅层语义向量空间模型( s s v s m ,s h a l l o w - s e m a n t i cv e c t o rs p a c em o d e l ) 和基于本体的浅层语义模型( o b s s m , o n t o l o g y - b a s e ds h a u o w - s c m a n t i cm o d e l ) 。基于这两种检索模型,本论文构建了两个信息检索系统,并分别采用英文标准语料和中文实际数据进行测试,同时与传统的基于统计的检索模型进行量化比较。本论文的主要研究内容及成果如下:1 、浅层语义向量空间模型相关内容及成果:( 1 )提出了浅层语义向量空间模型。通过对传统的向量空间模型( v e c t o rs p a c em o d e l ,v s m ) 的改进,提出了浅层语义向量空间模型。该模型与传统向量空间模型主要区别以及优点在于:它将传统的检索关键词( 本论文中主要指名词)与修饰它的修饰词( 本论文中主要指形容词) 合成,作为一个整体关键词( 本论文中称其为合成短语) ,可确定多义词的真正含义;同时,将合成短语中的修饰词以及它所修饰的中心词根据模糊同义词词典进行扩展并重组,可检索出一些由于用词生僻而原本检索不出来的但符合用户需要的文本。( 2 )建立了模糊同义词词典。为了实现浅层语义向量空间模型中的查询扩展,基于著名的语义词典w o r d n e t 建立了模糊同义词词典。模型中,使用该词典对查询向量进行了模糊扩展( 目前,该词典已经在与日本j u s t s y s t e m 公司的合作项目中得到应用,日方利用该词典开发了n l p s 工具) 。( 3 )进行了信息检索试验。使用英文标准语料库( 1 1 也c :l a - t i m e s ) ,输入共1 5 0个查询语句,验证基于本论文提出的浅层语义向量空间模型的信息检索系统性能,并将其反馈结果与普通检索试验的结果进行比较,用以说明该语义模型的优势。( 4 )进行系统评价。本论文主要从精确率和召回率两方面指标对信息检索系统进行评价,试验结果表明,浅层语义向量空间模型的检索精确率、召回率比普通检索模型有所提高。2 、基于本体的浅层语义模型相关内容及成果:信息检索中浅层语义模型的研究( 1 )( 2 )( 3 )( 4 )建立领域本体。分析了某市移动通信公司2 0 0 2 年2 0 0 5 年的投诉记录,使用p r o t 6 9 6 工具建立了移动通信投诉服务领域的本体。在该本体的建立过程中,提出了自顶向下结合延伸的概念提取方法、基于a p r i o r i 算法思想挖掘概念之间关系的方法,改善了人工建立领域本体的不完整性。提出了基于本体的浅层语义模型。基于所建领域本体,提出了基于本体的浅层语义模型,对比传统的基于关键词检索,它的主要优点在于:根据父子概念的继承关系、同义词词典的查询扩展,能够提高信息检索系统的召回率;根据主宾约束,能够提高信息检索系统的精确率。给出了基于该模型进行信息检索的应用实例。根据基于本体的浅层语义模型开发了信息检索系统,并将其应用于移动通信投诉服务领域,对几条有代表性的查询语句进行检索。将得到的检索结果与传统的基于关键词的信息检索系统进行比较,试验结果表明,基于本体的浅层语义模型具有较强的检索能力。该系统还实现了个性化处理。加入了人机互动的复选框,可使用户根据个人喜好对检索结果作进一步的处理,最终获得更加清晰的符合客户需求的检索结果。关键词:信息检索;语义;向量空间模型;本体;同义词词典大连理工大学搏士学位论文r e s e a r c ho ns h a l l o w s e m a n t i cm o d e lf o rt h ei n f o r m a t i o nr e t r i e v a la b s t r a c ti ti sf o u n do u tt h a ta tp r e s e n t , t h ei n f o r m a t i o nr e t r i e v a lm o d e l sb a s e do ns t a t i s t i cs u c ha sb o o l e a nm o d e la n dv e c t o rs p a c em o d e la r eu s e dg e n e r a l l y w h i c hc 锄tr e s o l v et h ef o l l o w i n gp r o b l e m sw e l lm c l u d m gp o l y s e m y sd i s c r i m i n a t i o n , s y n o n y m se x p a n s i o n , c o n c e p th i e r a r c h i e sa n dc o n t e x ts e m a n t i cr e l a t i o n s h i p s ,e t c t oi m p r o v et h ee f f i c i e n c yo fi n f o r m a t i o nr e t r i e v a ls y s t e m s ,t w ok i n d so fs h a l l o w - s e m a n t i ci n f o r m a t i o nr e t r i e v a lm o d e l sa r ep r o p o s e di nt h et h e s i s ,w h i c ha r es h a l l o w - s e m u n t i cv e c t o rs p a c em o d e la n do n t o l o g y - b a s e ds h a l l o w - s e m a u t i cm o d e l b ym e a n so ft h ea b o v et w om o d e l s ,t w oi n f o r m a t i o nr e t r i e v a ls y s t e m sa l eb u i l tu pr e s p e c t i v e l y 1 1 1 ee x p e r i m e n t sa r ep e r f o r m e do nt h ec o m p a r i n gt h ep r o p o s e di n f o r m a t i o nr e t r i e v a lm o d e l sw i t l lt h et r a d i t i o n a lm o d e l so nq u a n t i t y 1 1 l ec o r p u so f e x p e r i m e n tv e r i f y i n go f t h ef o r m e rm o d e li se n g l i s ht e x t , a n dt h a to f t h el a t t e ri sc h i n e s et e x t t h er a a i nr e s e a r c hc o n t e n t sa n da c h i e v e m e n t sc a nb es u m m a r i z e da sf o n o w s :1 r e l a t e dw o r k so nt h es h a l l o w - s e m a n t i cv e c t o rs p a c em o d e l( 1 )s h a l l o w - s e m a n t i cv e c t o rs p a c em o d e l f o ri m p r o v e i n gt h et r a d i t i o n a lv e c t o rs p a c em o d e l t h es h a l l o w - s e m a n t i cv e c t o rs p a c em o d e li sp r o p o s e d 1 km a i nd i f f e r e n c eb e t w e e nt h et r a d i t i o n a lv e c t o rs p a c em o d e la n dt h en e wo n ei st oc o m b i n et h em o d i f i e r ( a d j e c t i v ei nt h i st h e s i s ) w i t hi t sc o r r e s p o n d i n gh e a d w o r d ( n o u ni nt h i st h e s i s ) a sa ni n t e g r a t e dk e y w o r d ( c o m b i n e dt e r m ) i nt h en e wm o d e l w h i c hc a l lc o n f i r mt h ee x a c tm e a n i n go fp o l y s e m y m e a n w h i l ee x p a n d i n gt h em o d i f i e ra n dh e a d w o r da c c o r d i n gt ot h e i rs y n o n y m sa n dr e c o m b i n i n gt h e mc a nr e s u l ti nf i n d i n go u ts o m eo t h e ru s e f u ld o c u m e n t s ,w h i c hc a l l tb eo b t a i n e do r i g i n a l l yb e c a u s eo ft h en 眦k e y w o r d so f q u e r i e s ( 2 ) a 旧s y n o n y mt h e s a u r u s d u r i n gt h er e s e a l c h ,t oc o m p l e t et h eq u e r ye x p a n s i o no fs h a l l o w - s e m a n t i cv e c t o rs p a c em o d e l ,af u z z ys y n o n y mt h e 豫u m si sb u i l tu pb a s e do nt h ef a m o u ss e m a n t i cl e x i c o nw o r d n e t 1 1 1 ef u z z ys y n o n y mt h e s a u r u sc a nm a k et h eq u e r yv e c t o re x p a n d e dw e l l a tp r e s e n t , s u c ht h es a _ u r u sh a sb e e na p p l i e di nt h ec o l l a b o r a t i v ep r o j e c tw i t hj a p a n e s ej u s t s y s t e mc o r p o r a t i o n m o r e o v e rt h ej a p a n e s ep a r t n e rh a sd e v e l o p e dan a t u r a ll a n g u a g ep r o c e s s i n gt o o ln a m e l yn l p s ( 3 )i n f o r m a t i o nr e t r i e v a le x p e r i m e n t s e x p e r i m e n t sf o rv e r i f y i n gt h ei m p o r t a n c eo ft h es h a l l o w - s e m a n t i cv e c t o rs p a c em o d e lh a v eb e e ni m p l e m e n t e db yu s i n gb e n c h m a r ki i i信息检索中浅层语义模型的研究c o r p o r aw 陋ci ne n g l i s h a n d15 0q u e r i e sh a v eb e e nc h o s e nf o rt e s t i n g 1 1 l ee x p e r i m e n tr e s u l t ss h o w so u tt h eg r e a ti m p o r t a n c eo f t h en e wm o d e l ( 4 )s y s t e me v a l u a t i o n i n f o r m a t i o nr e t r i e v a lm o d e l st y p i c a l l ye x p r e s st h er e t r i e v a lp e r f o r m a n c eo ft h es y s t e mi nt e r m so ft w oq u a n t i f i e s :p r e c i s i o na n dr e c a l l a n dt h ep r e c i s i o na n dr e c a l lo fs h a l l o w s e m a n t i cv e c t o rs p a c em o d e la r eb o t hf o u n di n c r e a s e dv i s u a l l y 2 r e l a t e dw o r k so nt h eo n t o l o g y - b a s e ds h a l l o w - s e m a n t i cm o d e l( 1 ) d o m a i no n t o l o g y a f t e ra m i y m gt h ec o m p l a i n tr e c o r d sf r o mt h ey e a r so f2 0 0 2t o2 0 0 5o ft h em o b i l ec o m m u n i c a t i a nc o r p o r a t i o no fac e r t a i nc i t y 柚o n t o l o g yi nt h ed o m a i no f m o b i l ec o m m u n i c a t i o nc o r p o r a t i o n sc o m p l a i n ts e r v i c e si sb u i l tu pb yt h et o o lo f p r o t e g e d u r i n gt h eo o u r s eo f b u i d i n gu pt h eo n t o l o g y ,t h et o p - d o w nm e t h o dc o m b i n e dw i t ho u t s p r e a da p p r o a c ht oe x t r a c t i n gc o n c e p t sa n dt h em e t h o db a s e do nt h ei d e ao fa p r i o r ia l g o r i t h mt om i n i n gc o n c e p tr e l a t i o n s h i p sa t ep r o p o s e d , w h i c hc a nc o m p l e t et h ed o m a i no n t o l o g yo n l yb ym a n - m a d e ( 2 )o n t o l o g y - b a s e ds h a l l o w - s e m a n t i cm o d e l b a s e d0 1 1t h ed o m a i no n t o l o g y , t h eo n t o l o g y - b a s e ds h a l l o w - s e m a n t i cm o d e li sp r o p o s e 山1 1 wm a i nd i f f e r e n c eb e t w e e nt h et r a d i t i o n a lk e y w o r d - b a s e dm e t h o d sa n dt h en e wo n ei st h a tb yt h ei n h e r i t a n c eo fs u p - c o n c e p t sa n ds u b - c o n c e p t sa n dt h eq u e r ye x p a n s i o n , t h er e c a l lo fi n f o r m a t i o nr e t r i e v a ls y s t e mc a nb ei n c r e a s e d ;a n db yt h ec o n s t r a i n t so fs u b j e c t sa n do b j e c t s ,t h ep r e c i s i o nc a l lb ei n c r e a s e de i t h e r ( 3 )a na p p l i c a t i o ni n s l a n c eo fi n f o r m a t i o nr e t r i e v a l a ni n f o r m a t i o nr e t r i e v a ls y s t e i ni sd e v e l o p e db a s e do nt h en & o r e t r i e v a lm o d e l i na d d i t i o n , t h es y s t e mi sa p p l i e dt 0t h ed o m a i no fm o b i l ec o m m u n i c a t i o nc o r p o r a t i o n sc o m p l a i n ts e r v i c e s s o m er e p r e s e n t a t i v eq u e r i e sf i l es e l e c t e d b yc o m p a r i n gt h er e s u l t so ff l e wm o d e lw i t ht h a to ft h et r a d i t i o n a lo n e ,t h es i g n i f i c a n c eo ft h eo n t o l o g y b a s e ds h a l l o w - s e m a n t i cm o d e lc a nb ee a s i l ys h o w n ( 4 )i n d i v i d u a l i z a t i o np r o c e s s i n g b ya d d i n gh u m a n - m a c h i n ei n t e r a c t i v ec h e c kb o x e s t h eu s e r sc a nd i s p o s et h ei n f o r m a t i o nr e t r i e v a lr e s u l t sf u r t h e rm o r ea c c o r d i n gt ot h e i ro w ni n t e r e s t s f i n a l l yt h em o r ec l e a ra n ds a t i s f i e dr e s u l t sc a nb eo b t a i n e d k e yw o r d s :i n f o r m a t i o nr e t r i e v a l ;s e m a n t i c ;v e c t o rs p a c em o d e l ;o n t o l o g y ;s y a o n y mt h e s a u r u si v 独创性说明作者郑重声明:本博士学位论文是我个人在导师指导下进行的研究工作及取得研究成果。尽我所知,除了文中特 l , l j n 以标注和致谢的地方外,论文中不包含其他人已经发表或撰写的研究成果,也不包含为获得大连理工大学或者其他单位的学位或证书所使用过的材料。与我一同工作的同志对本研究所做的贡献均已在论文中做了明确的说明并表示了谢意。作者签名:班日期碑:盔塑盔兰壁主塑竺塑丝茎大连理工大学学位论文版权使用授权书本学位论文作者及指导教师完全了解“大连理工大学硕士、博士学位论文版权使用规定”,同意大连理工大学保留并向国家有关部门或机构送交学位论文的复印件和电子版,允许论文被查阅和借阅。本人授权大连理工大学可以将本学位论文的全部或部分内容编入有关数据库进行检索,也可采用影印、缩印或扫描等复制手段保存和汇编学位论文作者签名:导师签名:马擗易鲨4 4 月l 日大连理工大学博士学位论文1 绪论1 1 研究背景i n t e m e t 的出现引发了新的信息革命。w w w 已经发展成为包含多种信息资源、站点遍布全球的巨大信息服务网络,为用户提供了一个极具价值的信息源,并且它己成为i n t e r a c t 上的主要信息来源。2 0 0 6 年1 1 月2 日,据美国c n n 报道【1 1 ,由n e t e r a f t 因特网监控公司的数据显示,全球w w w 网站数量已经达到l 亿个。这是一个里程碑的数字,据n e t c r a r 的鼬c hm i l l e r介绍,现在全球已经有l 亿个具有独立域名及内容的网站了,在这些网站中,有一些网站是非常繁忙和经常更新的,这一类网站被定义为积极网站,数量约为4 7 0 0 万到4 8 0 0万之间。在今天,开一家网站已经变得越来越容易,成本也越来越低。w w w 万维网正在变成人们生活中越来越不可或缺的工具。根据中国互联网网络信息中心( c n n i c ) 2 0 0 6 年7 月提供的数据【2 】,截止到今年6月3 0 日,中国网站数为7 8 8 ,4 0 0 个,与去年同期相比增加1 1 0 ,9 0 0 个,增长率为1 6 4 。其中,2 0 0 6 年上半年就增长了9 万个网站,远高于2 0 0 5 年下半年2 万个的增长量。面对如此巨大的信息源,要找到自己需要的信息,如同大海捞针,已经不能够单纯地靠手工查找或组织所有的信息。传统的基于关键词匹配的信息检索方法采用单一、表面化的模型,仅用单一的词或词的组合来对网络信息资源进行检索,缺乏知识的理解和处理,因而返回的结果在查全率和查准率上都无法满足检索者的需求。词汇描述差异性与词之间关系模糊问题是传统信息检索方法所面临的主要问题。被称为下一代w e b 的语义网( s e m a n t i cw e b ) 通过获得词汇的语义使得w e b 应用不但能够表示信息,而且能够理解信息,还可以在此基础上依据一定的规则对信息进行推理。语义检索能够通过概念,立足于对信息进行语义层次上的分析和理解,解决之前一系列的信息检索难题,力图真正理解并挖掘检索者的信息请求。本论文提出两种浅层语义检索模型,并对它们进行深入研究,一种是浅层语义向量空间模型( s s v s m ,s h a l l o w s e m a n t i cv e c t o rs p a c em o d e l ) ,另一种是基于本体的浅层语义模型( o b s s m , o n t o l o g y - b a s e ds h a l l o w - s e m a n t i cm o d e l ) 。其中,浅层语义向量空间模型选题来源于大连理工大学系统工程研究所与日本j u s t s y s t e m 公司 3 1 的国际合作项目“在自然语言处理中根据文本信息前后关系改进向量空间模型检索效力的研究”( i m p r o v i n g t h e a c c u r a c y o f t h e v e c t o r s p a c e r e t r i e v a l m o d e l信息检索中浅层语义模型的研究b yu s i n gt h ec o n t e x t u a li n f o r m a t i o na m o n gt h en a t u r a ll a n g u a g ed a t a ) ;基于本体的浅层语义模型选题来源于大连理工大学系统工程研究所与辽宁省移动通信公司信息检索项目。在完成以上两个项目的研究过程中,取得一些可喜的成果,所提出的模型对提高信息检索系统检索效力具有一定意义。同时,由于模型涉及了语义方面的一些实际研究,具有一定进步性。对于两种浅层语义模型,还受到“国家自然科学基金重点项目( 7 0 4 3 1 0 0 1 ) 企业( 组织) 知识管理中的若干基础问题研究”的支持。该项目研究重点是知识的获取、知识转化、新知识生成,也就是研究创新过程中的知识流程的形成与再造,以及对言传性( 可编码的) 知识的获取;特别侧重于文本中的知识挖掘;对已经嵌入在产品、服务以及经营管理过程中的知识发现与提取;对意会性知识( 具备知识的人) 的发现与认定的方法与辅助工具。并且研究新知识作为生产要素,与传统生产要素相结合,以形成新的生产力,形成核心竞争力的模式、机制。对信息知识进行检索,是有效利用知识的一个重要手段,也是本项目的一个重要组成部分。本论文的研究侧重于结合语义网络、本体及现有的信息检索技术,对基于浅层语义模型的信息知识检索方法进行探讨。所提出的检索模型以传统检索方法作为基础,并利用语义及本体等方法对检索语句、待检索文本进行分析、建模、比较等,从而获取查询结果。研究表明,这些检索模型可以有效提高信息知识检索的性能,从而能够更为有效地利用知识。1 2 研究意义1 9 9 0 年t i mb e m e r s l e e 发明了万维网( w w w ) ,其目的是让人们通过因特网来获得各种信息【4 】。数十年问,网络技术得到飞速发展。一方面体现在网络上的信息量和使用人数的飞速增长以及应用领域的普及,从电子商务、电子政务到电子学习、网格科学计算等;另一方面体现在网络应用方式从本地应用程序到在线软件服务、中间件以及智能化、复杂程度更高的应用集成方向转变。从应用模式的角度来看,万维网应用基本上经历了两个阶段:信息显示阶段和多元化应用阶段【5 1 1 6 j 。网络时代的到来,促使人们在进行信息检索时,信息源更加广泛,同时人们对信息的要求也越来越高。但是,在这种网络科技快速发展的同时,也面临着种种的困难,如用户在进行信息检索时,有时候得到的查询结果非常多,甚至多达上百个网页,必须花费很多时间阅读,而真正符合要求、有价值的网页却不多,也就是说,大量用户不需要大连理工大学博士学位论文的信息“信息垃圾”占了检索结果的相当大的一部分;有时候得到的与用户需求匹配的信息非常少,甚至反馈结果为零,不能满足用户的需求目前,普遍采用基于统计的模型进行文本信息检索,如布尔模型、向量空间检索模型等。然而,缺乏语义的检索模型势必导致大量垃圾信息的出现,使人们不得不花费额外的时间和精力去处理检索结果。针对这一现象,经分析发现,尽管基于统计的模型容易理解和实现,但却存在以下几方面问题:( 1 ) 切词1 t i t s :英语文本中词与词之间存在间隔符,可以自然分开,不用进行切词。对中文文本处理过程中,先要经过切词。当中文信息处理从“字处理”阶段过渡到“词处理”阶段时,必须对由连续的汉字流构成的、单词之间无空白的汉语书面文本进行自动切分,然后进行词频统计。因此,切词的准确性大大影响了检索结果;( 2 ) 歧义词的辨析【9 】:一个词、短语或句子可以作两种或两种以上的理解,或者说有两种或两种以上的意义,即一词多义,这种现象称为歧义。计算机检索时出现歧义主要指同形歧义。在中英文中,大部分的词,有不同的意思,如检索词“仪表”,既可以表示人的外观、外貌;也可以表示用于记录、测量或控制的装置。如果缺乏语境或语义信息,计算机很难理解其真正的含义。但如果领域确定,则歧义现象可减少,使不相关的信息不被检索出来。计算机由于难以准确地识别正确的含义,将包含相同词的文本都查了出来,产生了大量的垃圾;( 3 ) 同义词的扩展嘲:表达同一个意思的时候,可以使用不同的方式、不同的用词,词形不同概念相同。如“手机”等同于“移动电话”。传统的基于统计的检索模型只单纯按照某个词的词形而不是对应的概念进行检索,单纯依赖机械的关键词匹配,可能会造成检索不全面,漏掉很多相关文本。( 4 ) 概念层次关系:即父、子概念。常常一些父概念所表达的含义是通过其子概念具体体现出来的。如“数据库软件”这个概念,它可以具体到一些数据库软件作为其子概念,如“s q ls e r v e r ”、“o r a c l e ”等。而传统的关键词检索只停留在某个概念层次上,没有考虑与这个概念层次相关的父子概念层,导致检索系统反馈信息不全;( 5 ) 忽略文本中上下文的语义关系:传统的关键词检索认为文本中各个关键词之间是孤立的,毫无关系的。因此,很需要一个能够滤去大量信息垃圾,同时又能够将用户们真正需要的文本留下的工具和方法。本论文正是致力于提高信息检索效力,提出了两种浅层语义检索模型浅层语义向量空间模型( s s v s m ) 、基于本体的浅层语义模型( o b s s m ) 。信息检索中浅层语义模型的研究其中,浅层语义向量空问模型在传统的向量空问模型( v s m ) 基础上,主要考虑修饰词成分;基于本体的浅层语义模型,以当前的研究热点本体( o n t o l o g y ) 为基础,考虑句法成分:主语+ 谓语+ 宾语。本论文所提出的两晕中检索模型利用语义关系,按照两种不同的恩路进行检索,基于这两种模型的信息检索系统检索性能都相比传统的基于统计的检索模型的信息检索系统在精确率、召回率上有所提高。1 。3 国内外研究现状目前信息检索技术的分类“o j 主要有三种:全文检索、数据检索、知识检索。对它们的特点及缺点描述如表1 1 所示:表1 1 信息检索技术分类t a b 1 1t h ec a t e g o r i z a t i o no f i n f o r m a t i o nr e t r i e v a lt e c h n i q u e s从上表很容易看出,知识检索目前属于三种信息检索技术范畴中最高级的检索,它结合了语义、知识等方面内容,具有一定智能性,而非计算机机械地进行信息匹配。本论文所进行的信息检索模型方面的研究也正是属于知识检索范畴,它们都考虑了语义信息,在查准率( 精确率) 、查全率( 召回率) 上都有较好的保证。目前所使用的万维网,实际上是一个存储和共享图像、文本的媒介,电脑所能看到的只是一堆文字或图像,对其内容无法进行识别。万维网中的信息,如果要让电脑进行大连理工大学博士学位论文处理的话,就必须首先将这些信息加工成计算机可以理解的原始信息后才能进行处理,这是相当麻烦的事情。而语义网的建立则将事情变得简单得多。语义网是对w w w 本质性的变革,它的主要开发任务是使数据更加便于电脑进行处理和查找。其最终目标是让用户获得极大的方便,对因特网上的海量资源达到几乎无所不知的程度,计算机可以在这些资源中找到你所需要的信息,从而将万维网发展成一个巨大的数据库。语义网将使人类从搜索相关网页的繁重劳动中解放出来。因为网中的计算机能利用自己的智能软件,在搜索数以万计的网页时,通过“智能代理”从中筛选出相关的有用信息。而不像现在的万维网,只罗列出数以万计的无用搜索结果。例如,某人在进行在线登记参加会议时,会议主办方在网站上列出了时间、地点,以及附近宾馆的打折信息。如果使用万维网的话,此时他必须上网查看时间表,并进行拷贝和粘贴,然后打电话或在线预订机票和宾馆等。但假如使用的是语义网,那么一切都变得很简单了,此时安装在计算机上的软件会自动替他完成上述步骤,他所做的仅仅是用鼠标按几个按钮而已。在浏览新闻时,语义网将给每一篇新闻报道贴上标签,分门别类地详细描述哪句是作者、哪句是导语、哪句是标题。这样,如果你在搜索引擎里输入“鲁迅的作品”,你就可以轻松找到鲁迅的作品,而不是关于他的文章。总之,语义网是一种更丰富多彩、更个性化的网络。目前,国内外许多人员已开展语义检索方面的研究。1 3 1 国外研究现状1 9 9 8 年,w e b 的创始人1 恤b e r n e r s - l e e 首次提出了“语义w c b ”( s e m a n t i cw e b )的概念及其技术路线,阐述了语义w e b 的基本思想【l l 】。然后,在2 0 0 0 年1 2 月1 8 日x m l 2 0 0 0 大会的重要发言中b e m e r s l e e 正式提出了语义w e b 的概念。语义w e b 所指的“语义”是“机器可处理的”语义,而不是自然语言语义和人的推理等目前计算机所不能处理的语义信息。对于数据,语义表达了机器能对这些数据做些什么。若给出一些“机器可处理的”语义数据到一台机器,它能用这些数据做出正确事情,就称它通过了。“语义测试”。语义w e b 目标是使w e b 上的信息具有计算机可以理解的语义,满足智能软件a g e n t 对w w w 上异构和分布信息的有效访问和检索。2 0 0 1 年2 月9 日,w 3 c 正式成立“s e m a n t i cw e ba c t i v i t y ”来指导和推动语义w e b的研究和发展,语义w e b 的地位得以正式确立【1 2 1 。语义w e b 是建立在r d f 与其它定义的标准基础之上,对w e b ( w o r l dw i d ew e b ) 上的数据所进行的一种抽象表示。语义信息检索中浅层语义模型的研究w c b 由w 3 c 负责开发,同时联合了为数众多的研究机构和工业团体。根据w 3 c“s e m a n t i cw e ba c t i v i t y ”,的目标是开发一系列计算机可理解和处理的表达语义信息的语言和技术,以支持网络环境下广泛和有效的自动推理。在目前阶段,它将主要致力于支持对网络信息资源及其内容的语义和语义关系表征,支持a g e n t 系统基于语义对数据的自动分析、理解和处理,支持a g e n t 系统相互间基于语义的知识交换,支持不同应用领域和系统间基于语义对数据进行自动的交换、转换和复用。2 0 0 1 年5 月,1 恤b e r n e r s - l e e 等在科学美国人( s c i e n t i f i ca m e r i c a n ) 上发表了文章“t h es e m a n t i cw e b ”,其用浅显的语言和生活实例从“应用设想”、“意义表达”、“知识表示”、“本体”、“a g e n t ”以及“知识演化”等诸多方面对“语义w 曲”作了较全面的阐述【1 3 1 。文章认为:语义w e b 是对当前w c b 的扩展,其所具有的定义良好的语义,能更好地使计算机和人之闻进行协同工作。图1 1 语义w e b 层次图f 培1 ,1t h eh i e r a r c h yc h a r to f s e m a n t i cw e b图1 1 为2 0 0 0 年1 2 月b c r n c r s l e e 在x m l 2 0 0 0 大会上描述的语义w e b 体系结构【,这个框架从底层到高层分别描述为:( 1 ) u n i c o d e 与u i u 层:本层是整个语义网体系结构的基础。其中u n i c o d e 负责处理资源的编码,它是一个新的字符编码系统标准,支持世界上所有的主要语言文本字符。而负责标识资源的u r i( u n i v e r s a l r e s o u r c e i n d i c a t o r ) 是u r l ( u n i v e r s a l r e s o u r c e l o c a t o r ) 的超集。作为i n t e r a c t大连理工大学博士学位论文资源的一种标准的识别方法,u r i 可以进行更为精确的资源标识,使信息的精确检索成为可能。( 2 ) x m l 十n s + x m ls c h e m a ( 语法层s y n t a xl a y e r )本层也叫语法层,用于从语法上表示数据的内容和结构,通过使用标准的格式语言将网上资源和信息的表现形式、数据结构和内容分离。x m l 是一个精简的s g m l ,它综合了s g m l 的丰富功能与h t m l 的易用性。它允许用户在文档中加入任意的结构,而无需说明这些结构的含意。n s ( n a m es p a c e ) 即命名空间,由u r i s 索引确定,目的是为了避免不同的应用使用同样的字符描述不同的事物。x m ls c h e m a 是d t d ( d o c u m e n td a t at y p e ) 的替代品,它本身采用x m l 语法,但比d t d 更加灵活,提供更多的数据类型,能更好地有效地为x m l 文档服务并提供数据校验机制。( 3 ) r d f 十r d fs c h e m a ( 赋值层a s s e r t i o nl a y e r )本层也叫赋值层,即赋值机制,以标准方式建立元数据与被描述资源的连接,从而保证计算机能明确地确认元数据、元数据含义及其与资源的关系。目前,r d f 正成为网络环境下的基本赋值机制。该层提供一种语义模型,用于描述w e b 上的资源及其类型,为网上资源描述提供了一种通用表示框架,实现数据集成的元数据解决方案。r d f 可提供一种处理元数据的环境,元数据即描述数据的数据,这些描述包含需要计算机理解的数据。r d f 增加语义到文档中而不用假定文档的结构,其语法可用咀。定义。w e b 上的数据是机器可读取的,但不一定是机器可理解的。如果网上的数据遵循一种标准的描述或标记方法,那么计算机对于它们处理的资源一定会理解得更多,所以r d f 标准为语义网奠定了基础。r d f 模式引入一个面向对象、可扩展类型( t y p e ) 系统到r d f 中,提供方法定义合适的定义域和值域,以及类和子类层次。r d fs c h e m a 使用一种机器可以理解的体系来定义描述资源的词汇,其目的是提供词汇嵌入的机制或框架,在该框架下多种词汇可以集成在一起实现对w e b 资源的描述。( 4 ) o n t o l o g yv o c a b u l a r y 层( 语义层s e m a n t i cl a y e r )该层也叫语义层,用来定义共享的知识,从而对各种资源之间的语义关系进行描述,揭示资源本身以及资源之间更为复杂和丰富的语义信息。o n t o l o g y ( 本体或本体论) 原本是一个哲学上的概念,用于研究客观世界本质。人工智能、信息检索领域中,o n t o l o g y ( 本体) ,即词汇体系,用以表达元数据,是某领信息检索中浅层语义模型的研究域内概念的显式说明,它对应的词汇用于描述该领域。一个本体可以描述事情的类型之问的关系。一般w e b 上的o n t o l o g y 包括分类和一套推理规则。分类用于定义对象的类别及其之间的关系,推理规则提供迸步的功能,完成语义w e b 的关键目标即“机器可理解”。本体的最终目标是“精确地表示那些隐含( 或不明确的) 信息”。该层是在r d f ( s ) 基础上定义的概念及其关系的抽象描述,用于描述应用领域的知识,描述各类资源及资源之间的关系,实现对词汇表的扩展。在这一层,用户不仅可以定义概念而且可以定义概念之间丰富的关系。( 5 ) l o g i c 层( 逻辑层)即逻辑知识体系。该层主要提供公理和推理规则,为智能服务提供基础。比如可利用分布在w e b 上的各种断言或公理推理出新的知识。逻辑层是利用w e b 各处的断言导出新知识的地方,问题是各种演绎系统不可互操作推理能力不同,任何规则系统都可以输出到这层。( 6 ) p r o o f 层和t r u s t 层( 认证层和信任层)p r o o f 和t r u s t 这部分内容在概念上目前还没有一个成熟的说法。但是语义w e b 的研究者普遍认为p r o o f 和t r u s t 将是下一代w e b 的重要概念。该层注重于提供认证和信任机制,使用户代理a g e n t 在网络上实现个性化服务和彼此间交互合作具有可靠性和安全性。如果不设计一个跨系统的推理系统,而是建议一种普遍性语言来表达证明,就实现了p r o o f 层。总的来说,语义w e b 环境下的应用在事实的基础上,通过应用逻辑推理,得出某种结论。这种推理的每一步对用户来说,都应该可见的,或者说应该是可查的。首先应该可以信任所见的数据,并且可以信任所做的推理过程,只有在这个基础上才能最终信任得到的结论。( 7 ) d i g i t a ls i g n a t u r e 层( 数字签名层)该层跨越了多层,在语义w e b 的层次体系结构中,从r d f 层以上,所有对资源的描述都贯穿了数字签名技术。数字签名技术就是对资源描述者的身份进行认证的关键性技术,是建立可信任网页的基石。虽然密钥技术已经存在较长时间了,但还没有真正广泛应用,如果加上语义网各层支持,通过p r o o f 交换以及数字签名,建立一定的信任关系,使一个团体在一定范围内可信任,就实现了p r o o f 层,从而证明语义w e b 输出的可靠性以及其是否符合用户的要求。这样一些诸如电子商务等重要的应用就可以进入到语义网的实用领域中。大连理工大学博士学位论文第五层到第七层是在下面四层的基础上进行
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年肾内科血液透析护理考试题库(含答案)
- 2026年农产品检测员《重金属检测知识》练习题及答案
- 2026年护理招聘笔试真题
- 2026年湖北省考《行政职业能力测验》真题及答案解析
- 2026年法考客观题试卷二试题题库(含答案)
- 地铁司机培训相关试题及答案
- 2025年事业单位b类考试试题及答案
- 2025年上半年教师资格证考试保教知识与能力幼儿园题含答案
- 2025年全国计算机等级考试二级C语言全真模拟试卷及答案
- 2025设施农业技术理论知识测试题(含答案)
- 新版2026年秋新版九年级上册道德与法治知识点全面梳理1合集
- 2026年6月青少年软件编程C-C++等级考试三级真题(含答案)
- 中国华电集团2026笔试题目及答案详解
- 2026青岛平度市农旅开发建设集团有限公司工作人员招聘(11人)笔试参考题库及答案详解
- 2026年心内科急诊心衰抢救护理配合流程
- 房屋修缮工程施工组织设计
- 空调系统维保招标文件范本
- 2026年秋人教PEP版新教材小学英语四年级上册教学计划及进度表
- 2026中国公证协会招5人笔试题库(巩固)附答案详解
- 长期照护师岗前技术水平考核试卷含答案
- 第1课《开天辟地的大事变》第二课时课件2026-2027学年统编版五年级上册道德与法治
评论
0/150
提交评论