(计算机软件与理论专业论文)本体搜索引擎的相关问题研究.pdf_第1页
(计算机软件与理论专业论文)本体搜索引擎的相关问题研究.pdf_第2页
(计算机软件与理论专业论文)本体搜索引擎的相关问题研究.pdf_第3页
(计算机软件与理论专业论文)本体搜索引擎的相关问题研究.pdf_第4页
(计算机软件与理论专业论文)本体搜索引擎的相关问题研究.pdf_第5页
已阅读5页,还剩89页未读 继续免费阅读

(计算机软件与理论专业论文)本体搜索引擎的相关问题研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 本体搜索引擎是本体选择与重用过程中的重要工具,在语义网快速发展的今天,随着本体文档 的数晕级不断攀升,本体搜索引擎的研究得到了越来越多的关注并发挥了日益重要的作用。近几年 来,人们对本体搜索引擎的相关研究问题做了初步的研究,取得了阶段性的成果,主要集中在r d f 文档的收集、语义网中的排序问题、本体文档中文本信息索引、海量r d f 三元组存储等方面。然而, 现有的本体搜索引擎在从收集本体到帮助用户选择与重用本体的过程中依然存在诸多的问题,需要 进一步的研究。1 9 9 8 年,t i mb e m e r s l e e 进一步提出了语义网( s e m a n t i cw e b ) 的概念,目标是一 个使用计算机可理解的方式描述事物的共享平台。 在现有工作的基础上,本文对本体搜索引擎的收集、分析、索引和检索这四个环节中的若干问 题开展了深入地研究。论文的贡献主要包括以下四个方面: ( 1 ) 给出了发现语义网站点的一组规则,并且提出了语义网站点的一个排序方法。本文定义了一系 列启发式规则,对给定的原始数据集中的r d f 文档进行分析,发现可能包含新的r d f 文档的 语义网站点,并提出了语义网站点的排序方法。相对于目前已有的数据收集方式,对语义网站 点的发现与排序方法的研究将提高本体搜索引擎数据收集的效率。 ( 2 ) 给出了基于r d f 句子的本体文档分析方法,并且提出了基于r d f 句子图的术语排序方法。本 文定义了r d f 句子的概念,并以r d f 句子为基础,提出了一套本体文档的分析方法。在这套 分析方法中,本文主要讨论了五个关键的研究点,包括术语定义权威性的判断方法、判断术语 类型的一组规则、r d f 句子解析算法、基于r d f 句子图的术语排序方法及术语的组织方法。 这些研究将从不同的方面加强和扩展本体搜索引擎所能提供的功能。 ( 3 ) 提出了一种基于虚拟文档的术语文本信息索引方法以及一种基于邻居树的结构信息索引方法。 本文首先借助于虚拟文档概念,提出了索引术语虚拟文档的方法。将术语的虚拟文档作为术语 的文本信息进行索引,可以提高检索的召同率;其次,本文提出了邻居树的数据结构,并通过 分而治之的方法,索引术语之间的关系这一重要的语义网结构信息。相对于现有的结构信息索 引方法,基于邻居树的结构信息索引更适合于大规模的信息检索系统。 ( 4 ) 提出了本体文档的摘要方法和词汇的摘要方法。类似于文本摘要方法,本体文档或词汇的摘要 方法使用链接分析方法从本体文档或词汇中评价并抽取重要的r d f 句子作为摘要,并通过一定 的重排序策略降低摘要的信息冗余度。 本文对以上研究内容均开展了相应的实验,并与相关工作进行了对比。实验结果表明,本文中 提出的概念和方法是合理的,有效的。这些概念和方法在数据规模、功能性、效率以及用户体验等 方面提升现有的本体搜索引擎,从而进一步推动现有本体的选择和重用。 关键词:万维网,语义网,本体,搜索引擎 a bs t r a c t o n t o l o g ys e a r c he n g i n ei sa ni m p o r t a n tt o o li no n t o l o g ys e l e c t i o na n dr e u s e 、聃t ht h er e c e n tg r o w t ho f t h es e m a n t i cw 曲,t h ea m o u n to fo n t o l o g i e si n c r e a s e si nap h e n o m e n a lr a t e ,a n dt h et o p i co fo n t o l o g y s e a r c he n g i n ei sa t t r a c t i n gm o r ea n dm o r er e s e a r c hi n t e r e s t t h e s ey e a r s s o m er e s e a r c h e sh a db e e nd o n e m a i n l yo n :t h ec o l l e c t i o no fo n l i n er d fd o c u m e n t s 。r a n k i n gi s s u e si nt h es e m a n t i cw e b ,t h ei n d e x i n go f t e x t u a li n f o r m a t i o ni no n t o l o g yd o c u m e n t sa n dm a s s i v es t o r a g eo fr d ft r i p l e s b a s e do ne x i s t i n gw o r k s ,o u rw o r ke n c o m p a s s e sr e l a t e di s s u e si nd a t ac o l l e c t i o n ,a n a l y s i s ,i n d e x i n g a n dr e t r i e v a ls u b s y s t e m so fo n t o l o g ys e a r c he n g i n e s t h em a i nc o n t r i b u t i o n so ft h i sp a p e ra r ea sf o l l o w s : ( 1 ) ( 2 ) ( 3 ) ( 4 ) as e to fr u l e si sd e f i n e dt of i n ds e m a n t i cw e bs i t e s a n dar a n k i n gm e t h o df o rs e m a n t i cw e bs i t e si s p r e s e n t e d w ed e f i n eas e to fh e u r i s t i cr u l e sa n du t i l i z et h er u l e si na n a l y z i n gag i v e no r i g i n a ld a t a s e t o fr d fd o c u m e n t st of i n ds e m a n t i cw 曲s i t e st h a tm a yc o n t a i nn e wr d fd o c u m e n t s ar a n k i n g m e t h o df o rs e m a n t i cw e bs i t e si sa l s op r o p o s e d c o m p a r i n gt oe x i s t i n gc o l l e c t i o na p p r o a c h e s 。t h e p r e s e n t e da p p r o a c ht of i n d i n ga n dr a n k i n go fs e m a n t i cw e bs i t e sw i l lb e n e f i tt h eo n t o l o g ys e a r c h e n g i n e si ni m p r o v i n gt h e i re f f i c i e n c y ; a na n a l y t i cm e t h o df o ro n t o l o g yd o c u m e n t si sg i v e nb a s e do nt h en o t i o no fr d fs e n t e n c e ,a n da r a n k i n gm e t h o do ft e r m si sp r e s e n t e db a s e do nr d fs e n t e n c eg r a p h w ep r o p o s ean o t i o no fr d f s e n t e n c e a n dt h e np r e s e n tas e to fa n a l y t i c a lm e t h o d sf o ro n t o l o g yd o c u m e n t sb a s e do nr d fs e n t e n c e w ef o c u so nf i v ek e y p r o b l e m s ,i n c l u d i n gam e t h o dt oj u d g et h ea u t h o r i t yo ft e r md e f i n i t i o n s ,as e to f r u l e st od e t e r m i n et e r mt y p e s ,ap a r s i n ga l g o r i t h mo fr d fs e n t e n c e s ,ar a n k i n gm e t h o do ft e r m s w i t h i no n t o l o g yd o c u m e n tb a s e do nr d fs e n t e n c eg r a p h ,a n dan o t i o no fv o c a b u l a r yt oo r g a n i z e t e r m s t h e s er e s e a r c h e sw i l le n h a n c ea n de x t e n dt h ef u n c t i o n a l i t yo fo n t o l o g ys e a r c he n g i n e si n d i f f e r e n ta s p e c t s ; a ni n d e x i n gm e t h o di sp r e s e n t e dt oi n d e xv i r t u a ld o c u m e n t so ft e r m s ,a n da ni n d e x i n gm e t h o db a s e d o nn e i g h b o rt r e ei sp r e s e n t e dt oi n d e xs t r u c t u r a li n f o r m a t i o n f i r s t ,at e x t u a li n d e x i n gm e t h o do f t e r m si sp r e s e n t e di nv i r t u eo ft h en o t i o no fv i r t u a ld o c u m e n t i n d e x i n gt h ev i r t u a ld o c u m e n to ft e r m s c a nr a i s et h er e c a l lo fr e t r i e v a l ;s e c o n d ,ad a t as t r u c t u r en a m e dn e i g h b o rt r e ei sd e f i n e d a d i v i d e a n d c o n q u e rm e t h o db a s e do nt h i sd a t as t r u c t u r ei sp r e s e n t e dt oi n d e xt h e s t r u c t u r a i i n f o r m a t i o ni nt h es e m a n t i cw e b ,w h i c hi sd e r i v e df r o mt e r mr e l a t i o n s h i p s c o m p a r i n gt oe x i s t i n g s t r u c t u r a li n d e x e s ,i n d i c e sb a s e do nn e i g h b o rt r e e sa r em o r es u i t a b l ef o rl a r g es c a l ei rs y s t e m s ; t w os u m m a r i z a t i o nm e t h o d sa r ep r o p o s e dt os u m m a r i z eo n t o l o g yd o c u m e n t sa n dv o c a b u l a r i e s s i m i l a rt 0t e x ts u m m a r i z a t i o n s u m m a r i z a t i o n so fo n t o l o g yd o c u m e n t sa n dv o c a b u l a r i e su s el i n k a n a l y s i st oa s s e s s a n de x t r a c ti m p o r t a n tr d fs e n t e n c e sa ss u m m a r i e s ar e r a n k i n gs t r a t e g yi s p r e s e n t e dt or e d u c et h ei n f o r m a t i o nr e d u n d a n c yi ns u m m a r i e s w ch a v ec l a r i f i e do u rr e s e a r c hb a s e do nc o r r e s p o n d i n ge x p e r i m e n t s ,a n dc o m p a r e do u rw o r kw i t h o t h e rr e l a t e dw o r k s t h ee x p e r i m e n t ss h o wt h a tt h ec o n c e p t sa n dm e t h o d su s e di nt h i sp a p e ra l er e a s o n a b l e a sw e l la se f f e c t i v e t h e s ec o n c e p t sa n dm e t h o d sc a ni m p r o v eo n t o l o g ys e a r c he n g i n e si nt h es c a l eo f d a t a s e t ,f u n c t i o n a l i t y , e f f i c i e n c ya n du s e re x p e r i e n c e ,a n df u r t h e rb o o s tt h e s e l e c t i o na n dr e u s eo f o n t o l o g i e s k e y w o r d s :w o r l dw i d ew e b ,s e m a n t i cw e b ,o n t o l o g y , s e a r c he n g i n e i l 东南大学学位论文独创性声明 本人声明所呈交的学位论文是我个人在导师指导下进行的研究工作及取得的研究成 果。尽我所知,除了文中特别加以标注和致谢的地方外,论文中不包含其他人已经发表 或撰写过的研究成果,也不包含为获得东南大学或其它教育机构的学位或证书而使用过 的材料。与我一同工作的同志对本研究所做的任何贡献均已在论文中作了明确的说明并 表示了谢意。 东南大学学位论文使用授权声明 东南大学、中国科学技术信息研究所、国家图书馆有权保留本人所送交学位论文的 复印件和电子文档,可以采用影印、缩印或其他复制手段保存论文。本人电子文档的内 容和纸质论文的内容相一致。除在保密期内的保密论文外,允许论文被查阅和借阅,可 以公布( 包括以电子信息形式刊登) 论文的全部内容或中、英文摘要等部分内容。论文 的公布( 包括以电子信息形式刊登) 授权东南大学研究生院办理。 研究生签名:导师签名:日期: 第一章引言 1 1 研究背景 第一章引言 i n t e m e t 通过t c p i p 协议将全球的计算机连接起来,让计算机网络的触角触及到全球的各个角 落。i n t e m e t 提供了最为广泛的网络平台,允许用户在t c p i p 协议的基础上构建自己的服务。i n t e m e t 的出现让计算机告别了孤立、封闭的年代,它的意义不仅仅是使得承载信息的电信号可以跨越大洋, 到达世界的另一端;它更开启了一扇创造之门,让面向伞球的应用平台开发成为了可能。 这扇创造之门通向了如今全球最大的信息资源和服务资源的共享平台一w o r l d w i d e w e b ,即万 维网。早在1 9 4 5 年,v a n n e v a rb u s h 就在( a sw em a yt h i n k ) ) 一文【l 】中提出了一种非线性结构的文 本,这被人们普遍认为是超文本的起源。b u s h 呼唤在有思维的人和所有的知识之间建立一种新的关 系,他的思想在此后5 0 年中产生了巨大的影响:1 9 6 5 年,t e dn e l s o n 首创了超文本( h y p e r t e x t ) 这个 术语;直到1 9 8 9 年,身在欧洲核研究中。t 二, ( c e r n ) 的t i mb e m e r s - l e e 为了让科学家们能很容易地共 享文档和科研数据,创建了一种新的语言来传输和呈现超文本文档。这种语言就是超文本标注语言 h t m l ( h y p e rt e x tm a r k u pl a n g u a g e ) ,用于传输h t m l 的协议称为h t t p 协议( h y p e r t e x tt r a n s f e r p r o t o c 0 1 ) 。h t m l 和h t t p 的诞生宣告了万维网正式登上了历史的舞台! 随着万维网的不断发展, 网上的信息和用户数目迅速增长。第2 2 次中国互联网发展状况统计报告表明:截止到2 0 0 8 年6 月 底,我国上网用户总数为2 5 3 亿,比去年| j 期增长5 6 2 ,c n 下注册的域名数已达1 1 9 0 万个。 万维网上的信息主要使用自然语言作为载体,人们对信息的理解主要取决于人对于自然语言的 理解。网页作为万维网中的信息单元,将信息以某种外观呈现给用户。但是万维网并没有提供某种 机制,让机器也能参与信息的理解和整合。这主要是因为传统的万维网中信息的提供者无法以机器 可理解的方式来描述信息本身的含义。 1 9 9 8 年,t i mb e r n e r s l e e 进一步提出了语义网( s e m a n t i cw 曲) 的概念,目标是一个使用计算 机可理解的方式描述事物的共享平台。时至今日,语义网的目标和理念也悄悄地发生变化,w 3 c 对 语义网的最新的解释为:“语义网是数据之网( t h es e m a n t i cw e bi saw e bo f d a t a ) 。w 3 c 将语义网 定位于描述数据与数据之间的关联。万维网巾的数据分散在不同的应用背后,我们称之为深层w e b ( d e e p w 曲) ,而语义网的目标是使用一种共同的模型( m o d e l ) 和语言( l a n g u a g e ) 将数据对应到 现实生活中的对象,并将不同数据源的数据进行整合。语义网提供了一套形式化的资源描述框架一 r d f 2 1 ,以r d f 三元组( r d ft r i p l e ) 作为基本的数据模型,一个r d f = 元组包含主语( s u b j e c t ) 、谓 语( p r e d i c a t e ) 和宾语( o b j e c t ) 。基于r d f 三元组模型,语义网还提供了一套标准的w e b 本体语言一 o w l 【3 】来明确定义r d f 文档中使用到的概念和概念之间的关联。 有了本体语言,用户可以形式化地定义领域相关的本体。g r u b e r 在【4 】中将本体定义为一种对共 享概念的形式化定义。一般来说,这些形式化定义的载体是以本体语言撰写的r d f 文档,我们称之 为本体文档。本体文档可以在社区( c o m m u n i t y ) 中共享,并且用于资源的描述。通过对传统万维网的 扩展,语义网达到了一个新的高度:由于使用了形式化定义且被共享的本体,信息的含义可以被机 器理解,语义网为万维网带来了更高层次的互操作性。新的应用如雨后春笋般涌现,例如基于语义 网技术的数据整合和信息检索,这些应用可能会给当前的w e b 带来巨大的变化。 本体的使用带来了一个新的问题:由于本体采用分布式的开发方法,每个机构和个人都可以开 发各自的本体;而语义网的未来也部分地取决于w e b 上是否有大量可用的本体,这些本体覆盖的概 东南大学博士学位论文 念框架越广泛,用户在描述资源时就拥有越强的表达能力。本体的需求和开发方法使得目前w e b 上 可用的本体数目不断增加,但是由于本体开发人员没有很好的方法找到并理解已有的本体,导致本 体的霞用度较低,描述相似概念框架的本体大量出现。h a r i t ha l a n i 在文献睁j 中将这样的现象称为“知 识重用的困局”,本体开发人员迫切需要一种检索和理解已有本体的方法。 随着以g o o g l e 、y a h o o 为代表的网页搜索引擎的盛行,用户可以很方便地通过关键字检索w e b 中的网页。而以g o o g l ep a g e r a n k 为代表的链接分析技术可以将用户检索到的网页按照网页的权威 性进行排序,使得排序后的网页结果对用户而言更有价值。虽然网页搜索引擎在收集并索引网页的 同时也索引到以“r d f ”或“o w l ”等为后缀名的本体文档,但是它们对本体文档和普通网页的处 理方式并无区别。然而本体文档和普通网页不同,后者大多为以文本信息为主的纯文本或遵循h t m l 语法的网页,而前者不仅包含了用于注释的文本信息,还使用w e b 本体语言形式化地定义了概念和 概念之间的关联,每个概念或概念之间的关联均用u r i 标识。传统搜索引擎索引网页的元数据和文 本信息,却忽略了本体文档中的结构信息。另外,本体文档中包含大量的u r i 引用( u r ir e f e r e n c e ) , 却只有极少量的超链接,这使得对本体重要性的排序与网页排序存在区别。综上所述,传统网页搜 索引擎不能满足本体检索的需要,为了解决这个问题,本体搜索引擎应运而生。 类似于传统的万维网搜索引擎,本体搜索引擎收集万维网中已存在的本体,并向本体开发人员 提供检索服务。本体搜索引擎的出现大大降低了本体开发人员查找本体的时间代价,提高了本体的 重用度,为语义网的发展提供了强大的支持。未来的本体搜索引擎将更加强调辅助本体开发人员理 解、使用并扩展已有的本体,使得本体的开发形成“网络效应”。因此,本体搜索引擎在现在和将来 都是语义网中重要的部件。 一般来说,本体搜索引擎是指那些在万维网中自动地、主动地收集本体文档,并将其自动索引 的应用。本体搜索引擎的任务是向用户提供语义网概念层相关的检索服务。 本文的研究在f a l c o n s 2 平台下完成。f a l c o n s 是东南大学万维网科学研究所开发的语义网搜索引 擎。不同于本体搜索引擎,f a l c o n s 不仅提供面向概念层的信息检索功能,还提供了更为广泛的面向 实例层的信息检索服务。截止至2 0 0 8 年9 月底,f a l c o n s 系统已经收集并索引了超过1 0 0 0 万个语义 网信息资源,其中包含超过1 万个本体文档。本文中的研究成果被部分应用于f a l c o n s 系统,以实现 部分的数据收集、分析、索引和检索功能。同时,本文中的实验以f a l c o n s 系统作为数据来源。 本文在广泛调研的基础上,结合了国家自然科学基金项目( 6 0 7 7 3 1 0 6 ) ,国家9 7 3 计划课题 ( 2 0 0 3 c b 3 1 7 0 0 4 ) ,以及江苏省自然科学基金重点项目( b k 2 0 0 3 0 0 1 ) ,旨在以f a l c o n s 为支撑平台, 深入探讨本体搜索引擎的相关研究问题,包括通过语义网站点的发现与排序提高本体搜索引擎的数 据收集效率;通过引入术语定义的权威性、r d f 句子、术语类型的判断方法、术语排序方法以及词 汇( v o c a b u l a r y ) ,来提高本体搜索引擎在文档分析阶段的分析能力和分析效率;使用虚拟文档进行 本体文档中文本信息的索引,并提出了邻居树的数据结构用于本体文档中结构信息的索引,这些索 引方法可以丰富本体搜索引擎的检索功能;提出了本体文档和词汇的摘要技术,用于帮助用户快速 地理解检索到的本体文档或词汇,促进本体的重用。 1 2 主要研究内容 作为语义嗍中信息检索的重要组成部分,本体搜索引擎的研究正在受到人们越来越多的关注, 并取得了一些阶段性的研究成果。本体搜索引擎和传统网页搜索引擎类似,也包含数据收集子系统、 数据分析子系统、数据索引子系统和数据检索子系统,如图1 1 所示。区别在于,本体搜索引擎的 数据来源为语义网中的本体文档而非网页。由于本体文档与网页存在本质的不同,本体搜索引擎的 2 第一章引言 各个子系统采用的技术也与网页搜索引擎存在区别。本文将从三个方面讨论本体搜索引擎中的若干 研究问题:在数据收集子系统中,我们将提出语义网站点的概念,以及语义网站点的发现与排序方 法。该方法将提高数据收集子系统的效率;在分析子系统中,我们将重点讨论分析过程中的几个关 键步骤;在索引子系统中,我们将讨论如何索引本体文档的文本信息与结构信息;在数据检索子系 统中,我们将研究摘要技术,以帮助用户在检索过程中快速理解本体文档和词汇。以上研究问题是 构建一个本体搜索引擎需要面对的部分关键问题,但不是全部问题。我们在本文中仅着重讨论这些 问题,而非讨论一个完整的本体搜索引擎的构建方法。 目前,还没有研究机构提出语义网站点概念的定义和分析方法,并将其用于本体搜索引擎的数 据收集子系统;本体文档的分析、索引方法也正处于起步阶段,并逐渐成为了研究的热点;本体文 档与词汇的摘要技术也是我们首先提出的。 1 2 1 语义网站点的发现与排序 图1 1 本体搜索引擎的模块划分 传统的网页搜索引擎如g o o g l e 和b a i d u 面向整个万维网,尽可能多地收集万维网中的网页。语 义网中的信息检索系统仅关注万维网的一部分,即包含r d f 数据的r d f 文档,而本体搜索引擎关 注的对象是更为特定领域的文档:采用本体语言描述的本体文档。本体文档是r d f 文档的子集,是 语义网中用来定义概念和概念问关系的信息资源。在收集本体文档的过程中。我们首先收集尽可能 多的r d f 文档,从得到的r d f 文档中发现寻找新的r d f 文档的线索,再从中过滤出本体文档。因 此,本体搜索引擎的数据收集子系统的收集目标是整个万维网中的r d f 文档。 然而,在海量的网页中收集r d f 文档并非易事。数据收集问题是本体搜索引擎在搭建初期面临 的最大问题。解决这一问题最简单直接的方法,是将本体搜索引擎搭建在网页搜索引擎的基础上: 在网页分析的基础上,利用网页中的超链接,首先收集尽可能多的网页,再从中过滤出r d f 文档, 这也是当前某些本体搜索引擎的做法。但是这种做法是盲目而低效的。r d f 文档中存在大量的由u r i 引用形成的对象间的链接信息,而通过u r l 形成的文档间的超链接相对较少。如何通过这种特殊的 链接自动地、高效地发现语义网信息资源,是我们研究的重点。 ( 1 ) 语义网站点的发现 3 u 瓜一 东南大学博十学位论文 提高数据收集效率的根本方法是提高数据收集的“目的性”,我们通过事先找到可能包含语义网 信息资源的站点来提高数据收集的“目的性”,我们将此类站点称为“语义网站点”。语义网站点为 数据收集子系统提供了有力的线索,是本体搜索引擎拥有的宝贵知识。我们描述了语义网站点与r d f 文档、r d f 模型以及语义网实体之间的关系,从而定义了一系列启发式的规则,从事先得到的“种 子”语义网信息资源中找到可能的语义网站点。这些站点是本体搜索引擎构建的基石,需要数据收 集子系统进行深入地挖掘。随着收集过程的不断进行,本体搜索引擎对语义网的了解将逐步深入, 其“知识库”中的语义网站点将不断地丰富。 ( 2 ) 语义网站点的排序 提高数据收集效率的另一个关键环节,是在了解已有的语义网站点的基础上,调查r d f 文档在 各站点中的分布,并且合理地按照一定的访问策略分配数据收集线程的任务。某些站点中包含的r d f 文档相对于其他站点来说数鼋上更为丰富,可信度上更高,表现出来的形式就是这些文档中定义的 语义网实体在语义网中被大量的引用。我们通过一定的链接分析方法简单地对每个语义网站点在整 个语义网中的“重要性”进行了评估。如果有大量的语义网站点依赖于某个语义网站点中包含的r d f 文档时,我们就称后者为“重要的”语义网站点。 语义网站点的重要性给了我们一个调整访问策略的参考。重要的站点需要优先地、高频率的回 访( r e v i s i t ) 。相对于盲日的数据收集方法,一个合理的访问策略可以让我们在单位时间内收集到更 多的r d f 文档。 1 2 2 本体文档的分析 在数据收集系统得到本体文档之后,需要对本体文档进行一定的加工处理,得到其中的文本信 息和结构信息。我们将加工处理过程称为本体文档的分析过程。这个过程的难点在于,目前并未见 相关研究探讨过对于本体搜索引擎而言,本体文档的分析过程需要得到哪些结果,也就是说本体文 档分析的目标还不明确。 分析的目标取决于本体搜索引擎需要提供的检索功能,而功能的定位取决于用户的需求。所以 我们首先需要了解用户的需求。首先,用户还需要本体搜索引擎能够从一定程度上保证检索结果的 权威性。语义网和传统的万维网一样,是一个开放自由的平台,任何组织和个体均可以自由地定义 各种术语。一方面,这种做法体现了语义网开放世界的理念,另一方面,这种做法也会导致一些不 良的后果:本体开发人员对术语的定义可能是权威的,也可能是不权威的,正如网页描述的信息可 能是可信的,也可能是不可信的。信任( t r u s t ) 问题无论对于万维网还是语义网都是一个重要而严 峻的问题,而大多数本体搜索引擎目前还未对这一问题提出系统的解决方案。其次,用户希望本体 搜索引擎能够具备一定的推理能力。这也是本体相对于其他结构化数据表示的优势。例如,对于术 语的类型( 类或属性) ,我们可以从本体文档中推理得到。但是语义网搜索引擎应当、并且能够提供 何种推理能力,至今未有权威的结论;再次,用户检索的对象并不仅仅是本体文档,还包含本体文 档中定义的术语,以及文档、术语之间的关系。现有的本体搜索引擎如s w o o g l e 已经能够做到本体 文档和术语的检索,但是却不提供关系的检索。这是因为s w o o g l e 的关注重点是本体文档中的文本 信息,而关系作为一种结构信息虽然在排序的时候有所体现,但是却不作为检索的对象。我们认为 用户存在对结构信息的检索需求,并且结构性是本体文档区别与普通文本的的重要特征,也是本体 搜索引擎的重要特征:另外,用户希望本体搜索引擎能够对检索结果给出令人满意的排序。排序体 现了语义网中对象之问霞要性的差异,而这种差异会影响本体文档或术语的重用;最后,用户对检 索结果的组织也提出了一定的要求。随着本体文档的大量涌现,一个常见的关键字可能对应到海量 的检索结果,尤其是对术语的检索。用户需要本体搜索引擎提供一种术语的组织方式,能够从术语 本身的领域相关性出发,对术语进行归类。 4 第一章引言 综上所述,从用户的需求出发,我们在分析过程中解决的问题包括:权威性问题、推理能力、 对象间关系的发现、排序问题和术语组织问题。我们将着重讨论这5 个关键研究问题。 ( 1 ) 术语定义的权威性问题 本体文档中术语的权威性问题正在受到语义网研究人员越来越多的关注。术语定义的权威性问 题是语义网信任问题中最基本的问题。在缺乏相应机制来规范本体开发的情况下,本体搜索引擎需 要初步地判断哪些术语定义是权威的,哪些是非权威的。这是本体搜索引擎的系统观点,用户在没 有本体搜索引擎的帮助下,很难了解单个本体文档中术语的权威性问题。 ( 2 ) 术语类型的推理 基于效率的考虑,本体搜索引擎在分析过程中对本体文档一般采用前向推理的模式。简而言之, 前向推理是指在分析过程中做推理,即事先进行推理;与前向推理相对的是后向推理,即在查询或 检索的过程中进行推理。对于大规模本体搜索引擎而言,后向推理会导致检索耗时过多,所以并不 可行,而较强能力的前向推理也依然会耗费大量的分析时间。如何合理地选择推理能力是本体搜索 引擎面临的一个关键问题。我们认为对术语类型的推理是所有推理能力中最重要也是本体搜索引擎 最易于实现的推理能力。目前的o w l 推理机大多是从逻辑的角度,通过本体中的公理( a x i o m ) 推 理得到术语的类型。而本体搜索引擎可以从语法分析的角度,以更为高效的方式启发式地得到术语 的类型,虽然这种做法无法达到基于公理的推理机所能达到的逻辑上的完备性,但是可以保证推理 结果的正确性和高效性。 ( 3 ) 通过r d f 句子发现对象间的关系类型 本体搜索引擎关注的对象主要为本体文档和其中定义的术语,我们需要明确对象之间存在哪些 关系。首先,一个本体文档可以通过o w l :i m p o r t s 导入另一个本体文档,本体文档之间还可能存在版本 兼容与否的关系;术语之间的关系包括子类关系、子属性关系等等。这些关系类型我们可以从本体 文档解析出来的r d f 三元组集合中得到。但是从三元组集合中分析关系类型时,我们会遇到一个由 空白节点带来的问题:一个包含空白节点的r d f 三元组并不能完整地表达一组对象之间的关系,只 有一组共享相同空白节点的三元组集合,才是一个完整的结构单元,才能完整地描述两个或多个术 语之间的关系。因此,我们定义了r d f 句子的概念作为关系类型分析的基本单位。对本体文档中 r d f 句子的解析问题成为了得到对象问关系类型的关键问题。 ( 4 ) 术语在本体文档中的排序问题 语义网中的排序问题目前已经取得了阶段性的成果,但是其中有个问题没有得到充分的研究, 即本体文档内部术语的排序问题。本体开发过程中,某些术语起到了“核心”的作用,而其他术语 仅仅是用于辅助这些“核心”术语的定义。所以在检索结果中,如果某个术语在本体文档中作为“核 心”术语出现,则应该给予较高的排名。在分析阶段利用链接分析方法对术语在本体内部进行排序, 是我们的研究重点之一,该方法可以作为其他现有排序方法的补充。 ( 5 ) 使用词汇对术语进行组织 从本体工程的角度来看,传统的术语组织方式相对简单:即通过本体文档来组织术语。我们将 这种方式称为物理上的组织。这种组织方式的优点在于简洁、高效。对于本体搜索引擎而言,当完 成每个本体文档的分析过程后,就得到了一组术语,本体搜索引擎无需对术语这种物理上的组织方 式再进行综合。当呈现检索结果时,搜索引擎可以选择将术语结果线性地罗列出来,也可以按照本 体文档的方式进行一定地组织。但是,对于某些本体文档而言,这种组织方式不能很好地刻画术语 之间的领域相关性。所谓术语间的领域相关性是指术语所表示( r e p r e s e n t ) 的概念之间的亲近性。 例如f o a l p e r s o n 和f o a s a g e 就是2 个领域相关的术语。一个本体开发人员完全可能将两个高度领域 5 东南大学博十学位论文 相关的术语定义在两个不同的本体文档中。这和开发人员选择的本体发布方式也存在一定的关系, 当本体文档使用h t t p 3 0 3 方式发布时,这种情况尤为明显。例如d b p e d i a c o r n 中定义的每个术语均 对应一个本体文档( 或称为本体文档片段) 。如何按照术语的领域相关性进行组织,而这种组织方式 又不会引起本体开发人员的异议,同时又不会给本体搜索引擎带来太多额外的开销,这是一个重要 的研究问题。我们提出了一个新的术语逻辑组织方式,并将其称为词汇。 1 2 3 本体文档的索引 本体文档的索引是本体文档分析过程的后继过程,索引过程的输入是分析过程的输出。在每个 信息检索系统中,索引的目的是了提高检索的效率。目前语义网中大多数对索引问题的研究集中于 海量三元组的索引,这些研究的目的,是为了提高对存储于关系数据库中的海量三元组进行s p a r q l 查询的效率。而面向信息检索任务的语义网结构信息索引还处于研究的起步阶段。我们拟从两个方 面研究本体文档的索引问题。 ( 1 ) 本体文档中文本信息的索引 s w o o g l e 采用n g r a m 技术索引每个术语和奉体文档的文本信息。其中一个术语的文本信息指它 在一个本体文档中的本地名( 1 0 c a l n a m e ) 、标签( 1 a b e l ) 以及注释( c o m m e n t s ) 信息。这种文本信息 索引方式的一个缺陷在于:术语的文本信息仅包含了术语的本地描述( l o c a ld e s c r i p t i o n ) ,而本地 描述作为术语语义的内涵,仅提供了有限的信息量,有时并不能完整地反映术语的语义。这使得用 户通过文本信息检索术语时,结果的召回率( r e c a l l ) 不高。我们应当在术语的文本信息中加入一定 的语义“外延”,即一个术语的邻居描述信息( n e i g h b o r i n gd e s c r i p t i o n ) ,但同时还要防止过多的邻 居描述信息导致搜索结果精度( p r e c i s i o n ) 的下降。 ( 2 ) 本体文档中结构信息的索引 本体文档结构信息的索引存在2 个难点:首先,至今没有相关研究讨论过对于本体搜索引擎来 说,本体文档究竟提供了哪些有用的结构信息;其次,网络结构或图结构的索引本身是一个难题。 如何高效地索引这些结构信息是我们关注的重点。对网络或图结构的索引大多采用“分而治之”的 做法,这些方法大多将错综复杂的结构信息划分为若干子图或子树,再将这些小的单元序列化为索 引。我们首先提出了语义网中结构信息的分类,接着提出了一个简单的数据结构用于建模本体文档 中的局部结构信息,再将这些局部结构信息序列化并合并成为语义网中结构信息的索引。 1 2 4 本体文档与词汇的理解 尽管语义网的初衷是让机器可以理解基于r d f 模型的数据,但是对于用户而言,在重用和实例 化本体文档中术语的过程中,依然需要人为地理解本体文档或词汇。用户对本体文档和词汇最直接 地理解方式是阅读本体文档中的r d f 句子。但是由于采用了x m l 语法和大量本体语言结构,本体 文档比起使用自然语言描述的文本文档而言,要难以阅读的多,尤其当本体文档规模较大,或词汇 对应的本体文档数量较多时。解决方法之一是通过可视化技术来辅助用户的理解。但是可视化技术 的复杂性较高,而且会占用太多的存储空间与网络传输带宽,所以对于本体搜索引擎而言,这种方 法并不经济。本体搜索引擎应当提供种简单、通用而高效的方法,帮助用户快速地理解检索到的 本体文档和用于组织检索结果的词汇。 我们受到了文本摘要技术的启发。文本摘要技术迄今已经发展了接近5 0 年,取得了大量重要的 研究成果。文本摘要技术目前已经相当成熟,广泛地应用于各类提供文档理解的服务。例如网页搜 索引擎利用文本摘要技术,帮助用户理解检索到的网页。我们可以通过摘要技术来帮助用户理解检 6 第一章引言 索到的本体文档和词汇。无论是本体文档还是词汇的摘要,我们的目的是找出其中最重要的r d f 句 子的集合,用这个精简的r d f 句子的集合代表本体文档或词汇,来帮助用户快速地理解。 由于本体文档与词汇存在本质的区别。前者是单一的物理文件,后者是一个综合的逻辑单元, 两者应使用不同的模型进行刻画,所以对这两者采用的摘要方法不一样,其中的研究难点也不尽相 同。 ( 1 ) 本体文档的摘要 本体文档的摘要技术适合应用于使用本体文档作为检索对象的本体搜索引擎,例如s w o o g l e ,或 以帮助用户理解本地的本体文档为目的的应用程序。我们将这类摘要技术称之为本地摘要。本地摘 要的难点在于:首先,如何对本体文档以r d f 句子为基本单位进行建模;其次如何定义r d f 句子 的重要性,并采用何种分析方式度量r d f 句子的重要性。针对r d f 句子重要性的不同定义,需要 采用不同的分析方法,而分析方法的选择将直接影响最终的摘要。目前还未有研究显示何种分析方 法适用于r d f 句子蕈要性的评估;再次,由于分析方法选择的不确定性,需要一套评估体系来判断 各种分析方法得到的摘要的质量;最后,作为用户需要阅读的材料,摘要不仅应当包含最重要的r d f 句子,还应当做到前后语义连贯、一致,并且在有限的长度中包含尽可能多的信息量,这样才能让 用户更容易理解奉体文档所讨论的主题。 ( 2 ) 词汇的摘要 词汇摘要技术适合应用于以词汇为检索对象,或作为术语检索结果组织方式的本体搜索引擎, 例如f a l c o n s 。我们将这类摘要技术称之为全局摘要,因为这类摘要技术需要得到被摘要的词汇在语 义网中所有相关的r d f 句子,即一个语义网全局的结构信息索引做为支撑。全局摘要的难点与本地 摘要大体相同,区别在于:词汇的建模比起单一的本体文档更为复杂,不仅需要找出被摘要词汇在 语义网中相关的所有r d f 句子,还要考虑词汇之间通过r d f 句子形成的关系,这是全局摘要与本 地摘要在模型上最大的不同。 1 3 国内外研究现状 早在2 0 0 1 年,y i n gd i n g 就提出了“本体库”( o n t o l o g yl i b r a r y ) 的概念 6 1 。一个“本体库”应当 管理已有的本体,并向用户提供重用已有本体的支持,比如按照某种本体语言对已有本体进行标准

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论