(系统工程专业论文)基于中文科技论文的本体交互式构建方法研究.pdf_第1页
(系统工程专业论文)基于中文科技论文的本体交互式构建方法研究.pdf_第2页
(系统工程专业论文)基于中文科技论文的本体交互式构建方法研究.pdf_第3页
(系统工程专业论文)基于中文科技论文的本体交互式构建方法研究.pdf_第4页
(系统工程专业论文)基于中文科技论文的本体交互式构建方法研究.pdf_第5页
已阅读5页,还剩68页未读 继续免费阅读

(系统工程专业论文)基于中文科技论文的本体交互式构建方法研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

大连理工大学硕士学位论文 摘要 同行评议是科学基金项目评审工作的核心,其效果主要取决于同行专家的选择。本 质上,同行专家的选择过程是在已知项目知识的条件下,从专家库中搜索出与已知项目 具有相似知识的专家的过程,也可以看作是一个语义检索的过程。本体是语义检索的基 础和核心,本体质量的好坏直接影响到语义检索的效果。同时,本体的手工构建由于耗 时费力也严重阻碍了本体大规模的应用。因此,本体的自动构建是一个亟待解决的问题。 本文在对国内外本体自动构建相关研究进行全面分析和总结的基础上,提出了基于 中文科技论文的本体交互式构建方法。该方法基于系统集成创新的思想,充分利用现有 的自然语言处理技术和统计学习方法,从特定领域内的自然语言文本中提取领域概念以 及概念间的语义关系。本文的核心工作包括以下三点: ( 1 ) 领域概念的提取。主要是通过基于长度递减与串频统计的文本切分方法以及汉 语短语词法规则,提取领域的候选概念,然后通过统计方法分析领域归属度并基于词典 进行概念约简,得到由多个词和短语组成的与领域相关的概念。 ( 2 ) 语义关系的获取。主要是通过关联规则挖掘、依存句法分析以及机器学习方法 来学习表达语义关系的关系句法模式,应用己得到的句法模式析取语义关系,并对概念 间的语义关系进行命名。 ( 3 ) 本体交互式构建原型系统的分析、设计和实现。系统主要分为三个模块:文本 管理、本体构建和本体维护,其中重点介绍了本体构建模块的功能和具体实现。 在此基础上,本文以“计算机科学”及其子领域“计算机硬件”的文本为试验对象, 基于本文提出的本体交互式构建方法和原型系统构建了一个小规模的领域本体,并对试 验结果进行了分析。试验结果表明,本文提出的基于中文科技论文的领域本体构建方法 具有较高的准确性,并且不依赖于领域词典,适用于任何领域本体的构建,具有较大的 通用性,能够辅助领域专家更高效、准确地完成本体构建的任务。 关键词:本体;本体构建;领域概念;语义关系;关系句法模式 基于中文科技论文的本体交互式构建方法研究 r e s e a r c ho nc h i n e s es c i e n t i f i ca n dt e c h n i c a lp a p e rb a s e di n t e r a c t i v e o n t o l o g yb u i l d i n g a b s t r a c t t h ep e e rr e v i e wo fg r a n tp r o p o s a l si si m p o r t a n tt oa c a d e m i c sf r o ma l ld i s c i p l i n e s ,w h i c h d e p e n d so nt h es e l e c t i o no fr e v i e w e r s g e n e r a l l ys p e a k i n g , r e v i e w e r s s e l e c t i o ni st os e a r c h e x p e r t sw h o h a v es i m i l a rk n o w l e d g ew i t ht h ep r o p o s a l s ,i no t h e rw o r d s ,i tc a l lb et r e a t e da sa p r o c e s so fs e m a n t i cr e t r i e v a l ,w h e r eo n t o l o g y a p p e a r st o b ea ni m p o r t a n tp a r t h o w e v e r , m a n u a l l yb u i l d i n go n t o l o g i e st u r n st ob et i m ec o n s u m i n g a n dl a b o ri n t e n s i v e ,t h u si n h i b i t st h e a p p l i c a t i o n s a sar e s u l t ,a u t o m a t i co n t o l o g yb u i l d i n gi sa nu r g e n tp r o b l e mt ob er e s o l v e d i nt h i sp a p e r , t h e o r i e sa b o u ta u t o m a t i co n t o l o g yb u i l d i n ga r ec o m p r e h e n s i v e l ya n a l y z e d a n dan o v e lm e t h o df o rc h i n e s es c i e n f i t i ca n dt e c h n i c a lp a p e r sb a s e di n t e r a c t i v eo n t o l o g y b u i l d i n gi sp r o p o s e d t h em e t h o dm a k e sf u l lu s eo fi d e a sf r o ms y s t e mi n t e g r a t e di n n o v a t i o n , n a t u r a ll a n g u a g ep r o c e s s i n gt e c h n i q u e sa n ds t a t i s t i c a la l g o r i t h m st oe x t r a c td o m a i n - s p e c i f i e c o n c e p t sa sw e l la st h e i rs e m a n t i cr e l a t i o n sf r o md o m a i nt e x t s k e yw o r k o ft h i sp a p e rc a nb e s u m m a r i z e di nt h ef o l l o w i n gt h r e ep a r t s : ( 1 ) d o m a i n - s p e c i f i cc o n c e p t se x t r a c t i o n h e r ed o m a i n s p e c i f i cc o n c e p t sa r ee x t r a c t e d f r o mt e x t s t h r o u g hs e m a n t i cs t r i n gs e g m e n t a t i o n , r o l e sm a t c h i n g , a n a l y s i so fd o m a i n c o n s e n s u sa n dd o m a i nr e l e v a n c e ,a n dc o n c e p tr e d u c t i o n ( 2 ) s e m a n t i cr e l a t i o n sl e a r n i n g f i r s ta s s o c i a t e dc o n c e p t sa r em i n e db ya s s o c i a t i o nr u l e , a n dt h e ns e n t e n c e sc o n t a i n i n gt h e ma r ea n a l y z e db yd e p e n d e n c yt r e ep a r s e r t h e ns y n t a c t i c p a t t e r n sa r eg e n e r a t e db ym a c h i n el e a r n i n ga l g o r i t h m s a n da r eu s e dt oe x t r a c tr e l a t i o n s b e t w e e nn e wa s s o c i a t e dc o n c e p t s a tl a s t ,r e l a t i o n sa r en a m e da c c o r d i n gt ot h ep a t t e r n s ( 3 ) t h ei m p l e m e n t a t i o no ft h ei n t e r a c t i v eo n t o l o g yb u i l d i n gs y s t e m t h es y s t e mh a s t h r e em o d u l e s :t e x tm a n a g e m e n t ,o n t o l o g yb u i l d i n g ,a n do n t o l o g ym a i n t e n a n c e ,a n do n t o l o g y b u i l d i n gm o d u l ei ss t r e n g t h e n e da n dd e s c r i b e di nd e t a i l i nt h ee n d ,as m a l lo n t o l o g yi sb u i l tf r o mc h i n e s et e x t si nc o m p u t e rs c i e n c ed o m a i na n d i t ss u bd o m a i nc o m p u t e rh a r d w a r e ,a n de x p e r i m e n t a lr e s u l t sa r ee v a l u a t e d ,w h i c hs h o wt h a t t h em e t h o df o ri n t e r a c t i v eo n t o l o g yb u i l d i n gp r o p o s e di n t h i sp a p e rc a ni m p r o v et h e e f f i c i e n c yt oag r e a te x t e n ta n ds h o wt h ep r o m i s eo fr e l a t i v e l yh i g hp r e c i s i o n f u r t h e r m o r e ,i t i sd o m a i nl e x i c o ni n d e p e n d e n t t h u si ss u i t a b l ef o ra n yd o m a i no n t o l o g yb u i l d i n g k e yw o r d s :o n t o l o g y :o n t o l o g yb u i l d i n g ;d o m a i n - s p e c i f i cc o n c e p t :s e m a n t i c r e l a t i o n :r e l a t i o ns y n t a c t i cp a t t e r n 独创性说明 作者郑重声明:本硕士学位论文是我个人在导师指导下进行的研究工 作及取得研究成果。尽我所知,除了文中特别加以标注和致谢的地方外, 论文中不包含其他人已经发表或撰写的研究成果,也不包含为获得大连理 工大学或者其他单位的学位或证书所使用过的材料。与我一同工作的同志 对本研究所做的贡献均已在论文中做了明确的说明并表示了谢意。 作者签名:选窒9 日期:翌2 圣! 璺壁! 曰 大连理工大学硕士研究生学位论文 大连理工大学学位论文版权使用授权书 本学位论文作者及指导教师完全了解“大连理工大学硕士、博士学位论文版权使用 规定”,同意大连理工大学保留并向国家有关部门或机构送交学位论文的复印件和电子 版,允许论文被查阅和借阅。本人授权大连理工大学可以将本学位论文的全部或部分内 容编入有关数据库进行检索,也可采用影印、缩印或扫描等复制手段保存和汇编学位论 文。 作者签名: 导师签名 丝塑 专蜒殳、 大连理工大学硕士学位论文 1 绪论 1 1 问题的提出 同行评议是科学基金项目评审工作的核心,其效果主要取决于同行专家的选择和评 价标准的制定,其中选择真正“同行”的专家是评议结果科学性的保证,也是正确决策 的前提。目前对于评审专家的选择,主要是采用学科、领域和专业代码来表示知识体系, 项目申请人申报项目时要填写项1 7 t 所属的领域、学科和专业,专家注册时也要填写主要 的研究领域、学科和熟悉的专业。为项目分配专家时采用人机交互的方式,首先由计算 机按照学科类别匹配为工作人员提供一个专家选择范围,工作人员根据其自身的经验来 判断哪位专家适合评审哪个项目。 随着学科分类日益细化,交叉学科发展迅速,待评审的项目所涉及的知识往往不是 单一的领域或学科,即使是同一领域的专家,研究方向的侧重也不尽相同。单纯的基于 学科、领域和专业的分类体系严重割裂了各学科间的关系,使得很多项目并不是由真正 “同行”的专家评议的,甚至出现“外行评内行”的局面。在专家拒绝评审的项目中, 大部分是由于对项目相关领域知识不熟悉造成的。另外,即使选择出属于该领域的专家, 也并不能准确判断出专家对该领域的熟悉程度。专家库中的专家数量通常是上万人,而 且几乎涉及到科学研究的所有领域,工作人员并没有时间和能力去了解每位专家的专 长,仅凭借自身的经验来判断和选择专家难免会产生偏差。因此,如何选择最内行的专 家评审最熟悉的项目是一个亟待解决的问题。 本质上,同行专家的选择是一个将专家的知识和项目的知识进行匹配的过程,也就 是说,根据项目所描述的知识,从专家库中检索出具有最相似知识的专家。项目所涉及 的知识通常体现在项目申请书中,专家所具有的知识除了体现在其学术论文、专著和会 议报告中,还体现在其参评过的项目中,其同意资助并最终获得资助的项目与不同意资 助并最终落选的项目所涉及的知识也可近似认为是该评审专家具有的知识,这些属于间 接获得的知识。因此,从知识的角度来讲,同行专家的选择可以看作是一个语义检索和 知识匹配的过程。 目前的检索方法主要是基于关键词的匹配和基于语义的检索。其中语义检索由于引 入了词语的语义而得到广泛而深入的研究和应用。语义检索的前提是对领域知识的表示 要明确和统一,这是计算语义相似度的基础,而本体作为领域内共享概念的明确规范的 说明,成为语义检索的核心。 基于中文科技论文的本体交互式构建方法研究 目前已有的本体大部分是通过手工构建的,不仅需要耗费大量的时间和精力,也不 利于本体的更新和扩充。同时由于构建者的主观倾向,也使得本体的共享性大打折扣, 因此,本体构建的困难已经严重阻碍了它在知识管理、软件工程等领域的大规模应用。 基于以上分析,本文对中文本体的自动构建方法作了相关研究,并提出了本体的交互式 构建方法,以期辅助领域专家高效准确地构建领域本体。 1 2 国内外相关研究现状 1 2 1 国内外已有的本体系统 目前国内外已有的比较知名的本体主要有7 个,其中国外的有w o r d n e t ,f r a m c n e t , g u m ,s e n s u s ,o n t o s e c k ,c y c ,国内的有知网( h o w n e t ) 。 w o r d n e t 1 】是美国普林斯顿大学认知科学实验室的g e o r g e 气m i l l e r 教授负责开发 的。它是基于心理语言学规则的英文词典,以同义词集为单位组织信息,对查询结果的 演绎比较符合人类思维定式。目前最新版本是w o r d n e t 2 0 ,包含名词、动词、形容词和 副词4 种词汇,其中动词与名词之间的关联关系已达到4 2 0 0 0 余条。从实质上来讲, w o r d n e t 并非真正意义上的本体,只是一部电子词汇数据库,并不能实现推理功能。 f r a m e n c t 2 】由美国国家科学基金赞助,加州大学伯克利分校的国际计算机科学研究 所负责开发。它也是一部英文词典,采用称为框架语义学的描述架构,提供强有力的语 义分析能力,目前已发展为f r a m e n e ti i 。f r a m e n e t 的特征主要体现在词汇与语义框架 之间的关联,可用于推理及检索。 g u m 3 】是通用上层模型( g e n e r a l i z e du p p e rm o d e l ) 的缩写。它是独立于专业领域 的语言本体,目的是希望用自然语言的表达方式来组织信息。g u m 支持多语种处理, 包含基本概念及独立于各种具体语言的概念组织方式。 o n t o s e e k l 4 1 是一个集中了在线黄页和产品目录的基于内容检索的系统。系统中的本 体是通过复用s e n s u s 本体的概念体系框架中的5 0 0 0 个节点以及合并w o r d n e t 中的主 题词和文体上层模型的顶级本体结构实现的,可用于推理。 c y c 5 】项目是由卡耐基梅隆大学和斯坦福大学计算机科学系的教授d o u gl e n a t 发起 的,旨在提供一种可以为其他程序使用的“深层次的”理解。c y c 知识服务器包含一个 多语境知识库和推理引擎。其中知识库拥有2 0 余万条术语以及数以万计手工录入的用 于解释术语的断言。推理引擎用于执行通用的逻辑学推理。o p e n c y c l 6 】是c y c 技术的开 发源代码版本,包括c y e 本体的部分内容,以及公理、规则集和推理引擎。目前 o p e n c y c l 0 版本包含6 0 0 0 余个概念以及相关6 万条断言,可以通过扩展o p e n c y c 知识 库的某一学科领域而构建领域本体,促进领域本体的快捷开发。 大连理工大学硕士学位论文 h o w n c t 【7 】被德克萨斯大学计算机系知识系统研究小组列为本体项目之一。它是一个 以英汉双语所代表的概念以及概念的特征为基础的,以揭示概念与概念之间以及概念所 具有的特征之间的关系为基本内容的通用知识库。其中概念之间以及概念的属性之间的 关系有八种,包括( 1 ) 上下位关系,( 2 ) 同义关系,( 3 ) 反义关系,( 4 ) 对义关系,( 5 ) 属性 宿主关系,( 6 ) 部件整体关系,( 7 ) 材料成品关系,( 8 ) 事件- 角色关系。h o w n e t 虽然包含 了大量的概念以及概念之间的关系,但是它本身并不具备本体系统所应具备的推理和知 识发现功能,可以作为自然语言理解以及汉英机器翻译的语料库进行使用。 综合以上分析,可以看出英文本体研究的早期工作如w o r d n e t 和f r a m e n e t 是围绕 词典、叙词表等资源展开的。g u m 和s e n s u s 相对于前两者而言更为成熟,主要用于 机器翻译。c y c 和o n t o s e e k 是具有推理功能的最为完备的本体系统,尤其是c y c 本体 系统,不仅具备完整的开发工具和表示语言,还具备大型的自主开发的知识库,使之成 为开发领域本体的概念基础。中文的h o w n e t 是基于现代汉语词典展开的,主要面 向机器翻译和初级的自然语言处理,与真正的本体应用还相距甚远。 1 2 2 本体自动构建方法的研究现状 上述本体大都是在领域专家的参与下,以手工的方式构建而成的。实际应用中,本 体的构建是一项工作量巨大并且异常繁杂的任务,如w o r d n e t 的构建耗时大概十余年的 时间。近十年以来,本体编辑工具已经日趋完善,从早期的o n t o l i n g u a ”,o n t o s a u r u s n , w e b o n t o 堋,到目前广泛使用的p r o t6g6 1 1 】,w e b o d e 1 2 1 ,o i l e d 1 3 1 ,o n t o e d i t 1 4 l 和 k a o n ! ”】等。这些工具提供了友好的图形化界面和一致性检查机制,借助这些工具,用 户可以把精力集中在本体内容的组织上,而不必了解本体描述语言的细节,同时避免了 语法错误的发生。但是,这些工具提供的仅仅是本体的编辑功能,本体中概念和关系的 获取仍然需要手工完成。因此,如何半自动或自动地构建本体成为近年来的研究热点。 目前国外在本体的自动构建方面有较多的尝试,其中较具代表性的是以德国卡尔斯 鲁厄大学的r u d is t u d e r 和a l e x a n d e rm a e c h e 为首的应用情报学和规范描述方法研究所 ( a i f b ,i n s t i t u t eo fa p p l i e di n f o r m a t i c sa n df o r m a ld e s c r i p t i o nm e t h o d s ) 从事的o n t o l o g y l e a r n i n g i l q 的研究,目前他们已经开发出包括o n t o e d i t 1 4 】和t e x t 2 0 n t o 1 7 】在内的多种支 持英文本体构建的工具。m a e c h e 和s t a a b 1 8 l 提出的本体自动构建方法主要是通过自然语 言处理技术( 包括句法分析、命名实体识别、词性标注、组块分析) 和机器学习算法( 关 联规贝挖掘) ,以及领域词典g e r m a n e t 、w o r d n e t 从领域文本中抽取概念及其关系。 该方法目前存在的问题是未区别领域概念和通用概念,通过关联规则学习得到的规则过 于宽泛,需要大量的人工参与修正。 基于中文科技论文的本体交互式构建方法研究 i n f o s l e u t h l l 9 1 是m c c ( m i c r o c l e c t r o n i c sa n dc o m p u t e rt e c h n o l o g yc o r p o r a t i o n ) 的一 个研究项目,目的在于为企业网络和外部网络开发新的信息获取技术,已经成功应用于 知识管理、商业智能、物流等多个领域。i n f o s l e u t h 的核心是基于本体的a g e n t 结构,。 其中的本体是基于文本自动构建丽成的。方法主要是通过专家提供的种子词汇 ( s c e d w o r d ) 由系统自动从文本中抽取出包含种子词汇的短语生成概念,抽取的关系包 括i s a ,p a r t - o f ,m a n u f a c t u r e d b y ,o w n e d b y 以及a s s o c - w i t h 。其中a s s o c - w i t h 是指除 了i s a 关系的所有其它关系,本体构建过程中每一步都需要专家的参与修正。这种方法 通过浅层自然语言处理如词性标注和语言学特性为领域专家提供候选概念和关系,在领 域专家构建本体的同时完成文本的标注,有利于信息检索。它存在的问题是忽略了同义 概念的识别,获取的概念主要取决于s e e d w o r d 的定义等等。 o n t o l t 2 0 是基于目前广泛使用的本体编辑工具p r o t 6 9 d 1 1 1 】开发的本体提取和扩展插 件。它集成了各种语言学分析工具,使用映射规则从标注的文本集合中提取概念和关系, 并输出给p r o t d g d 进行编辑和存储。这种方法的不足在于映射规则的人工定义需要专业 性的知识和大量时问,规则的规模直接影响到本体构建的结果,并且该方法缺少相应的 评价标准,对于提取的本体无法给出定量的评价。 o n t o l e a m 2 1 j 是u n i v e r s i t yo f r o m e 开发的一个基于文本的本体学习工具,它能够获 取概念及其关系。其特点是将语义解释的方法应用到本体获取中,即首先使用基于语言 学和统计的方法从文本中抽取领域相关的术语,然后使用通用本体中的概念对这些术语 进行语义解释,从而确定术语之间的分类和其他语义关系。o n t o l c a r n 选择w o r d n e t 作 为通用本体,使用w o r d n e t 中的概念对获取的术语进行语义解释,从而使所构建的领域 本体与w o r d n e t 具有明确的关系,有利于不同领域本体之间的互操作和一致性。 h a s t i 2 2 j 是由a m i rk a b i ru n i v e r s i t yo f t e c h n o l o g y 开发的一个本体学习工具。它通过 手工定义的初始核心本体自动地从自然语言文本中获取新的概念、关系和公理,以便对 核心本体进行扩充和更新。h a s t i 的主要特点是基于模板的本体公理的自动获取以及基 于概念聚类和模板匹配的关系获取方法。此外,h a s t i 还引入了启发式的学习方法,即 在本体学习过程中,当同时出现多个可能的候选结果时,它利用一些启发式规则来减少 假设空间,消除不确定性。但是,模板和启发式规则是由人工完成的,还有待于进步 的改进。 此外,s t o j a n o v “乃j 等人提出从数据库构建本体的方法。该方法通过考察数据库中 的表、属性、主外键和包含关系,给出了一组从关系模型到本体的映射规则,基于这些 规则能够直接得到个候选本体,然后可以进一步对该候选本体进行评价和精炼,生成 最终本体。 大连理工大学硕士学位论文 国内在中文本体的自动构建方面的研究还处于起步阶段,目前为止还没有任何成型 的系统,与国外相比,无论在理论研究、实证研究还是技术手段的实现和应用方面都相 对落后。中国科学院陆汝钤院士为代表提出了基于专业领域知识复用的虚拟领域本体半 自动构建方法f 2 4 1 。该方法充分利用了领域知识模型以及领域本体相互之间存在的语义相 关性,从语义匹配的角度探讨了构造新领域本体的可能性。究其本质,该方法并不是真 正的构建本体,而是通过归并、合成已有本体来构建新的领域本体。 方卫东等提出了一种基于w e b 挖掘的学习模型,通过可扩展的模式集和分布语 义模型获取本体主干,使用关联规则发现概念间的一般关系,对候选本体进行修剪和合 并。通过文本分析本体获取文本扩充的迭代过程,优化模型参数和阈值。该模型解决 了现有本体学习方法对词典或核心本体的依赖性,并且对概念关系进行可信度的量化。 值得一提的是,文中并未提及概念的获取方法,同时关系的学习过于粗糙,也没有解决 关系的命名。 w e b o n t k a m 【2 6 】是浙江大学的高济教授等提出的面向知识网格的本体学习研究方 法,即从w 曲文档中自动获取领域术语及其关系。该方法包括语料库和w e b 文档集的 收集、选择和预处理,然后从文档集中抽取领域术语,进而选择出本体概念。最后通过 信息抽取( m ) 技术确定语义关系并构建分类层次体系,创建形式化表示。该方法虽然 为中文本体的构建提供了指导性的方法,但是其中很多环节还有待进一步改善,如文本 预处理阶段对文本的手工标注,短语式概念的抽取,关系模板的人工定义等等。 武汉大学的董慧等人也提出了一种中文本体的自动获取与评估算法【2 ”。该算法的主 要思想是将中文领域本体的提取划分为文本预处理,本体抽取和本体关系获取三个阶 段,其中包括基于统计模式对文本抽词,通过奇异值分解从词文档矩阵中提取本体、 使用语义相似度对本体进行聚类等。对于本体自动获取的效果评估,提出了利用计算手 工和自动两种方式得到的本体相似度来进行衡量的思路。值得一提的是,该方法仍停留 在算法分析阶段,并没有根据算法设计出试验性的系统,因而无法对该方法进行进一步 的评价。 除此以外,国内和国外也有很多学者对本体构建过程中的概念获取、分类关系获取、 一般关系获取以及关系的命名等分别进行了研究,本文的后续章节将予以介绍。 1 2 3 国内外研究现状的评价 综观国内外的研究现状可以发现,迄今为止国外的本体自动构建理论研究取得了显 著进展,理论体系正在逐步完善,应用系统已初见规模。总体来讲,国外的本体自动构 建方法具有以下特点: 基于中文科技论文的本体交互式构建方法研究 ( 1 ) 本体学习的数据源可以分为多种,如非结构化文本( 如自然语言文本) 、半结 构化的文本( 如x m l ,h 州l ) 和结构化数据源( 如关系数据库) 。 ( 2 ) 本体学习的方法是多个领域如人工智能、机器学习、统计学等方法的集成。 ( 3 ) 上述很多本体学习方法都依赖于自然语言处理,具有很强的语言特性,如h a s t i 支持波斯语,t e x t 2 0 n t o 支持英语和德语,o n t o l e a m 支持英语等等。 ( 4 ) 在概念间关系的获取方面,对获取分类关系,即上下位关系的研究较多,而对 于非分类关系的获取仍停留在判断两个概念间是否存在关系的层次上,无法进一步为获 取的关系赋予语义标签,即得到的都是匿名关系。 ( 5 ) 在本体学习中,主要关注于概念及概念间关系的获取,对公理的获取方法研究 较少。 ( 6 ) 现有的本体学习工具都是半自动的,即在学习的过程中需要人的不断修正。 ( 7 ) 本体的构建缺少标准的测试数据集和标准结果,因此不同方法间对本体学习结 果的定量评价不具有可比性。 相对于国外来讲,国内关于本体自动构建的研究刚刚起步,研究特点主要如下: ( 1 ) 目前还停留在理论研究阶段,专门针对本体自动构建方法的研究成果比较少, 大多是通过手工构建本体来解决语义共享和检索的问题。 ( 2 ) 至今为止国内还没有一个能够支持中文的本体构建工具。 ( 3 ) 由于中文的语言特点和英文有很大差异,语法更加复杂,已有的国外的本体构 建方法无法直接适用于中文表示的本体的构建。 ( 4 ) 在本体构建中,单纯的依靠统计的或规则的方法很难获得令人满意的结果,必 须结合中文自然语言处理领域的研究成果,同时使用机器学习的方法来改善本体学习的 质量。中文的自然语言处理技术还不够完善,基于中文的本体学习的技术因此存在很多 困难。 随着语义网的提出,本体在人工智能、信息检索、知识管理和软件工程等领域的应 用目益广泛,本体的构建是其应用的基础,因此对中文本体自动构建的研究具有至关重 要的意义。 1 3 研究内容及研究思路 本文研究的主要内容是在对本体相关理论综合介绍的基础上,分析和总结国内外本 体自动构建相关理论,重点研究基于中文自然语言文本的本体交互式构建方法。本文提 出了个基于自然语言理解和机器学习算法的螺旋上升式的本体交互式构建模型,针对 中文语言的特点和语法结构,提出基于统计和词法规则的本体概念获取方法以及基于关 一6 一 大连理工大学硕士学位论文 系句法模式的关系获取方法。在此基础上,分析、设计并实现基于中文科技论文的本体 交互式构建原型系统,最后通过对“计算机科学”领域及其子领域“计算机硬件”领域 的文本的试验对本文的方法进行相应的分析和评价,从而验证了本文提出的本体交互式 构建方法的可行性和正确性。 1 4 论文内容安排 本文的内容安排如下: 第2 章介绍本体构建相关的基本理论,包括本体的定义、建模元语、描述语言、本 体分类和本体构建的原则,在此基础上对基于文本的本体自动构建方法进行了可行性分 析,提出了本文的研究对象和本体构建的目标。 第3 章是本文研究的重点,首先提出了本体交互式构建模型,介绍了模型的基本结 构和本体的交互式构建方法,包括概念获取和关系获取方法。概念获取方法包括基于长 度递减与串频统计的语义串获取方法,对获取的语义串基于词法规则进行语义筛选,然 后详细介绍了概念的领域归属度以及同义概念的获取方法,最终获得领域本体的概念。 关系获取方法是在领域概念的基础上,进一步获取概念间的关系。提出了基于语义依存 树的关系模式表示方法,通过机器学习算法自动获取关系模式,以及基于关系模式的关 系获取,最后介绍了关系的自动命名方法。 第4 章是本体交互式构建方法的原型系统展示以及试验结果的分析与评价。首先分 析、设计并实现了本体交互式构建的原型系统,并以“计算机科学”领域及其子领域“计 算机硬件”领域为例,对领域文本进行概念以及概念间关系的获取,在此基础上对试验 结果进行了分析与评价。 第5 章是对本文工作的总结和对未来工作的展望。 基于中文科技论文的本体交互式构建方法研究 2 理论研究基础 2 1 本体的定义 本体( o n t o l o g y ) 这个术语最早诞生于1 7 世纪,派生于希腊语的“o n t o ”( “存在”) 和“l o g i a ”( “箴言录”) ,是一个哲学术语。在2 0 世纪9 0 年代被引入人工智能领域, 广泛应用于知识工程、自然语言处理和信息检索等领域,并取得了显著的成果。 目前关于本体的概念国际上还未达成共识。在人工智能领域最早提出本体概念的是 n c c h e s 等人【删,他将本体形容为“给出构成相关领域词汇的基本术语和关系,以及利 用这些术语和关系构成的规定这些词汇外延的定义。”1 9 9 3 年,美国斯坦福大学知识系 统实验室( k s l ) 的g m b c r 提出在人工智能领域被广泛接受的本体定义【2 9 1 ,即“i ti sa l l e x p l i c i tf o r m a ls p e c i f i c a t i o no fas h a r e dc o n c e p t u a l i z a t i o n ”。译为中文意思是:“本体是 得到大多数人认同的、关于概念体系的明确的、形式化的规范说明。”随后b o 塔t 【3 0 1 在 g n l b e r 的基础上定义“本体是共享概念模型的形式化规范说明。”,s t u d e r 3 1 】综合前人 的研究提出“本体是共享概念模型明确的形式化规范说明。”这个定义包含四层含义: ( 1 ) 明确性( e x p l i c i t ) :是指概念及其上位概念,使用此概念的约束条件应该有明 确的定义。 ( 2 ) 形式化( f o r m a l ) :是指本体应该是计算机可读的。 ( 3 ) 共享性( s h a r e d ) :是指本体应该体现出大多数人共同认可的知识,即知识的 共性,反映相关领域中公认的概念。 ( 4 ) 概念化( c o n c e p t u a l i z a t i o n ) :是指客观世界中对象的抽象模型,该模型是通过 定义这些对象的相关概念形成的,模型所表现的含义独立于具体的环境状态。 波音公司的m i c h a e lu s c h o l d 博士【3 2 】等在1 9 9 6 年提出本体的定义“i ti sav o c a b u l a r y o f t e r m sa n ds o m es p e c i f i c a t i o n o f t h e i r m e a n i n g ”译为中文即本体是一套术语词表以及术 语含义的规范说明。国内李景博士【3 3 】沿用了这一定义,迸一步将本体定义为一个得到公 认的形式化的知识表示体系,它包含词表( 或名称表、术语表) ,词表中的术语全是与 某一专业领域相关的,词表中的逻辑声明全部是用来描述那些术语的含义和术语间关系 的。因此,本体提供了一个用来表达和交流某些主题知识的词表和一个关系集,关系集 是词表中术语问关系的集合。 综上所述,尽管本体的定义有很多不同的方式,但是它们所表达的内涵是一致的。 本文主要参考并借鉴o r u b e r ,m i c h a e lu s c h o l d 以及李景的本体定义,将本体理解为用详 大连理工大学硕士学位论文 细明确的结构化的词汇表描述某一领域内的概念、属性及其之间的关系,并在此基础上 提出基于中文文本的本体交互式构建方法。 2 2 本体的建模元语 目前关于本体的建模元语国际上还没有统一的标准,普遍使用的是五元组表示法【蚓 d := c r 只爿) 。 ( 1 ) c 表示概念( c o n c e p t ) ,又称为类( c l a s s ) ,是相似术语所表达的概念的集合体。 ( 2 ) r 表示关系( r e l a t i o n ) ,包括概念层次关系和概念间的非分类关系。关系可以通 过函数来表示。例如,函数m o t h e r - o f ( x ,y ) ,表示某个人或动物x 与其母亲y 间存在 m o t h e r - o f 的关系。对于x 来讲,y 的值是唯一的,而m o t h e r - o f ( ) 的逆反函数c h i l d r e n o f f ) 的值允许不是唯一的。因此,通过函数来表达的关系有利于本体的推理。 ( 3 ) p 表示属性( p r o p e r t y ) 。属性用来描述概念,一个概念可以具有多个属性,另外 一个概念可能不具有这些属性。属性是区分概念的标准,具有继承性。一个属性必须有 相应的属性值。例如“人”这个概念,具有属性“肤色”,属性取值类型是枚举型,范 围是“黄、白、黑、褐”等等。 ( 4 ) i 表示实例( i n s t a n c e ) 。实例和概念的关系类似于面向对象程序设计中类和对象的 关系,也就是说,实例是概念的实例,概念是实例的概念。例如,“邓小平”是概念“人” 的一个实例。实例是本体中的最小对象,它具有原子性,即不可再分性。这也是判断概 念和实例的标准,即如果某个实例还可以再进行划分,那么它就是一个概念,而不是实 例。 ( 5 ) a 表示公理( a x i o m ) 。公理是用来限制概念和实例的取值范围,其中包括许多具 体的规则和约束。例如,三角形内角和等于1 8 0 度。公理通常都是一阶谓词的逻辑表达 式。 从本体的建模元语可以看出,基本的本体至少应该包括概念以及概念间的关系,如 图2 1 所示,而真正完整的本体应该包括上述所有五种建模元语。由于基于中文文本的 本体自动构建方法还处于起步阶段,自动构建本体中的所有建模元语在目前来讲是不现 实的,因此,本文的研究对象仅仅针对最基本的本体,因此本文中本体构建的任务包括 概念的获取以及概念间的关系( 包括概念层次关系和非分类关系) 的获取。 9 基于中文科技论文的本体交互式构建方法研究 图2 1 本体举例 f i g 2 1as a m p l eo fo n t o l o g y 2 3 本体的描述语言 本体的描述语言是用来描述本体的,为用户提供领域概念模型的清晰、形式化的概 念描述。它起源于人工智能领域对知识表示的研究,理想的本体描述语言不仅仅需要具 有良好定义的语法和语义,充分的表达能力,更需要有效的推理支持。为此,李烈3 3 j 提出本体的描述语言应该具有如下功能: ( 1 ) 为本体的构建提供建模元语。 ( 2 ) 为本体从自然语言的表示格式转化为机器可读的逻辑表达格式提供标引工具。 ( 3 ) 为本体在不同系统之间的导入和输出提供标准的机读格式。 ( 4 ) 形式化语言表示,利用机器可读的形式化表示语言表示本体,可以直接被计算 机存储、加工、利用,或在不同的系统之间迸行互操作。 总体来讲,本体描述语言可以是自然语言,也可以是框架( f r a m e w o r k ) 、语义网 络或逻辑语言。截至目前本体的表示语言已经达到近3 0 种之多,不同的语言针对不同 的应用环境,其中比较知名的本体表示语言包括l o o m ,o i l ,c y c l ,o n t o l i n g u a ,s h o e , r d f ,o w l 等等。 l o o m 【3 5 】是一种基于一阶谓词逻辑的知识表示语言,由美国南加州大学信息科学学 院设计并实现,目的是为支持o n t o s a u m s 工具进行本体构建提供一种底层描述语言。它 大连理工大学硕士学位论文 的描述性知识包括定义、规则、事实和缺省规则等,利用向前推理,语义一致化和面向 对象范例能集成在同一个应用中。因此,l o o m 可以提供表达能力强、声明性的规范说 明语言、强大的演绎推理能力以及多种编程风格和知识库服务。目前l o o m 语言已更新 为p o w e r l o o m 。 0 叫拍i 是o n t o l o g yi n t e r c h a n g el a n g u a g e 和o n t o l o g yi n f e r e n c el a y e r 的缩写,即“本 体交换语言”和“本体推理层”。o i l 将基于框架表示的方法应用于建模元语,具有合 并和表示本体以及进行系统间交互两种功能。o i l 将本体定义为一个由若干元素和组件 组成的结构,分为三个层次,即对象层、本体定义层和本体容器。利用o i l 可以定义概 念、关系以及公理,但无法定义有关实例的语法结构、规则和公理。 c v c l 【3 7 l 是c y c 的表达能力和灵活性很强的知识表示语言。它在一阶谓词演算的基 础上扩充了等价推理、缺省推理等功能,具备一些二阶谓词演算的能力并且它的语言环 境中配有功能很强的推理机制。在c y c 中,命名是唯一的,断言的语法形式与l i s p 语 法一致。c y c l 中有大量的概念和概念之间的关系,目前最多处理五元组,基本可以满 足实际应用。 o n t o l i n g u a 3 8 】是o n t o l i n g u a 服务器进行本体构建的一种基于知识交互格式( k i f , k n o w l e d g el a t e r c h a n g ef o r m a t ) 的本体构建语言,由斯坦福大学的k s l 从1 9 9 5 年开始 开发。o n t o l i n g u a 的定义包括三个部分,即定义头部分,用自然语言描述的非形式化定 义部分以及用k i f 或f r a m eo n t o l o g y 的词汇描述的形式化定义部分。它的特点是为构造 和维护本体提供了统一的、计算机可读的方法。同时由于其构造的本体可以方便地转换 到各种知识表示和推理系统中( 如p r o l o g 、c l i p s 等) ,从而将本体的维护与使用它的 目标系统分割开。 s h o e l 3 9 l 是s i m p l e h t m l o n t o l o g y e x t e n s i o

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论