已阅读5页,还剩117页未读, 继续免费阅读
(信号与信息处理专业论文)领域知识的获取.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
领域知识的获取 摘要 知识库是自然语言处理系统的基础,为系统“理解”自然语言并顺利 完成任务提供有力的知识保障。本文针对领域知识的获取进行了研究和探 索,提出了一些新的处理技术和模型。主要创新点包括: 1 针对领域知识源获取过程中的网络冗余信息问题,提出了一种基于 关键词序列的网络文本信息去重算法叫s m 。以全信息理论为依 据,使用文档的关键词序列来描述其结构特征和内涵特征,通过比 较主题相似文档的关键词序列的重叠度,判断是否存在信息冗余现 象。在各类隐式重复检测实验中,k s m 算法的总体准确率和召回率 分别达到了9 9 2 和9 7 7 ,显示了较好的性能。 2 针对低频术语抽取召回率较低的问题,提出了一种基于语言认知理 论的中文术语自动抽取算法,借助科技论文的话语标记,在c v a l u e 测度和s c pf 测度中引入候选术语的加权词频因子,提出了一种 m c s c p 测度,用于候选术语的单元性和术语性的综合评价。在车 牌识别领域的术语抽取实验中,基于m c s c p 测度的算法召回率和 准确率分别是9 6 5 和7 7 8 ,低频术语的召回率和准确率则分别是 9 6 2 和7 9 3 ;在保证术语抽取整体性能的同时,显著改善了低频 术语的抽取效果。 3 针对术语关系类型的多样化问题,提出了一种基于多策略的术语关 系自动获取模型。根据科技论文的语言学特点,综合术语的内部特 征和外部特征,从多个层面发现和获取术语间的各种关系,包括: 基于规则的术语同义关系获取、基于结构相似性的术语层级关系获 取、基于完全加权关联规则的术语非层级关系获取、基于粒子群的 术语聚类等。在术语非层级关系获取中,提出了一种基于非频繁项 集多重剪枝检测的完全加权关联规则挖掘算法一a w a r m m p i s , 用于完全加权关联规则的频繁项集生成和剪枝,取得了良好的效果; 在术语分组关系获取中,提出了一种基于粒子群的术语聚类算法, 使用术语的结构相似性( 内部特征) 和关联度( 外部特征) 来评价 术语的语义相似性。实验结果表明,其平均运行时间与迭代次数比 k m e a n s 提高了2 个级别。 4 针对多领域科技论文的大量出现与编辑人员专业知识有限的问题, 提出了一个领域知识制导的科技论文初审辅助系统模型。根据科技 期刊的出版要求和科技论文的特点,结合编辑人员的工作经验,将 编辑初审细化为4 个方面的评判,以此为依据开发了一个原型系统, 并使用计算机工程与应用和计算机科学与探索的2 3 6 5 篇投 稿论文为语料进行了性能测试。实验结果表明,该系统可辅助编辑 人员淘汰3 5 左右的低质量稿件,提高了编辑初审的效率。 关键词:术语抽取术语关系获取文本信息去重完全加权关联规则挖掘 科技论文初审辅助系统 d o m a i nk n o w l e d g e a c q u i s i t i o n a b s t r a c t k n o w l e d g eb a s ei s b r a i n o fn a t u r a ll a n g u a g ep r o c e s s i n gs y s t e m sa n d e n a b l e st h e mt o u n d e r s t a n d a n dp r o c e s sn a t u r a ll a n g u a g e t h i sd i s s e r t a t i o n m a k e se f f o r tt oe x p l o r en e wt e c h n o l o g i e so fd o m a i nk n o w l e d g ea c q u i s i t i o n t h e m a i nc o n t r i b u t i o n sa r ea sf o l l o w : 1 t os o l v ew e br e d u n d a n c yi n f o r l r l a t i o nd u r i n gt h ed o m a i nk n o w l e d g e s o u r c ea c q u i s i t i o n ,aw e bd o c u m e n td u p l i c a t er e m o v a la l g o r i t h mb a s e d o nk e y w o r ds e q u e n c e s ( i e k s m ) i s p r e s e n t e d r e f e r r i n g t o c o m p r e h e n s i v ei n f o r m a t i o nt h e o r y , k s mu s e sk e y w o r ds e q u e n c e so f w e bd o c u m e n tt or e p r e s e n ti t ss t r u c t u r ef e a t u r ea n di n t e n s i o nf e a t u r e t h e nj u d g e si n f o r m a t i o nr e d u n d a n c yb yc o m p a r i n gk e y w o r ds e q u e n c e s b e t w e e ns i m i l a rd o c u m e n t s i nt h ev a r i o u so b s c u r ed u p l i c a t ed e t e c t i o n e x p e r i m e n t s t h eo v e r a l lp r e c i s i o na n dr e c a l lr a t eo fk s mi s9 9 2 a n d 9 7 7 r e s p e c t i v e l y 2 t oi m p r o v et h er e c a l lo ft e r m sw i t hl o wf r e q u e n c y , a na u t o m a t i c c h i n e s et e r me x t r a c t i o na l g o r i t h mb a s e do nl a n g u a g ec o g n i t i o nt h e o r y i sp r e s e n t e d m a k i n gu s eo fd i s c o u r s em a r k e r si nr e s e a r c hp a p e r s ,t h i s a l g o r i t h mi n t r o d u c e s w e i g h e df r e q u e n c y f a c t o rt oc - v a l u ea n d s c pfm e a s u r e s t h e np r o p o s e sm c s c pm e a s u r et oe v a l u a t eb o t h u n i t h o o d a n d t e r m h o o d o fc a n d i d a t et e r m s i nt h e l i c e n s ep l a t e r e c o g n i t i o n d o m a i nt e r me x t r a c t i o n t h eo v e r a l lr e c a l la n dp r e c i s i o ni s 9 6 5 a n d7 7 8 r e s p e c t i v e l y , w h i l et h er e c a l la n d p r e c i s i o nf o rt e r m s w i t hl o wf r e q u e n c yi s9 6 2 a n d7 9 3 r e s p e c t i v e l y 3 t oa c q u i r ev a r i o u sr e l a t i o n so ft e r m s am u l t i s t r a t e g i e sb a s e dr e l a t i o n a c q u i s i t i o nm o d e li sd e s i g n e d ,i n c l u d i n ga ) r u l e b a s e ds y n o n y m i c a l r e l a t i o na c q u i s i t i o n ,b ) h i e r a r c h i c a lr e l a t i o na c q u i s i t i o nb a s e do nt e r m s m o r p h o l o g i cs i m i l a r i t i e s ,c ) n o n h i e r a r c h i c a lr e l a t i o na c q u i s i t i o nb a s e d o na 1 1w e i g h t e da s s o c i a t i o nr u l e s ,a n dd ) p s o - b a s e dt e r mc l u s t e r i n g 4 t oa l l e v i a t et h ec o n f l i c tb e t w e e ns w a r m i n go fm u l t i d o m a i nr e s e a r c h p a p e r sa n dl i m i t a t i o n o fe d i t o r s k n o w l e d g e ,ad o m a i n - k n o w l e d g e g u i d e df i r s tr e v i e wa s s i s t a n ts y s t e mi sp r e s e n t e d a c c o r d i n g t ot h e e d i t o r s e x p e r i e n c e ,t h ef i r s tr e v i e wi sr e f i n e di n t of o u rj u d g m e n t s i n t h ee x p e r i m e n to f2 3 6 5r e s e a r c hp a p e r s ,t h i ss y s t e mc a na s s i s te d i t o r s w i t hf i l t e r i n g35 u n q u a l i f i e dm a n u s c r i p t s k e yw o r d s :t e r me x t r a c t i o n ,t e r m s r e l a t i o na c q u i s i t i o n ,d o c u m e n td u p l i c a t e r e m o v a l ,a 1 1 w e i g h t e da s s o c i a t i o nr u l e sm i n i n g ,f i r s tr e v i e w a s s i s t a n ts y s t e mf o rr e s e a r c hp a p e r s 本人声明所呈交的论文是本人在导师指导下进行的研究工作及取得的 研究成果。尽我所知,除了文中特别加以标注和致谢中所罗列的内容以外, 论文中不包含其他人已经发表或撰写过的研究成果,也不包含为获得北京 邮电大学或其他教育机构的学位或证书而使用过的材料。与我一同工作的 同志对本研究所做的任何贡献均已在论文中作了明确的说明并表示了谢 :l 思。 申请学位论文与资料若有不实之处,本人承担一切相关责任。 本人签名: 毒卫日期:少略。6 易 关于论文使用授权的说明 学位论文作者完全了解北京邮电大学有关保留和使用学位论文的规 定,即:研究生在校攻读学位期间论文工作的知识产权单位属北京邮电大 学。学校有权保留并向国家有关部门或机构送交论文的复印件和磁盘,允 许学位论文被查阅和借阅;学校可以公布学位论文的全部或部分内容,可 以允许采用影印、缩印或其它复制手段保存、汇编学位论文。( 保密的学位 论文在解密后遵守此规定) 保密论文注释:本学位论文属于保密在年解密后适用本授权书。非 保密论文注释:本学位论文不属于保密范围,适用本授权书。 本人签名: 导师签名: 老2 如嘲言 1 日期:删口彳易 日期:唯一j 占一0 3 北京邮电大学博士学位论文 第一章绪论 第一章绪论 自然语言理解( n l u ,n a t u r a ll a n g u a g eu n d e r s t a n d i n g ) 一直是人工智能学科内引人 注目而又困难重重的一个核心研究课题,其根本任务就是建立一种能够像人那样理解、 分析并回答自然语言的计算机模型。所谓自然语言,指的是人们日常使用的各种通俗语 言,如汉语、英语、日语等。要让无生命的机器系统能够像有智慧的人类那样理解人类 的自然语言,显然是一个非常困难的问题。因此,目前关于计算机对自然语言的理解都 是从实用的角度进行评判,即认为一台计算机只要能够对自然语言进行某些“处理 , 如入机对话、机器翻译或自动文摘等,就具备了自然语言理解的能力。因此,在计算机 科学中,“自然语言理解”又称为“自然语言处理( n l p ,n a t u r a ll a n g u a g ep r o c e s s i n g ) 【l 捌 0 正如人类要正确理解自然语言,必须在之前积累大量必要的知识,如果人们希望机 器能够“理解 自然语言,首先就必须为其建立一个高质量的知识库,作为机器的头脑 和核心,以支持系统正确无误地处理自然语言。知识库的规模和质量在很大程度上决定 了自然语言处理系统的成败【3 】,这已经成为自然语言理解技术研究者和系统开发者的共 识。因此,研究和开发知识库是自然语言处理系统的关键问题之一。 1 1 知识库的相关概念 1 1 1 知识 在日常生活中,人们常常会使用到“知识 这个名词;但是,要想对它做出一个公 认的确切定义还是很困难的。由于知识是一个内涵丰富、外延广泛的概念,不同学科各 从不同角度对知识进行了定义。这里将列举其中一些比较有代表性的知识定义【4 5 】。 从哲学角度对知识的定义: 所谓知识就它反映的内容而言是客观世界在人弦中的主观映象。就它的反 映活动形式而言。有时表现为主体对事物的感性知觉或表象。藏于感性知识: 有时表现为关于事物的概念或规律属于理性知识o 中国大百科全书教育卷 知识羁于认识范畴,是人类的认识或果。经验是知识的初级形态:系统的科学 理论是比较完备的知识形态o ( 知识) 是对事物霭性s 联系的认识表现 北京邮电大学博七学位论文 第一章绪论 为对事物的知觉、表象、概念法氏等心理形式。司通过书籍和其他人造物独 立于个体之外o 教育大辞典 - ( 知识是) 人类的认识或果,即人通过社会实践中对自然、社会、思维的现象 和本质的认识的观念的总和o 实用科学名词术语词典 知识是认识论范畴的概念。它所表述的是事物运动的状态和状态变化的规律, 钟义信【6 ,刀 从计算机科学角度对知识的定义: 知识是经过加i ( 包括肖l j 减、塑造、解释、选择和转换等) 的信息o - 。_ _ _ _ _ _ _ _ _ _ _ _ f c i g e n b a u m 知识是由特定领域中的描述、关系和过程组成的o b e r n s t e i n 知识= 事实+ 信念+ 启发式信息o _ - _ _ h e y e s r o t h 知识是一种分类能力4 使胃集合的概念来表示,知识就是等价关系集r 对离散 表示的空间u 进行翅分的结果o z p a w l a k t 8 】 这些对知识的各种定义,从不同侧面说明了知识的性质和特点。本文不刻意去追求 一个统一的定义,不妨通过知识在信息过程( 如图1 1 所示) 中扮演的角色来理解其本 质【6 7 1 。 攀认识论信息 知识 信息再生矧目标信息 | i 智能策略 l 、- 信息传递 智能策略 信息获取i e = = = 爿 问题与环境) 4 i 信息施效 f 本体论信息、智能行为il_-。_。_。_。_。_ 图1 1 典型信息过程模型 由图1 1 可以看到,在信息过程中,主体( 人类或智能系统) 为了在给定的环境下 北京邮电大学博士学位论文第一章绪论 成功解决问题、达到主体目的,需要有针对性地获取问题与环境信息,恰当地对其进行 处理,以提炼知识,达到认知,然后在其基础上结合主体的目标信息,合理产生解决问 题的策略信息进行问题求解。在整个过程中,信息、知识、智能之间是相互依存、共为 一体的关系:信息是基本资源;知识是对( 认识论) 信息进行加工所得到的规律性、抽 象化产物;策略( 即狭义智能) 是由客体信息和主体目标演绎出来的智慧化身;( 广义) 智能是把信息资源加工成知识,进而把知识激活成解决问题的策略,并在策略信息引导 下具体解决问题的能力。知识在信息过程中扮演着桥梁的角色,它一方面来源于信息, 另一方面又服务于智能策略的生成。 虽然关于知识的定义有各种形式,但是对于任何知识,人们通常采用f h a y e s r o t h 提出的知识三维空间( 范围,目的,有效性) 来描述 4 1 。知识的范围是由具体到一般, 知识的目的是由说明到指定,知识的有效性是由确定到不确定。图1 2 给出了知识的三 维空问描述。 范围 1 1 2 知识库 有效性 图1 - 2 知识的三维空间描述 目的 所谓知识库( k n o w l e d g eb a s e ) ,就是用于存放知识的实体,是结构化、易操作、 易利用、全面、有组织的知识集群,是针对某一( 或某些) 特定领域问题求解的需要, 采用某种( 或若干) 知识表示方式在计算机存储器中存储、组织、管理和使用的关于这 个( 或这些) 领域的知识片集合。知识库是将传统的人工智能( a r t i f i c i a li n t e l l i g e n c e , 简称a i ) 技术和数据库( d a t a b a s e ,简称d b ) 技术相结合的产物【9 , 1 0 】。 在张效祥主编的计算机科学技术百科全书中,根据知识在专家系统求解问题过 程中的作用,将知识库内的知识分成了三个层次:最低层是描述性知识( d e s c r i p t i v e k n o w l e d g e ) ,也称为事实性知识,使用对象和概念的特征及其相互关系来表示;中间层 北京邮电大学博:卜学位论文第一章绪论 是判断性知识( j u d g m e n t mk n o w l e d g e ) ,也称为启发性知识,是与领域有关的问题求解 知识,如某领域内有关的定义、定理、运算法则、推理规则和常识性知识等;最高层是 过程性知识( p r o c e d u r a lk n o w l e d g e ) ,是进行问题求解的控制策略,即如何应用判断性 知识进行推理的知识。因此,知识库的基本结构是层次结构( 如图1 3 所示) 。知识库 和传统数据库的区别就在于它不但包含了大量的简单事实,还包含了问题求解所需的各 种规则和策略 9 1 。 图1 - 3 知识库的层次结构 知识库使基于知识的系统( k n o w l e d g e - b a s e ds y s t e m ) 具有智能性。并不是所有具 有智能的程序都拥有知识库,只有基于知识的系统才拥有知识库,它将应用领域的问题 求解知识显式地表达,并单独地组成一个相对独立的程序实体知识库。 1 2 知识库构建的国内外研究现状 2 0 世纪8 0 年代以来,国内外的研究者在大规模知识库的构建方面做了很多工作【l , 比较著名的有:w o r d n e t t l 2 1 ,f r a m e n e t t l3 1 ,m i n d n e t 1 4 1 ,c y c 常识知识库【1 5 】,e d r 概 念词典【1 6 】,现代汉语述语动词机器词典【1 7 】,中文信息处理应用平台工程【1 8 】,h o w n e t ( 知 网) 0 9 】,s i n o t r a n s 语义词典【2 0 1 ,北大语义词典【2 l 】,中文概念词典( c h i n e s ec o n c e p t d i c t i o n a r y ,简称c c d ) 2 2 】,概念层次网络( h i e r a r c h i c a ln e t w o r ko f c o n c e p t s ,简称h n c ) 【2 3 】等等。这些知识库大多通过手工方式构建,且面向通用领域知识,可以满足大多数自 然语言处理系统的通用知识需求。 对于一些专门用途的自然语言处理系统,如文本分类系统、垃圾邮件过滤系统、反 动信息监控系统,以及各种个性化信息服务系统,系统处理的对象并不局限于通用领域 的自然语言( 文本内容) ,更多的是专业领域里的自然语言( 文本内容) 。此时,适用于 通用领域的知识库无法满足系统的知识需求,需要另外为系统配备特定领域的知识库, 以满足系统对领域知识和工作目标的理解需求。这类知识库包含自然语言处理系统所需 的一个或若干个特定专业领域( 如政治、数学、体育、艺术、信息科学、医药等领域) 内的相关知识,为系统提供这些特定领域内的概念、概念之问的相互关系以及概念的约 北京邮电大学博上学位论文第一章绪论 束条件等【2 4 】,为系统“理解特定领域的问题并顺利完成任务提供有力的知识保障。 过去,知识库主要通过手工方式构建,虽然有的知识库后期可以通过机器学习来不 断扩充和维护,但是前期完全依靠人工来构造知识库的结构、获取知识,仍然是一项费 时费力的工作,成为自然语言处理系统应用的一个瓶颈。因此,知识库的构建是自然语 言理解的一项基础性工作。 知识库构建的三大关键技术问题是知识表示、知识获取和知识推理。本文将着重讨 论知识获取问题,知识表示和知识推理的深入研究将作为本课题的后续研究内容。 1 2 1 知识获取 知识获取( k n o w l e d g ea c q u i s i t i o n ,简称k a ) 就是将问题求解所需的知识从外部 知识源转移或转换到计算机内部的过程【4 】。问题求解知识是指一些特定领域的事实、规 则和策略知识。知识源可以是领域专家,也可以是教科书、经验数据、技术报告、科技 论文或其它一些已经渗透领域专家知识的数据库和w e b 资源等。知识获取是构建知识 库的关键环节,直被公认为是知识库系统的瓶颈问题,因此受到了广泛的重视和研究 2 5 , 2 6 1 o 知识获取有两个基本途径:一个是从实践中逐步积累,把观察到的现象的共性核心 升华成为概念,把所积累的精华上升成为理论;另一个途径是由已有的知识通过推断产 生新的知识。前者是由信息到知识、由具体到抽象的过程,从逻辑上称为归纳;后者是 从知识到知识,由抽象到抽象的过程,在逻辑上称为演绎【6 】。因此,知识获取的主要任 务包括: ( 1 ) 对知识源中已有的知识进行理解、选择、抽取、汇集、分类和组织,转换成某 种形式的系统内部表示; ( 2 ) 通过某种推理或学习机制,对已有的知识中产生新的知识; ( 3 ) 检查并消除已有知识的矛盾性和冗余性,保持知识的一致性和完整性约束。 1 2 1 1 知识获取方式 根据知识获取的自动化程度,可以将知识获取分为人工获取、半自动获取和自动获 取三种方式【2 7 之9 】。 ( 1 ) 人工的知识获取 早期的专家系统( 如m y c i n ) 都是采用人工方式来获取知识。知识工程师通过与 领域专家进行交流( 如非正式交谈、口述备忘录、观察学习等) 或者阅读文字记载来获 北京邮电大学博士学位论文 第一章绪论 得知识,对其进行分析、综合、整理和归纳后,使用某种知识编辑软件存入知识库。其 工作方式如图1 4 所示。 ,一、 领域专家、一, 卜知识工程师b 专 知识编辑器b 。 知识库 、j , 文字记载 、一一 图1 4 人工的知识获取方式 使用这种方式获取知识,很容易受到领域专家的知识完备程度、知识表达能力以及 知识工程师对知识的理解深度、对知识进行抽取、处理、表达的能力等因素影响,出现 “知识畸变( k n o w l e d g ed i s t o r t i o n ) ”现象。这是因为,每个领域都有自己特定的专业 术语( 俗称行话) ,领域专家很难使用通俗易懂的日常语言来表达这些术语并让知识工 程师真正领会。在脱离问题求解的具体环境时,领域专家对问题求解过程的描述,与他 们在实际操作中所采用的方法也有一定的区别。例如,领域专家在处理专业问题时,有 时候是依靠直觉和经验,这些直觉和经验往往很难采用数学理论或其他决定论的模型加 以精确刻画;在解题过程中,领域专家还可能下意识地使用一些日常生活中的常识,在 表述过程中却极易将其忽略;由于信息表示形式的影响、问题表达的需要以及其他心理 学上的原因,专家对知识的表达也可能会与实际经验不一致。因此,使用人工方式构建 的知识库,一般都存在知识规则量偏少、知识规则应用易产生决策偏差和失误、知识库 的开放性和透明度较低等缺附2 7 , 3 0 j 。 ( 2 ) 半自动的知识获取 在半自动的知识获取方式中,知识获取分两步进行。首先,知识工程师与领域专家 交流合作,建立知识表达模型和智能知识编辑工具;然后,领域专家再使用知识编辑工 具直接与计算机交互,将结构化的知识( 如关联规则等) 存入知识库。其工作方式如图 1 5 所示。 ,、 l 知识工程师陪= 冷 知识表达模型 、p ”巴 l 领域专家陪= = 参 知识编辑器 图i - 5 半自动的知识获取方式 与人工的知识获取方式相比,使用这种方式所构建的知识库易扩充和维护,知识规 则可逐渐被完备。因此,目前大多数专家系统都采用这种方式获取领域知识。但是,使 北京邮电大学博士学位论文第一章绪论 用这种方式所构建的知识库同样无法避免知识表达的模糊性与不确定性问题【2 。7 1 。 ( 3 ) 自动的知识获取 这种知识获取方式的工作原理如图1 - 6 所示。知识工程师在领域专家的指导下开发 专门的机器学习系统,将从知识源获得的问题求解实例输入到系统中作为“粗糙数据 , 让系统直接从中获取或生成知识,填充知识库。在自动的知识获取方式中,有的系统还 可以从自身的运行实践中总结、归纳出新知识,发现和改正自身存在的错误,不断自我 完善,使知识库逐步趋于完整一致。 图l 击全自动的知识获取方式 这是一种理想的知识获取方式,涉及到人工智能的多个研究领域,如模式识别、自 然语言理解、机器学习等。目前,关于自动知识获取的研究还处于探索阶段,能实现自 动知识获取的a i 系统还较少,而完全使用自动方式建立复杂领域知识库的系统则几乎 没有。因此,通常所说的自动知识获取还包括人机交互式的半自动知识获取,它们都属 于知识获取工具的范畴。 l 2 1 2 知识获取工具 自上个世纪五、六十年代以来,国内外a i 工作者在知识获取工具的智能化和自动 化方面进行了大量的研究工作【矧。 早期的知识获取自动化研究主要针对知识库的知识自动维护和更新来开展。例如, 故障分离专家系统( f a u l ti s o l a t i o ne x p e r ts y s t e m ) 内部的知识编辑软件a u t o k n a q t 3 l 】 采用人机对话的方式,从知识源获取非结构化的故障分离信息,然后对其进行自动分析、 转化为系统内部的表示形式,并与知识库内原有的知识进行自动检测与融合,从而实现 知识库的自我完善。 之后,研究者们把机器学习的理论和方法应用到知识库的构建过程,使得知识获取 的过程逐步变得智能化。例如,我国中科院合肥智能所开发的实例学习系统s l f e ( a s y s t e mo f l e a r n i n gf o r me x a m p l e s ) 【3 2 j 能够通过训练实例的增量归纳学习获得知识,在 农业病虫害的规则获取应用中取得了较好的效果。 北京邮电大学博士学位论文第一章绪论 随着上世纪末k d d ( k n o w l e d g ed i s c o v e r y i nd a t a b a s e $ ,数据库中的知识发现) 技 术的兴起,研究者们开始把k d d 技术应用到专家系统的知识自动获取。例如,南京信 息工程大学的黄瑞等人【2 9 】提出了一种基于k d d 的知识自动获取通用模型,一方面,可 以利用k d d 过程发现的知识,与知识库中的原有知识自动进行知识检测与知识融合, 自动完善知识库;另一方面,还可以从知识库中自动生成指导k d d 过程的约束,提高 k d d 过程的针对性和发现模式的潜在有用性。他们将该模型应用到辅助石油天然气勘 探和开采的测井数据分析过程,实现了智能测井数据分析系统i n t w e l a n a l y z e r ,在应用 中取得了较好的效果。 最近,知识自动获取的研究扩大到了知识管理( k n o w l e d g em a n a g e m e n t ,简称k m ) 、 w e b 知识获取等领域,产生了新的知识获取研究热点,如本体学习( o n t o l o g yl e a r n i n g ) 、 基于本体的知识获取、基于语义w e b ( s e m a n t i cw e b ) 的知识自动获取等。 在本体学习方面,国内外很多研究机构进行了大量的研究工作,开发了不少本体学 习工具 3 3 】,例如,德国u n i v e r s i t yo fk a r l s r u h e 的t e x t t o o n t o 3 4 、伊朗a m i rk a b i r u n i v e r s i t yo f t e c h n o l o g y 的h a s f i o s 】、意大利研究机构的o n t o l e 锄【3 6 l 、日本研究机构的 d o d d l e 系列【3 7 1 、台湾中央研究院资讯科学研究所的s o a t t 3 8 】等。这些工具主要通过 对相关领域的文本语料进行自然语言处理( 包括词性标注、浅层句法解析、短语提取、 领域关键词提取等) ,使用基于规则或统计的方法来自动或半自动地抽取领域的相关概 念和概念之间的关系等本体知识。这些本体学习工具获得的只是本体知识的候选结果, 需要在用户的评价和确认后才能作为最终的结果添加到本体库中;也就是说,整个本体 学习过程还是需要人工干预,是在用户指导下进行的。 在基于本体的知识获取方面,荷兰的h e n k j a nl e b b i n k 等人【3 9 】在p r o t 6 9 6 2 0 0 0 和 j e s s 的基础上建立了基于本体的知识系统,该系统可以根据已有的领域本体,自动识别 领域的知识推理规则,抽取和检验领域事实,实现基于本体的知识获取。国内中科院计 算所的曹存根等人对基于领域本体的知识获取做了大量工作,研究成果有基于医学形式 本体的医学知识获取和知识分析系统】、基于本体的数学知识获取管理平刽4 l 】等。 在基于语义w e b 的知识获取方面,研究者也进行了积极的探索和实践。例如,中 科院计算所智能信息处理重点实验室开发了面向语义的多主体知识管理系统 k m s p h e r e 4 2 , 4 3 ,该系统包括三个部分:半自动化本体获取环境o n t o s p h e r e 、可视化本 体管理编辑环境o n t o m a n a g e r 和知识服务环境o n t o s e r v i c c ,实现了基于w e b 的知识获 取、组织和服务;清华大学知识工程研究室开发了基于语义w e b 的本体数据挖掘平台 s w a r m s ( s e m a n t i cw 曲a i d e dr i c hm i n i n gs y s t e m ) m j ,使用语义w e b 技术来辅助领 域知识的挖掘,如领域本体数据的生成和存取、基于语义的搜索、领域本体数据的可视 北京邮电大学博士学位论文第一章绪论 化和导航等。 1 3 论文研究背景和意义 尽管国内外研究人员针对知识库构建做了很多研究工作,但是,目前知识库构建仍 然存在不少问题1 4 2 j 。面临的主要问题有: ( 1 ) 知识源 传统的知识源主要包括领域专家、教科书、技术报告、科技论文和其它一些已经渗 透领域专家知识的数据库等。随着现代信息技术和互联网技术的飞速发展,w e b 上大量 以电子文档形式存在的资料在知识源中占据越来越重要的地位,这些语料在w e b 上分 散储存,且文档格式各异,亟需开发新技术,从w e b 上收集这些语料进行预处理和筛 选,以从中选取适量的、具有代表性的文档进行知识获取。 ( 2 ) 领域知识获取 现有的一些大规模知识库都是关于通用领域知识的,不能满足专业领域的自然语言 处理系统对问题求解的知识需求。因此,需要获取专业领域知识,构建特定领域的知识 库,为自然语言处理系统“理解 特定领域的问题并顺利完成任务提供知识保障。领域 知识包括专业领域的概念、概念之间的相互关系以及概念的约束条件等。w e b 上绝大多 数语料都是自由文本或半结构化文本,在利用这些语料获取领域概念和关系的过程中, 还存在许多特殊困难,需要借鉴自然语言处理、机器学习和文本挖掘等领域的先进技术, 对其进行深入的研究。 ( 3 ) 知识表示方法 目前,人们已经提出了各种各样的知识表示方法,如逻辑表示法、语义网络表示法、 产生式系统表示法、框架表示法和面向对象表示法等。对同一知识可以采用不同的表示 方法,然而,在求解某一问题时,不同的表示方法会产生完全不同的效果。这些知识表 示方法在单独使用时普遍存在知识表示形式单一,知识的整体形象难以把握,知识的组 织、管理和维护困难等缺点。因此,需要根据自然语言处理系统对领域问题求解的需要, 选择几种比较合适的知识表示方法并用,以取得优势互补的效果。 ( 4 ) 不确定知识的表示、处理和获取 从知识的确定程度来分,知识可分为确定性知识和不确定性知识两类。确定性知识 是可以给出其真值为“真”或“假”的知识,这类知识是可以精确表示的知识。不确定 性知识是具有“不确定”特性的知识( 这里的不确定性包含不精确、不完备和模糊等涵 义) ,这类知识的真值并非“非真即假,可能处于某种中间状态。不确定性是自然语言 北京邮电大学博二匕学位论文 第一章绪论 的固有属性。因此,不确定知识的表示、获取和推理是人工智能和知识工程领域的重要 课题之一。针对不同类型的不确定知识,研究者提出了各种理论和方法,包括确定性理 论、主观b a y e s 方法、可能性理论、证据理论、灰色系统理论、概念图、粗糙集理论、 基于信比概念的知识处理以及集对分析等等【4 5 】。这些方法和理论各有优缺点,存在一定 的互补性。近年来,人们认识到了这种互补性,开始尝试不同理论方法的融合以弥补单 一方法的局限性,如将模糊和粗糙集相结合,对粗糙集进行模糊推广来解决不确定知识 的表示、处理和获取。在这些方法中,有的还处于发展阶段,在实际问题中的应用也有 待继续研究。 ( 5 ) 知识推理 知识推理就是利用知识库中的知识进行推理,从而得出结论的过程。知识库的知识 推理主要通过推理机来实现。知识推理所涉及的问题有:知识库的搜索、目标的控制、 模式匹配的方法、推理的策略,以及对不确定性知识和可拓知识的评价等。知识推理的 方式在很大程度上依赖于知识的表示方法。知识表示方法的不同决定了知识的选择和运 用方式不同,即推理策略的不同。知识库构建的最终目标是知识的应用,因此,知识推 理是知识库构建的核心问题之一。 本文针对领域知识的获取问题,主要从下列几个方面做了一些研究工作: 研究网络文本信息去重算法:期望能够在提高抵抗文档噪声能力的同时,减少 将相似文档误判为信息冗余文档的几率,以提高领域知识源获取过程中的冗余 信息过滤性能。 研究术语自动抽取算法:试图利用科技论文话语标记的认知功能,实现中文术 语的快速自动抽取,在保证术语抽取整体性能的同时,提高低频术语的抽取效 果。 研究术语关系自动获取机制:针对专业领域术语的特点,综合术语的内部特征 和外部特征,从多个层面获取术语间的各种关系。 研究科技论文初审辅助系统,尝试使用领域知识来辅助科技期刊的编辑人员完 成初审工作。 本课题得到国家自然科学基金( 6 0 4 9 6 3 2 7 ) “非规范知识处理的基本理论和核心技 术”,( 6 0 5 7 5 0 3 4 ) “信息一知识一智能转换理论:智能生成机制的原理与算法,国家8 6 3 项目( 2 0 0 1 a a l1 4 21 0 ) “中文信息处理的基础和应用基础研究”、( 2 0 0 2 a a l1 7 0 1 0 0 7 ) “面向奥运的多语言智能信息服务系统”,北京市自然科学基金( 4 0 7 3 0 3 7 ) “支持q o i 的 网络用户行为分析的关键技术研究”和教育部博士点基金( 2 0 0 6 0 0 1 3 0 0 7 ) “情智协调 北京邮电大学博士学位论文第一章绪论 信息服务系统模型与算法研究”的资助。作者希望本文的工作能在理论和技术上对知识 库构建技术、尤其是领域知识的获取研究发展起到积极的推动作用。 1 4 论文研究工作概述 领域知识是在某一个特定( 专业) 领域内的概念、概念之间的相互关系以及概念的 约束条件的集合;而术语是特定专业领域中概念的词语指称,是概念的语言表达方式, 是通过语音或文字来表达或限定科学概念的约定性语言符号,是领域知识表示的基本单 元。因此,领域知识获取的目标,就是实现特定专业领域术语的自动抽取、关系发现和 公理获取。 本文将针对领域知识获取的相关问题进行研究,主要包括以下几个方面: 1 ) 针对领域知识源获取过程中的网络冗余信息问题,提出了一种基于关键词序列 的网络文本信息去重算法k s m 。以全信息理论为依据,综合考虑文档的语法 信息和语义信息,使用文档的关键词序列来描述其结构特征和内涵特征,通过 比较主题相似文档的关键词序列的重叠度,判断是否存在信息冗余现象。在各 类网络文本隐式重复的检测实验中,k s m 算法的总体准确率和召回率分别达 到了9 9 2 和9 7 7 ;与经典的文本信息去重算法相比,k s m 算法显示了更好 的性能,在提高抵抗文档噪声能力的同时,减少了将相似文档误判为信息冗余 文档的几率。 2 ) 针对低频术语抽取召回率较低的问题,提出了一种基于语言认知理论的中文术 语自动抽取算法。根据语言认知过程中的“最大化收益和最小化成本”原则, 借助科技论文的话语标记,在c v a l u e 测度和s c pf 测度中引入候选术语的加 权词频因子,提出了一种m c s c p 测度,用于候选术语的单元性和术语性的综 合评价。在车牌识别领域的术语抽取实验中,基于m c s c p 测度的算法召回率 和准确率分别是9 6 5 和7 7 8 ,低频术语的召回率和准确率则分别是9 6 2 和7 9 3 ;在保证术语抽取整体性能的同时,显著改善了低频术语的抽取效果。 3 ) 针对术语关系类型的多样化问题,提出了一种基于多策略的术语关系自动获取 模型。根据科技论文的语言学特点,综合术语的内部特征和外部特征,从多个 层面发现和获取术语问的层级关系和非层级关系,包括:基于规则的术语同义 关系获取、基于结构相似性的术语层级关系获取、基于完全加权关联规则的术 语非层级关系获取、基于粒子群的术语聚类等。在术语非层级关系获取中,提 出了一种基于非频繁项集多重剪枝检测的完全加权关联规则挖掘算法 北京邮电大学博士学位论文第一章绪论 a w a r m m p i s ,用于完全加权关联规则的频繁项集生成和剪枝,取得了良好 的效果;在术语分组关系获取中,提出了一种基于粒子群的术语聚类算法,使 用术语的结构相似性( 内部特征) 和关联度( 外部特征) 来评价术语的语义相 似性。实验结果表明,其平均运行时间与迭代次数比k - m e a n s 提高了2 个级别。 4 ) 针对多领域科技论文的大量出现与编辑人员专业知识有限的问题,提出了一个 领域知识制导的科技论文初审辅助系统模型。根据科技期刊的出版要求和科技 论文的特点,结合编辑人员的工作经验,将编辑初审细化为4 个方面的评判, 以此为依据开发了一个原型系统,并使用计算机工程与应用和计算机科 学与探索的2 3 6 5 篇投稿论文为语料进行了性能测试。实验结果表明,该系 统可辅助编辑人员淘汰3 5 左右的低质量稿件,提高了编辑的初审效率。 1 5 论文组织结构 本文总共分为七章。 第一章绪论 主要介绍本文的主要研究内容。首先,介绍知识库的相关概念;然后,对目前知识 库构建的国内外发展现状做了简要分析,并介绍了知识获取的任务、方式和工具;最后 介绍本文的研究背景和研究意义,并讨论本文研究的主要内容。 第二章相关工作 主要介绍领域知识获取的相关工作。首先,对领域知识的相关概念进行了介绍;然 后,对术语自动抽取和术语关系获取的研究现状进行了详细的介绍和分析。 第三章基于关键词序列的网络文本信息去重算法 针对领域知识源获取过程中的网络冗余信息问题,提出了一种基于关键词序列的网 络文本信息去重算法k s m 。首先,简单回顾和分析了现有的文本信息去重算法。然后, 详细介绍了k s m 算法的基本思想和实现流程;最后,进行实验分析。 第四章基于语言认知理论的中文术语自动抽取 针对低频术语抽取召回率较低的问题,提出了一种基于语言认知理论的中文术语自 动抽取算法。
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026氢能储运复合材料高压容器疲劳失效机制分析报告
- 2026日本半导体制造行市场供需显然评估促进入股布局发展简报
- 2026摄影器材行业市场现状供应需求分析及投资评估规划发展研究报告
- 2026中国印刷行业商业模式分析投资评估市场竞争分析研究
- 2026全球叶黄素酯贸易流向与区域市场细分研究报告
- 2026染料制造行业市场需求分析及未来方向与投资机会研究报告
- 2026中国智能设备制造业市场需求发展现状分析及投资评估策略规划调研报告
- 2026汽车租赁行业市场分析现状及投资规划
- 2026时尚服饰行业市场现状与分析投资评估规划研究
- 临床PCI术中急性心脏压塞护理急救要点
- 《大数据导论(第2版)》全套教学课件
- 坟墓修建简单版的合同范本(3篇)
- JT-T-1130-2017桥梁支座灌胶材料
- 老年年人如厕、使用便盆、更换纸尿裤
- 2023公路连续梁桥整联同步顶升施工技术规程
- 马克思经典著作导读
- 膀胱阴道瘘修补术后护理查房
- 曲臂车高空作业车施工方案
- 盾构机拆机吊出安全技术交底
- JJG 949-2011经纬仪检定装置
- GB/T 3766-2001液压系统通用技术条件
评论
0/150
提交评论