已阅读5页,还剩42页未读, 继续免费阅读
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 我们处于一个信息爆炸的时代,互联网上的中文信息在飞速地增长通过信息 抽取技术从浩瀚的中文信息海洋中自动寻找用户所需求的信息则显锝至关重要而 命名实体语义关系抽取是信息抽取中的主要任务之一,所以近年来命名实体语义关 系抽取研究也成为了我国自然语言处理研究领域中的一个热点 当前汉语的命名实体语义关系抽取研究主要是有指导( s u p e r v i s e d ) 或弱有导 ( w e a k l ys u p e r v i s e ) 的方法,且研究对象大多是一般领域的语料这些方法在训练语 料库的标注、关系抽取规则的编制以及初始关系种子的选取上都费时费力;此外, 适用于一般领域语料的关系抽取方法难以满足一些专业领域的需求所以,本文提 出了一套适用于专业语料的无指导命名实体语义关系抽取的方案,并实现了该系 统。此外,本文还尝试了利用该系统的抽取结果构造关系模板和关系种子。 本研究针对专业领域的语料特性,运用语言资源工具对向量空间模型( v s m ) 进行改进和优化,解决了专业领域语料的特征模糊问题;根据潜在关系信息分布特 征。设计了专业领域语料中实体关系网络的构造方法;利用复杂网络( c o m p l e x n e t w o r k s ) 理论中的网络社区( c o m m u n i t y ) 特性,实现了在专业领域语料中关系 类别的自动发现;通过对词语在上下文中的重要性分析,采用了提取重要性权重最 高词作为关系描述词的关系描述方法 本文在专业领域语料平台上对该系统进行了实验,并结合权威评价手段对实验 进行了评估,另外还构造了有指导关系抽取系统对实验系统获得的关系进行验证。 最终结果表明:本系统在专业领域语料中不但能发现几乎所有的人们已知的关系种 类,而且能发现一些不为人知的关系种类:系统在无指导的情况下,可以快速并比 较准确鲍得到命名实体之间的关系描述 实验证实了本文构造的系统在专业领域语料中及无指导情况下具有良好的性 能,同时实验还证实了无指导关系抽取结果对有指导关系抽取系统具有辅助作用 此外,本文还发现该系统提取的关系描述可以为专业领域中关系本体( o n t o l o g y ) 的建设提供依据。 关键词:信息抽取;命名实体对;语义关系; 硕士学位论文 m a s t e r s t h e s i $ a b s t r a c t w ea l ei na l le r ao fi n f o r m a t i o ne x p l o s i o n , a n dt h ec h i n e s i n f o r m a t i o ni nr a p i d g r o w t ho nt h ei n t e r n e t i ti sc r u c i a lt oa u t o m a t i c a l l yc o l l e c tt h en e e d f u li n f o r m a t i o nf o r u s e 侣b yi n f o r m a t i o ne x t r a c t i o nt e c h n o l o g yf r o mt h el a r g e - s c a l ec h i n e s ei n f o r m a t i o n a n dt h es e m a n t i cr e l a t i o ne x t r a c t i o na m o n gn a m e de n t i t i e si so n eo fm a j o rt a s k s i n i n f o r m a t i o ne x t r a c t i o n t h e r e f o r e ,i nr e c e n ty e a r s ,t h er e s e a r c ho fc h i n e s es e m a n t i c r e l a t i o ne x t r a c t i o na m o n gn a m e de n t i t i e sh a sb e c o m eah o tf i e l di nl 谢t l l r a ll a n g u a g e p r o c e s s i n gr e s e a r c hi no u rc o u n t r y am a j o n t yo fc u r r e n tm e t h o d so fc h i n e s er e l a t i o ne x t r a c t i o na r es u p e r “s e do r w e a k l ys u p e r v i s e d a n dt h e i rr e s e a r c ho b j e c t sa r cc o r p u s o si nc o m l t l o nd o m a i n t h e r e w a y sa r et i m e - c o n s u m i n ga n dl a b o r i o u si nm g # n gt r a i n i n gc o r p u s o s ,m a k i n gr e l a t i o n e x t r a c t i o nr u l e sa n ds e l e c t i n gi n i t i a lr e l a t i o ns e e d s i na d d i t i o n , t h o s em e t h o d ss o m e t i m e s a mn o ta p p l i c a b l ei nc e r t a i np r o f e s s i o n a lc o r p u s c s t h e r e f o r e t h i sp a p e rp r e s e n t sa r t u n s u p e r v i s e dm e t h o dt od i s c o v e rt h e s e m a n t i cr e l a t i o n sa m o n gn a m e de n t i t i e si n p r o f e s s i o n a lc o r p u s e s a n dt h i sp a p e ra c h i e v e st h es y s t e m i na d d i t i o n , w ea t t e m p tt o 心 t h ee x t r a c t e dr e s u l t so f t h i ss y s t e mt oc o n s t l - u e tt h er e l a t i o nt e m p l a t e sa n dr e l a t i o ns e e d s a c c o r d i n gt ot h ec h a r a c t e r i s t i c so f c o r p u si np r o f e s s i o n a lf i e l d ,w eo p t i m i z e dv e c t o r s p a c em o d e la d o p t i n gs o m el i n g u i s t i ct o o lt oo v e r c o m et h eb l u r r yf e a t u r eo f p r o f e s s i o n a l c o r p u s t h e nw ep r o p o s e dam e t h o dt oc o n s t r u c te n t i t y - r e l a t i o nn e t w o r ka c c o r d i n gt ot h e f e a t u r eo fl a t e n tr e l a t i o ni n f o r m a t i o nd i s t r i b u t i o n a n dt h e n , w ee x t r a c t e dr e l a t i o n s a u t o m a t i c a l l yu t i l i z i n gc o m m u n i t yc h a r a c t e r i s t i ci nc o m p l e xn e t w o r k s f i n a l l y , b y i m p o r t a n c ea n a l y s i so fw o r d si nc o n t e x t , w eu s et h ew o r d sw i t hh i g h e s tw e i g h ta sk e y w o r d st od e s c r i b er e l a t i o n s w et e s t e do u rs y s t e mi nt h ec o r p u so fp m f e s s i o n a lf i e l da n de v a l u a t e di tu s i n g s t a n d a r dm e t h o d w ea l s oc o n s w a c t e das u p e r v i s e dr e l a t i o ne x t r a c t i o ns y s t e mt ov e i l f y t h er e s u l to ft h es y s t e m r e s u l ti n d i c a t e dt h a tt h es y s t e mc a r lg e td e s c r i p t i o na m o n g n a m e de n t i t i e sr a p i d l ya n da c c u r a t e l yw h i l eu n s u p e r v i s e d a n di tc o u l dg e ta l m o s ta l lt h e k n o w nr e l a t i o n s ,e v e ns o m ek i n do f u n k n o w nt e l a t i o n s e x p e r i m e n ts h o w sg o o dp e r f o r m a n c eo fo u rs y s t e mi nb o t hp r o f e s s i o n a lf i e l da n d u n s u p e r v i s e dp r o c e d u r e i ta l s op r o v e st h a tt h er e s u l to fu n s u p e r v i s o dr e l a t i o ne x t r a c t i o n c o u l da s s i s ts u p e r v i s e dm e t h o d i na d d i t i o n , t h er e l a t i o nd e s c r i p t i o n so f0 1 1 1 r e s u l tc a n p r o v i d eb a s i sf o rt h ec o n s t r u c t i o no f o n t o l o g yi np r o f e s s i o n a lf i e l d k 吖w o r d s :i n f o r m a t i o ne x u a c t i o n ;n a m e de n t i t yp a i r ;s e m a n t i cr e l a t i o n ; 华中师范大学学位论文原创性声明和使用授权说明 原创性声明 本入郑重声明:所呈交的学位论文,是本人在导师指导下,独立进行研究工作 所取得的研究成果。除文中已经标明引用的内容外,本论文不包含任何其他个人或 集体已经发表或撰写过的研究成果。对本文的研究做出贡献的个人和集体,均已在 文中以明确方式标明。本声明的法律结果由本人承担 作者签名:炙乙君素盖 日期:年月f 日 学位论文版权使用授权书 本学位论文作者完全了解学校有关保留、使用学位论文的规定,即:学校有权 保留并向国家有关部门或机构送交论文的复印件和电子版,允许论文被查阅和借 阅。本人授权华中师范大学可以将本学位论文的全部或部分内容编入有关数据库进 行检索,可以采用影印、缩印或扫描等复制手段保存和汇编本学位论文。同时授权 中国科学技术信息研究所将本学位论文收录到中国学位论文全文数据库,并通 过网络向社会公众提供信息服务 作者签名:诞愚铭作者签名:他届宣节 日期:。,7 年6 月7 日 争睁粉l 百f 击 嘛研月7 日 本人已经认真阅读“c a l l s 高校学位论文全文数据库发布章程”,同意将本人的 学位论文提交“c a l i s 高校学位论文全文数据库”中全文发布,并可按“章程”中的 规定享受相关权益。圄塞论塞埕銮厦迸匿;旦圭生;旦= 生i 旦三笙蕉查! 作者签名:丧姐专刍 日期h 矿月1 日 与; 静产 ,f 扩如 , 矿年 :。p 名l 签 : 师期 乎日 第1 章绪论 1 1 专业领域中命名实体语义关系抽取的研究意义 随着计算机的广泛应用与互联网的高速发展,网络信息不断爆炸式地增长信 息的过量增长带来一定负面影响:面对大规模的信息,用户难以找到自己真正的需 求。如何利用一些自动化的方法帮助人们在海量信息源中迅速找到真正需要的信 息,已成为自然语言处理领域研究开发的焦点信息抽取( i n f o r m a t i o n e x t r a c t i o n ) 正是在这种背景下产生与发展起来 信息抽取系统的主要功能是从文本中抽取出特定的事实信息( f a c t u a l i n f o r m a t i o n ) u 1 比如,从新闻报道中抽取出恐怖事件的详细情况:时间、地点、 作案者、受害者、袭击目标、使用的武器等;从经济新闻中抽取出公司发布新产品 的情况:公司名、产品名、发布时间、产品性能等;从病人的医疗记录中抽取出症 状、诊断记录、检验结果、处方等等。通常,被抽取出来的信息以结构化的形式描 述,可以直接存入数据库中,供用户查询以及进一步分析利用 近十年来,信息抽取逐步发展成为自然语言处理领域的一个重要分支,涉及到 了深层次的语言理解、篇章分析与推理、多语言文本处理、w e b 信息抽取、名实 体识别等自然语言研究领域通过系统化、大规模地定量研究和评测推动了自然语 言处理研究的发展,促进了自然语言处理研究与应用的紧密结合近年来,信息抽 取的处理对象也扩展到了语音、图像、视频等其他媒体类型的数据。可以说,信息 抽取已成为当前自然语言处理和相关领域的研究热点信息抽取技术对搜索引擎、 网络信息过滤和信息安全、自动问答系统、机器翻译、文本挖掘、企业智能信息系 统等许多应用领域具有至关重要的作用【2 3 1 。 在信息抽取领域中,命名实体( n a m e de n t i t y ) 是文本中基本的信息元素,是 正确理解文本的基础。狭义地讲,命名实体是指现实世界中的具体的或抽象的实体, 如人、组织、公司、地点等,通常用唯一的标恚符( 专有名称) 表示,如人名、组 织名、公司名、地名等广义地讲,命名实体还可以包含时间、数量表达式等。至 于命名实体的确切含义,只能根据具体应用来确定。比如,在具体应用中,可能需 要把住址、电子信箱地址、电话号码、舰船编号、会议名称等作为命名实体。 关系( r e l a t i o n ) 被看作两个实体在一段时间或空间范围内的某种联系,在信息 抽取研究中关系的发现在事件的侦测与描述中起着关键的作用。所以命名实体之间 语义关系的抽取是信息抽取领域的一项重要的基础性研究。 命名实体间语义关系抽取技术目前被广泛地应用到许多研究领域,如:信息检 索( y a n g a r b e rc ta 1 ,2 0 0 0 ) 一】、问答系统( r a v i c h a n d r a n , 2 0 0 2 ) i s 、本体的构建( n a v i g l i a n dv c l a r d i ,2 0 0 4 ) n 、生物技术( 1 - i u a n ge ta 1 ,2 0 0 4 ) t n 等这表明命名实体语义关系抽 取技术在普通领域中的应用研究成为了热点。 现如今,命名实体语义关系抽取技术在很多专业领域中有着更高的要求和更迫 切的需求在教育自动化、公司人事管理等领域都期待着高质量的专业领域的命名 实体语义关系抽取技术面向专业领域的信息抽取技术作为未来高层次、高效率的 专业领域信息处理技术的基础具有重大研究价值。而作为信息抽取的核心任务之一 的关系抽取在专业领域中的研究同样极具价值。 当前,虽然有一些有指导或弱有导的语义关系抽取方法可以移植到专业领域, 但是这些方法的抽取规则、关系种子、训练语料库都要重新构造,从而耗费大量的 时间和人力。丽目前效率较高的无指导的命名实体语义关系抽取方法却只适用于一 般领域,在特定的专业领域中却难以满足用户的需求所以寻求一种在专业领域中 高效的命名实体语义关系抽取方案具有重大意义。 本文旨在研究一种能在专业领域中高效获取命名实体语义关系的解决方案其 中专业领域的无指导命名实体语义关系研究不仅能对无指导信息抽取技术做出深 入发展的贡献,还能为专业语料特征的理解及专业语料的处理积累重要经验。而利 用无指导关系抽取的结果信息,辅助有指导或弱指导的方法来构造关系提取规则和 初始关系种子的研究,是将自然语言处理中互相独立发展的有指导方法和无指导方 法结合利用的一种尝试:该研究为今后有指导和无指导的自然语言处理技术相结合 提供了探索经验和依据。此外,该解决方案中对语言模型、聚类模型、特征表达以 及词语重要性等研究对自然语言处理的发展尤其是在专业领域中的发展具有重要 价值 1 2 国内外研究现状 1 2 1 研究背景 从2 0 世纪s o 年代末开始,由于信息量的迅速增长,人们对信息处理的质量 和速度的要求也日益增高,信息抽取也因此成为自然语言理解和自然语言处理的一 个热点问题,特别是由美国国防高级研究计划署( t h e d e f e n s ea d v a n c e dr e s e a r c h p r o j e c t sa g e n c y , d a r p a ) 资助的消息理解系列会议( m e s s a g eu n d e r s t a n d i n g 2 硕士学位论文 m a s t e r st h e s i s c o n f e r e n c e ,m u c ) 的召开,使得各国学者有了一个公开、公正、统一的研究平台, 从而可以在一致的条件下对比各自的系统,总结成功的经验,探讨解决问题的方法, 因此信息提取技术在其影响下得到了迅速的发展m u c 是信息提取方面的一个国 际性的评测会议,与n 强c 类似,它也是典型的评测驱动会议无庸置疑,评测是 技术发展的动力,各个参赛单位为了取得好的评测结果,千方百计地发掘和利用新 技术,从而在整体上推动了信息提取技术的不断进步 s 1 从1 9 8 7 年开始到1 9 9 8 年, m u c 会议共举行了七次,表1 给出了历届m u c 会议评测的简单情况 表1 1m u c 会议简介 会议时间消息文本参加单位评测任务 m u c l1 9 8 7 海军军事情报 6 无 m u c 21 9 8 9 海军军事情报 8 模板填充 模扳填充 m u c - 31 9 9 1 新闻恐怖事件 1 5 ( 1 8 个槽) 模板填充 m :u c _ 41 9 9 2 新闻恐怖事件 1 7 ( 2 4 个槽) 公司合资情况嵌套的模板填充 m u c - 51 9 9 3 1 5 芯片技术进展情况( 4 7 个槽) 场景模板填充 劳动争议协商模板元素填充 m u c 61 9 9 51 6 管理人员职务变动 命名实体识别 共指关系识别 场景模板填充 飞机失事事件 模板元素填充 m u c 71 9 9 81 8 命名实体识别 航天器发射事件 共指关系识别 模板关系识别 在1 9 9 8 年的第七届m u c 会议上,首次将关系识别作为单独的一个模板任务提 出来,这极大地推动了关系抽取研究的发展【9 】。随着m u c 会议的停止,从2 0 0 0 年 开始由美国标准技术研究院组织的自动内容抽取评测会议( t h ea u t o m a t i cc o n t e n t e x t r a c t i o n a c e ) 接过了m u c 的任务,将信息抽取的研究推到了一个新的高度 a c e 的目标是为了达到发展自动内容抽取的技术以支持人类语言文本方式的自动 处理a c e 技术的研究发展目标是支持不同方式的分类、过滤和选择,通过抽取来 硕士擘位论文 m a s t e r st h e s i s 呈现文本的内容,因此a c e 需要发展自动检测和表现语言的意义的技术。自 a c e 2 0 0 0 开始到a c e 2 0 0 6 一共进行了7 次评测,其基本任务定义了实体检测和识 别、数值检测和识别、时间检测和识别、关系检测和识别、事件检测和识别“0 1 该 会议将继续开展下去,对于信息抽取的未来发展将起到进一步推进作用 2 2 研究现状 目前绝大部分信息抽取方法都是有导的( s u p e r v i s e d ) 学习方法,主要分为两类, 一是知识工程方法 k n o w l e d g ee n g i n e e r i n ga p p r o a c h ) ,二是自动训练方法 ( a u t o m a t i ct r a i n i n ga p p r o a c h ) 知识工程方法主要靠手工编制规则使系统能处理特 定知识领域的信息抽取问题,这种方法要求编制规则的知识工程师对该知识领域有 深入的了解这种开发过程可能非常耗时耗力 一 自动训练方法不一定需要专业的知识工程师。系统主要通过学习已经标记好的 语料库获取规则。任何对该知识领域比较熟悉的人都可以根据事先约定的规范标记 语料库经训练后的系统能处理没有见过的新文本这种方法要比知识工程方法快, 但需要足够数量的训练数据才能保证其处理质量 国内有许多研究人员从事信息提取的研究,有北京大学计算语言学研究所设计 并发了面向新闻领域的中文信息提取系统( 孙斌,2 0 0 0 ) 【1 1 1 ,该系统以人民日报新 闻文本为处理对象,首先根据构成规则对文本中出现的各类数字、货币、时间等进 行绑定预处理,再利用隐马尔可夫模型( h i d d e n m a r k o vm o d e l , h m m ) 进行中文分 词、词性标注,根据触发词或触发短语以及一些启发式规则进行人名识别( 包括译 名和中国人名) 、地名识别、机构名识别,然后根据模板提取人名与职务、人名与 机构等的二元关系,进而根据模板和触发词提取会议事件和访问事件清华大学的 周剑辉等人进行了金融领域类信息抽取规则自动获取的研究( 周剑辉,2 0 0 3 ) 1 1 2 】, 该方法是由人工标记大量的语科,再由程序学习得到信息抽取规则,在规则的指导 下,抽取领域内词汇的语义关系。北京大学的崔玉珍进行了体育类篇章信息的语义 框架的研究( 崔玉珍,2 0 0 4 ) 0 3 1 ,该方法是由专家来预先定义该领域有关的名词成 分之间的语义框架。啥尔滨工业大学信息检索实验室、复旦大学等也都开展了信息 抽取的研究工作 在关系抽取领域中,有指导的方法也是占主导位置。其中k e r n e l m e t h o d s ( z e l e n k o e ta 1 ,2 0 0 2 ) 1 4 】是其中比较有代表性的一种方法。在该方法中,系统通过学习已经标 记好的语料库获取规则,经训练后的系统根据规则,对新文本进行浅层句法分析, 并得到命名实体间的语义关系。国外比较典型的其他有导方法还包括c a l i i f , m o o n e y ( 1 9 9 9 ) l i s 】和s o d e r l a n d ( 1 9 9 9 ) 1 1 6 1 等的方法,国内也有基于特征向量的机器学习 的方法( 车万翔等,2 0 0 5 ) i l ”这些方法的最大问题是需要花大量的时问和精力去 标注足够数量的训练语料 为避免有导方法的弱点,有些系统采用弱指导( w e a k l ys u p e r v i s e d ) 方法这些 系统预先定义一些关系和关系实例作为毒中予,然后通过机器学习,发现一些新的关 系模板,主要代表包括:b r i n ( 1 9 9 8 ) l i s l 、a g i c h t e i n ( 2 0 0 0 ) 1 9 1 、s u d o ( 2 0 0 3 ) 1 2 0 1 等 这类方法的主要问题在于如何定义那些初始的关系和关系实例的集合 此外国内还有许多学者利用已有的语义资源,提取词汇或者概念之间的语义关 系在资源建设方面,影响较大的有h o w n e t ( 知网) 【2 1 1 、同义词词林阎、h n c ( 概 念层次网络) 嘲、c c d ( 中文概念词典) 脚1 等其中,h o w n e t 以概念为描述对象, 依靠“义原”这种“知识表示语言”来定义概念,通过概念与概念之间的关系以及 概念的属性与属性之间的关系形成一个网状的知识系统,董强( 2 0 0 4 ) 提出了基于 知网的中文信息结构抽取方法。而h n c 理论建立了概念层次网络,在此基础 上,定义了一套词汇语义的符号化描述方法,这种表示方法并非要给出词汇语义的 精确定义,而是希望能表现词汇包含的概念关联性知识和联想脉络的线索,利用 h n c 理论的词汇语义符号化描述方法,通过推理,可以发现概念之间的一些语义关 系。c c d 沿袭w o r d n e t 的分类体系,将名词分为2 5 个语义类,吴云方( 2 0 0 4 ) 瞄l 利用c c d 探讨了并列成分中心语的语义关系 2 0 0 4 年在a c l 会议上,无指导的( u n s u p e r v i s e d ) 语义关系抽取方法首次被提出 ( h a s e g a w a , 2 0 0 4 ) 刚该方法中,他们首先剔除出现频率较低的命名实体对,然 后提取每个命名实体对实例的上下文,并将同一命名实体对的所有实例的上下文进 行累加作为该实体对的上下文;接下来采用c o m p l e t e1 i n k a g e 的方法对实体对的 上下文进行聚类;最后在得到的类中寻找出现频率最高的词汇,并以该词汇标注该 类命名实体对的关系然而此方法依然存在一定的缺陷,剔除低频的命名实体对或 许会遗漏一些重要关系;其次,采用的c o m p l e t el i n k a g e 的聚类方式,其阙值难以确 定。次年c h e nj i n x i u ( 2 0 0 5 ) 【27 】还对此方法做出过改进;总之,h a s c g a w a 提出了 无导语义关系抽取的大体步骤为之后无导语义关系的抽取奠定了重要基础。无导的 关系抽取建立在以下假设之上:拥有相同语义关系的实体对,它们的上下文环境较 为相似,其上下文集合代表着该实体对的语义关系。在这种思想下,无指导名实体 对中语义关系的抽取过程被大体划分为3 个部分:【1 ) 命名实体对及其上下文的提 取;( 2 ) 命名实体对的聚类;( 3 ) 标注各个类中的语义关系。 目前,大部分的信息抽取研究都是在一般领域中进行的,而一些特定领域对信 息抽取有着很高需求,例如教育自动化领域呼喊着“教学设计自动化的核心技术实 现取决于该领域的实体抽取技术和关系抽取技术的发展”( 黄荣怀,2 0 0 5 ) 嘲,于 是近年来也逐渐开始有人研究适应于某些专业领域中的信息抽取技术关系抽取在 专业领域中的应用大都采用有指导的方法,如北京邮电大学的公司人事变动领域的 关系模板抽取研究( 张素香,2 0 0 6 ) 网面将高效的无指导关系抽取技术应用在专 业领域中的研究目前还没有相关报道;将无指导关系抽取与有指导的关系抽取技术 结合起来在专业领域中的相关研究同样未曾见到 1 3 研究内容 本文的研究目标是在专业领域中寻求一种高效的命名实体语义关系抽取的方 案该目标包含以下几个方面的研究内容。 一、专业领域中潜在关系信息研究 专业领域的语料与一般领域的语料相比有着独特的语言特征。在专业领域中, 语言之间的差异度比较小,而且某些一般情况下不常出现的专业词汇出现频率非常 高,从而导致某些特征项的局部权重和全局权重失真在这种情况下如何选择文本 特征才能突显更多的语义关系信息;构造什么样的语言模型才能合适地表达专业领 域语料特征;如何处理文本特征空间才会消除专业领域语言差异度低的影响;这些 分支研究都是整个研究项目的难点和关键。 二、语义关系自动发现研究 如何高效地自动发现专业领域里的命名实体之问的关系是本项研究的核心内 容如何构造合适的聚类器来划分命名实体对之间的关系种类;怎样充分利用关系 信息来构造聚类模型使得聚类器依照语义关系特征来分类;如何对语义关系的分类 进行合理地自动命名;这些也都是我们的主要研究工作 三、关系发现结果辅助有指导关系抽取系统研究 一般来说,无指导关系抽取的精度不容易超过有指导的关系抽取方法,但是可 以利用高效率的无指导方法辅助有指导方法构造关系抽取模板、初始关系种子等这 些耗费大量人工和时间的工作所以,如何从无指导的关系抽取结果中自动提取有 价值的信息来构造弱有导关系抽取系统的初始关系种子;如何从无指导关系抽取结 果中提取一些关系模板为有指导关系抽取提供帮助;以上这些也都是我们要研究的 重点。 具体到各章节的内容安排如下: 6 第1 章是绪论,介绍了专业领域中命名实体语义关系抽取的研究意义、研究背 景及国内外研究情况,同时还介绍了该研究的主要研究内容 第2 章介绍专业领域中命名实体语义关系抽取的相关理论 第3 章介绍了本项目实验系统的构造方法和各种实现技术。 第4 章奔绍了本项目所进行的各种实验以及实验结果评价方法,并对实验结果 进行了分析 第5 章是全文内容的总结和对将来研究的展望 7 第2 章关系自动抽取的理论和技术 2 1 文本表示模型 长期以来,人类一直梦想着能让机器代替人来翻译语言、识别语音、认识文字 和进行海量文献的自动检索,这就需要让机器理解语言但是人类的语言可以说是 信息里最复杂最生动的一部分为了解决这个问题,入们容易想到的办法就是让机 器模拟人类进行学习学习人类的语法、分析语句等等尤其是在乔姆斯基 ( n o a mc h o m s k y ) 提出“形式语言”以后,人们更坚定了利用语法规则的办法 进行文字处理的信念遗憾的是,几十年过去了,在计算机处理语言领域,基于语 法规则的方法在发展过程中依然存在着重重困难。 二十世纪四十年代,数学家兼信息论的鼻祖香农( c l a u d es h a n n o n ) 就提出了 用数学的办法处理自然语言的想法。遗憾的是当时的计算机条件根本无法满足大量 信息处理的需要,所以他这个想法当时并没有被人们重视七十年代初,有了大规 模集成电路的快速计算机后,香农的梦想才得以实现此后,各种数学模型开始在 自然语言处理领域扮演着越来越重要的角色。 在大规模文本处理任务中,首要任务就是利用数学模型将非结构化的自语语言 文本转化为结构化的计算机可识别的信息,即对文本进行形式化处理这一形式化 的结果称为文本表示。不同的文本表示模型有着不同的特点,所以根据文本的特点 和文本处理的要求来选择合适的文本表示模型是非常重要的目前比较常见的文本 表示模型包括严格匹配模型、概率模型、向量空间模型等1 3 0 1 3 。 2 1 1 严格匹配模型 严格匹配模型顾名思义就是利用严格考查特征项是否存在的思想来表达文 本。严格匹配模型中最简单并且常用的一种便是布尔模型在布尔模型中要定义一 个二值变量的集合,这些变量都对应文档的某个特征,称为特征变量。文本由这些 特征变量组成的集合来表示,如果变量对文本的内容表示有贡献,则赋值为t r u e , 否则为f a l s e 。查询语句则是由特征变量和操作符a n d o r 和f 组成的表达式。匹 配函数则遵循布尔逻辑的规则在标准的布尔模型中,文本采用如下的表达形式, 如公式2 1 所示。 , 盔= ( 讹,$ v i 2 ,w 碡,w 曲,k = 1 ,2 ,雅 ( 2 1 ) 8 其中行为特征项的个数,w 砖为0 或l ,表示第_ j 个特征项在文本f 中是否出现。 布尔模型的优点是速度快,易于表示同义关系和词组;其缺点是不能表示特征 相对文本的重要性,缺乏定量分析和灵活性,并且不能表示模糊匹配。 2 1 2 概率模型 概率模型考虑词与词的相关性,把文本集中的文本分为相关文本和无关文本 以数学理论中的概率论为原理,通过赋予特征词某种概率值来表示这些词在相关文 本和无关文本之间出现的概率,然后计算文本间相关的概率,系统根据此概率做出 决策 例如在关系抽取中,基于概率排序原则:对于任意一个命名实体对的上下文集 合文本对其它所有的命名实体对的上下文集合文本d 计算概率p ( r i d ,固并从 大到小进行排序,并设定一个相似度阈值占,如公式2 2 所示这里r 表示d 与s 的相关性如果以呵西,d 2 ,4 v ) 表示文本d ,为特征项个数,特征项i 在 文本中出现d r l ,否则d r o =善t+;p硒i(1-q,)p(rid,ad l o g ( 2 2 )= t + 忑( 2 。2 ) - l 1 f 、r , 其中参数p l ,毋主要通过相关反馈进行计算。一种简单的方法是:p 严r j r , q f - ( n r r ,) ( n - r ) 。这里,拄为反馈文本集所含的文本数,为与s 的相似度大于d ( 即 与s 相关) 的文本数,胁为特征i 出现的文本数,i 为特征f 出现且与s 的相似度大 于j 的文本数。 概率模型的缺点是对文本集的依赖性过强,而且处理问题过于简单。 2 1 3 向量空间模型 向量空间模型v s m ( v e c t o rs p a c e m o d e l ) 1 3 2 1 是2 0 世纪6 0 年代末由g e r a r ds a l t o n 等人提出的,主要应用于信息检索、信息抽取、分类、聚类、篇章分析等研究领域。 其思想是把文本表示成向量空间中的向量,采用向量之间的夹角余弦作为文本间的 相似性度量。当将向量空间模型用于关系抽取时,首先要建立命名实体对上下文集 合的向量表示,然后进行两两向量之间的相似性计算,之后进行命名实体对在向量 空间表示下的聚类。 l 、文本的向量化表示 为了将文本向量化,首先把文本的内容简单地看成是它含有的基本语言单位 ( 字、词、词组或短语) 所组成的集合,这些基本的语言单位统称为特征项。即文 9 硕士学位论文 m a s t e r st h e $ 1 s 本可以用特征项集表示为d ( 霸,如,丁d ,其中疋是项,l 七栉然后根据各个项 死在文本中的重要性给其赋予一定的权重,这时文本d 就可以被记为 蹦死,疋,死阡,简记为d 哦阢,耽,h 如果把乃,死,瓦看成是一 个疗维坐标系,而矾,阡幺,是相应的坐标值,因而d ( ,耽,) 被看成是开 维空间中的一个向量( 如图l 中的d l 和侥) 。我们称d ( ,既,降为文本d 的向 量表示 纾缸,f ,) 图2 - 1n 维空间中的向量表示 2 、特征项的选取与生成 文本中的特征项有很多,比如有字、词、概念、短语、句子和段落等如何选 取特征项,直接影响着向量对文本的表达能力例如,如果以词为文本的特征项, 则在进行项的选取时,要考虑下列一些因素: 词的选取常用词和低频词的区分度较低,而中等频率的词则往往与文档的 主题相关,区分度较大。所以可以将一些常用词和低频词去掉。 停用词。将那些没有实在意义使用频率又高的词组成停用词表,把表中的词 从词汇特征集中滤去,如“的”、“把”、“被”、“就” 特征项的分类。向量空间模型建立在。所有的项两两正交”假设的基础上, 这种正交性假设是过于严格了,不能很好地反映自然语言的特征一般的解决方法 有两种:一种方法是采用潜在语义分析的手段将n 维向量空问上的向量投影到一个 丘( 一般情况下k 远小于,1 ) 维完全正交的近似等价空间中,从而实现空间降维和特 征优化;另外一种方法是把低频词组织成类,将相似的项合并成项类,通常是用分 类词典实现项类的生成,分类词典可以由人工编制,也可以由计算机自动构造完成。 对特征空间的优化处理将在2 2 2 章节中详细介绍 3 、特征项的权重 简单情况下可以由专家或用户根据经验与所掌握的知识领域,人为地给特征项 赋予权重但这种办法随意性较大,更为常用的办法是运用统计的办法,从特征项 的统计信息中计算权重利用统计方法计算特征项的权重的方法有很多种:如反比 文本频数权重评价、信噪比、信息增益、区分度等近年来,效果较好且应用较多 的权重评价函数是:彤f 缸i 诉,靠表示项靠在文档d i 中的文本内频数,硒表示 项靠的反比文本频数,其中颂的计算般采用i d f k = l o g ( n l n k ) n 表示文本集中的 文本数量,m 表示项靠的文本频数( 出现最的文本的数量) 另外,文本的长度也 是必须要考虑的因素,否则,越长的文本信息量越大。这可以通过将上式归一化后 得到公式2 3 : 畋= 以l o g ( n n i ) ( 2 3 ) 矿i a f 的权重计算方法有很多变形和改进形式,很多情况下在不同的实际应用中 要灵活运用p 3 1 向量空问的优点在于将上下文表示为特征项和权值集合的向量,从而将归类操 作变换为向量空间中的向量运算向量的权重可以通过简单的统计来完成,即通过 定量的分析对上下文之间进行比较它的缺点在于特征项之间的“两两正交”的假 设,因为在自然语言中,词或短语之间存在着十分密切的联系,所以这种假设会对 计算结果的可靠性造成一定的影响 4 、向量间的相似度度量 两个向量肪,岛之间的( 内容) 相关程度常常用它们之间的相似度s i m ( d , , d j ) 来度量。当文本被表示为向量空间中的向量时,可以借助向量之问的某种距离来表 示文本间的相似度1 3 4 1 一般的表达方式有: 三 ( 1 ) 内积:s i m ( d i ,q ) = 蚝+ ( 2 4 ) k = l ( 2 ) 绝对值距离:斯撑( d f ,q ) = i 形,i 一 l ( 2 5 ) ( 3 ) 欧氏距离:s i m ( ( d ,d j ) = ( 所,七一叻,七) 2 ( 2 6 ) ( 4 ) 切比雪夫距离:s i m ( d i , d ,) = m a xi w 啦一w ”l( 2 7 ) 硕士擘位论文 m a s t e r st h e s i $ ( 5 ) 夹角余弦:s i m ( d ,q ) = c o s 0 = + k = l ( 2 8 ) 将v s m 应用于不同的领域,其相似度的计算有所不同例如,对于信息检索 来讲,v s m 采用向量间的某种距离度量来反映文本对查询的满足程度所以相似 度的值最好能与真实情况相符且计算简便,同时最好能归一化n 1 0 ,1 i n n 上,且 分布尽可能的均匀,使阈值的选择更加容易。 2 2 特征提取 关系抽取过程中,在使用机器学习算法解决聚类问题之前,必须将“自然的实 例”表达成可供学习算法使用的方式并确定实例间的相似度( 距离度量或核函数) 度量方法,这个过程通常被称为“特征提取” 一次“理想”的特征提取应该产生一个表达,以使后继的聚类器( 学习算法) 的工作变得稀松平常这就要求我们要提取具有如下性质的特征描述,即,来自同 一类别的不同实例的特征值非常相近,而来自不同类别的实例的特征值应该有很大 差异。也就是同类实例间的相似度高,不同类别的实例问相似度低这让我们产生 了提取最有“鉴别”( d i s t i n g u i s h i n g ) 能力的特征的想法,这些特征对与类别信息无关 的变化具有不变性。 2 2 1 特征信息 命名实体对相关的特征信息非常多,在有指导的关系抽取中,大多采集如下特 征信剧”】: 一、实体相关特征 ( 1 ) 实体的组合特征。实体对中两个实体的实体类型以及实体类型的组合对确定 两个实体之间的关系具有很好的作用。例如:l e a d 、 等关系大_ o f m a n a g eo f 多是p e r - l o c ( 一个实体为人名,另一个实体为地名) 形式的命名实体对实例 所以不同命名实体类型的组合包含了不同关系分布的特点。 ( 2 ) 两个实体之间的包含关系。也就是在句子中对两个实体进行描述的字符串的 包含关系。例如“湖北武汉”是对实体“武汉”的一个描述,两者之间存在着包含 关系。在中文处理中判断两命名实体是否为包含关系难度高于英文,所以该特征在 硕士学住论文 m a s t e r s n i e s l s 中文文本中的提取往往借助于一些语言资源工具。其实这种特征本身对分类也许没 有太大意义,但是有些情况下与其它特征结合使用会对分类有较大的作用。 二、实体对上下文环境特征 所谓的实体对的上下文环境就是两个实体周围的词。根据这些词的位置不同, 将它们分为3 个部分:两个实体中间的词、第一个实体之前的词和第二个实体之后 的词前面曾提到,实体对上下文包含的关系信息非常突出,所以无论是有导还是 无导的关系抽取都将其当作重要的特征。 三、实体位置关系特征 一个句子中往往包含2 个以上实体,其它实体的一般信息对分类作用不大,但 是很多情况下一个句子中的所有实体的整体位置关系对过滤实体对( 剔除非关系实 例) 有很大帮助另外,两个实体之间其他实体的数量对分类也
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年师宗县带编教师招聘考试参考题库及答案解析
- 2026年陇西县带编教师招聘考试备考试题及答案解析
- 2026年南木林县带编教师招聘考试模拟试题及答案解析
- T/CAOE 79-2024海洋牧场选址调查评价技术指南
- T/CAIM 015-2024慢性前列腺炎中西医结合诊疗指南
- 营销策划 -腾讯音乐行业案例手册
- 2026年跨境电商高级测试卷及答案
- T/ASAC 0008-2021成熟蜜初加工成套设备
- DB32/T 4780-2024职业健康检查机构卫生监督执法工作规范
- 湖北省新八校协作体2025-2026学年高二下学期5月考试历史试卷(含答案)
- 2026电动重卡充电站投建运营与产业洞察报告
- 2026年安全生产法知识竞赛试题库及答案
- 小学五年级英语 Unit 2 Id like a hamburger(Part CD)任务型教学与跨文化交际教案
- 2026年四川泸州市江阳区社区工作者招聘考试试卷-含答案解析
- 湖南文艺出版社四年级上音乐全册教案
- 建筑工程管理专业中级职称理论考试题库判断题答案及解析(2026年)
- 2026秋新版苏教版小学科学四年级上册教学设计(附目录)适用于新课标
- 2026年浙江杭州市中考英语试题(附答案)
- 2026年度医师定期考核【执业-2】
- 实验室安全考试试题及答案
- GB 18613-2020电动机能效限定值及能效等级
评论
0/150
提交评论