已阅读5页,还剩46页未读, 继续免费阅读
(教育技术学专业论文)基础教育资源搜索引擎中的分词技术研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 自动分词技术是自然语言处理的基础j :程。任何基下词一级的中文处理应删系统都离 不开分词系统。自动分词技术的重点和难点在于歧义切分处理平米登录词的识别。 本文结合基础教育资源搜索引擎项目i 程,提山了中文分词在该项目中的解决方案。 对歧义词的处理,本文统计高频特征词的构词特点,提出并采川了”高频特征词”消歧 义的办法,同时系统实现时辅助以”统计汉字二元语法关系”的方法来解决交集歧义的问题。 对姓名的处理,本文主要是结合统计与规则两种方法各自的优点,统计语料库,并对 这些姓名用字进行分析,提出了自己的分类策略。采用分词碎片识别中文姓名法,对常见 的姓名识别率达到9 0 左右。 对其它未登录词的处理,本文尝试采用高频重复词自动识别,能把每篇文章中出现的 高频未登录词统计出来( 匹配次数、文章篇数) ,然后根据权重计算,计算机能把它自动加 入到词库,从而可以自动的扩充主词库的容量。 本文最后对分词系统的构架、流程、接口设计进行了阐述。 关键词:中文信息处理中文分词歧义未登词 a b s t r a c t a u t o m a t i cw o r ds e g m e n t a t i o ni st h eb a s i so fn l re v e r yc h i n e s ei n f o r m a t i o np r o c e s s i n g s y s t e mb a s e do fc h i n e s ew o r dm u s td e p e n do nw o r ds e g m e n t a t i o n t h ef o c u sa n dd i f f i c u l to f c h i n e s ew o r ds e g m e n t a t i o na r em ep r o c e s s i n gm e t h o d 船c r o s s i n g - a m b i g u i t yw o r da n d u n k n o w n - w o r d o nt h eb a s eo f b e r s e ( b a s i ce d u c a t i o nr e s o u r c er e s e a r c he n g i n e ) p r o j e c t i o n 1d i s c u s s e d t h em e t h o do f c h i n e s ew o r ds e g m e n t a t i o ni nt h i sp a p e r t or e s o l v ec r o s s i n g a m b i g u i t yw o r dp r o b l e m ,1f o u n dt h a tt h ed i s t i n g u i s h i n gf e a t u r ef o r h i g hf r e q u e n c yc h a r a c t e r i s t i cw o r da n dp r e s e n t e dam e t h o dt od e a lw i t hc r o s s i n g - a m b i g u i t y w o r d ,a sas u p p o r t ,w eu s e dc h a r a c t e rb i g r a mf o ra m b i g u i t yr e s o l u t i o ni nc h i n e s ew o r d s e g m e n t a t i o ni nt h es y s t e mi m p l e m e n t t oi d e n t i f yc h i n e s en a m e ,ia d o p t e dar e s o l u t i o no fs t a t i s t i ca n dr e g u l a t i o n ,u s e ds t a t i s t i c a l m e a s u r e s ,a n a l y z e dt h ec h a r a c t e ro fn a m ea n dd r e s e n t e dam e t h o df o ra a n l es o r t i ns y s t e m d e s i g n ,i tc a nf i n dc h i n e s en a m eb yt h ew o r ds e g m e n t a t i o nf r a g m e n t ,e x p e r i m e n t ss h o wt h a t a b o u t9 0 c o r r e c tr a t ei sa c h i e v e d i nt h i sp a p e r , 1t r i e dt of i n dh i g hf r e q u e n c yw o r da s ar e s o l u t i o nt ou n k n o w n w o r d sw o r d s e g m e n t a t i o ns y s t e mc a nc o u n tt i m eo fs u c c e s s f u lm a t c ha n dp a p e rf o rh i g hf r e q u e n c y , a n dt h e n u s es o m ew e i g h tt oa p p e n dt h e s eu n k n o w n w o r d si n t ov o c a b u l a r y t h e r e f o r e ,t h ec a p a c i t yo f m a i nv o c a b u l a r yc a l lb ee x t e n d e da u t o m a t i c a l l y mt h ee n do f t h i sp a p e r , t h ef r a m e f l o wa n di n t e r f a c ed e s i g no f c h i n e s ew o r ds e g m e n t a t i o n s y s t e mh a v eb e e ne x p a t i a t e d k e y w o r d s :c h i n e s ei n f o r m a t i o np r o c e s s ,c h i n e s ew o r ds e g m e n t a t i o n ,c r o s s i n ga m b i g u i t y , u n - k n o w nw o r d 学位论文独创性声明 本人郑踅疹骥: l 、坚撼以“求实、刨裁”的季净学罐耱姨搴秘究王终。 2 、本论文是我个人在导师撵譬下进弦鲍硪究工作翘取德艇科究 成果。 3 、本论文中除弓| 文外,所蠢实验、数据和有关材料均怒真实的。 4 、本埝文中除引文和致谢的内容外,不包含獒他人或其它枫构 已经发表或撰写过的研究成聚。 5 、其他弼志对本研究所做的贡献均已在论文中作了声明并表示 了谢意。 , 作者签名:瑗移簟 订 潮:盘:! 堑 学位论文使用授权声明 本人宠全了蜒怒寨炻熬大学有关徐躲、镬用学位论文的蕊意,学 棱寅极缳整学位论文势自国家主管部门或菸攒定掘橡送交论文豹泡 子舨和纸矮敝;有投将学位论文用予非赢莘晷的的少量复割并允许 论文进入学校图书馋被查耀;有权将学位论文鲍沟套壤入鸯关数援 库避行检索;有权将学位论文的标题和撼要汇撼出版。保密的学经 论文在解密后适用本媲定。 佟者签名: 嗣掰: 缓护 日u 舌 1 、研究背景 随着教育信息化的发展,i n t e r n e t 上的教育资源数量每年以几何级的速度增长,对中小 学广大的网络用户来说,怎样最大程度地实现教育资源共享,怎样从已有的资源上快速地 精确地找到自己所要的资源,是基础教育资源搜索引擎所要追求的目标,这对在我国实现 教育现代化有着重要的意义。 基础教育资源搜索引擎所要做的就是从互联网上采集资源,识别教育资源,将之按学 科和阶段进行分类,并将资源文档与词进行标引,再通过前台用户接口程序进行检索。其 中中文分词系统是基础教育资源搜索引擎系统的一个子模块,分词技术是搜索引擎中其它 模块的基i - 对整个系统最终的评价指标查准和查全,有着非常重要的影响。 而在开放的网络教育资源环境中,要处理的w e b 资源文本文档有如下特点:一、文档 内容类别丰富;二、基础教育领域学科专用词多;三、数据海量。通用的分词技术来说, 并不能满足具体分词的要求,有些接口并不能直接满足具体系统的要求,因此,通过对分 词技术在具体的应用环境下的深入研究,很有必要: ( 1 ) 在基础教育资源搜索引擎系统的背景下,教育领域的专业分词词库建立的必要 因为在基础教育资源搜索引擎系统中,存在一个学科分类体系,比通用搜索引擎多了 一个资源特征训练与资源类别辨别这样的任务,所以在特征训练时,要求有关学科专用名 词成为特征词,并不能分开,以求特征与资源分类的准确。 如:对“荷塘月色的作者是朱自清”、“物质的量的单位是摩尔”进行分词: 通用分词结果是:“顼擅坦鱼盟的缝耋是塞宜渣”、“物厦的量的 皇缱是麈筮”; 基础教育资源搜索引擎特征训练分词的要求是:“萄塘县鱼盟堂往煮基塞自遗”、 “物厦的量的望僮星蹙筮”。显然,基础教育资源搜索引擎的中文分词技术对教育领域 的词库有依赖,而通用的搜索引擎的词库并不能满足专业分词的要求。基础教育领域的专 业词库需要建立与完善,而这是分词的基础。 ( 2 ) 对现有分词技术的切词速度与精度尝试进一步改进,开发适合于本项目的分词系统 分词的速度与精度是一对矛盾,在机器翻译与校对等领域在分词精度上要求相对要高, 而在信息检索与自动抽取等领域对速度要求相对要高,因此在本研究中想找一个适合于我 们项目要求的,速度与精度相对平衡的解决办法。 ( 3 ) 具体的系统要求分词系统对外所提供接口并不一样,必须根据具体的要求来设计 通用的分词系统一般仅仅提供以分隔符分好的的字串形式和词性标注的接口,而在具 体的搜索引擎系统中,可能还有很多要求,如:分词形式( 最大分词或混合分词) 、词的位 置信息、返回结果数据类型( 字符串或数组或其它) 、数据字典初始化情况、分词时是否记 录未登录词等等,所以,就具体的搜索引擎来说,分词系统必须服务于上层模块的要求, 重新设计开发很有必要。 2 、主要研究的内容 ( 1 ) 解决适用于基础教育资源可行的歧义词与学科未登录词的识别,提高分词精度与速 度,能满足海量数据与信息进一步的处理的要求; ( 2 ) 分词程序在基础教育资源搜索引擎系统中的各种接口和规范设计; ( 3 ) 适用于基础教育资源搜索引擎项目的中文分词系统没计与开发方案。 3 、研究的成果 本研究理论与实践相结合,主要取得了如下一些成果: ( 1 ) 整理出了包含基础教育各学科的专业词库,适合于基础教育资源搜索引擎的分词: ( 2 ) 改进了中文姓名与高频未登录词及歧义词的解决办法,提高了分词的精度与速度: ( 3 ) 完善了一套完整的a p i 接口设计,能使我们研究的各个模块方便调用分词程序; ( 4 ) 开发分词系统程序源代码; 4 、创新之点 本研究有如下一些创新之处: ( 1 ) 基于统计,提出了基于高频特征词消歧义的办法,该方法不需要特别推理机制,边 分词边消歧义,速度快,空间省,处理常见交集歧义问题很有效果。 ( 2 ) 姓名的识别时,对姓与名用字,前人分类时做的多数是从作姓名出现的频率来归纳, 如:“苏、方”作姓时前人把它归纳到“做姓与常用词出现多”的一类;而本文是从作姓与 名用字的组合特点来归纳,把它归纳为“单字时作姓,是词时不作姓”这一类字,这样做 减少了对这一类字的作姓与作普通词的判断,推断分析过程减少,识别效率高。 ( 3 ) 对高频未登录词识别时,从总频率与出现的篇次二个维度来考虑,经实验,未登录 识别效果很好,干扰高频词少,此法对计算机自动建设专业词库有一定的借签意义。 5 、本文的组织结构 本文第一章主要介绍了中文分词技术的发展、分类、分词的关键点与所遇到的困难,最 后论述了中文分词在搜索引擎之间的地位。 第二章在现有的歧义处理方法上,通过归纳大量的歧义词,提出了以高频特征词为标记 的歧义字段的解决办法,解决了8 0 左右交集歧义的问题。 第三章讨论了中文分词技术中未登录词的主要问题,并重点对属于未登录词的中文姓名 及高频未登录词进行了总结,并提出了自己的解决方法。 第四章是关于中文分词整个系统的设计,阐述了系统的功能、处理流程结构图、类模块 的设计、分词接口的设计等方面的内容。 第五章对整个工作的总结与展望。 2 第一章中文分词概述 “词是最小的能够独立活动的有意义的语言成分,而汉语的中文信息处理就是要“用 计算机对汉语的音、形、义、进行处理”,包括“对字、词、句、篇章的输入、输出、识别、 分析、理解、生成等的操作和加工”2 然而,汉语文本中词与词之间没有明确的分隔标记, 而是连续的汉字串,它不像西文那样,主要以标点符号与空格来标记一个个词的存在,因 此,自动识别词的边界,将汉字切分为正确的词串的汉语分词问题无疑是实现中文信息处 理的各项任务的首要问题。汉语自动分词是所有中文信息处理的基础,同时也是语料库自 动加工的基础,它的准确性也会直接影响到语料库的加一的所有后续步骤,包括词性标注 和句法分析层次。 1 1 中文分词技术的发展 分词是汉语自然语言处理的第一步。目前,汉语自然语言处理的应用系统处理对象越 来越多的是大规模语料,因此分词的速度和分词算法的易实现性变得相当关键。汉字的简 体繁体转换、信息检索和信息摘录、搜索引擎、w e b 文本挖掘、文本分类、文本校对等中 文信息处理系统同样都首先需要分词作为其最基本的模块。 作为自然语言处理的前处理阶段,自动分词技术又是重中之重,它是机器翻译、文献 标引、智能检索、自然语言处理等必不可少的基础,也是制约中文信息处理飞跃的“瓶颈” 之一。其实,自动分词技术取得的成果是可观的汉语自动分词研究最早可追溯到5 0 年代后 期的俄汉翻译机的研制时期,大约在1 9 6 0 年左右,苏联学者首先提出了“6 - 5 4 3 2 1 ”的 分词方法。这种方法中的匹配思想成为后来许多分词方法的基础。在我国8 0 年代以来,语 言学界、人工智能领域和情报检索界的学者们,在汉语自动分词与自动标引的研究与实践 上进行了大量的研究,找到了许多解决汉语分词的方法。下面所列的就是早期的些分词 技术: ( i ) 北航的c d w s 和c w s s ,c d w s 是国内公开的第一个实用性汉字分词系统,切分精 度为1 次错分1 5 0 _ - 3 0 0 字,分词速度为1 0 1 3 字,秒。后来的c a s s ,分词速度为2 0 0 字,秒。 ( 2 ) 山西大学刘开瑛研究的a b w d 分词系统,其知识库含八类规则,分词速度1 5 字, 秒,正确率9 9 1 4 。 ( 3 ) 清华大学黄昌宁、马晏等在s u n t 作站上用c 语言实现的一个基于评价的全切分 汉语自动分词系统s e g ,切分正确率9 9 1 3 ,切分速度为2 5 8 字秒。 ( 4 ) 杭州电子工业学院张国煊研制的h d c a w s 系统,分词速度达1 8 0 0 字秒,分词正确 率为9 9 1 8 。 ( 5 ) 北师大何克抗、徐辉等推出的自动分词专家系统。在3 8 6 机上对封闭语料的切分速 1 朱德熙语法讲义北京:商务印书馆,1 9 8 2 2 汉语信息处理词汇0 l 部分;基本术语北京;中国标准出版社,1 9 9 度达1 9 4 1 7 ,秒,切分正确率为9 9 1 8 3 。 ( 6 ) 东北工学院姚天顺建立的基于规则的汉语分词系统,在s u n 2 e 作站上实现。 ( 7 ) 南京大学王启祥、王锡江完成的分词系统w s 2 b n ,使用改进的最大匹配法、结合 标志分词法,辅之以词法和语义知识。 ( 8 ) 哈工大韩世欣、王开铸等提出的基_ - 短语结构文法的分词系统p s g 。 ( 9 ) 中软总公司的吴蔚天、周依欣等研制的链接表法分词系统,在g w - 2 8 6 机上实现, 分词速度1 2 1 3 字秒,准确率9 5 以上。 ( 1 0 ) 上海交大王永成1 9 8 5 年采用部件词典法研制的自动抽词系统。 现在中文信息处理可以说今非昔比,又达到了一个新的层次,在典型的分词系统主要有: ( 1 ) 中国科学院计算技术研究基于多层隐马模型的汉语词法分析系统i c t c l a s ( 2 ) 美国布朗大学的t a g g i t 系统; ( 3 ) 基于统计方法的c l a w s 系统: ( 4 ) 海量科技公司的中文智能分词系统; ( 5 ) 杭州麦达电子有限公司的中文分词技术 1 2 中文分词技术的分类 近1 0 年来,语言学界、人工智能领域和情报检索界的学者们,在汉语自动分词与自动 标引的研究与实践上进行了大量的研究,找到了许多解决汉语分词的方法。8 0 年代以来见 诸报端的自动分词方法归纳起来有:最大匹配法、逆向最大匹配法、逐词遍历法、设立切 分标志法、最佳匹配法、有穷多层次列举法、二次扫描法、高频优先分词法、基于期望的 分词法、联想回溯法、双向扫描法、邻接约束法、扩弃转移网络分词法、语境相关法、 全自动词典切词法、基于规则的分词法、多遍扫描联想法、部件词典法、链接表法、最少 分词词频选择法、专家系统分词法、基于神经网络的分词方法等2 2 种。 归纳起来,目前国内公开报道过的分词系统采用的分词方法主要有二种类型: ( 1 ) 机械分词法。机械分词法主要有最大匹配法( m m 法) 、逆向最大匹配法( r m m 、 o m m 、i m m ) 、逐词匹配法、部件词典法、词频统计法、设立标志法、并行分词法、词库 划分和联想匹配法等。 ( 2 ) 语义分词法。语义分词法引入了语义分析,对自然语言自身的语言信息进行更多 的处理,如扩充转移网络法、知识分词语义分析法、邻接约束法、综合匹配法、后缀分词 法、特征词库法、约束矩阵法、语法分析法等。 ( 3 ) 人工智能法。又称理解分词法,人工智能是对信息进行智能化处理的一种模式, 主要有两种处理方式:一种是基于心理学的符号处理方法。模拟人脑的功能,像专家系统。 一种是基于生理学的模拟方法。神经网络旨在模拟人脑的神经系统机构的运作机制来实现 一定的功能。 以上两种思路也是近年来人工智能领域研究的热点问题,应用到分词方法上,产生了 专家系统分词法和神经网络分词法。 4 这些方法又大体上可分为两类:一类是基于规则的,一类是基于语料库的,但无论是 基于规则还是基于语料,最后都归结为计算词频的统计信息,串频和互信息是词频的另一 种表现形式。但遗憾的是自然语言远不是一个经过事先精心规划的系统,难以用一套完整 的规则去准确地预测正式汉语文本中所出现的各种变异。分词精度与分词速度永远是一对 矛盾,我们只能结合我们廊用的需要努力提高分词的精度与速度两个指标。 1 3 分词技术的关键点 汉语分词是由计算机自动识别文本串中的词边界过程。从计算机处理过程上看,分词 系统的输入是连续的字符串( c l c 2 c 3 c c 。) ,输出是汉语的词串( w l w 2 w 3 w 。) ,在这 里,可以是单字词也可以是多字词。 在分词问题上,尽管我们的许多计算机自动分词应用系统都宣称达到9 0 以上的正确 率,但由于一方面在理论上没有最终解决汉语词这个语言单位的性质问题,另一方面也是 更重要的方面是汉语词本身的特点造成困难,国家虽然已经出台了分词规范( “信息处理用 现代汉语分词规范”,中国国家标准g b l 3 7 1 5 ) ,但在实践中仍有相当多的分词歧义问题、 未定义词问题等困扰着研究人员。 ( 1 ) 歧义切分 汉语文本中含有许多歧义切分字段,典型的歧义有交集型歧义( 约占全部歧义的8 5 以上) 和组合型歧义。其中交集歧义如果说还可以通过统计,语法等角度来解决的话,那 么组合歧义的解决基本上效果很差了。比如交集歧义串“真正在”中,“真”作为单字词的 频率大大低于“在”作为单字词的频率,即“在”常常单独使用而“真”作为单字词使用 的可能性较小,所以应切成“真正在”。而如“马上”这个词,用在“他马上过来”和“他 从马上跳下来”中分词的效果截然不同,当然可以这个词可以根据句法规则来切分,但是 再如“将军用毛毯把他盖起来”,这个串中的“将军用”就无法就这个句子来解决歧义了。 到底是“将军用毛毯”还是“将,军用毛毯”这就需要看较睦的一段文字,然后根据 上f 文的句意来切分,这个对分词的要求就更高了,因为它需要计算机先理解再分词。 ( 2 ) 识别未登录词 切分一般都是在字典基础上的,即使是无字典分词,语料库之外的词互信息也得不到, 也需要进行未登录词的识别。未登录词即未包括在分词词表中但必须切分出来的词,包括 各类专名( 人名、地名、企业字号、商标号等) 和某些术语、缩略词、新词等等。未登录词 的识别对于各种汉语处理系统不仅有直接的实用意义,而且起到基础性的作用。因为各种 汉语处理系统都需要使用词频等信息,如果自动分词中对未登录词识别不对,统计到的信 息就会有很大误差。比如,一个分词系统若不做中外人名识别,分词后进行词频统计,可 能会发现“张”、“王”、“李”、“刘”、“尔”、“斯”的频率比“却”、“如”、“你”的频率还 要高,用这样的统计结果做汉语处理,其效果肯定有问题。又比如校对系统,如果系统不 具备生词识别能力,就无法判断句子中大部分诃的使用是否合理,也就不能检查真正的错 误所在。 5 1 4 中文分词的困难 在过去的十几年里,汉语自动分词工作虽然也取得了很火成绩,但无论按照人的智力 标准,还是同实用的需要相比较,差距还很人。r 。作的困难主要在f 面几个方面。 1 、分词规范的问题 汉语自动分词的首要困难是词的概念不清楚。书面汉语是字的序列,词之间没有间隔 标记,使得词的界定缺乏自然标准,而分词结果是否正确需要有一个通用、权威的分词标 准来衡量。分词标准的问题实际上是汉语词与语素、词与词组的界定问题,这是汉语语法 的一个基本、长期的问题。它涉及到许多方面: ( 1 ) 核心词表问题:分词需要有一个核心( 通用、与领域无关的) 词表,凡在该词表 中的词,分词时就应该切分出来。对于哪些词应当收进核心词表,已提出各种收词条件, 但这些条件本身难以操作,目前尚无合理的可操作的理论和标准。 ( 2 ) 词的变形结构问题:汉语中的动词和形容词有些可以产生变形结构,如“打牌”、 “开心”、“看见”、“相信”可能变形成“打打牌”、“开开心”、“看没看见”、“相不相信” 等。可以切分出“打打牌”,但“开开,j b ”就不合理。“看没看见”说得过去,“相不 相信”就说不过去了。又如大量的离合词“打架”、“睡觉”等可以合理地变形为“打了一 场架”、“睡了一个觉”。对这些变形结构的切分缺少可操作而又合理的规范。 ( 3 ) 词缀的问题:语素“者”在现代汉语中单用是没有意义的,冈此“作者”、“成功 者”、“开发者”内部不能切开。依据这个标准,“作出了巨大个人财产和精神牺牲者”、“克 服许多困难而最终获得成功者”、“开发中国第一个操作系统软件者”也不能切开,但这样复 杂的结构与词的定义相矛盾。又如职务名称“教育局长”,语义上理解为“教育局之长”, 切成“教育局长”、“教育局长”、“教育,局长”或不予切分,都会有人提出异议。 ( 4 ) 非词语素问题:一些汉字在古代汉语中是词,演变到现代汉语时成了非词语素, 例如“民”。现代的书面汉语并非纯粹的“现代汉语”,其中夹杂着不少文言成分,如“为 民除害”、“以逸待劳”、“帮困济穷”等等。探寻白话文中夹杂文言成分的规律,是中文信 息处理需要解决的一大问题。 2 、不同应用对词的切分规范要求不同 汉语自动分词规范必须支持各种不同目标的应用,但不同目标的应用对词的要求是不 同的,甚至是有矛盾的。 ( 1 ) 以词为单位的键盘输入系统:为了提高输入速度,一些出现频率高的相互邻接的 几个字也常作为输入的单位,如:“这是”、“每一”、“再不”、“不多”、“不在”、“这就是”、 “也就”等。 ( 2 ) 校对系统:校对系统将含有易错字的词和词组作为词单位,如许多人“作”、“做” 分不清。计算机自动判别时,若把它们当作单字词也不好区分,但在同前后文构成的词或 孙宾现代汉语文本的词语的切分技术h t l p :l x l m z n e f f f o r u r n v i e w t h r c a d p h p ? f i d = 2 4 6 0 6 词组中往往可以有确定的选择,故应把有关的词和词组都收进词库,如“敢做”、“敢作敢 为”、“叫做”、“做出”、“看作”、“做为”等。校对系统要求分词单位较大。如把“勇斗”、 “力擒”、“智取”等分别作为一个分词单位并划归及物动词参与上下文检查。“张老师”、 “五分之三”、“北京中医学院”也应分别作为分词单位,并分别归类作为人、数字、机构 名,再参与上f 文检查。 ( 3 ) 语音合成系统:语音合成系统收集多音字所组成的词和词组作为分词单位,如“补 给”、“给水”,冈为在这些词或词组中,多音字“给”的音是确定的。 ( 4 ) 检索系统:检索系统的词库注重术语和专名,并且一些检索系统倾向于分词单位 较小化。比如,把“并行计算机”切成“并行计算机”,“计算语言学”应切成“计算语 言学”,使得无论用“并行计算机”还是用“计算机”、“计算语言学”或是“语言学”检索, 都能查到。分词单位的粒度大小需要考虑到查全率和查准率的矛盾。 3 、分词与理解的先后 计算机无法像人在阅读汉语文章时那样边理解边分词,而只能是先分词后理解,因为 计算机理解文本的前提是识别出词、获得词的各项信息。这就是逻辑上的两难:分词要以 理解为前提,而理解又是以分词为前提。由于计算机只能在对输入文本尚无理解的条件f 进行分词,冈此任何分词系统都不可能企求白分之自的切分正确率。 1 5 中文分词与搜索引擎 中文分词是搜索引擎的基础模块,分词形式与结果直接影响到其它相关处理模块的处 理结果。 i 、数据标引与分词 在数据标引中,根据是否采用词语切分技术,中文信息检索可以分基于词的检索和基 于字的检索。基于字的检索系统对文章中所有字建立全文索引,在检索时得到每个单字白勺 索引,而后加以适当地逻辑运算,得到检索结果。而基于词的检索对词汇建立索引,检索 时次命中。由于汉语自动分词的困难,很多搜索引擎退而求其次,采用基于字的检索4 。 包括g o o g l e 、y a h o o 、s o h u 、s i n a 等影响力大的网站都是采用基于字的搜索方法。这种方 法虽然可以保证较高的查全率,但查准率较低,检索到的结果虽然很多,但是与检索要求 相关的有用结果却很少,可能检索的结果与用户的查询要求会大相径庭,例如当检索德国 货币单位“马克”时,就会把“马克思”检索出来,而检索“华人”时会把“中华人民共 和国”检索出来。因而进行切词,可以大大提高检索的准确率。适当的分词颗粒度可以提 高搜索引擎的查全率和查准率。准确率越高的分词可以降低检索分词和索引分词的不一致 率,不然,尽管库里存在这个词,但是由于分词语境不同,造成分词结果的不同就是查不 出来,用字或分词准确率的低系统,所以结果用户体验会差很多。 7 有人曾对雅虎中国c h a p :c n y a h o o t o m ) 的查询准确率做过局部调查,结果表明, 由于未做分词处理,平均检索精度仅为4 8 8 。中文分词到底对搜索引擎有多大影响? 对 于搜索引擎来说,最重要的并不是找到所有结果,因为在上百亿的网页中找到所有结果没 有太多的意义,没有人能看得完,最重要的是把最相关的结果排在最前面,这也称为相关 度排序。中文分词的准确与否,常常直接影响到对搜索结果的相关度排序。在搜索引擎上 输入“和服”,得到的结果就发现了很多问题。在g o o g l e 上输入“平服”搜索所有中文简体 网页,总共结果5 0 7 ,0 0 0 条,前2 0 条结果中有1 4 条与和服一点关系都没有:在白度上输 入“和服”搜索网页,总共结果为2 8 7 ,0 0 0 条,前2 0 条结果中有6 条与和服一点关系都没 有。这次搜索引擎结果中的错误,就是由于分词的不准确所造成的。据了解,g o o g l e 的中 文分词技术采用的是美国一家名叫b a s i s t e c h n o l o g y ( h r p :w w w b a s i s t e c h c o r n ) 的公司提 供的中文分词技术,百度使用的是自己公司开发的分词技术,中搜使刚的是国内海量科技 ( h t t p :w w w h y l a n d a t o m ) 提供的分词技术。由此可见,中文分词的准确度,对搜索引 擎结果相关性和准确性有相当大的关系。 2 、网页的消重 目前互联网上转载的网页太多,基于分词的消重算法会起很好的作用。 3 、基于分词的敏感信息过滤 搜索引擎的分词还能传递出词的其他属性,像一些反动的,黄色的敏感的字眼,可以 经过适当处理,从而达到净化网页环境的作用。 4 、分词的速度对搜索引擎的升级非常重要 搜索引擎的核心升级需要重新生成索引如果分词速度慢,那么成本会有大幅度地增加, 分词准确率如果相差1 ,在查询体验上大约会差2 0 左右。因为分不准的地方往往是新 词最需要查询的计算的地方。 5 、信息检索系统对分词的要求 信息检索是找出包含了指定的一类特征( 关键字、检索表达式) 的文档、段落或句群 供用户阅读的过程。针对信息检索而言,分词技术的主要问题是确定词的颗粒大小,对专 用术语的识别、判别词与词之间的语义关联。为了适应用户的各种查询,第一、词库的分 词单位应该较小化,也就是词典中的词条应是汉语中最基本的、最稳定的词。第二、尽可 能的把各领域的专用术语收录,这就要求分词系统要有一定的智能性地识别未登录词。第 三、分词速度要达到一定级别。因为分词是最基础的部件,因些不能占用太多时间。 总而言之分词技术会贯穿整个引擎中的各个部分。 5 孙茂松自动分词与中文搜索引擎计算机世界报,2 0 0 2 8 第二章高频特征词与歧义词处理 在分词过程中具有两种或两种以上切分形式的字段称为歧义字段,只有歧义字段才能 产生错误切分,所以,要提高自动分词的精度,必须有效地处理歧义字段。 高频歧义字段与高频特征词有一定的联系,它对交集歧义影响很人,如何发现这些字 的构词特点,运用一些策略,直接消除它们在交集歧义中的影响是我们的研究出发点,因 此,本章主要研究“高频特征词”的特点,统计其规律,并用它来解决交集歧义的问题, 理论上能保证8 0 左右的歧义切分的正确率。 2 1 歧义的分类及现有的处理的方法 自动分词中的歧义现象分为两类:交集型歧义切分字段、多义组合型歧义切分。 如:“下工作”可以分为“下i 作”或“下i 作”,它是一个交集字段。“手指”可以 切分成“,手指”或“手手日”,它是一个多义组合字段。 郑延斌( 1 9 9 7 ) 按分词过程中歧义产生的根源把歧义分为三个类型: ( 1 ) 由自然语言中的二义性所引起的歧义,称为第一类歧义:如:“乒乓球拍卖完了” 可以切分成“乒乓球拍卖完了”又可以切分成“乒乓球拍卖完了”这两种切分形式无论 在语法上、语义上都是正确的,只有结合上下文才能给出正确的切分。 这类歧义,由于他们本身就是汉语言中的歧义问题,解决这类歧义需要依靠上、f 文 语义信息,即增加语义、语用知识的处理。这无异对自动分词的效率有很大的影响( 时间上 和空间上) ,而且实现起来比较困难若是在词处理的相应阶段,结合对分词阶段未解决的 歧义字段进行处理,则会起到事半功倍的效果。统计表明,第一类歧义字段只占整个歧义 字段总数的1 3 0 以下,因此不必在分词阶段花费巨大的开销来处理它们。 ( 2 ) 由计算机自动分词产生的特有歧义,称为第二类歧义;如:“在这种环境下工作 是太可怕了”,用计算机切分,可以切分成“在,这种环境下t _ 作是太可怕了”,也可以 切分成“在这种环境下i 作是,太可怕,了”,而对本句来说,只有第二种切分都正确的 这用人工分词是不可能产生歧义的。 目前对它们的处理方法有以下几种: _分词知识处理法:这类方法是通过对大量歧义切分字段的研究,发现其中的一些 普遍规律,获得知识,并反过来利用所获得的知识来处理歧义字段。 联想一回溯法:该方法主要依据规则库处理歧义字段,规则库中包括有语法知识, 使用联想机制构造新词汇,利用回溯机制处理歧义。 基于词频统计的方法:该方法的基本思想是在分词过程中,依据词频统计的结果, 对歧义字段进行处理。频度高的词优先分出。若a b c 是交集字段,a b 的频度比b c 的频 度高,则应切分为a b c 。若a 的频度比c 的频度大,则应切分为a b c 。 9 _ 邻接约束法:由于句法、语义或习惯用法的限制,或人们为了避免造成阅读上的 困难,相邻词之间有一种约束关系,称为邻接约束。如“那里”不能切分成“那里”。 一 基于数学期望的方法:在一个句子中,由于人们说话的习惯和汉语语法及语用规 则,一个词的出现对于它后面的紧相随的词有一种期望。根据语法知识和语义知识可把该 期望分为结构期望和语义期望。 ( 3 ) 由于分词词典的大小而引起的歧义,称为第三类歧义;如:“王小二是一个农民”, 川计算机切分被分为“千h j , 二是一个农民”,在这里“王小二”是一个人名,在汉语中 应是一个词,所以这个切分是错误的。“发展社会主义的新乡村”,“新乡”是一个地名,若 词典中有该词,则“新乡村”是一个歧义字段。因此,不论词典的火与小都可以产生歧义。 这类歧义目前有两种方法: _ 增加构词知识:如:“他快快乐乐地走了”中的“快快乐乐”词典中可能没有这 个词,故该句被错误切分成“他肤快乐乐,地腱了”、“快快乐乐”一词属于a a b b 构词 形式,若系统中有a a b b 这一条知识,就可以正确切分这一句子。 一 增加临时词典:对于人名、地名等专用名词,词典中只能收集少量,对没有收 集的人名、地名可以采用临时词典的形式来解决。有了临时词典后,匹配过程中若分词词 典匹配不成功,需要从临时词典中来匹配。 第二类歧义据统计占到歧义种类的9 5 以上6 ,所以我们主要解决第二种歧义,根据以 特征词为标记的交集歧义的切分方法来解决这个问题。 2 2 以特征词为标记的交集歧义切分 文献。从1 亿字的语料库中发现,最大交集型歧义切分字段的高频部分表现出相当强的 覆盖能力及稳定性:前4 ,6 1 9 个的覆盖率高达5 9 2 0 ,且覆盖率受领域变化的影响不大, 其中4 ,2 7 9 个为伪歧义型,覆盖率高达5 3 3 5 。 我们以1 3 万词条的词库作切分词库,也从包含中小学各个学科的语料库3 1 ,5 2 0 篇网 络文档共1 5 0 多兆文本中,训练得到交集歧义词共有8 3 ,7 2 8 条,其中链长为l 的3 字歧 义词有6 6 ,0 4 4 个,占8 0 多,词频大于5 的有1 5 ,9 1 9 条,大于1 0 的有8 3 6 0 条,大于 2 0 的有4 1 7 7 条。其效果也与文献1 1 指出的一样:在训练过程中,当文本训练达到一定数 目时,歧义字条数量趋向稳定。同时我们对词频大于5 的1 3 ,2 7 1 万多条歧义字段进行分 析,其中包含有高频特征词的歧义字段有9 0 4 9 条,占6 8 2 。因此高频歧义字段与高频特 征词有一定的联系,它对交集歧义影响很大,如何发现这些字的构词特点,运用一些策略, 直接消除它们在交集歧义中的影响是我们的研究出发点,因此,本章主要研究“高频特征 词”的特点,统计了其规律,并用它来解决交集歧义的问题,理论上能保证8 0 左右的歧 义切分的正确率。 6 闰引堂,交集型歧义字段切分方法研究,情报学报,2 0 0 0 1 2 7 孙茂松等,高频最大交集歧义切分字段在汉语自动分词中的作用,中文信息学报,第1 3 卷第1 期 1 0 2 2 1 高频特征词的概念 交集歧义现像的产生是由于某个字在它前后的字都能组成词,形成了交集歧义词串, 从而使得计算机无法识别哪一种是正确的切分形式( 如:“表现在”) 。我们经过统计长度为 3 个字的高频歧义词串发现,在这些歧义词串中存在一批这样的字:它们往往有着构词能 力很强,出现频率很大,趋向于歧义词串后而形成歧义词串,而且应该单独切分出来的特 点,如:“表现在、水平;日i 、反映出”中的字“在、和、出”就属丁这一特点,我们把这些 字命名为高频特征词。有着这种特点能称为高频特征词的还有“墼一地:时:必! 怼! 王! 运二麴:凰! 与:煎j 上:虫! 里:后j 啦! 馒! 羞! 地! 工也时! 越! 则:垦! 丕! 塞二盛:出j 馕:金! 茎j 砉二垫:查:剿:垂:焦! 蒯:逗! 燕:能! 赞! 也! 缝: 熊! 旦:遒j 递二叠:厶:国:等。 为了便于说明,我们在逆向最大匹配算法的基础上进行考察这些字的特点。由逆向分 词的特点知道,分词程序会一律把交集歧义串处理向右优先匹配( 如:“表现在”) 。虽然, 逆向分词也能分对些歧义词( 如:“相,对应”) 切分正确,但是对交集歧义字段切分的总 体准确率只保持在5 0 左右。因此我们仅对剩下的己切错的5 0 歧义字段进行统计分析。 2 2 2 交集歧义类型分析 交集型歧义字段:在字段a b c 中,a b w 并且b c w ,则称a b c 为交集型歧义 字段。其中a 、b 、c 为字串,w 为词表。 链长:交集型歧义字段中含有交集字段的个数,称为链长。 当交集型歧义字段具有且只有a b c 形式时,即a b 、b c 都成词时,称a b c 链长为】, a b c 的字数总和称为a b c 的长度,如:“要求是、负责人和、情不白禁地”是歧义字段, 其链长为1 ,长度分别为3 、4 、5 ,“今天f 午”包含“今天f ”和“天f 午”两个歧义字 段,链长为2 ,长度为4 ,其它的以此类推。 交集歧义主要有以f 几种情况: 1 链长为1 交集歧义串根据长度主要有下面3 种 ( 1 ) 长度为3 的a b c 型: “要求是、解除了、水平和、方面的”等。 最大逆向分词分词时会分为:“要求是、解除了、水平和、方面的”。 “其实质、太平淡”等。 最大逆向分词分词时会分为:“其实质、太平淡”,为正确分词形式。 f 2 ) 长度为4 的a b c d 型: a b c d :“负责人和”等。 a b c d :“第一部分”等。 f 3 ) 链长为1 的a b c d e 型: a b c d e :“情不自禁地”等。 a b c d e :“地面目全非”等。 长度大于4 链长为1 的的占极少。 2 链k 为2 的交集歧义串: ( 1 ) a b c d “互助学习、共同构成、今天f 午、充分发挥、促进学习”等。 最大逆向分词时会把它们分为:“互助学习、共同构成、今天f 午、充分发挥”, 9 8 符合分词正确形式。 ( 2 ) a b c d 切分形式,如“从,前年底、地,表明了、分类n 的”,约 14 3 f 3 ) a b c d 切分形式如“比分子式”也占少部分。 3 链长大于2 的交集歧义串 这类歧义串出现次数较少,以长度为5 的字串较为典型,其切分形式主要有: ( 1 ) 切分结果为“a b c d e ”,如“埃及时经常”; ( 2 ) 切分结果为“a b c d e ”,如“爱国教授与”; ( 3 ) 切分结果为“a b c d e ”,如“从冲学时代”。 2 2 1 3 含高频特征词的歧义词串处理策略 1 、链长为l 的含高频特征词的交集歧义串主要有下列几种情况: ( 1 ) 长度为3 的a b c 型: 这类a b c 型歧义字串占整个歧义词的5 5 3 6 ,占链长为1 的歧义类型的8 9 , a b c 型占4 0 3 ,a b c 型占5 1 4 ,还有未登陆词占8 2 8 。运用逆向分词时,a b c 型的会分为“a b c ”,所以,只要对“a b c ”歧义型,识别出“a b c ”这种类别,就 可以达到正确分词结果。而恰恰“a b c ”这种类型中,我们对“a b c ”型进行倒排档 规律统计,大多数c 就包含我们所讨论的高频特征词。引起的歧义形式例举如r : a b c ( 介) 型 这类介词主要有:在、为、时、以、对、于、还 在:表现在出现在体现在注意在如何在储存在常用在止好,在等共4 7 1 条 为:转变为学生为部分为反应为建设为假设为排列,为看作为等1 0 5 4 条 时:上课时小学时设计时将来,时作战时错误时通过时施工时等共6 8 4 条 a b ,c ( 连) 型 这类连词主要有:和、及、与 和:语言,和思维,和民主,和个人,和需求a n 母亲和气温和水平和等共6 0 7 条 及:语言圾原料及理论,及结论圾疑问及序言及讨论及提问及等共1 0 8 条 ( 要) a b c ( 方位) 型 这类词主要有:前、上、中、里、后 前:半年前比赛,前备课,1 封闭幕,前参赛前柜台前教学前节日前等共2 8 2 条 8 闫引堂周晓强交集型歧义字段切分方法研究,情报学报,2 0 0 0 ( 1 2 ) 1 2 上:大会上方向上讲台上轨道上思路,上作j = i j 上目标上海岸上等共9 8 8 条 中:国家中海水中革命中周期中太空中森林中旅途,中发言中等共9 6 2 条 a b c ( 助词) 型 这类词主要有:的、得、着、地、了、们、啊、吧、时 的:题目,的项目的数目的瞩目的盲目的科目的注目的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 建筑施工扣件式钢管脚手架悬挑工艺设计方案
- 建筑结构加固技术手册
- 急救医院地基基础施工方案
- 光伏升压站建设方案
- 合同能源管理绩效考核方案
- 供排水安全工作方案
- 公司工作总结汇报模板
- 工程监理咨询文明施工管理规范
- 新形势下湖泊管理服务行业顺势崛起战略制定与实施分析报告
- 家具生产智能调度系统企业制定与实施新质生产力战略分析报告
- 福建省厅警用地理信息系统(PGIS2.0)建设方案V1.1
- 华为公司质量管理
- 2025四川遂宁发展投资集团有限公司招聘8人笔试参考题库附答案
- 2025年香港特别行政区统计局综合分析岗位事业单位招聘考试综合类专业能力测试试卷(统计类)
- 主网线路专业知识培训课件
- 如何做护理小讲课
- 中国邮政2025苏州市秋招信贷审查岗位面试模拟题及答案
- 肝病科科普课件
- 入场人员安全告知书
- 新生儿桡动脉品管圈成果汇报
- 血透病人常用药物管理规范
评论
0/150
提交评论