版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
基于上下文和语义信息的跨领域中文分词报告人:张婧导师:黄德根教授学校:大连理工大学研究领域:自然语言处理NLP&MT基于上下文和语义信息的跨领域中文分词报告人:张婧NLP&M1主要内容NLP&MT中文分词概况中文分词的一大挑战本文主要方法参考文献主要内容NLP&MT中文分词概况中文分词的一大挑战本文主要方2中文分词概况中文分词的主要技术:
基于规则的方法基于统计的方法规则与统计相结合的方法NLP&MT基于序列标注的机器学习方法[1-2]基于字标注的方法[3-5]基于子词标注的方法[6-8]中文分词的技术难点:
未登录词、歧义、规范等本文所用的方法中文分词概况中文分词的主要技术:NLP&MT基于序列标注的机3主要内容NLP&MT中文分词概况中文分词的新挑战本文主要方法参考文献主要内容NLP&MT中文分词概况中文分词的新挑战本文主要方法4中文分词的一大挑战跨领域分词的一个显著特点是:一个特定领域文章中的通用词和术语较多,这些领域性OOV是基于某个特定领域的,并且可能会在其所属领域的某一上下文内多次出现。NLP&MT因此,领域适应性已经成为中文分词面临的一大挑战[9]。在现实应用中,需要分词的绝大部分文本并不带有来源、主题等标记数据[9]
。分词系统不能预先把所有可能的文本种类都训练好[9]。分词系统能贡献最高价值,发挥最高效益时,是针对新主题,新来源,带有许多未登录词的文本[9]。中文分词的一大挑战跨领域分词的一个显著特点是:NL5主要内容NLP&MT中文分词概况中文分词的新挑战本文主要方法参考文献模型及特征上下文及语义信息分词算法流程实验结果及总结主要内容NLP&MT中文分词概况中文分词的新挑战本文主要方法6本文主要方法NLP&MT模型及特征上下文及语义信息分词算法流程实验结果及总结本文主要方法NLP&MT模型及特征上下文及语义信息分词算法流7本文主要方法——模型及特征NLP&MT本文采用字词联合的CRFs模型。先将使用基于字的CRFs获得的候选词放入词图,然后再使用基于词的CRFs模型对词图中的词进行标注。训练时,使用最大似然估计,为了避免训练过载,使用高斯先验对参数进行规格化。解码时,用Viterbi算法。模型:特征模板:基于字的CRFs特征模板基于词的CRFs特征模板本文主要方法——模型及特征NLP&8本文主要方法——模型及特征NLP&MT基于字的CRFs:使用的特征模板:C-1,C0,C1,C-1C0,C0C1,C-1C1,T-1T0T1,并且加入AV[16]特征。表1基于字的CRFs特征模板本文主要方法——模型及特征NLP&9本文主要方法——模型及特征NLP&MT基于词的CRFs:采用的具体特征模板有:W0,T0,W0T0,T0T1,W0W1,其中,W表示词形,T表示词性,下标0和1分别表示相邻两个词的前词和后词。表2基于词的CRFs特征模板本文主要方法——模型及特征NLP&10本文主要方法NLP&MT模型及特征上下文及语义信息分词算法流程实验结果及总结本文主要方法NLP&MT模型及特征上下文及语义信息分词算法流11本文主要方法——上下文及语义信息NLP&MT“日本金融特任大臣①龟井静香(ShizukaKamei)周五(3月19日)发表讲话……②龟井静香此前就一直呼吁推出新一轮的大规模经济刺激计划……③龟井静香表示,昨日发布的土地价格调查报告显示……④龟井静香还呼吁日本央行直接买入国债来为政府赤字提供融资……金融市场对⑤龟井静香的评论应该不会有太大反应……”.提出假设:如果某个词在篇章中出现了一次,那么将会增加它下一次出现的可能性。也就是说,若某个字串在上下文中多次被当作候选词,则它很可能就是一个词。对此,本文用上下文变量来量化这个假设。上下文变量记录候选词的词形(w),词性(t),词出现的难易程度(Cost),该词作为候选词的频数(Frequency),该词作为最终切分路径中词节点的频数(rNum)。上下文信息:本文主要方法——上下文及语义信息NLP&M12NLP&MT本文主要方法——上下文及语义信息Al05A01=模范标兵表率榜样师表轨范楷范英模典型丰碑Al05A02=劳模劳动模范在查找某个候选词在词林中的同义词时,遵循着就近原则,因为两个同义词集合距离越近,其词义信息越接近。表3同义词词林编码规范语义信息:NLP&MT本文主要方法——上下文及语义信13本文主要方法NLP&MT模型及特征上下文及语义信息分词算法流程实验结果及总结本文主要方法NLP&MT模型及特征上下文及语义信息分词算法流14跨领域分词的分词算法流程如下:NLP&MT本文主要方法——分词算法流程Step1.使用基于字的CRFs得到3-Best路径,并且将路径中所有的节点加入到词图中。图1词图示例跨领域分词的分词算法流程如下:NLP&MT本文主要方法15NLP&MT本文主要方法——分词算法流程Step2.为词图中的每个候选词赋予属性和代价。具体步骤为:①若候选词为系统词典中的词,则直接将该词在系统词典中的属性及词代价赋给该候选词;②若候选词不在系统词典中,但在上下文信息词典中,则采用公式(1)对该候选词的出现代价进行加权;(1)其中,frequency是该候选词出现的频率;rNum是候选词作为正确结果的频率;cost’(w)是分词路径中候选词的出现难易程度;cost0(w)为上下文变量表中词条的原始代价。NLP&MT本文主要方法——分词算法流16NLP&MT本文主要方法——分词算法流程③若候选词不在上述两个词典中,则到同义词词林中查找该候选词的同义词,若能在系统词典中找到其同义词,则用系统词典中该同义词的相关信息代替该候选词相对应的信息;④若无法通过上述方法找到或代替该候选词,则用未登录词分类处理该候选词。具体分为四类:汉字,字母,数字,标点符号。它们的词性,分别赋为名词,字符串,数字,标点,而词出现的代价为词典中该类词性词语代价的平均值。Step3.构建词图后,用Viterbi算法根据公式(4)计算每条路径的分词代价,找到一条最佳路径,即代价最小的分词路径。公式(4)中的Cost(wi)和TransCost(ti,ti+1)分别通过公式(2)和公式(3)计算得到。(2)NLP&MT本文主要方法——分词算法流17NLP&MT本文主要方法——分词算法流程(3)其中,U(w)为关于当前词w的一元特征集合,B(t1,t2)是关于相邻的两个词的属性(这里仅为词性)的二元特征集合,λfk为特征fk在模型文件中的相应权重,变量factor为将特征权重转换为代价的放大系数。从以上公式可以看出,由于所有的特征函数都为二值特征函数,所以在计算词条的代价时,词出现的代价等于该词能表示的所有一元特征权重之和,属性集之间的转移代价为两属性集所能表示的二元特征函数的权重之和。(4)NLP&MT本文主要方法——分词算法流18本文主要方法NLP&MT模型及特征上下文及语义信息分词算法流程实验结果及总结本文主要方法NLP&MT模型及特征上下文及语义信息分词算法流19实验数据:系统词典是从2000年1-6月份的人民日报中抽取出来的,词性体系为相应的北大词性体系,词典中共含有85,000个词。本文采用的语义资源是同义词词林(扩展版),共包含77,343条词语。SIGHAN2010的跨领域简体中文训练和测试语料。训练基于词图的CRFs模型时,所用的语料是有词性标注的评测语料(1998年1月份人民日报)。NLP&MT本文主要方法——实验结果及总结实验数据:NLP&MT本文主要方法——20NLP&MT本文主要方法——实验结果及总结NLP&MT本文主要方法——实验结果及21该方法用基于字标注的CRFs模型得到3-Best路径,将路径中包含的所有候选词添加到词图中,充分利用篇章的上下文信息和同义词语义信息,在词的层面上从词图中选择代价最小的路径作为最终的分词结果。该方法很好地发挥了基于字标注的方法在发现未登录词上的能力,而且在分词过程中充分利用词汇的领域性信息,提高了领域性分词的分词结果。用Bakeoff2010简体中文测试语料进行开式测试,结果表明:该方法在四个测试领域中的三个领域的F值和OOV的召回率好于2010参加评测的最好成绩。本文获国家自然科学基金(No.61173100,No.61173101)资助。NLP&MT本文主要方法——实验结果及总结NLP&MT本文主要方法——实验结果及22主要内容NLP&MT中文分词概况中文分词的新挑战本文主要方法参考文献主要内容NLP&MT中文分词概况中文分词的新挑战本文主要方法23参考文献[1] XueNianwen.Chinesewordsegmentationascharactertagging.ComputationalLinguistics,2003,8(1):29-48.[2] LaffertyJ,McCallumA,PereiraF.probabilisticmodelsforsegmentingandlabelingsequencedata//ProceedingsofICML2001.ConditionalRandomFields:SanFrancisco:MorganKaufmann,2001:282-289[3] TsengH,ChangPichuan,AndrewG,etal.AconditionalrandomfieldwordsegmenterforSIGHANbakeoff2005//Procofthe4thSIGHANWorkshoponChineseLanguageProcessing.JejuIsland:ACL,2005:168–171[4] PengFuchun,FengFangfang,McCallumA.Chinesesegmentationandnewworddetectionusingconditionalrandomfields//ProcofCOLING2004.SanFrancisco:MorganKaufmann,2004:562-568[5] LowJK,NgHT,GuoWenyuan.AmaximumentropyapproachtoChinesewordsegmentation//Procofthe4thSIGHANWorkshoponChineseLanguageProcessing.JejuIsland:ACL,2005:161–164[6] HuangDegen,TongDeqin.ContextInformationandFragmentsBasedCross-DomainWordSegmentation.ChinaCommunications,2012,9(3):49-57[7] ZhangRuiqiang,KikuiGenichiro,SumitaEiichiro.Subword-basedtaggingbyconditionalrandomfieldsforChinesewordsegmentation//ProcofHLT-NAACL-2006.Morristown,NJ:ACL,2006:193-196[8] 黄德根,焦世斗,周惠巍.基于子词的双层CRFs中文分词.计算机研究与发展,2010,47(5):962-968[9] 黄居仁.瓶颈_挑战_与转机_中文分词研究的新思维//中国计算机语言学研究前沿进展(2007-2009):北京:中国中文信息学会,2009:14-19[10] GaoQin,VogelS.AMulti-layerChineseWordSegmentationSystemOptimizedforOut-of-domainTasks//ProcofCIPS-SIGHANJointConferenceonChineseProcessing.Beijing:ACL,2010:210-215[11] HuangDegen,TongDeqin,LuoYanyan.HMMRevisesLowMarginalProbability
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 基于云计算的2025年无人机物流配送路径仿真技术创新报告
- 高中信息技术粤教版选修3教学设计-2.3 网络域名及其管理
- 2025-2026学年课题买文具教学目标设计
- 2025-2026学年高尔夫教学设计比赛网站
- 公共关系的工作过程教学设计中职专业课-公共关系基础-社会工作事务-公共管理与服务大类
- 高中英语下学期第18周教学设计
- 高中信息技术浙教版:2-1搜索算法-教学设计
- 2025-2026学年高中物理教学设计手写
- 2025-2026学年课堂教学与写作教学设计
- 2025-2026学年风车教学流程设计
- 老年人认知障碍预防干预技术标准
- 2025国家义务教育质量监测小学四年级语文试题
- 《全国校园心理危机分级识别专业技术指导原则(试行)》
- 《跨境电子商务英语》课件-跨境电子商务的概念与特点
- 生产异常举手制度
- 施工安全课件
- (一模)榆林市2026届高三第一次模拟测试地理试卷(含答案详解)
- 雨课堂学堂云在线《人工智能原理》单元测试考核答案
- 高速公路收费站安全课件
- GJB3243A-2021电子元器件表面安装要求
- 2025年4月自考03450公共部门人力资源管理试题
评论
0/150
提交评论