(模式识别与智能系统专业论文)语音识别置信度研究.pdf_第1页
(模式识别与智能系统专业论文)语音识别置信度研究.pdf_第2页
(模式识别与智能系统专业论文)语音识别置信度研究.pdf_第3页
(模式识别与智能系统专业论文)语音识别置信度研究.pdf_第4页
(模式识别与智能系统专业论文)语音识别置信度研究.pdf_第5页
已阅读5页,还剩82页未读 继续免费阅读

(模式识别与智能系统专业论文)语音识别置信度研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

、 1 “鼍,j1 创新性声明 1 1 1 11 1 1i iii ii iit i i ii ii y 17 5 8 5 3 0 本人声明所呈交的论文是本人在导师指导下进行的研究工作及取得的研究 成果。尽我所知,除了文中特别加以标注和致谢中所罗列的内容以外,论文中不 包含其他人已经发表或撰写过的研究成果,也不包含为获得北京邮电大学或其他 教育机构的学位或证书而使用过的材料。与我一同工作的同志对本研究所做的任 何贡献均已在论文中作了明确的说明并表示了谢意。 申请学位论文与资料若有不实之处,本人承担一切相关责任。 - 4本人签名: 日期: 关于论文使用授权的说明 学位论文作者完全了解北京邮电大学有关保留和使用学位论文的规定,即:研究生在 校攻读学位期间论文工作的知识产权单位属北京邮电大学。学校有权保留并向国家有关部门 或机构送交论文的复印件和磁盘,允许学位论文被查阅和借阅;学校可以公布学位论文的全 部或部分内容,可以允许采用影印、缩印或其它复制手段保存、汇编学位论文。 本学位论文不属于保密范围,适用本授权书。 本人签名:丑彳影 导师签名:砂l 同= j 日期:7 尸lj ,弓。1 3日期:沙fj ,与u 日期:7 口j 口,匹 ,疆0f b 【, h 语音识别置信度研究 摘要 手机端的语音短信输入,可以免去人们手工输入短信的不便,有 着实际的应用需求,但是尚未得到很好的解决。因此短信语音识别成 为当前语音识别的一个热点问题。短信语音有语句短,口语化强的特 点,识别起来有很大的难度。短信语音识别要解决的主要问题有:手 机语音库的建设,识别系统开发,识别结果置信度评价等。 本文对短信语音识别问题进行了研究,建立了性能优越的短信语 料库和语音库,搭建了置信度评价系统。此外,还针对分类样本不平 衡问题做了初步的不平衡数据集分类问题研究。 本文的研究重点为短信语音语料库的建立和置信度分类中的特 征提取与特征选择,主要的工作如下: 1 建立了性能优越的短信语音语料库 良好的语音库和语料库的建立对于声学模型和语言模型的训练 都有很大的帮助作用,对于系统测试也必不可少。本文实现了短信注 音系统,根据短信语料的特性,选择了合理的语料选择算法从五十万 条原始短信中,自动选择出了6 0 0 0 句语音学角度丰富的短信语料。在 保证稀有三音子全部被选择出的前提条件下,使三音子尽量平衡。 6 0 0 0 句三音子理论覆盖率达到9 3 9 ,实际覆盖率达至a j l 0 0 。并以此 建立了2 0 0 人参与录音,时长超过3 0 0 d 、时的手机语音库。 2 置信度分类中的特征提取和特征选择 在语音短信输入的应用中,识别结果的可靠性是一个实际要解决 问题。传统的语音识别置信度方法基于各种静态特征进行分类判决, 而忽略了词与周围环境之间的关系所携带的信息。本文在一个词错误 率为1 4 0 2 的基线系统上,利用1 0 维静态特征做分类,比基线系统的 错误率降低了2 4 9 。进一步在静态特征的基础上提出了上下文特征 和动态特征,它们和静态特征组合在一起的特征分类效果比静态特征 提高了7 4 。但是并非所有特征都对分类效果有正面影响,过多的特 征不但带来信息的冗余,还会使分类速度变慢。针对这个问题,本文 将特征提取和特征选择引入到语音识别置信度的研究中,提出了用特 征提取的方法降低特征维数和用特征选择的方法从原始特征中选择 出一个有效的子集。实验表明本文提出的上下文和动态特征是相对重 要的分类特征,并且通过特征提取和特征选择可以得到有效压缩。 3 不平衡数据集分类 置信度分类所采用的实验数据为语音识别过程中所产生各种特 征。由于识别率较高,造成了正确样本数与错误样本数的比例接近到 了8 :1 。针对置信度分类模型训练中,正确样本数和错误样本数不平 衡的问题,作者对不平衡数据集分类问题进行了初步的研究。提出了 欠采样改进的办法,在正确类样本正确分类率下降不多的前提条件下, 使分类器对错误类样本的正确分类率得到了显著的提高。 关键词置信度手机平台短信语料库特征提取特征选择不平衡 数据集 鼍 r e s e a r c ho nc 0 栅i d e n c e a s u r eo fs p e e c h r e c o g n i t i o n a b s t r a c t v o i c es h o r tm e s s a g ei n p u ti nm o b i l ep h o n ec a ng i v ep e o p l eg r e a t c o n v e m e n c e i th a sp r a c t i c a l a p p l i c a t i o n ,b u th a sn o ty e tb e e nw e l l d e v e l o p e d t h e r e f o r e ,v o i c es h o r tm e s s a g er e c o g n i t i o nb e c a m eah o t i s s u ei ns p e e c hr e c o g n i t i o n b e c a u s eo ft h ec h a r a c t e r i s t i c so fs h o r t m e s s a g e ,i t sr e c o g n i t i o nc a nb ev e r yd i f f i c u l t t h em a i np r o b l e m so f v o i c es h o r tm e s s a g er e c o g n i t i o na r e :t h ec o n s t r u c t i o no fm o b i l ep h o n e s p e e c hd a t a b a s e ,r e c o g n i t i o ns y s t e md e v e l o p m e n t ,c o n f i d e n c em e a s u r e s o f r e c o g n i t i o nr e s u l t s t h ep a p e rr e s e a r c h e do nv o i c es h o r tm e s s a g er e c o g n i t i o n w r c c o n s t r u c t e da g o o ds p e e c h d a t a b a s ea n dt e x tc o r p u s ,a n db u i l ta c o n f i d e n c em e a s u r ee v a l u a t i o n s y s t e m i na d d i t i o n ,w eg a v e a p r e l i m i n a r ys t u d y o ni m b a l a n c e dd a t as e tc l a s s i f i c a t i o n t h er e s e a r c hf o c u s e so nf e a t u r ee x t r a c t i o na n df e a t u r es e l e c t i o ni n c o n f i d e n c em e a s u r ec l a s s i f i c a t i o na n di m b a l a n c e dd a t as e tc l a s s i f i c a t i o n t h em a i nr e s e a r c hc o n t e n t sa r ed e s c r i b e di nd e t a i l sa sf o l l o w s : t h ee s t a b l i s h m e n to fag o o ds p e e c hc o r p u si so fg r e a th e l pt ot h e t r a i n i n go fa c o u s t i ca n dl a n g u a g em o d e l t h i sp a p e ra n a l y z e dt h r e ek i n d s o fc o r p u ss e l e c t i o na l g o r i t h m s a c c o r d i n gt ot h ec h a r a c t e r i s t i c so fs m s c o r p u s ,ar e a s o n a b l ec o r p u ss e l e c t i o na l g o r i t h mw a sd e v e l o p e d 6 , 0 0 0 p h o n e t i c a l l yr i c hs m sm e s s a g e sw e r ec h o s e nf r o m5 0 0 ,0 0 0r a ws m s m a t e r i a l s i nt h ep r e c o n d i t i o no fa l lr a r et r i p h o n e sa r es e l e c t e do u to fr a w m a t e r i a l s ,w et r i e dt ob a l a n c et h e c o v e r a g er a t eo f6 0 0 0s m sr e a c h e d t r i p h o n e t h et h e o r e t i c a lt r i p h o n e 9 3 9 ,a n dt h ea c t u a lc o v e r a g er a t e r e a c h e d10 0 a n dw eb u i l tam o r et h a n30 0h o u r ss m s s p e e c hd a t a b a s e b a s e do nt h ec o r p u sw ec h o s e ,w h i c hi n v o l v e d2 0 0p e o p l e t r a d i t i o n a ls p e e c hr e c o g n i t i o nm e t h o d sb a s e do ns t a t i cf e a t u r e so fa w o r dt oj u s t i f yw h e t h e rt h ew o r di sc o r r e c t l yr e c o g n i z e do rn o t ,w h i c h 1嘎磊r n e g l e c t e dt h ei n f o r m a t i o nc a r r i e db yi t sc o n t e x t sa n dt h es u r r o u n d i n g e n v i r o n m e n t i nt h i sp a p e r , a14 1 w o r de r r o rr a t e ( w e r ) s p e e c h r e c o g n i z e r ( s r ) i su s e da st h eb a s e l i n es y s t e m ,a n d10 一d i m e n s i o ns t a t i c f e a t u r e sa c h i e v e d2 4 9 d e c l i n eo fc l a s s i f i c a t i o ne r r o rr a t e ( c e r ) c o n t e x tf e a t u m sa n dd y n a m i cf e a t i l i e sa r ee x t r a c t e di nr e l a t i o nt ot h e s t a t i cf e a t u r e s t h et o t a l4 2 d i m e n s i o nf e a t u r e sg e tab e t t e rc e ro f7 4 t h a ns t a t i cf e a t u r e s b u tn o ta l lt h e s ef e a t u r e sh a v eap o s i t i v ei m p a c to n t h ec l a s s i f i c a t i o n t o om a n yf e a t u r e sn o to n l yt a k er e d u n d a n ti n f o r m a t i o n , b u ta l s om a k et h ec l a s s i f i c a t i o np r o c e s st i m e c o n s u m i n g t os o l v et h i s p r o b l e m , f e a t u r ee x t r a c t i o nw h i c hc a ne x t r a c tp r i m ei n f o r m a t i o nf r o m o r i g i n a lf e a t u r e sa n df e a t u r es e l e c t i o nm e t h o dw h i c hc a ns e l e c te f f e c t i v e f e a t u r e sf r o mt h eo r i g i n a lf e a t u r es e ta r ep r o p o s e di nt h i sp a p e r m ,叼 e x p e r i m e n t a lr e s u l t ss h o wt h a tc o n t e x tf e a t u r e sa n dd y n a m i cf e a t u r e sa l e h e f f e c t i v ef e a t u r e sf o rc l a s s i f i c a t i o n a n dt h ef e a t u r e sc a nb ec o n s i d e r a b l y c o m p r e s s e dt h r o u g hf e a t u r ee x t r a c t i o na n df e a t u r es e l e c t i o n t h ee x p e r i m e n t a ld a t ao fc o n f i d e n c em e a s u r ec l a s s i f i c a t i o nc a m e f r o mt h ep r o c e s so fs p e e c hr e c o g n i t i o n a st h er e c o g n i t i o nr a t ei s r e l a t i v e l yh i g h ,t h er a t i oo fc o r r e c ta n dw r o n gt h en u m b e ro fs a m p l e sh a s r e a c h e d8 :1 t od e a lo ft h i sp r o b l e m i m b a l a n c e dd a t as e tc l a s s i f i c a t i o ni s d r a w ni n t os t u d y t h ea u t h o rc a r r i e do u tap r e l i m i n a r ys t u d yi d s c l a s s i f i c a t i o na n du s e dd o w n s a m p l i n gm e t h o dt os o l v et h i sp r o b l e m t h e c l a s s i f i c a t i o nr a t eo fw r o n gc l a s ss a m p l e sa p p r o v e dal o tw h i l et h e c l a s s i f i c a t i o nr a t eo fc o r r e c tc l a s sr a t eo n l yr e d u c e dal i t t l e k e yw o r d sc o n f i d e n c em e a s u r e f e a t u r ee x t r a c t i o nf e a t u r es e l e c t i o n m o b i l ep l a t f o r m c o r p u ss e l e c t i o n i m b a l a n c e dd a t as e t trjj - 雾 : 营 0 第一章 绪论 目录 l 1 1语音识别发展历史1 1 2 语音识别研究现状及发展趋势2 1 3 语音识别系统的鲁棒性问题3 1 a 语音识别置信度研究的意义4 1 5 本文研究工作和进展5 1 6论文结构6 第二章连续语音识别原理7 2 1 语音识别技术概述7 2 2 连续语音识别基本框架9 2 3 声学特征和声学模型1 0 2 3 1声学特征1 0 2 3 2 声学模型1 l 2 4 语言模型。1 2 2 5 解 码器1 3 2 5 1 帧同步v i t e r b i 解码1 4 2 5 2a 堆栈解码1 7 2 5 3 解码器输出,1 9 2 6 语音识别系统的性能评价。1 9 2 6 1 测试数据的选择2 0 2 6 2 识别精度2 0 2 6 3识别速度2 l 第三章短信语音语料库的建立 3 1语料库性能要求2 2 3 2短信注音。2 2 3 2 1 短信长度调整2 2 3 2 2 错别字和标点符号的处理2 3 3 2 3 数字的注音2 3 3 2 4 包含英文短信的处理:2 3 3 2 5 多音字的注音2 3 语音单元的选择和分类2 4 3 4几种三音子选择算法2 6 3 4 1算法一2 6 3 4 2 算法二2 7 3 4 3算法三2 9 3 5 本文采用的算法3 0 3 6 实验结果与分析3 2 3 6 1 各种语音单元覆盖率3 2 3 6 2 三音子频率分布3 3 3 7语音库的建立3 4 第四章语音识别置信度评价系统 4 1语音识别中的置信度问题3 6 4 2 置信度评价方法3 6 4 3 置信度研究方法综述3 7 4 3 1 基于预测特征的置信度方法3 7 4 3 2 基于后验概率的置信度3 8 4 a s v m 分类器介绍4 0 4 5 基于预测特征融合的语音识别置信度4 3 4 6实验结果与分析4 4 4 6 1 实验设定4 4 4 6 2 实验结果4 5 第五章置信度中的特征提取与特征选择4 6 5 1 上下文特征与动态特征的提出4 6 5 1 1 上下文特征4 6 5 1 2 动态特征。4 7 5 2 特征提取与特征选择方法介绍4 7 5 3 特征选择理论。4 8 5 3 1 特征选择方法的分类4 8 5 3 2 特征选择作为搜索问题4 9 5 ,3 3 特征选择算法四要素4 9 5 4 主成分分析( p c a ) 5 0 5 5 基于s v m 的递归特征消除法5 2 5 6 实验结果与分析。5 3 5 6 1 实验设定5 4 _ 一 t | j 5 6 2 实验评价标准5 4 5 6 3 实验系统。5 4 5 6 4 实验结果5 5 5 6 5 实验结果分析5 7 第六章不平衡数据集分类问题 6 1 不平衡数据集分类简介5 8 6 1 1 问题实质探讨5 8 6 1 2 不平衡数据分类的性能评价5 9 6 2 常用的不平衡数据分类方法。6 0 6 2 1 基于数据采样的方法6 0 6 2 2分类方法6 1 6 2 3 综合方法6 2 6 3 基于欠采样技术的s v m 分类6 2 6 3 1 模糊样本集修剪技术6 2 6 3 2 指导型欠采样技术“ 6 4 随机欠采样方法实验结果6 5 第七章总结与展望6 7 7 1论文总结6 7 7 2 研究展望。6 8 参考文献 致谢 6 9 7 5 攻读学位期间发表的学术论文目录。7 6 北京邮电大学硕士论文语音识别置信度研究 第一章绪论 在现实生活中,语言( 包括语音和文字) 是人们进行思想和情感交流的主要 工具之一,也是人类历史和文化传承的主要工具之一,包含着丰富的信息。随着 社会的不断发展,各种各样的机器逐步参与了人类的生产生活和社会生活。尤其 是计算机的出现与计算机技术的发展,彻底改变了人类的生活状态与生活水平。 随着计算机和互联网技术的飞速发展和日益普及,计算机的主要应用已经从简单 的数值运算向复杂的数据和信息处理方向发展,需要对丰富的音频和视频等数字 媒体信息进行管理。与此同时,提高人机交互效率的需求也日益突出,人们希望 在将来计算机能够真正“理解 人类的语言,可以通过。听一和“说”的方式与 用户进行交流。作为人际沟通最直接、最有效的手段,语音技术得到了众多研究 人员的重视。 手机是目前最常用的通讯工具之一,语音短信输入成为现阶段要解决的一个 重要问题,这就是短信语音识别问题。短信语音识别的基本任务就是把人类说话 的“语音”转换成对应的“文字”输入,免去了手工输入短信的不便。 短信语音有句子短,口语化强的特点,有实际应用需求,是当前语音识别研 究的热点。短信语音识别技术目前还是不很成熟,问题没有得到很好的解决,因 此本实验室与诺基亚研究院合作,共同开发语音短信输入系统。开发语音短信输 入系统,有这样几个实际问题需要解决: 1 ) 手机语音库的建立 2 ) 手机端语音识别系统的开发 3 ) 识别结果的可靠性判断,即错误提醒 4 ) 识别错误的纠正 本文的工作主要集中在前端和后端,即短信语音语料库的建设和搭建置信度 评价系统。 1 1 语音识别发展历史 语音识别的研究可以追溯n 2 0 世纪5 0 年代,a t & tb e l l 实验室实现了世界上 第一个语音识别系统_ a u d r e y 系统,虽然该系统仅能识别十个英文数字,但语音 识别系统速度优化算法研究是a u d r e y 的现意味着机器听懂人的语言不再是天 方夜谭,翻开了语音识别技术的第一页。 随后的6 0 年代,线性预测分析技术( l i n e a r p r e d i c t i o n ,l p ) 和动态时间归整算 北京邮电人学硕士论文 语音识别置信度研究 法( d y n a m i c t i m ew a r p i n g ,d t w ) 被成功的引入了语音信号处理中,解决了特 征提取以及不定长匹配的动态时间对准问题,为特定人孤立词识别技术带来了曙 光。 7 0 年代,l p 技术和d t w 技术基本成熟,基于线性预测倒谱和d t w 技术的特 定人孤立词语音识别系统得到了实现。尤其值得一提的是,这期间提出了矢量量 化( v q , v e c t o rq u a n t i z a t i o n ) 和隐马尔可夫模型f f i m m ,h i d d e nm a r k o vm o d e l s ) 理论。大词汇量连续语音识别系统的开发已初见端倪。 8 0 年代,a t & tb e l l 实验室r a b i n 礴科学家把原本晦涩的h m m 纯数学模型 工程化,使得h m m 模型为更多研究者所了解和认识。同时人工神经元网络( a n n ) 在语音识别中也得到了成功应用。 9 0 年代也就是多媒体时代,很多国际著名公司比如m m 、a p p l e 、a t & t 等都 为语音识别的实用化开发投以巨资。语音识别系统从实验室走向了实用。这一时 期,半导体和集成电路技术得到了突飞猛进的发展,语音识别的研究热点也开始 从p c 机上转移到了嵌入式设备上。 嵌入式语音识别技术的出现有着其必然的原因,半导体和集成电路技术的突 飞猛进,基于嵌入式系统的便携式移动设备( 比如手机,掌上电脑等等) 的普及, 使得语音识别应用于嵌入式设备成为可能。此外嵌入式设备的体积较小,既没有 较大的屏幕来进行信息的提示,也没有足够的空间容纳类似鼠标和键盘等输入设 备,这更使得语音成为输入的最理想选择。 1 2 语音识别研究现状及发展趋势 目前语音识别技术在实验室研究中,精度己经达到了相当的高度。例如:美 国的c a r n e g i em e l l o n 大学开发的s p h i n x 系统将识别和语言理解结合在一起,很 好的完成了非特定人、大词汇量的连续语音识别任务【l 】。2 0 0 3 年,i b m 在康柏i r a q 掌上电脑上实现了大词表的两级搜索语音识别系统,识别任务包括1 4 7 5 条歌名, 词表大小为3 6 9 9 词,测试集包含1 3 7 6 条,误识率为2 4 ,0 5 6 倍实时,存储量为 2 2 m b 2 1 。此外,m m 在其大词汇量连续语音识别引擎v i a v o i c e 的基础上研究开 发了嵌入式v i a v o i c e ( e m b e d d e dv i a v o i c e ) ,在各项应用中取得了一定的成绩。值 得一提的是,国内语音行业的领军人物中科信利公司开发的嵌入式语音识别引擎, 在2 0 0 词的情况下识别率不小于9 5 ,2 0 0 0 词的情况下识别率不小于9 0 ,并且 能满足实时性。 通常情况下,市场上产品的性能会比实验室产品的性能和技术落后几年。但 是,目前阶段市场上也不乏优秀的语音识别商用系统。比如:日本n t t 的a n s w e r 系统,它用于银行业服务系统,可以识别1 6 个词( 数字0 9 以及6 个控制词) ,人们 北京邮电人学硕士论文语音识别置信度研究 可以通过电话和该系统打交道取得必要信息。2 0 0 6 年美国无线运营商s p r i n t n e x t e l 向商业客户推出了语音识别服务,用户按一个按钮就可以对b l a c k b e r r y 手机 口述电子邮件收信者姓名和邮件内容,最高速度为每分钟2 0 个词。2 0 0 2 年日本一 家研究机构设计了一个用于汽车信息查询的嵌入式语音识别系统,其中间件是在 s h 3 微处理器( 6 0 m h z c p u ) 上实现的,对于2 0 0 0 词的词表,识别率达到9 3 , 速度为0 6 5 ,r o m 仅用了2 5 6 k b ,r a m 5 0 0 k b 。 从当前语音识别技术的现状可以总结出:首先,国内的发展水平与国际领先 水平还有一定的距离,目前国内只有少数几个走在前端的企业在做这一市场。其 次,嵌入式设备的应用比桌面上的应用更加的广泛,市场的需求量更大,多数研 究机构或者企业已然转战于嵌入式领域。第三,连续语音识别的应用不如孤立词 识别成熟,并且词表受限。同时,我们也看到了语音识别的典型应用已经扩展到 电信系统、银行服务系统、车载系统等更多的领域,也将必然有着更大的发展前 景。 语音识别系统速度优化算法研究中科院声学所的权威人士用四个字概括了 语音识别技术的发展趋势,也就是“非、鲁、自、学 这四个字。 “非”是指非特定入,目前非特定人系统的应用越来越广泛,但是训练系统 的适应人群,尤其是口音的适应面仍然存在局限性,因此加强发音模型研究和方 言移植是个重要的研究方向。 “鲁”就是鲁棒性,语音识别的应用环境五花八门,需要有很强的语音增强 技术。此外利用麦克风阵列技术可以只拾取目标说话人方向的语音,而不采集其 他方向的语音。 “自 是指自然,想要让用户感觉是在和人进行对话,就需要采用有限状态 语法网络、对话管理、统计语一言模型和关键词一识别等技术来满足。 “学”就是自学习和自适应,包括自动适应用户的口音和说话习惯用语。这 就要求对声学模型和语言模型有自适应技术,要求优化模型的架构和管理程序以 满足系统的需要。 1 3 语音识别系统的鲁棒性问题 语音识别系统的鲁棒性问题,是语音识别技术走向实际应用的主要问题,包 括两个方面:一是移植问题,在语音识别技术走向实际应用过程中,人们发现, 一个在实验室中非常成功的语音识别系统( 识别率可以达n 9 0 以上) ,在实际 应用环境中,效果往往不是很理想,识别率甚至可能不到5 0 ,根本无法使用; 二是拒识问题,就是在系统遇到非预期的输入时,拒绝识别,防止误操作,这对 检测系统或命令识别系统来说尤其重要。 3 北京邮电大学硕士论文语音识别置信度研究 语音识别系统移植性差的根源在于训练和应用的不匹配性:训练数据不可能 包含所有的说话人、说话方式和背景噪声等,这样,训练出来的模型就与实际应 用存在不同程度的差异,导致模型精度下降,识别率降低。为了提高系统对应用 环境的鲁棒性,可以通过声学特征的补偿来实现,如各种抗噪算法,也可以通过 模型层的自适应调整来实现,通常这两种方法是结合在一起使用的。为了调整系 统的模型参数,我们往往需要花费较大的精力去准备训练数据,对模型进行有监 督的自适应调整。如果我们能够从系统在实际应用环境下的输出结果中挑选出正 确的结果,对系统模型参数进行无监督的自适应调整,那么系统的性能将会在实 际应用过程中不断提高陬咖。 语音识别中的拒识问题,则是实际应用中提出来的:在实际应用环境下,系 统接收到非预期输入的情况是在所难免的,如果系统没有拒识的能力,在收到非 预期输入时也根据最大似然的识别结果作出动作,则会出现很多误操作,带来许 多的不便。 语音识别系统鲁棒性的这两个典型问题,实际上可以归结为同一个问题,即 置信度( c o n f i d e n c em e a s u r e ,c m ) 问题。所谓置信度问题,就是在没有参考答 案的情况下,如何让计算机对语音识别结果的可靠性给出一个“客观 的度量, 从而使得系统可以根据这个可靠性的度量,对识别结果的对错进行判决。利用置 信度信息,我们就选择识别结果可靠性比较高的部分,对系统模型进行无监督自 适应,提高系统性能;或者根据识别结果的置信度,对识别结果可靠性比较低的 结果进行拒识,减少系统的误操作。 可见,置信度问题的解决,对提高语音识别系统的鲁棒性具有重要作用。 1 4 语音识别置信度研究的意义 置信度的研究对提高语音识别系统鲁棒性,促进语音识别技术走向实际应用 具有重要意义。从具体应用角度来说,置信度研究的主要意义包括以下几个方面: ( 1 ) 提高孤立词语音识别系统拒识能力:语音识别系统的识别率是系统的一个 重要性能指标,但是,在实际应用中,对集外词语音的拒识能力也具有重要意义, 可以减少系统的误操作,提高系统的可靠性。因此,一个实用的语音命令识别系 统,不但要给出识别结果,还要给出相应的置信度,通过门限控制系统的误操作。 ( 2 ) 提高关键词检测系统的检测效率:目前关键词检测系统的主要机制就是先 给出足够多的候选,降低系统漏报;然后用置信度度量方法,确认这些候选哪些 是比较可信的,降低系统误报。关键词检测系统希望同时降低系统的误报率和漏 报率,因此,其性能的好坏从根本上取决于置信度的区分能力口4 1 。 ( 3 ) 大词汇量连续语音识别系统的无监督自适应:m l l r 自适应算法是目前最 4 北京郎电大学硕士论文语音识别置信度研究 常用的说话人快速自适应方法,对于提高语音识别效果有比较明显的作用。但是, 如果使用全部的识别结果作为自适应数据,则错误识别的部分将会影响自适应的 效果,因此,需要引进置信度算法,将识别比较可靠的数据挑出来,将识别不可 靠的数据去掉,这样就可以从数据选择的角度改善系统自适应的效果州。 ( 4 ) 在声学模型轻监督训练中的应用:电话和广播语音识别系统中最大的困难 就是标注语料比较少,训练数据不充分,人工标注的工作量非常大,不可能得到 太多训练数据。目前通常采用的方法是用现有的通用声学模型,加上相关的语言 模型去自动标注电话和广播语音语料,将标注比较可靠的语料用于训练,如此循 环,逐步提高系统性能。可见,这里的置信度应用和无监督自适应中的应用比较 类似,只是这里处理的语料比较大,训练数据比较充分,无监督自适应的数据量 通常比较少州o 】。 ( 5 ) 在识别结果融合中的应用:不同的语音识别系统,虽然识别率相差不大, 但识别结果上的差异往往比较明显,这就说明这些系统中具有相当的互补性。如 果能够根据置信度将这些识别结果整合成一个新的结果,就可以提高系统的识别 率m 一例。 由此可见,置信度在语音识别系统中具有重要的应用价值,对推动语音识别 技术走向实用化具有重要意义,这些也是置信度的主要应用场合。正是这些应用 价值,促进了置信度研究的发展,但是,置信度问题本身也是语音识别中的一个 很难解决的问题,其重点和难点将在下一节中进行分析。 1 5 本文研究工作和进展 短信语音识别是现阶段新出现的研究方向,有着广阔的应用前景。短信语音 识别的核心问题是置信度的评价。本文总结了语音识别置信度的研究现状,建立 了性能优越的短信语料库,搭建了置信度评价的平台。由于识别过程中产生的特 征种类相对较多,而手机的处理能力有限,这就需要。作者提出了自己的创新观 点,并用实验验证了观点的正确性。 本文的工作主要集中在三个方面: 第一,建立了性能优越的短信语料库。良好的语料库对于声学模型和语言模 型的训练都有很大的帮助作用。本文从五十万条原始短信中,自动选择出了6 0 0 0 条语音学角度丰富的短信。在保证稀有三音子全部被选择出的前提条件下,使三 音子尽量平衡。6 0 0 0 句短信的三音子理论覆盖率达到9 3 9 ,实际覆盖率达到1 0 0 。 并以此建立了一个时长l o o d 、时的短信语音库。 第二,搭建了一个基于预测特征融合的置信度判断平台。针对解码过程,提 出了动态特征和上下文特征的概念。静态特征,动态特征及上下文特征一个组成 5 北京邮电大学硕士论文 语音识别置信度研究 了4 2 维预测特征。通过特征选择得到了有效地1 6 维特征子集,分析了哪些特征对 于置信度的判断是最有效果的。通过特征提取( p c a ) 的方法,将4 2 维预测特征转 化为1 3 维主成分特征。采用s v m 分类器分别对特征选择和特征提取得到的特征 做做置信度判断,对比了两种方法的结果,分类效果都比只用静态特征时有大幅 提高。 由于语料库的录音工作需要较多的人力及时间投入,本文完成时,短信语料 库的录音工作才刚刚结束。基于短信语料库的声学模型和语言模型的训练也需要 一定的时间。所以本文所搭建的置信度评价系统是基于桌面语音的,但是研究方 法是针对短信语音识别应用中所面临的问题。 第三,针对分类模型训练中,正类样本和负类样本不平衡的问题,本文初步 研究了不平衡数据集的分类问题。提出了欠采样改进的办法,在正确类样本正确 分类率下降不多的前提条件下,使分类器对错误类样本的正确分类率得到了显著 的提高。 1 6 论文结构 本文整体分为七章。 第一章为绪论部分,这一部分介绍了语音识别的发展历史,提出了短信语音 识别这样一个新的课题。介绍了本文的研究重点语音识别置信度研究及其在 短信语音识别中的应用。 第二章主要介绍一般语音识别技术的通用理论知识以及评价语音识别系统 的一般方法。 第三章介绍了设计语料库的基本原理与方法,包括语料库性能要求、短信注 音、语音单元的选择和分类、三音子选择算法等内容。 本文的重点工作在第四章和第五章。第四章介绍了语音识别置信度研究的基 本方法,评价体系以及本文所搭建的置信度评价系统。 在第五章中,重点介绍了本文的主要创新工作,即把特征提取和特征选择的 方法引入到语音识别置信度的研究中,选择出了一个有效的特征子集,实验表明 同时本文提出的上下文和动态特征是相对重要的分类特征,并且通过特征提取和 特征选择可以得到有效压缩。 第六章针对置信度判断中存在的不平衡数据集分类问题,介绍了不平衡数据 集分类的研究方法。提出了欠采样改进的办法,在正确类样本正确分类率下降不 多的前提条件下,使分类器对错误类样本的正确分类率得到了显著的提高。 第七章对全文进行了总结并提取了展望。 6 北京邮电大学硕士论文 语音识别置信度研究 第二章连续语音识别原理 为了后面章节的需要,本章节将介绍语音识别技术相关的理论基础知识。主 要包括:语音识别基本框架、声学模型、语言模型、解码算法以及系统评测标准 等。此章节分为两大部分,第一部分主要介绍语音识别几个重要领域的基本理论 方法。第二部分重点介绍如何来评测一个识别系统的性能。 2 1 语音识别技术概述 语言作为人类最重要最自然的交流工具,是人类获得信息的重要来源之一。 用语音实现人与计算机之间的交互,主要包括三项技术,即语音识别、自然语言 理解和语音合成。自动语音识别( a u t os p e e c hr e c o g n i t i o n ) 的主要任务是完成 语音到文字的转变;自然语言理解( n a t u r a ll a n g u a g eu n d e r s t a n d i n g ) 则是完成 文字到语义的转换;语音合成( s p e e c hs y n t h e s i s ) 是用语音方式输出用户想要的 信息,即将文字转变为语音。 语音识别技术作

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论