(信号与信息处理专业论文)自动语音识别特征补偿方法研究.pdf_第1页
(信号与信息处理专业论文)自动语音识别特征补偿方法研究.pdf_第2页
(信号与信息处理专业论文)自动语音识别特征补偿方法研究.pdf_第3页
(信号与信息处理专业论文)自动语音识别特征补偿方法研究.pdf_第4页
(信号与信息处理专业论文)自动语音识别特征补偿方法研究.pdf_第5页
已阅读5页,还剩53页未读 继续免费阅读

(信号与信息处理专业论文)自动语音识别特征补偿方法研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 摘要 本文主要研究的是自动语音识别中的前端噪声鲁棒性问题。众所周知,语音 识别的根本目的就是使机器能够听懂人类的语言。在当前的实验室环境下,很多 识另i 土系统已经能够达到很好的性能。但在实际环境中,由予噪声的复杂多变和未 知因素的干扰,系统性能往往会急剧下降以至于远远不能达到实用的目的。因此, 噪声鲁棒性一直是语音识别研究中一个非常重要的方面。噪声鲁棒性关键问题是 解决训练环境和测试环境的失配。实际中这种失配是由语音采集环境的影响( 如 加性噪声、信道畸变等) 以及说话人自身的影响( 如说话风格、口音等) 引起的。 为了使语音识别系统在不同噪声环境下仍能具有较好的性能,就需要采用各种方 法来增强识别系统的鲁棒性。 噪声鲁棒性的方法多种多样,但一般来说可分为前端方法和后端方法两大 类。前端方法集中于对语音信号本身或者语音特征做处理,达到消除或尽可能抑 制噪声影响的效果;后端方法主要集中于增强语音声学模型自身的宽容度和适应 能力,使模型能够容忍一定程度的噪声,或者调整模型参数使之跟上噪声环境的 变化。本文主要是对噪声鲁棒性的前端方法进行了研究,改善了一些已有的方法, 也提出了一些新的方法。 首先,在本文第一章中,对语音识别技术的发展历程做了简单的概述,并重 点介绍了一下基于统计建模框架下自动语音识别系统的几个重要组成部分。 由于实际中噪声的多样化,相应的噪声鲁棒性方法也有很多种,每种方法都 有它的特点和适用范围。正是针对这种情况,论文在第二章中分别从鲁棒性特征 的提取、语音增强、特征补偿增强、模型补偿四个方面对噪声鲁棒性问题进行 了比较全面的介绍和总结。 在本文第三章中,首先介绍了基于显式模型的阶矢量泰勒级数( v t s ) 离 线特征补偿算法,但是离线算法在实用时并不完美,它最大的缺陷在于其巨大的 运算量极大的降低了系统处理的效率。因此,在离线算法的基础上我们提出了高 实时性的一阶v t s 特征补偿算法,它在保证离线算法性能的同时,大大提升了 算法处理的实时性。 虽然在第三章中介绍的高实时性的一阶v t s 特征补偿算法取得了不错的效 果,但是它和离线算法一样,对噪声均采用的是单高斯建模,而在实际环境中噪 声是复杂多样的,这种情况下单高斯可能不能很好的描述噪声参数的分布特性, 从而使干净语音估计不准最终影响到识别性能,针对以上问题,在本文第四章中, 提出了对噪声多高斯建模的一阶v t s 特征补偿算法。实验结果表明,噪声多高 摘要 斯建模方法还是能够在一定程度上提高系统识别的性能。 关键词: 自动语音识别,噪声鲁棒性,矢量泰勒级数,特征补偿,高实时性, 多高斯建模 i i a b s t r a c t a b s t r a c t t h i st h e s i sf o c u s e so nt h er e s e a r c ht o p i co fn o i s e - r o b u s tf r o n t - - e n do fa u t o m a t i c s p e e c hr e c o g n i t i o n ( a s r ) a sw e a l lk n o w ,t h eu l t i m a t ep u r p o s eo fs p e e c hr e c o g n i t i o n i st om a k et h ec o m p u t e ru n d e r s t a n dh u m a ns p o n t a n e o u sl a n g u a g e a n dn o wm a n y m a t u r es y s t e m sh a v eg o tf a i r l yh i g hs p e e c hr e c o g n i t i o nr a t ei nl a b o r a t o r y h o w e v e r , t h es y s t e m sp e r f o r m a n c ei st o om u c hw o r s et ob eu s e di nr e a le n v i r o n m e n tb e c a u s e o fd i s t u r b a n c eo fv a r i o u sn o i s e sa n du n k n o w nf a c t o r s t h e r e f o r e ,t h en o i s er o b u s t n e s s i sav e r yi m p o r t a n tp a r to fs p e e c hr e c o g n i t i o nr e s e a r c h t h ed e r i v a t i o no fn o i s e r o b u s t n e s sc o m e sd o w nt ot h em i s m a t c hb e t w e e nt r a i n i n ga n dt e s t i n ge n v i r o n m e n t i n o u rr e a lw o r l d ,t h i sm i s m a t c hi sc a u s e db yt h ei n f l u e n c e so ft h es p e e c hc o l l e c t i n g e n v i r o n m e n t ( a d d i t i v en o i s e ,c o n v o l u t i o n a ln o i s e ,e t c ) a n ds p e a k e rv a r i a t i o n s ( s p e a k i n gs t y l e ,a c c e n t , e t c ) i no r d e rt om a k et h es p e e c hr e c o g n i t i o ns y s t e mm a i n t a i n t h eg o o dp e r f o r m a n c eu n d e rt h e s en o i s ec o n d i t i o n s ,w em u s tu s ev a r i o u sm e t h o d st o e n h a n c et h er o b u s t n e s so fs y s t e m t h e r ea r ev a r i o u sn o i s e - r o b u s tm e t h o d st h a tc a i lb er o u g h l yc l a s s i f i e di n t ot w o c a t e g o r i e s :f r o n t - e n dm e t h o d sa n db a c k - e n do n e s t h ef r o n t - e n dm e t h o d sf o c u so n m i t i g a t i n gt h ee f f e c to f n o i s e sb yp r o c e s s i n gt h es p e e c hs i g n a lo rs p e e c hf e a t u r e ,w h i l e t h eb a c k e n do n e st r yt oa d j u s tm o d e l s t om a k em o d e l sa n dr e a le n v i r o n m e n t s m a t c h e d t h i st h e s i si s p r i m a r i l yf o c u s e do nt h er e s e a r c ho ff r o n t e n dn o i s e r o b u s t m e t h o d s ,i n c l u d i n gt h ei m p l e m e n t a t i o na n di m p r o v e m e n to fs o m ee x i s t i n ga l g o r i t h m s , a n ds u f f e s t i o n o fs e v e r a ln e wm e t h o d s f i r s t l y ,t h i st h e s i sg i v e sa no v e r v i e wa n ds u m m a r yo nt h ed e v e l o p m e n th i s t o r yo f a s ri nc h a p t e ro n e ,a n dh i g h l i g h t st h es e v e r a li m p o r t a n tc o m p o n e n t so fa s rw h i c h i sb a s e do nt h es t a t i s t i c a lm o d e l i n g t h e r ea r em a n yk i n d so fn o i s e r o b u s tf r o n t e n dm e t h o d st od e a lw i t ht h e d i v e r s i t yo fn o i s e s ,a n de a c hh a si t sc h a r a c t e r i s t i c sa n di n p o i n tr a n g e t h e r e f o r e , g e n e r a li n t r o d u c t i o n sa n dc o n c l u s i o n sf o rn o i s e r o b u s tf r o n t - - e n dm e t h o d sa r em a d ei n c h a p t e r2f r o mf o u ra s p e c t si n c l u d i n gr o b u s tf e a t u r ee x t r a c t i o n ,s p e e c he n h a n c e m e n t , f e a t u r ec o m p e n s a t i o n e n h a n c e m e n ta n dm o d e lc o m p e n s a t i o n i n c h a p t e r3 ,w ef i r s t l yi n t r o d u c et h eo f f l i n ef e a t u r ec o m p e n s a t i o nb a s e do n f i r s t o r d e rv e c t o rt a y l o rs e r i e sf v t s ) a p p r o x i m a t i o nu s i n ge x p l i c i tm o d e l l i n go f e n v i r o n m e n t a ld i s t o r t i o n b u tt h eo f f l i n ea l g o r i t h mi sn o ta p p l i c a b l ei np r a c t i c e t h e b i g g e s td i s a d v a n t a g eo ft h eo f f l i n ea l g o r i t h mi si t sh u g ec o m p u t a t i o nw h i c h w i l lr e s u l t i i i a b s t r a c t t h el o ws y s t e mp r o c e s s i n ge f f i c i e n c y t h e r e f o r e ,ah i g hr e a l - t i m ef i r s t o r d e rv t s a p p r o x i m a t i o ni sp r o p o s e d ;i tk e e p st h ep e r f o r m a n c ec o m p a r a b l et o t h eo f f i i n e c o n d i t i o n ,a n da l s og r e a t l yi n c r e a s e st h ee f f i c i e n c yo ft h ea l g o r i t h m a l t h o u g ht h eh i g hr e a l - t i m ef i r s t o r d e rv t sa l g o r i t h mi nc h a p t e r3h a sa c h i e v e d g o o dp e r f o r m a n c e ,b u ta st h eo f f i i n ea l g o r i t h m ,i ta s s u m e s t h a tf o re a c hs e n t e n c e ,t h e n o i s ef e a t u r ev e c t o ri nc e p s t r a ld o m a i nf o l l o w so n es i n g l eg a u s s i a np d f , (probabilitydensity f u n c t i o n ) t h i sm a yb en o tas u i t a b l ea s s u m p t i o no ft h en o i s ed i s t r i b u t i o n b e c a u s eo ft h ed i v e r s i t ya n dc o m p l e x i t yo fn o i s e s s oaf i r s t - o r d e rv t sa p p r o x i m a t i o n w h i c ha s s u m e st h en o i s ef e a t u r ev e c t o ri nc e p s t r a ld o m a i nf o l l o w sm u l t i g a u s s i a n p d fi sp r o p o s e di nc h a p t e r4 t h ee x p e r i m e n t a lr e s u l t ss h o wt h a tt h i sm e t h o dc a n i m p r o v et h es y s t e m sp e r f o r m a n c et os o m e e x t e n t k e yw o r d s :a s n o i s er o b u s t n e s s ,v t s ,f e a t u r ec o m p e n s a t i o n ,h i g hr e a l t i m e , m u l t i g a u s s i a nm o d e l i n g i v 中国科学技术大学学位论文相关声明 本人声明所呈交的学位论文,是本人在导师指导下进行研究工作 所取得的成果。除已特别加以标注和致谢的地方外,论文中不包含任 何他人已经发表或撰写过的研究成果。与我一同工作的同志对本研究 所做的贡献均已在论文中作了明确的说明。 本人授权中国科学技术大学拥有学位论文的部分使用权,即:学 校有权按有关规定向国家有关部门或机构送交论文的复印件和电子 版,允许论文被查阅和借阅,可以将学位论文编入有关数据库进行检 索,可以采用影印、缩印或扫描等复制手段保存、汇编学位论文。 保密的学位论文在解密后也遵守此规定。 作者签名: 场剑 和| o 年5 只 第1 章绪论 1 1 自动语音识别背景介绍 第1 章绪论 语音是人类之间进行交流最自然、最快捷和最有效的工具。在计算机日益普 及的当代社会,键盘是人和计算机之间最主要的交互方式。试想一下,如果最终 实现了用语音代替键盘和计算机进行自由的交互,这将是影响人类社会发展一大 飞跃。因此,实现人机交互一直是这几十年来研究的热点,它的实现依赖于语音 识别、语音理解和语音合成等几项关键的技术。其中,自动语音识别( a u t o m a t i c s p e e c hr e c o g n i t i o n ,a s r ) 是其中最重要、最具挑战的核心技术之一,它属于模 式识别和人工智能的范畴,其目的就是研究出一种具有听觉功能的机器,把人类 的语言转换为相应的文本、命令等等,便于计算机能理解人的意图并做出相应的 反应。 实际上,让“机器”能够理解人类的语言,一直是我们长期追求的目标,具 有广泛的应用前景。语音接口的计算机将对目前电脑的操作方式产生大变革,引 起操作系统的革命;听写机将进一步加速办公的自动化,同时也使得某些非拼音 文字的输入不再是一种需要专门训练的技能。这样,在某些特定情况下,就可以 将操作者的双手解放出来( 比如汽车行驶中进行电话拨号等) ,这必然将会给人 们的工作生活带来巨大的变化。 语音识别涉及声学、信号处理、模式识别、人工智能、信息论、语言学、计 算机科学以及生理学和心理学等多个方面。下面简单介绍一些语音识别的发展历 史( f u r u i2 0 0 5 ) 。 语音识别的研究工作开始于2 0 世纪5 0 年代初期。在1 9 5 2 年,贝尔实验室 的研究者使用模拟元器件提取语音中元音的频谱共振峰信息,得到了第一个特定 说话人的孤立英文数字识别系统( d a v i se ta 1 1 9 5 2 ) 。1 9 5 6 年和1 9 5 9 年美国r c a 研究所和m i tl i n c o l n 实验室分别成功研发了1 0 音节特定人语音识别系统和l o 元音非特定人语音识别系统( f o r g i ee ta 1 1 9 5 9 ) 。但是这个时期只是语音识别研 究的初始阶段,在理论和技术水平上都不够,这些系统主要依靠不同元音频谱间 的差别来对不同发音进行区分,因此都未取得明显的成功。 6 0 年代,计算机产业的迅速发展,软、硬件环境的改善推动了语音识别的 发展。这时期的重要成果是提出了动态规划( d p ) ( s a k o ea n dc h i b a1 9 7 8 ) 和 线性预测分析( l p ) ( i t a k u r a1 9 7 5 ) 技术,它们对整个语音识别、语音合成、 语音分析、语音编码的研究发展都产生了深远的影响。 第1 章绪论 7 0 年代,语音识别领域取得了一系列重大的突破。一方面,线性预测分析 技术在理论上得到进一步发展,动态时间归整( d y n a m i ct i m ew a r p i n g ,d t w ) ( v i n t s y u k1 9 6 8 ) 技术也基本成熟,实现了基于线性预测倒谱和d t w 技术的特 定人孤立语音识别系统。另一方面,提出了矢量量化( v e c t o rq u a n t i z a t i o n ,v q ) ( g r a y1 9 8 4 ) 和隐马尔可夫模型( h i d d e nm a r k o vm o d e l ,h m m ) ( f e r g u s o n1 9 8 0 ) 理论。尤其是基于h m m 理论的出现,绝对是语音识别领域一个里程碑的事件, 开创了语音识别的新时代。现在市场上很多成熟的系统都是基于这个理论架构。 其中包括i b m 公司的v i av o i c e 系统和微软公司的w h i s p e r 系统( h u a n ge ta 1 1 9 9 5 ) 最为有名。与此同时,英国剑桥大学开发的h t k 系统是被广泛使用的软 件开发包。下面所述的所有实验都是在这个系统的支持下完成的。 8 0 年代,隐马尔科夫模型在语音识别中的理论和应用趋于完善( s c h w a r t ze t a 1 1 9 8 5 ;j u a n ge ta 1 1 9 8 6 ;r a b i n e r1 9 8 9 ;r a b i n e ra n dj u a n g1 9 9 3 ) ,导致了语音 识别的快速发展。现在大部分更的识别系统都是基于该统计模型。并且主要的焦 点逐渐由孤立词语音识别转向连续语音识别。1 9 8 8 年美国卡内基梅隆大学运用 v q 和h m m 技术研制出了非特定人、大词汇量、连续语音识别系统s p h i n x 系 统( l e ee ta 1 1 9 8 8 ;l e ee ta 1 1 9 9 0 ) ,它可以理解由1 0 0 0 个单词构成的4 2 0 0 个 句子,被认为是语音识别历史的一个里程碑。 9 0 年代以后,一方面,随着多媒体时代的来临,迫切需要语音识别从实验 室走向实用,出现了产品化的热潮。许多发达国家如美国、日本以及i b m 、a p p l e 、 a t t 、n t t 等著名公司都为语音识别系统的实用化开发研究投以巨资,研制 出了大词汇量连续语音识别系统。另一方面,随着对语音识别相关技术的深入研 究,鲁棒性语音识别、隐马尔科夫模型及人工神经网络的结合成为了新的研究热 点,并且一些模式识别、机器学习方面的技术也被应用于语音识别中( 比如支持 向量机) 。 进入新世纪以后,自动语音识别的研究向深度和广度两方面进一步发展。提 出了d a r p a 全球自动语言开发计划( g l o b a la u t o n o m o u sl a n g u a g ee x p l o i t a t i o n , g a l e ) ,它使得逐渐成熟的各项语音识别技术得到了空前的整合( k a w a h a r ae t a 1 1 9 9 6 ) 。同时出现了更加自由的口语式语音识别( s p o n t a n e o u ss p e e c h r e c o g n i t i o n ,s s r ) 的研究。同时在鲁棒性语音识别方面,针对1 2 1 语识别,一种 基于检测的方法( s o l t a ue ta 1 2 0 0 7 ) 被提出来,它主要用于检测口语中语义重要 的部分,这种识别和确认技术的结合,提高了语音识别的精度。另外,由于区分 性训练的深入研究,声学模型也得到了极大的提高。最后,近几年也出现了语音 识别的新应用,比如语音搜索( 比如g o o g l e 推出的w o r ds e a r c h 系统) 等,受 到了越来越多的关注。 2 第1 章绪论 我国从7 0 年代后开展研究,从引进国外理论技术入手,结合汉语特点进行 研究,取得了不少成果并逐步形成了“汉语语音识别”学科。 1 2 基于统计建模框架的自动语音识别 从信息论的角度来看,语音识别的过程可以如图1 1 所示。从图1 1 可以看 出,语音识别是指将语音转化为文本的过程。但是这个过程本身非常的复杂,通 常的做法是利用贝叶斯公式: 矿= a r g m a x p ( w l x ) 铺咿学 ( 1 1 ) 在贝叶斯统计建模框架下加以解决,其出发点非常直观,就是从众多备选的 此序列中找出最接近当前目标的那个。其中,x 为特征观察向量,为备选的 词序列。p ( ) 为语言模型( l a n g u a g em o d e l ,l m ) 概率,表示自然语言中词序 列形出现的概率。p ( x l 肜) 为声学模型( a c o u s t i c sm o d e l ,a m ) 概率,表示从 语音中提取的声学特征彳和词序列形之间的相似度,它一般可以通过预先设定 的概率分布或模型进行统计。矿则是根据贝叶斯决策理论选择的最优结果,即 为语音识别的输出结果。 信息传输理论 语音识别过程 图1 1基于信息传输理论的语音产生和识别系统统计建模框架 1 2 1 语音特征参数的提取 语音识别系统一般由图1 2 中所示的几个重要的部分组成。从图中我们可以 看出,语音信号输入以后,我们首先需要得到语音的声学特征,特征提取的目的 在于将一段采集到的语音信号转化为计算机能够处理的语音特征向量序列,它是 后续处理的基础。一般来说,好的声学特征应该具备三大属性。首先并且也是最 重要的是由声学特征得到的声学模型应该具有良好的区分性。其次,特征的维数 3 第1 章绪论 要适中,考虑到语音信号本身的复杂性及实际使用中计算量的要求,维数不能太 低,否则区分性不会太好,但是太高会导致信息冗余和计算量较大的问题,给实 际运用带来困难。最后,就是特征需要具备鲁棒性,也就是特征本身的抗干扰性, 即不会由于说话人说话风格、背景噪声的影响而产生较大变化。 图1 2 语音识别系统的主要构成 目前,在语音识别中最常用的主要是m e l 频率倒谱系数( m e l f r e q u e n c y c e p s t r a lc o e f f i c i e n t s ,m f c c ) ( d a v i se ta 1 1 9 8 0 ) 和感知线性预测系数( p e r c e p t u a l l i n e a rp r e d i c t i o n ,p l p ) ( h e r m a n s k y1 9 8 0 ) 。在本文中的工作都是基于m f c c 特征,下面将对m f c c 加以简单介绍。 m f c c 考虑了人耳的听觉特性,并且没有任何的前提假设,它是将频谱转化 为基于m e l 频标的非线性频谱,然后再转换到倒谱域上,具有较高的计算精度。 人耳对约在1 0 0 0 n z 以上的声音的频率的感知不遵循线性关系,而是在对数频率 坐标上满足近似的线性关系。感知频率与实际频率的具体关系可以表示为: m e l ( f ) = 1 1 2 5 1 n ( 1 + f 7 0 0 ) 0 f f ( 1 2 ) 它是将语音频域划分为一系列的三角滤波器序列,即m e l 滤波器组的中心频 率在m e l 标度频率域上呈等间隔分布。所有滤波器总体上覆盖从0 h z 到奈奎斯 特频率,如下图( 图1 3 ) 所示: 图1 3 梅尔刻度三角滤波器组 4 第l 章绪论 语音信 号预处加窗 a f f ta m e l 滤八a 理 叫叫波器叫 2 1 9 】 d c t 吖 图1 4m f c c 的提取流程 m f c c 的提取过程如图1 4 所示,具体步骤如下: ( 1 ) 语音信号经过“模数转换 得到数字信号,然后经过去直流、预加重,提 升高频信息。 ( 2 ) 分帧,加汉明( h a m m i n g ) 窗,变为短时信号,以消除由于分帧引起的信 号边缘锐变。 ( 3 ) 用f f t 将以上得到的时域信号转化为频域信号,并取模的平方进一步得 到它的短时能量谱( 识别中一般只用幅度谱或功率谱,相位信息丢失) 。 ( 4 ) 使用以下m e l 域滤波器组对短时能量谱进行滤波,再取对数对幅度进行压 缩。得到对数能量谱: 口( 坂) = m l x ( 七) 1 2 以( i i ) 1n l = l ,2 ,。,m ( 1 3 ) k = l m 为滤波器的个数,m 为每一个滤波器,x ( d 为信号的f f t 变换。 三角滤波器的频率响应是: 0 k f ( m + 1 ) 玩( 叫而可丽2 ( k 两- f ( 丽m - l 碉) ) f ( i - 1 ) k f ( m ) ( 1 4 ) i = f 巧i ;可i j 2 瓦( 石f i ( 二m 巧+ 豇i 孑) 彳- ;k i ) 西万厕厂( 聊) 后厂( 肌+ 1 )( ( 聊+ 1 ) 一厂( 肌一1 ) ) ( ( 胁+ 1 ) 一厂( 朋) ) jv ”7 一一。v f ( m ) 是三角滤波器的中心频率,满足: m e l ( f m + 1 ) - m e l ( i f r e i ) = m e l ( s m ) - m e l ( f m - 1 ) ( 1 5 ) ( 5 ) 对数滤波器组幅度或能量通过d c t 变换得到倒谱系数,即m f c c 。d c t 变换主要是用于降维及去除维与维之间相关性。 这时得到的m f c c 加上对数能量为静态特征,再经过计算差分系数后( 一 般计算阶、二阶差分( f u r u ie ta 1 1 9 8 6 ) ) ,就得到我们常用的声学特征。 1 2 2 声学模型 上世纪6 0 年代末7 0 年代初,b a u m 等研究人员率先提出了h m m ( b a u me t 5 第1 章绪论 a 1 1 9 6 7 ) 的概念,后来经过c m u 的b a k e r 等成功将h m m 概率体系运用于自动 语音识别领域,时至今日,h m m 是当今语音识别系统进行声学建模的主流方法, h m m 及其相关的技术是目前语音识别系统最重要的核心技术之一。 h m m 模型是语音信号时变特征的有参表示法,是一个双随机过程。它由相 互关联的两个随机过程共同描述信号的统计特性,其中一个是隐蔽的( 不可观测 的) 具有有限状态的m a r k o v 链,用来描述状态之间的转移。另一个是与m a r k o v 链的每一状态相关联的观察矢量的随机过程( 可观测的) ,用来描述状态和观测 值之间的统计对应关系。隐蔽m a r k o v 链的特性要靠可观测到的信号特征揭示。 这样,语音等时变信号某一段的特征就由对应状态观察符号的随机过程描述,而 信号随时间的变化由隐蔽m a r k o v 链的转移概率描述。按照随机函数的特点, h m m 模型可分为离散隐马尔可夫模型( 采用离散概率密度函数,简称d h m m ) 和连续隐马尔可夫模型( 采用连续概率密度函数,简称c h m m ) 以及半连续隐 马尔可夫模型( s c h m m ) ,它集中了d h m m 和c h m m 特点。 一个典型的h m m ( 如图1 5 ) 模型通常可以描述为兄= ( ,死a ,b ) ,它由两 部分组成,首先是用参数 ,a 来描述产生状态序列。其次是用b 描述观测值序列。 其中n 为模型中状态数目。它包含以下要素:l 、观察矢量o = d ,) ,2 、状态集 合s = 墨) ,3 、状态转移概率矩阵彳= 嘞) ,4 、初始状态概率分布万= 乃) ,5 、 概率分布函数矢量b = 包( x ) ) ;并且他们还满足以下条件: a q 0 ,6 ( x ) o ,乃0 占,占 ( 1 6 ) a j j = ln ) a x = l 乃= l “ 1 = 1 f - l a 3 3a 4 4 包( ) 也( ) 良( ) 图1 5h m m 模型 6 第1 章绪论 在了解h m m 后,为了在实际中真正的使用,h m m 必须解决三个问题: l 、概率计算前后向算法 h m m 模型产生语音序列的概率是最基本也是最重要的问题。即给定模 型五= ( 彳,b ,万) 和观察事件序列o = ( o ,0 :,) ,计算观察序列d 在模型五下 发生的概率e ( 0 1 名) ,可以得到: e ( o l 五) = p ( o s l 五) = p ( s l g ) p ( o l s ,力) ( 1 7 ) ss 其中p ( o is ,兄) 为在给定状态序列s = ( 五,是。,s r 一。) 条件下,h m m 产生观 测序列的概率,有: 7 e ( o ls ,五) = 兀p ( d ,is , ,五) = ( d ,) 玩:( 0 0 。( o o ( 1 8 ) p ( si 彳) 为产生状态序列s = h 屯,岛一。 的概率,状态序列 s = h 屯,5 n ) 是指h m m 从开始以概率气的概率跳转到状态墨,再以气屯 的跳转概率跳转到岛,如此不断跳转下去直至跳转到最后一个状态曲。由于 状态序列本身也是一个随机变量,它也要受到马尔科夫链的约束,可以得到 状态产生概率为: r p ( s i 允) = 气兀毛 ( 1 9 ) 因此最终得到概率计算公式为: e ( o l 旯) = 气( d 。) 口盹玩:( d :) 。即b , r ( o r ) ( 1 1 0 ) s 但是式( 1 1 0 ) 给出的理论计算方法需要对模型所有可能的n t 个( n 为 h m m 总共的状态数) 状态序列求和,计算量相当大,所以有学者提出了更 高效的算法前后向算法,用来计算语音信号相对于给定模型的似然度。它是 一组迭代算法,用来计算前向概率q ( f ) 和后向概率屈( 力,前向概率q ( f ) , 表示h m m 通过一系列状态转移,产生部分观测值d k ,并最终在t 时刻时 停留在状态i 的概率。后向概率屈( f ) ,表示h m m 在f 时刻处于状态i 的条件 下,其后的部分观测值为吒如的概率。则算法流程为: 7 第1 章绪论 ( 1 ) 初始化 t r l ( i ) = r r , b , ( 0 1 ) l f n f l , ( i 、= l l l n ( 2 ) 迭代 , a t + l ( f ) = q ( 加少6 f ( d 州) = l 屈( d = 屈+ 。( j ) a q b j ( o 州) ,= l ( 3 ) 概率计算: 2 0 ( o l :t ) = q ( 帽( f ) l t t 一1 ,1 i n l t t - 1 ,1 i n ( 1 1 2 ) ( 1 1 3 ) 2 、最优状态序列搜索 给定模型名= ( 么,b ,万) 和观察事件序列d = ( d 。,d :,听) ,估计系统模型产 生d 时最可能经历的状态序列q = ( 口。,g l i 。g ,) 。即在给定模型彳和观察向量d 情况下,找出名中最可能生成0 的状态序列: s = a r g m a x p ( o ,s i 旯) ( 1 1 4 ) 实际上寻找最优状态序列s + 的过程,就是利用得到的观测值o 来得到 h m m 中状态信息的过程,从根本上说就是对0 进行解码,对应于识别的过 程。解决这一问题的经典方法为v i t e r b i 算法,该算法概述为: ( 1 ) 初始化 k ( f ) = 乃6 j ( _ ) ,旦( f ) = o l f n ( 1 1 5 ) ( 2 ) 递归计算 巧( f ) = m 。;f a x v , 一l ( _ ) 口】6 j ( _ ) l f s ;2 s s r ( 1 1 6 ) e ( f ) = a r gm a x 一l ( 歹) 口,i 】 i t ( oi 见) ,其中允为原模型参数,互为重 估的模型参数。总的来说,b a u m w e l c h 算法可以分为以下四步: ( 1 ) 模型参数初始化。 ( 2 ) 构造辅助函数q ( 互l 兄) 。 ( 3 ) 最大化辅助函数q ( 五i 旯) ,得到更新后的模型参数五。 ( 4 ) 设置五= 五,跳转到( 3 ) ,不断迭代直至目标函数收敛。 在解决以上三大经典问题后,就可以用h m m 进行声学建模了。首先我们需 要选择基本的声学单元,并为不同的声学单元建立不同的h m m ,常用的基本声 学单元有:音素、音节、词等。此外,考虑到实际发音中存在严重的协同发音 ( c o a r t i c u l a t i o n ) 现象,每一个声学单元都受到左右相邻单元的的强烈影响,因 此一般需要采用能反映上下文信息的上下文相关( c o n t e x td e p e n d e n t ,c d ) 的 声学单元,比如三元音素( t r i p h o n e ) 等。 9 第1 章绪论 1 2 3 语言模型 语音识别得到的候选词序列不一定能够构成自然语言中的句子,只有符合句 法的才能被接受,而语言模型正是提供这方面的语法和语义的约束。最基本最朴 素的语言模型最初是由香农( s h a n n o n ) 提出,它是一个n 连词的模型,用来解 决在给定的字母序列情况下下一个最有可能出现的字母是什么的问题。 语言模型可以分为基于规则和基于统计两种。基于规则的语言模型通过专家 知识总结出语法、语义规则,然后利用这些规则排除声学语音层的搜索识别中不 合语法或语义规则的结果。基于统计的语言模型,通过对大量的文本信息的统计, 提取不同词条的出现概率及其相互关联的条件概率。由于基于文本的统计具有机 器学习的优点,从而获得了广泛的应用。目前语音识别中用到的语言模型,很大 部分都是n g r a m 统计语言模型。下面就介绍一下常用的n g r a m 统计语言模型。 设词条序列为w = w 。w 2 w w ,其出现的先验概率尸( 形) 可以表示为: p ( 形) = p ( w l w 2 w m ) = p ( w 1 ) p ( w 21w o e ( w , ih ) 尸( w im 屹w l 1 ) ( 1 1 9 ) l = 兀尸( w jfw 。w 2 w w 一,) s = l 其中,第一项为p ( w 。iw l w o ) = p ( w 1 ) ,并且假设此序列的生成过程为一个词 间跳转的n 1 的马尔科夫过程,即当前词条的条件概率只与前n 1 的词条相关: r ( 形) = 兀尸( 嵋1w , 一。w 。- 2 - 一+ 。) ( 1 2 0 ) 从上式可以看出,当前词条的出现概率可以根据前n 1 个词条预测。这 也正是n - g r a m 语言模型名称的由来。n g r a m 语言模型可以通过对训练语料进行 统计,用频率计数来估计,即: 盹i w j _ i w , _ 2 w i _ n + i ,= 篇矧 2 。 其中,( m 一。掣一+ 。) 是词序列w f 一,w j 叫一w f 一州在训练语料中出现次数。 可以看到,随着阶次的提高,语言模型的准确度及精细程度都相应增加,但 是也意味着系统开销也会大大增加,同时还会遇到语言模型训练数据稀疏的问 题,导致某些词序列的样本出现概率为0 ,这时可以采用一些平滑算法来处理 ( k a t z1 9 8 7 ) 。实际上,一般的n g r a m 也是很难估计的,在实际应用中一般采 用n = 2 、n = 3 和n = 4 的情况,即通常所说的二元文法( b i - g r a m ) 、三元文法 ( t r i g r a m ) 和四元文法( 4 - g r a m ) 语言模型。 第1 章绪论 1 2 4 解码搜索 语音识别的最终目的是得到语音输入对应的文本信息,这就需要通过一定的 上搜索算法在解码器中找到最优的词序列矿作为输出结果。这时候如果没有任 何限制的话,仅仅在词这一级的搜索空间都可能已经非常巨大。因此,对如此大 规模的搜索进行压缩优化以达到计算机能够处理的程度是一个在语音识别实用 化进程中不得不面对的问题。 基于动态规划思想的维特比算法( v i t e r b ia l g o r i t h m ) ( v i t e r b i1 9 6 7 ) 是当 今主流解码器普遍采用的压缩搜索空间的方法。对于v i t e r b i 算法,它还用到高 斯选择、b e a n 裁剪、语言模型前看( l a n g u a g em o d e ll o o k a h e a d ) 、词法前缀 树( l e x i c a lp r e f i xt r e e ) 等方法,它们主要是用于在解码过程中的同步快速概率 计算和搜索空间裁剪。 1 3 章节的组织结构 本文主要讨论自动语音识别中噪声鲁棒性方法中基于特征补偿的语音识别 的相关问题。文中设计的主要内容和创新点包括:基于高实时性的一阶v t s 特 征补偿算法的讨论;基于噪声多高斯建模的一阶v t s 特征补偿算法的讨论等。 下面对后续章节的组织安排做简单的介绍:本文一共分为5 个章节,在本章 绪论中,主要是对语音识别的历史及基于统计模型的语音识别框架做了介绍;第 2 章主要介绍了当前比较常用的噪声鲁棒性方法:第3 章中,将对离线的一阶 v t s 特征补偿算法进行介绍,并在此基础上提出了高实时性的一阶v t s 特征补 偿算法:第4 章将主要介绍基于噪声多高斯建模的一阶v t s 特征补偿算法的基 本原理,并进行了相应的实验分析。最后将对本论文进行总结,并进行一些讨论, 探索后续可能的研究方向。 第2 章鲁棒性前端方法回顾 2 1 引言 第2 章鲁棒性前端方法回顾 通常,我们在实验室得到的识别系统虽然在相同的环境下能够取得良好的识 别性能,但是由于实际中存在着各式各样的噪声干扰和未知因素的影响,使语音 的训练环境和测试环境之间存在着失配,往往导致性能急剧下降。通过大量试验 统计表明,对识别系统鲁棒性影响比较大的因素主要有: ( 1 ) 加性噪声。这是比较常见的噪声干扰,实际中背景噪声通常是加性的,比 如发动机声音和散弹噪声等。通常采集到的语音信号一般都是干净语音信 号和背景噪声之和,这种带噪的语音信号在时域上可以用一个加性模型来 描述。根据加性噪声对时间的变化情况可以分为平稳的和非平稳的噪声, 一般来说我们遇到的大都是平稳噪声( 如发动机声音) ,并且也相对比较 容易处理,可以采用谱减法及本文中重点介绍的一阶v t s 特征补偿算法 均可以达到比较理想的识别效果。但对于非平稳的噪声,大多数情况下都 难以处理,一般需要自适应方法和其它降噪方法配合使用。 ( 2 ) 信道影响。实际中用于识别的语音信号一般都是通过麦克风录制,但是麦 克风不同,频率响应一般也各异,在理想情况下,麦克风的频率响应对语 音信号的作用相当于干净语音信号卷积一个线性时不变系统( l i n e a rt i m e i n v a r i a n t ,l t i ) ,这个卷积过程将会带来原干净语音信号频率的改变, 由

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论