已阅读5页,还剩118页未读, 继续免费阅读
(模式识别与智能系统专业论文)基于语音数据异质性信息处理的声学建模研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 摘要 语音信号中包含丰富的信息,除文本内容外还包括很多与语音识别任务无关的部分。 这些信息的典型来源包括说话人性别、年龄、情绪、说话风格、背景噪声、传输信道等因 素,在本文中被统一定义为异质性信息。 对语音数据异质性信息的处理正日趋成为当前语音识别界研究的重点之一,其原因有 二:首先,异质性因素的存在将会导致声学模型参数的非线性畸变,从而造成误识率的升 高和模型推广能力的下降:其次,随着语音识别技术的发展,越来越多的异质性相对明显 的现场数据参与到了声学模型的训练过程中。因此无论从研究的必要性还是从紧迫性方面 来看,数据异质性信息的处理问题都亟待解决。 认识问题的过程是分析和综合的统一。作为全文立论的基础之一,本文对当前主流语 音识别系统的框架结构和作为本文主要研究对象的声学模型的训练准则进行了全面综述, 一方面界定本文的研究目的和意义,另一方面指出区分度训练对于解决语音数据异质性问 题大有稗益。作为全文立论的基础之二,我们多方面分析了异质性信息对语音数据分类和 建模可能造成的影响。在这些基础之上,本文对目前可行的解决方法做了全面的总结,并 依据算法的实质将它们分为多套模型分而治之、消除、描述和利用四大类。分析的目的是 为了综合并提出解决方案。为此我们分别进一步研究了多套模型分而治之、消除、描述 几种簧略,并遵循“在变化中寻找相对不变性并为之建模”的指导思想,提出了一种协 同消除和描述策略的裔翠决方案。 本文针对语音数据中蕴畲的异质性信息问题进行了深入的研究,涉及到了许多语音识 别的基本问题,主要的工作和贡献有: 提出了一种基于非语境因素扩展决策树技术和输出分布覆盖度测度的分析方法,这 种方法不但可以定性反映异质性因素对于语音数据分类和建模可能造成的影响,而 且在一定程度上进行定量描述; 提出了一种基于最大似然增益的模型组合算法,该算法一方面可以避免由于数据分 类建模而可能带来的训练数据稀疏问题,同时包含一套灵活的模型组合和选择机 制; 发展了一种推广的特征空间说话人自适应训练算法,将说话人自适应训练对于数据 异质性的消除能力推广到了声学模型的参数共享机制中,从而进一步提高了模型的 推广能力: 将因素分析方差建模技术应用到说话人识别系统中,并研究了在训练数据严重稀疏 条件下的多种模型参数共享技术,显著提高了说话人识别系统的性能。借助因素分 析,本文还研究了m f c c 各维特征对说话人识别任务的贡献; 摘要 深入研究部分共享方差建模技术,并针对半共享方差模型研究模型、变换参数联合 优化算法,基于贝叶斯信息准则的模型选择算法以及基于塌大互信息准则下的参数 重估公式,显著提高了大闻汇量连续语音识别系统的声学建模能力; 提出了协同特征空间说话人自适应训练和半共享方差建模的消除加描述解决方案。 协同中的两种策略取长补短,相互促进:描述策略弥补了消除策略无法完全去除数 据中所存在异质性的问题,同时提高了无监督自适应每次迭代的解码精度;消除簧 略的应用可以减小数据的异质性,降低分布的方差,为进一步使用描述策略创造了 一个良好的基础。 对于语音数据的异质性处理问题,在全面分析的基础上,本文的工作做了一个有益的 探索,但这仅仅是一个开始。 关键词:大词汇量连续语音识别,声学模型,语音数据分类与建模,隐马尔可夫模型,说 话人自适应训练,方差建模 第“页 英文摘要 一一 o np r o c e s s i n go fe x t r a n e o u sa c o u s t i cv a r i a t i o n s a n da c o u s t i cm o d e l i n gi ns p e e c hr e c o g n i t i o n a u t h o r :d i n gp e n g s u p e r v i s o r :x ub o a b s t r a c t t h e r ea r em a n yk i n d so fu n w a n t e dv a r i a b i l i t i e so t h e rt h a n p h o n e t i c v a r i a t i o n s c o n t a i n e di ns p e e c hs i g n a l s ,w h i c hm i g h tc a u s e db yd i f f e r e n ts p e a k e r s ,s p e a k i n g s t y l e s ,c h a n n e lo ra c o u s t i ce n v i r o n m e n t s s i n c et h o s ev a x i a t i o n se x i s t e di nt h e d a t aa r en o td i r e c t l yr e l a t e dt ot h em o d e l i n gp u r p o s e ,i nt h i s p a p e r ,t h e ya r e n a m e da se x t r a n e o u sa c o u s t i cv a r i a t i o n s t h e h i g hn e c e s s i t i e st od e a lw i t ht h ee x t r a n e o u sa c o u s t i cv a r i a t i o n sa x et w o f o l d sf o ro n et h i n g ,i nt h et r a i n i n gp h a s e ,t h ee s t i m a t e dm o d e l m a y b ed i v e r g e d s u b s t a n t i a l l yb ya l s om o d e l i a ge x t r a n e o u sv a r i a t i o n s f o rt h es e c o n dt h i n g ,i n r e c e n ty e a r st h e r eh a sb e e nat r e n dt o w a r d su s i n gf o u n dt r a i n i n gd a t a ,i nw h i c h g r e a t e rv a r i a b i l i t yc a l lb es e e nt h a nt h es p e c i a l l yc o l l e c t e dd a t a ,t ob u i l ds p e e c h r e c o g n i t i o ns y s t e m s t os o l v et h e p r o b l e m ,i nt h i st h e s i s ,w ef i r s tp r e s e n t e dac o m p r e h e n s i v ea n a l y - s i so nt h ee f f e c t so fe x t r a n e o u sa c o u s t i cv a r i a t i o n sm a y i m p o s e o nt h ec l a s s i f i c a t i o n a n dm o d e l i n go fs p e e c hd a t a t h e nw e b r i e f l yr e v i e wa n dc a t e g o r i z et h ep o s s i b l e s o l u t i o n si n t od i v i d ea n dc o n q u e r ,r e m o v a l ,m o d e l i n ga n du t i l i z a t i o nf o u rb r o a d c l a s s e s a f t e rh a v i n gt a k e nt h ed i v i d ea n dc o n q u e r ,r e m o v a l ,m o d e l i n g s t r a t e g i e s i n t of u r t h e rs t u d i e s ,w ep r o p o s eas y n e r g yw h i c hc o m b i n e sf e a t u r es p a c es p e a k e r a d a p t i v et r a i n i n ga n ds e m i t i e dc o v a r i a n e em o d e tt od e a lw i t ht h ep r o b l e m i nt h i st h e s i s ,w ep r e s e n t e dac o m p r e h e n s i v es t u d yo nt h ep r o c e s s i n go fe x - t r a n e o u sa c o u s t i cv a r i a t i o n s t h ee f f o r t sa r ef o l l o w i n g s : w ep r o p o s eas i m p l eb u tc o n v e n i e n ta n a l y s i ss c h e m et oe x p l i c i t l ys h o wt o w h a te x t e n tt h ei m p a c to fv a r i o u ss o u r c e so fe x t r a n e o u sv a r i a t i o n sm a y i m p o s e do i lt h ec l a s s i f i c a t i o na n dm o d e l i n go fs p e e c hd a t ab yt h eu s eo f g e n e r a lf e a t u r e sd e c i s i o nt r e e ( g f d t ) a n do u t p u tc o v e r a g em e a s u r e an e wf r a m e w o r kb a s e do ng f d tn a m e da sm a x i m u ml i k e l i h o o dm o d e l c o m b i n a t i o ni s i n t r o d u c e d b yu s i n gt h i sf r a m e w o r k ,t h et r a i n i n gd a t a s p a r s ep r o b l e mb r o u g h tb yt r a i n i n gd a t as p l i t t i n gc o m m o n l ye m p l o y e di n t h ed i v i d ea n dc o n q u e rs t r a t e g yc a nb ea u e v i a t e da n daf l e x i b l em o d e ls e l e c t i o np r o c e d u r ei sa d v a n c e d w ee x t e n d st h ef e a t u r es p a c es p e a k e ra d a p t i v et r a i n i n g ( f s a t ) s c h e m et o n o r m a l i z et h ee f f e c t so ft h o s ev a r i a b i l i t i e si np h o n e t i cd e c i s i o nt r e ec o n s t r u c t i o np r o c e s s ,t h u st oi m p r o v et h e g e n e r a l i z a t i o na b i l i t yo fa c o u s t i cm o d e l i n g 第i i i 页 英文摘要 a p p l y i n gt h ef a c t o ra n a l y s i sm o d e l d e a lw i t ht h ec o n t r a d i c t i o nb e t w e e n i n t ot h es p e a k e rr e c o g n i t i o ns y s t e mt o t h es p a r s et r a i n i n gd a t aa n dt h en e e d o fs p a t i a lc o r r e l a t i o nm o d e l i n g v a r i o u sp a r a m e t e rt y i n gs t r a t e g i e sw e r e s t u d i e dt of u r t h e ri m p r o v et h es y s t e mp e r f o r m a n c e m o r e o v e r ,t e n t a t i v e a n a l y s i so f t h e i m p o r t a n c e o ft h e c e p s t r a l c o e f f i c i e n t sf o rt h es p e a k e ri d e n t i t y - r e l a t e di n f o r m a t i o nw e r ea l s op r e s e n t e d i nt h i st h e s i s ,w ea l s os t u d i e dt h es e m i t i e dc o v a r i a n c e ( s t c ) m o d e lt o a l l e v i a t et h ep r o b l e mo fw e e ks p a t i a lc o r r e l a t i o nm o d e l i n g t h t e et e e h n i q u e s ,i n c l u d i n gt h ej o i n to p t i m i z a t i o no fb o t ht r a n s f o r m a t i o na n dh m m p a r a m e t e r s m o d e ls e l e c t i o nb yb a y e s i a ni n f o r m a t i o nc r i t e r i o n a n dt h ed i s c r i m i n a t i v ee x t e n s i o nb a s e d0 1 2m a x i m u mm u t u a li n f o r m a t i o nc r i t e r i a f o r t h es t ca x ea l s od e r i v e d l a s t l y , w ep r o p o s e da n d e v a l u a t e dan e wr o b u s tt r a i n i n gs t r a t e g yt 0s y n e r - g i z et h en o r m a l i z a t i o na b i l i t yo ff s a ta n dt h em o d e l i n ga b i l i t yo fm o d e l s t c t h en a t u r eo ft h ep r o p o s e ds c h e m ei st ob e t t e rm o d e lt h er e s i d u a l v a r i a t i o n sr e s u l t e df r o mf s a t b ys t c t os u m u p ,i nt h i st h e s i s ,w eh a v em a d eal o to ff r u i t f u la t t e m p t sa n ds i g n i f i - c a n tp r o g r e s s e so nt h ep r o c e s s i n go fe x t r a n e o u sa c o u s t i cv a r i a t i o n s b u ti ti ss t i l l ab e g i n n i n g k e yw o r d s :l a r g ev o c a b u l a r yc o n t i n u o u sa u t o m a t i cs p e e c hr e c o g n i t i o n ,a e o u s t i cm o d e l i n g ,s p e e c hd a t ac l a s s i f i c a t i o na n dm o d e l i n g ,h i d d e nm a r k o vm o d e l s , s p e a k e ra d a p t i v et r a i n i n g ,c o v a r i a n c em o d e h n g 第i v 页 独创性声明 本人声明所递交的论文是我个人在导师指导下进行的研 究工作及取得的研究成果。尽我所知,除了文中特别加以标 注和致谢的地方外,论文中不包含其他人已经发表或撰写过 的研究成果。与我一同工作的同志对本研究所做的任何贡献 均已在论文中作了明确地说明并表示了谢意。 签名日期: 关于论文使用授权的说明 本人完全了解中国科学院自动化研究所有关保留、使用 学位论文的规定,即:中国科学院自动化研究所有权保留送 交论文的复印件,允许论文被查阅和借阅;可以公布论文的 全部或部分内容,可以采用影印、缩印或其他复制手段保存 论文。 签名导师签名日期: 语音识别中数据异质性处理与声学建模研究 第一章绪论 直到今天,语音交互一直是人与人之间最自然、最重要的交流方式。而随 着科学技术的发展,人们生活中智能设备、通讯服务和多媒体工具日盏普及, 人类迫切需要一种便捷的方式以实现人与机器之间的自然交互,语音识别技术 因此应运而生。从语音识别技术产生的那一天起,人们就致力于赋予计算机类 似于人耳一样的听觉能力,通过对语音数据的分析与处理来获取蕴含其中的语 言信息作为智能设备应答以及高层次语义理解的基础。 无论从实用角度而言,还是科学研究角度来看,语音识别技术都具有重大 的意义: 随着智能设备的不断小型化和无线互连、无所不在的计算等现代理念的不 断深入人心,语音识别技术的对人类生活方式潜在地改变趋势不断地显现 出来; 对人类认知机理的研究与探索一直是科学研究的一个重要方向,虽然人们 已经从生理、心理、神经和认知等多个方面进行了长期的探索,但是还远 远没有解开其奥秘。通过对语音识别的研究,人们也希望籍此打开一扇通 向认识人类认知机理的大门; 人类如此丰富的语言现象和发音方式决定了这项研究的复杂度,三十年 来,语音识别技术的研究极大地推动了包括统计、模式识别、信号处理、 语音学、语言学、声学等多学科的发展,并且也是各种新算法、新技术实 践和检验的舞台。可以说语音识别是当前人工智能领域的一个最活跃、最 具挑战性的科学问题之一。 1 1 统计语音识别概述 当前主流语音识别技术是建立在贝叶斯决策理论框架之上的。解析地表述 如下,对于包含个词序列( 鲫,她,t o n ) 的一段语音,声音信号首先经过特 征提取转化为声学特征向量序列,o ( o 】,0 2 ,呀) ,在接下来的动态模型匹配过 第1 页 第一章绪论 程中,特征序列通过预先训练好的统计模型,尸( 0 ) 和p ( ) ,基于贝叶斯最 大后验决策准则,解码得到词序列咖。 i 缈= a r g 节p ( w l 。) _ a r g m x 警( 1 - 1 ) 在上式中p ( ) 通常被称为语言模型,表述出现词序列w 的概率,而p ( o l w ) n 其刻划了当出现词序列时产生声学特征序列o 的概率而被称为声学模型。另 外p ( 0 ) 描述了o 出现的平均概率,即: p ( d ) = p ( w ) p ( o i w 7 ) w ( 1 - 2 ) 由于在解码过程中声学特征序列d 给定,因此( 1 1 ) 式可以进一步化简为 w = = a r g m w a x p ( w ) p ( o i w ) 0 - 3 ) 通过上述分析可以看到,一个基本的语音识别系统主要由三个模块组成, 即特征提取、统计建模和解码。其中统计模块中包括声学模型、语言模型和发 音字典等分类所必须的先验知识。图1 1 给出了一个典型主流语音识别系统的原 理框架图。 下面我们将结合本文所采用的实验平台对语音识别系统的几个基本模块作 一简单综述。更加详细的内容可以参见文献f 1 1 。 1 1 1 声学特征提取 从模式识别最优分类器设计的角度来说,特征提取模块应该满足如下设计 要求: 所抽取的特征应尽可能地最大化声学建模单元的区分度 特征向量的维数应尽可能低,以为后续统计建模阶段稳健地估计模型参数 提供保证: 特征中所包含的信息应仅仅包括对声学分类有用的信息。 第2 页 语音识别中数据异质性处理与声学建模研究 图1 - 1 目前主流语音识另系统的原理框架图,参考文献【1 】。 目前主流语音识别系统通常采用的以下几种特征:m e l 化倒谱系 数( m f c c ) 2 和感知线性预测( p l p ) 3 。由于这些特征的提取主要是以模仿 人耳的听觉机理为依据,没有考虑后续分类器的设计,一些研究人员曾尝试 将区分度准则引入到特征提取的过程中,如| 4 1 。另外,对特征所作的某些线性 变换也已经证明了其有效性,最常见的如引入特征的动态一阶和二阶差分系 数( 5 】和线性判别分析( l d a ) 。前者的引入既可以增加语音谱中的动态信息,而 且有利于部分地消除背景噪声和信道失真造成的谱偏差。最近的一些研究成果 表明,在特征后处理阶段采用l d a 替代传统的动态差分技术可以进一步提高系 统的性能f 6 ,7 】。在文献 5 】中,作者提供了一个较为全面的概括,其它还有一些 基于听觉模型的特征提取方法,如文献f 8 9 1 ,在本文中不一一赘述。 本文实验所采用的特征包括1 2 维标准m f c c 系数,1 维规一化的能量以及它 们的一阶、二阶差分特征,为体现汉语的声调特征,再加上1 维规一化的基频特 征以及它的一阶、二阶差分特征,共4 2 维【1 0 卜 第3 页 第一章绪论 1 1 2 声学建模 在一个语音识别系统中,声学模型的任务是刻划每一个声学基本建模单元 的统计特性,这些特性既包括声学层面上的也包括时序上的。基本建模单元既 可以是词,也可以是字、音素等,这些建模基本单元在发音字典的所提供的约 束下,相互连接构成每一个系统所预先定义的词汇。对于本文所研究的大词汇 量连续语音识别系统而言,基本建模单元通常被定义为三音子( t r i p h o n e ) ,即包 括上下文语境的因素,这样建模主要是为了考虑上下文协同发音时对每个音素 所造成的影响。 为了描述连续语音中不可忽视的时序性,目前的语音系统大多数都 采用了隐马尔可夫( h i d d e nm a r k o vm o d e l ,h m m ) 模型来模拟语音的产生机 理 1 l 】。h m m 是个由状态网络构成的有限状态自动机,由于语音信号具有 短时平稳性,因此如果将语音划分为具有平稳统计特性的短时段分别对应 于h m m 的每个状态,就可以采用固定的参数统计模型来描述语音的特性了。 如下图示常用的b a k i s 模型( 12 ,该结构允许自跳转、前向跳转和前向跨越,包 括6 个状态( 其中只有3 个不同) 。如果以帧移1 0 m s 计,该结构所描述的三音子的 平均时长为6 0 m s ,最短时长为3 0 m s 。 结合式1 3 并采用一阶马尔可夫假设,声学模型可以进一步的表述为: p ( o f w ) = 尸( 。 ,s ) s 叫, = p ( 。( ) 8 , ,t 。1 2 币m 。a x r g p ( p ( s t h 一1 ) 1o r d e rm a r k o v p ( 魂k 一1 ) v i t e r b i ( 1 - 4 ) 上式中,状态序列s ( s 1 ,8 2 ,s r ) 表述了h m m 系统内部运行机制,系统输出为 观测序列o ( 0 1 ,0 2 ,即) ,由于状态序列不为外部所见,隐马尔可夫模型由此得 名。 通常需要使用如下参数来表述h m m :状态转移矩阵一4 ,其元素为o :。= p ( s t = j l s = ) ,表示系统从状态z 跳转到状态j 的概率;状态起始概率分布向 量”,其元素为巩;观测输出概率p ( d ( ) 陬) ,表示系统t 时刻处于状态兔时,观 第4 页 语音识别中数据异质性处理与声学建模研究 词 : 识 别 i 目 素 姥 山 - 由, !| 蹈 “ r 。 一? 牙f 矛 予f 斧7 矛 - 憾 三一0 o 嘿 o j j 要 由 是 n 肇 1 j 守 喜:隧 ”毡;d j ;d ;d f odo 石6o 喜 图1 - 2b a k i s 拓扑结构h m m 对语音的描述 f 莰 态 测到特征向量。似) 的概率。 式1 3 最后一行表示对应于所有可能状态序列组合的全概率加和通常可以用 对应于最大概率的一种状态序列加以近似,即v i t e r b i 近似【l3 。对于所需的加和 或最大化计算,可以采用前向后向算法( f o r w a r db a c k w a r d ,f b ) 1 1 1 或动态规 j i l j ( d y n a m i cp r o g r a m m i n g ,d p ) 1 4 实现。 对于观测输出概率,目前最常用的参数化表示是混合高斯模型f g a u s s i a n m i x t u r em o d e l ,g m m ) : p ) = 。卵- p ( o ( t ) i s t , m ) = u 一( 。( p 一,一)( 1 5 ) lm 另外在常用的系统中,出于参数估计量、解码计算量和在倒谱域中帧内相 关性较小的考虑,一般对高斯模型的方差作对角化假设。虽然对于输出概率 分布的选择还可能存在一些其它更优的选择f 1 5 】,但在本文的后续部分,都采用 了g m m 。 第5 页 第一章绪论 由于语境相关信息的引入。使得声学模型建模单元的数量非常庞大。即使 使用海量的训练数据也无法避免某些模型的训练数据稀疏问题。因此,从某种 意义上来说,声学建模的“艺术”在于如何平衡训练数据量和所要估计的参数 量之间的关系。常用的方法是参数共享,有两种方案。其一,采用自底向上的 聚类算法,如 1 6 】;其二,采用自顶向下的分类算法,如f l7 1 。第一种算法的缺 点在于无法估计训练数据中未出现的或出现很少的模型参数,这个缺点在第二 种方案中可以避免。在本文的实验中都采用了第二种方案。 经过多年的研究,人们总结出上述基于h m m 和g m m 声学建模主要存在如 下缺陷:较差的时长建模能力,观测向量之间的条件独立性假设,基于帧的特 征提取方法自身的限制,以及观测向量内部各维之间的统计独立性假设。目 前,对于前三个缺点的解决方案主要在特征和模型层次引入段长信息f 1 8 1 。而对 于第四个缺点,一般是通过方差建模技术加以克服 1 9 卜本文将在第6 章对于方 差建模技术进行详细的讨论。 在包括本文所使用的实验平台1 0 1 在内的大多数语言识别系统中, 声学模型都采用了最大似然准目! u ( m a x i m u ml i k e l i h o o d ,m l ) 进行训l 练。由 于h m m 和g m m 中隐变量的存在,标准的m l j i i 练不存在 j j 式解,因此在训练 过程中通常使用期望最大化( e x p e c t a t i o nm a x i m i z e ,e m ) 并配合f b 或v i t e r b i 算 法。 本文的研究重点在于探讨如何处理数据中的异质性并有效地进行声学建 模,而声学模型的训练与训练准则密不可分。因此在本文的第3 章里,我们还将 详细地对声学模型的训练准则加以研究。 1 1 3 语言建模 语言模型的功能在于为识别器提供语言上的约束,对于大词汇量连续语音 识别系统而言,语言模型对于系统性能提高的贡献往往最为显著。 结合式l 一3 ,语言模型可以进一步的分解为: p ( w ) = i i p ( w 。i 一t ) n = l i i p ( i 蛾n 一- 。1 + 1 ) m - 1o r d e rm a r k o v p r o c e s s( 1 6 ) 第6 页 语音识别中数据异质性处理与声学建模研究 上式中采用了如下简化:w n “一- 。1 + 。兰,? _ 。通常把马尔可夫过程的阶数( m 一1 ) 称 为历史词的长度并定义相应的语言模型为m 元。 如上文提到的,m l 准则一般被用来训练声学模型,对于语言模型的训练可 以采用最小化困惑度( p e r p l e x i t y ) 准则,定义困惑度如下: p e r p l e z i t y = 尸( 叫f ) 一 n a l n = p ( 。f ”。n 一- - 。1 + 。) l n = 1 ( 1 7 ) 在词汇量较大时,还必须考虑语言模型的平滑和回i i i 2 0 】。由于本文的研究 重点不是语言建模,更新的技术不拟一一例举。在我们的实验平台中采用的是 基于词的三元语言模型 1 0 1 。 1 1 4 解码 解码的功能是结合声学模型( 1 - 4 ) 、语言模型( 1 6 ) 、在贝叶斯决策的框 架( 1 3 ) 下基于给定的声学特征序列,搜索最优的词序列以摄大化后验概率: 咖= 缸g 铲 【尸( ”1 ) n = 1 p ( 。( m 尸( s t k ,) ) 8 ,”rt = l ;m i ,。a x 。h 。:。p ( 。( t ) 1 5 t ) 尸( s t s t 一,) 】) ( 1 - 8 ) 目前的主流的搜索技术都是基于动态规划,根据搜索的策略是否与时间同 步可以分为帧同步的v i t e r b i 搜索和帧异步的小( s t a c k d e c o d i n g ) 搜索。针对 大词汇量语言识别,还通常采用以下技术以进一步提高v i t e r b i 搜索的效率: 词树( l e x i c a lp r e f i xt r e e ) 、动态路径裁剪( b e a ms e a r c h ) 、语言模型预;澳l j ( l o o k a h e a d ) 以及快速高斯计算。更详细的内容可以参考 2 1 1 。 本文的后续实验所采用的解码引墼是个基于有调三音子声学模型和三 元语言模型预测技术的帧同步v i t e r b i 一遍搜索框架。其实现技术细节可以参 考f 2 2 。 第7 页 俨。吖 叮日 铲 g 壮 第一章绪论 1 、2 语音数据中包含的异质性信息 人们常说,闻其声,知其人,这就是说语音信号本身蕴含着丰富的信息, 除了文本内容外,通过听一个人的讲话,我们还可以判断出说话人的性别、年 龄、函速、籍贯、身体状况以及说话时的情绪等诸多信息。因此,如果将语音 信号中的所蕴含的信息按照是否与话语所对应的文本信息相关来划分的话,可 以分为文本信息相关和文本信息无关两类。在本文中,我们将后者定义为异质 性因素或异质性信息,特指蕴含在语音数据中,但与语音识别系统任务无关的 那部分信息。 无论是文本信息还是异质性信息都会反映到我们所提取的语音特征中,但 异质性信息对语音识别任务而言并无裨益。从模式识别的角度来看,数据建模 的目的是为了描述数据中所蕴含的,最能够反映出其本质的分类信息,只有抓 住了类别区分性信息,才能够在分类阶段保证良好的推广能力。具体到语音识 别系统来说,所要区分的模式类是不同的发音单元,而数据异质性信息的存 在,将会导致模型均值偏移,方差增大,其直接后果是导致声学空间中不同类 别间的混迭增加,进而致使误识率提高。广义而言,数据异质性是导致测试语 音和识别系统参数失配的根本原因,它的存在将直接影响语音识别系统的推广 能力。这就是说,在建模过程中,不可避免地引入了数据中的异质性z ,而这些 异质性在测试阶段通常会发生变化,从而引入了统计建模和识别数据之间的失 配。举例来说,假设在模型训练阶段,同个发音单元,由不同的话者、通过 不同的信道、在不同的环境中录音所得到的数据不加处理的放在一起建模。到 了实际的应用场合,如果上述因素与训练环境存在明显失配的话,即使出现同 一个发音单元,识别错误的几率也很大。 按照异质性因素产生的来源,我们可以进行如下分类: 由话者声道和说话风格差异引起,如性别、年龄、语速、口音、身体状况 以及说话时的情绪等; 由语音采集信道因索引起,如麦克风特性( 方向性及距离) 、各种电话信 道( 有无线及传输特性) 等; 1 在目前主流特征提取技术下,某些异质性因素对于数据分类所造成的影响甚至超过了声学 上j 勺差别。 第8 页 语音识别中数据异质性处理与声学建模研究 一 由背景噪声因素引起,如系统录音所处的环境特性等。 由于可能导致异质性的因素多种多样,因此在开始本文的探讨之前,我们 还需对本文的研究范畴作一个界定。本文所讨论的异质问题主要集中在 兑话人 风格因素以及信道因素,而基本没有涉及到背景噪声问题。这一界定基本符合 大词汇量连续语音识别系统的声学模型训练数据库的要求,因此本文的主要研 究对象是声学模型的训练问题。 最后值得一提的是,对于不同的应用系统,数据异质性的定义也有所不 同。如说话人风格信息对于语音识别系统来说属于异质性范畴,但对于说话人 识别系统而言,则摇身变成模型所应该描述的本质信息了。 1 3 本文研究工作的意义、内容与结构 1 3 1 本文研究工作的意义 本文研究的目的在于在语音数据的声学建模过程中,如何有效地处理包含 其中的异质性信息,从而更加合理有效地使用语音数据、并为之建模。对于语 音数据中所包含异质性信息的处理,是语音识别乃至模式识别的根本问题之 一。 从工程应用角度出发,解决语音数据异质性闯题也越来越凸现出其重要 性。众所周知,现代语音识别系统的成功与海量语音训练数据库的不断发展和 完善密不可分。如截至2 0 0 0 年,美国l d c 已经发布了1 0 6 个语音数据库。收录的 语音数据采自包括麦克风、广播、电话、无线等在内的各种信道,内容涉及政 治、经济、新闻以及日常对话,背景噪声各异,并且包括几十个语种f 2 3 。而随 着语音识别任务的日趋实用化,越来越多的现场数据( f o u n dd a t a ) 出现在了语 音库中,如真实场景下的访谈、会议、聊天式对话等等。通常来说,现场数据 较之特殊录音环境下的朗读式语音而言,数据呈献出的异质性更为突出。在这 种趋势下,探讨如何更加有效地处理和应用语音数据成为了亟待研究的实际课 题。 结合第1 2 节的分析不难发现,无论从理论研究还是工程应用角度来看,数 据异质性处理问题都具有重大意义。但由于造成数据异质性的因素种类繁多, 迄今为止,很难找到一种能够不受各种异质性因素影响的稳健特征提取方法, 第9 页 第一章绪论 因此如何分离、消除、补偿这些不利因素对特征提取、数据建模的影响一直困 扰着语音识别工作者,也因此成为了当前语音识别领域研究的热点。 1 3 2 本文研究工作的内容及结构 本论文的主要的工作是围绕基t h m m g m m 、以m f c c 为特征的汉语大词 汇量连续语音识别系统展开的,主要研究了如何消除、补偿训练语音中所蕴含 的影响识别系统性能的异质性因素,从而更加有效地进行语音数据分类与建模 的问题。 早期的解决方法之一是采用多元化( m u l t i s t y l e ) _ j 练。这种方法受到了从说 话人相关识别系统过渡到说话人无关识别系统所采用的增加说话人方法的启 发,认为尽可能地增加采自不同性别、年龄、口音、录音信道甚至不同信噪比 条件录音环境下的训练语音,即尽可能多地让模型学习数据的异质性,就可以 在实际应用场合“以不变应万变”。这种通过不加任何处理地引入异质性方法 是不可取的,且不说不可能考虑到所有在实际应用中可能出现的情况,不断钝 化的统计模型分布函数会使得分类期望风险不断增加。 上述实践启发我们在解决异质性所带来的问题时,必须考虑如下几个问 题:首先确定模型应该描述什么,继而考虑如何消除数据中我们所不希望模型 描述的因素,最后考虑应该如何更好地描述。这就是本文在后续章节所要探讨 并研究的。 对于模型应描述什么这个问题的回答是肯定的:为保证模型的推广性,我 们应该力求模型描述数据中蕴含的对分类而言不变的、最本质的区分性信息, 因为任何异质性因素都是造成训练和识别阶段失配的原因。对于语音识别系统 而言,所要求的区分性信息是基本发音建模单元之间的发音差异。由于在特征 提取阶段,目前还无法找到一种不受任何异质性因素影响的稳健特征提取方 法,因而在建模阶段,异质性因素的引入不可避免。再加上目前也没有一种可 以完全消除这些异质性因素的方法,这就要求我们必须找到一种折衷。本文提 出的解决方案是,在变化中寻找相对不变性,并为之建模。具体来说,首先采 用某种可以部分消除异质性的方法,在最大的范围内将同一模式类中由异质性 造成的数据分布的变化降低,继而采用某种有效的建模手段为数据中残余异质 性因素建模。 第l o 页 语音识别中数据异质性处理与声学建模研究 在这种指导思想下,本文主要包括以下八章: 第一章是绪 ,在简要介绍大词汇量连续语音识别基本理论基础上,界定 了本文的研究重点一一语音训练数据所蕴含的异质性处理问题一一的研究内 容、研究意义、研究背景以及本文的主要研究思路。 第二章是本文的立论基础。很多影响语音识别系统性能的因素都可以归结 到语音数据所蕴含的异质性信息,但其影响程度却很难量化。为此,本章采用 了一种非语境因素扩展决策树技术以分析和在一定程度上定量研究数据中所蕴 含的异质性对数据分类与建模的影响。通过该技术还可以研究经过补偿算法处 理过的数据所残余的异质性,为进一步建模研究提供了一个分析基础。异质性 信息处理问题一直是语音识别研究领域的一个难点和热点,在本章中,我们还 对目前的异质性处理算法根据其所适应的场合进行了分类和总结。本章给出全 文的研究动机和后续各种算法的脉络。 第三章是本文的理论基础。本文的研究重点是声学模型的训练,而模型 训练与训练准则密不可分。为此,本章总结了目前声学训练常用的准则,其 中包括最大似然( m a x i m u ml i k e l i h o o d ,m l ) 准则、最大互信息( m a x i m u mm u t u a i n f o r m a t i o n ,m m i ) 、最小分类错误率准贝l l ( m i n i m u mc l a s s i f i c a t i o ne r r o r r a t e ,m c e ) 以及支持向量机( s u p p o r tv e c t o rm a c h i n e ,s v m ) 准则。除t m l 准 则外,其它几种准则都隶属于区分度训练范畴。从广义上来说,只要是能够提 高模型区分能力,锐化模型分布的方法,对于处理数据中的异质性信息都是有 所裨益的。从这个角度出发,各种区分度训练准则在数据异质性比较严重,数 据分布混迭较大时,由于其描述的是各个模式类的分类边界,对于提高模型的 区分能力和解决数据的异质性问题有所帮助。为此,本文在后续许多章节的研 究工作中都引入了基于m m i 区分度准则的研究。另外,在本章中还对s v m 在语 音识别中的可能应用作了一些尝试性的研究。 上面的三章阐明了本文的出发点,并给出了全文的立论和理论依据。从第 四章开始将进入具体的解决策略研究。 第四章研究了多套模型,分而治之策略。对于异质性差异明显的训练数 据既不能不加处理地直接放在一起训练模型,而且目前常见的技术手段也难 以对其进行补偿,在这种情况下可取的方法将数据首先按照异质性的种类进行 分类,然后再分别建模。这类方法通常有两个闯题需要解决:其一,训练数据 第l l 页 第一章绪论 的分类通常会造成数据稀疏问题;其二,在识别阶段需要一种合适的算法找到 对特定测试环境而言最合适的模型。在本章中我们提出了一种最大似然增益模 型组合算法,这种算法建立在非语境因素扩展的决策树技术基础之上,为解决 建立多套声学模型时可能出现的训练数据稀疏以及识别时的模型选择提供了一 个可行的框架方案。 接下来的三章一脉相承,提出了实现本文研究指导思想一在变化中寻找 相对不变性,并为之建模一一的一种解决方案。 第五章着重研究了异质性信息消除策略。不同于在研究卷积和加性噪声 补偿时所通常采用的环境模型f 2 4 ,2 5 1 方法,对于说话人风格很难找到一种参 数化形式的模型表述,更不用说把这些因素分离出来了。一种简单可行的 尝试是说话人声道规一化( v t l n ) 2 6 ,其基本思想是在功率谱域通过一个频 率弯折系数调整说话人声道共振蜂的位置,但这种方法对于其它异质性因素 很难奏效。因此,比较常用的算法
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 塑料热合工诚信道德考核试卷含答案
- 燃料值班员岗前培训效果考核试卷含答案
- 2025年全国计算机等级考试二级C语言真题及答案
- 2025年计算机应用基础考试试卷及答案
- 2025年达梦数据库题库及答案
- 2025考核人工智能训练师四级真题精-选附答案
- 2005年中级会计资格考试《财务管理》模拟试题及答案
- 2026浙江省教师职称考试(道德与法治学科知识)历年参考题库含答案详解3卷
- 2026浙江建设工程质量检测人员考试(市政桥梁检测)历年参考题库含答案详解3卷
- 2026河南机关事业单位工勤技能岗位等级考试(土建施工人员·中级/四级)历年参考题库含答案详解2卷
- (17)义务教育劳动课程标准日常修订版(2022年版2025年修订)
- 2025年教师资格证综合素质考试题及答案
- 人教版(2024)七年级全一册信息科技第1单元《探寻互联网新世界》教案
- 车间电动三轮车安全培训课件
- 迎接新阶段追逐新梦想-2025-2026学年高一上学期新生入学开学第一课主题班会
- 腾讯研究院:工业大模型应用报告
- 环境实验室安全知识培训
- (高清版)DB33∕T 1208-2020 工型混凝土预制桩水泥土连续墙技术规程
- 中医知识与优生优育
- 异常分娩的识别及处理
- 中国椎管内分娩镇痛专家共识(2020版)
评论
0/150
提交评论