已阅读5页,还剩53页未读, 继续免费阅读
(电路与系统专业论文)说话人识别中缺失特征的自动检测研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 摘要 文本无关说话人识别在实验室条件下性能良好,但是在实际情况中,噪声的 存在会导致训练和测试环境的不匹配,从而引起系统性能下降。缺失特征方法是 将语音中受噪声严重污染的频段标记出来,通过去除这些区域,仅利用剩下的可 靠特征进行识别,以此来提高说话人识别系统在噪声环境下的鲁棒性。 缺失特征方法在文本无关说话人识别中,第一步是将受噪声严重污染的频段 标记出来,这一步称为缺失特征检测。第二步是利用缺失特征检测后,去除了缺 失特征后的可靠特征进行识别。准确的缺失特征检测对于后续的缺失特征重建, 以至识别都起了关键的作用。大多数缺失特征检测方法采用局部信噪比( s n r ) 准则,依赖于对噪声的直接估计,噪声估计的不准确会导致识别率下降,尤其是 在非平稳噪声环境下,噪声估计更加困难。如果不需要对噪声进行估计,即,不 依赖于局部s n r 准则,而只考虑带噪语音本身的特征,就可以减少噪声估计的影 响。本文研究的主要内容就是在加性噪卢环境下,文本无关说话识别中,缺失特 征的自动检测方法。 为了实现缺失特征的自动检测,我们需要提取一些能够反映语音受噪声污染 程度的语音特征。从这些特征所反映的信息就町以直接得剑语音频谱的口j 靠性。 文中主要研究了四种语音特征,从理论和实验的角度分别蜕明了这些特征在噪声 环境f 的性能。实验表明,这些语音特征在不同噪声环境下以及不同信噪比的情 况下,在时一频区域的变化规律与语音实际得到的s n r 之i n j 存在一定的关系。说 明了这些语音特征在缺失特征检测中具有一定的使j j 自仃景。 利用提取的语音特征,将缺失特征检测的问题转化为一个二分类问题,用这 些语音特征训练分类器,直接判断语音在侮个时一频区域的可靠性,也就实现了 利用语音本身特征进行缺失特征自动检测的目的。本文采用的是神经网络分类 器,通过神经网络的训练,将四个语音特征所显示的语音谱的可靠性综合到一个 分类器中,也就是利用四个语音特征同时训练分类器,以避免单一语音特征在某 些频段不能很好的反映语音受噪声污染的程度。对受不i 亓j 信噪比的平稳f 1 6 噪 声,非半稳f a c t o r y 噪声和b a b b l e 噪声污染的带噪语爵进行了实验,将神经网络 得到的缺失特征检测结果与基于聚类的缺失特征重建方法相结合,得到说话人泌 别系统的识别率。实验结果表明,在相州的实验条件下,分别与理想缺失特征检 测和基t :谱减的缺失特征枪测相比,从检测结果的准确性方面以及最终的谚 别率 角度进行分析,此方法优于基于黹减的缺失特征检测。最后,讨论了缺失特征自 动检测方法的扩展性问题,包括i - t j 两种噪声训练同个分类器来说明此方法的噪 摘要 声鲁棒性;结合g m m 的重建方法来进一步说明此处自动检测方法的优越性。 关键词:说话人识别缺失特征检测分类器缺失特征重建 a b s t r a c t a b s t r a c t t e x t - i n d e p e n d e n ts p e a k e rr e c o g n i t i o np e r f o r m sw e l li nn o i s ef r e ee n v i r o n m e n t , b u tt h ep r e s e n c eo fa d d i t i v en o i s ec a nc a u s et h em i s m a t c ho ft r a i n i n ga n dt e s t i n g e n v i r o n m e n t s ,w h i c hm a k e t h ep e r f o r m a n c eo fr e c o g n i t i o ns y s t e m d e g r a d e d r a m a t i c a l l y m i s s i n gf e a t u r em e t h o dl a b e l st h eh i g h l yc o r r u p tr e g i o no fs p e c t r o g r a m , u s i n go n l yt h er e l i a b l e f e a t u r e st op e r f o r mr e c o g n i t i o n t h i sc a ne n h a n c et h e r o b u s t n e s so fs p e a k e rr e c o g n i t i o ni nn o i s ye n v i r o n m e n t m i s s i n gf e a t u r em e t h o d si nt e x t - i n d e p e n d e n ts p e a k e rr e c o g n i t i o no p e r a t eb yf i r s t i d e n t i f y i n gc o m p o n e n t so fas p e c t r o g r a p h i cr e p r e s e n t a t i o n o fs p e e c ht h a ta r e c o n s i d e r e dt ob ec o r r u p t e d t h i sp r o c e s si sc a l l e dm i s s i n gf e a t u r ee s t i m a t i o n a c c u r a t e e s t i m a t i o no fm i s s i n gf e a t u r ep l a y saf u n d a m e n t a lr o l e i n m i s s i n g f e a t u r e r e c o n s t r u c t i o na n dr e c o g n i t i o n m o s tm i s s i n gf e a t u r ee s t i m a t i o nm e t h o d sr e l yo nt h e l o c a ls n r ,w h i c hn e e dt oe s t i m a t et h ec h a r a c t e r i s t i co fn o i s e 。i n a c c u r a c yo fn o i s e e s t i m a t i o nw i l ll e a dt ot h ep o o rp e r f o r m a n c eo ft h es y s t e m i nn o n 。s t a t i o n a r y e n v i r o n m e n t ,e s p e c i a l l y , i ti sh a r dt oe s t i m a t en o i s e i fw ec a nm a k en oa s s u m p t i o no f n o i s es i g n a l ,a n do n l ye x p l o i tt h ec h a r a c t e r i s t i c so fs p e e c hs i g n a l ,t h e n ,w ec a nr e d u c e t h ei m p a c to fi n a c c u r a c yo fn o i s ee s t i m a t i o nt ot h er e c o g n i t i o ns y s t e m t h et h e s i s m a i n l yd i s c u s s e st h ea u t o m a t i cm i s s i n gf e a t u r ee s t i m a t i o ni nt e x t i n d e p e n d e n ts p e a k e r r e c o g n i t i o ni nn o i s ye n v i r o n m e n t i no r d e rt oa c t u a l i z et h ea u t o m a t i cm i s s i n gf e a t u r ee s t i m a t i o n ,w eh a v et o a b s t r a c ts o m es p e e c hf e a t u r e sw h i c hc a nd e s c r i b et h ec o r r u p t e dd e g r e ec a u s e db y n o i s e u t i l i z i n gt h e s es p e e c hf e a t u r e s ,w ec a ng e tt h er e l i a b i l i t y o fs p e c t r o g r a m d i r e c t l y f o u rs p e e c hf e a t u r e sa r ed i s c u s s e d ,a n dt h e i rp e r f o r m a n c ei ss t u d i e di nt h e o r y a n db ye x p e r i m e n t o u re x p e r i m e n t ss h o wt h a tt h e s es p e e c hf e a t u r e sh a v es o m e r e l a t i o n s h i p sw i t hs n ri nd i f f e r e n tn o i s ye n v i r o n m e n ta n dd i f f e r e n ts n r t h e s e s p e e c hf e a t u r e sh a v ep r o m i s i n gu t i l i z a t i o ni nm i s s i n g f e a t u r ee s t i m a t i o n t h e s es p e e c hf e a t u r e sc a nc o n v e r tt h em i s s i n gf e a t u r ee s t i m a t i o n t oa c l a s s i f i c a t i o np r o b l e m ,w h i c hc a nb eu s e dt ot r a i nc l a s s i f i e r s a n dt r a i n e dc l a s s i f i e r s c a nc l a s s i f yt h er e l i a b i l i t yo fs p e c t r o g r a md i r e c t l y o u ra u t o m a t i cm i s s i n gf e a t u r e e s t i m a t i o nm e t h o dh a st ob ea c t u a l i z e d w et r a i n e dn e u r a ln e t w o r kc l a s s i f i e r su s i n g t o u rt 、e a t u r e s ,w h i c hc a ns e p a r a t e l yd e s c r i b et h ec o r r u p t e dd e g r e eo fc l e a ns p e e c hi n e v e r yf r e q u e n c yb a n d t h ec o m b i n e du s eo ff o u rf e a t u r e sc a na l s oa v o i dt h es i t u a t i o n t h a ti nc e r t a i nf r e q u e n c yb a n d ,as i n g l es p e e c hf e a t u r ec a nn o td e s c r i b et h ei m p a c to f n o i s e i nd i f f e r e n ts n ra n ds t a t i o n a r yf16n o i s e ,n o n s t a t i o n a r yf a c t o r ya n db a b b l e n 0 1 s ee n v i r o n m e n t ,o u re x p e r i m e n t sp e r f o r mr e c o g n i t i o nu s i n go u r a u t o m a t i cm i s s i n g f e a t u r ee s t i m a t i o na n d m i s s i n gf e a t u r er e c o n s t r u c t i o nm e t h o d t h er e s u l t ss h o wt h a ti n t h es a m ee x p e r i m e n t a lc o n d i t i o n ,c o m p a r e dw i t ho r a c l em i s s i n gf e a t u r ee s t i m a t i o n a n ds p e c t r a l 。s u b t r a c t i o nb a s e d m i s s i n gf e a t u r ee s t i m a t i o n ,o u rm e t h o dp e r f o 啪sw e l l 1 nn o to n l yt h ee s t i m a t i o na c c u r a c yb u t a l s ot h er e c o g n i t i o na c c u r a c y w ed i s c u s st h e e x p a n s i b i l i t yo ft h i sa u t o m a t i cm i s s i n gf e a t u r ee s t i m a t i o n ,w h i c hi n c l u d e s :t r a i na c l a s s i t i e rw i t hn o to n l yo n en o i s eb u tt w o ;u s eg m m b a s e dr e c o n s t r u c t i o nm e t h o d n o tc l u s t e r - b a s e dm e t h o d t h ee x p e r i m e n tr e s u l t ss h o wo u rm e t h o da l s o h a sg o o d p e r f o r m a n c e k e yw o r d s :s p e a k e rr e c o g n i t i o n ,m i s s i n gf e a t u r ee s t i m a t i o n ,c l a s s i f i e r ,m i s s i n g f e a t u r er e c o n s t r u c t i o n i v 中国科学技术大学学位论文原创性和授权使用声明 本人声明所呈交的学位论文,是本人在导师指导下进行研究所取 得的成果。除已特别标注和致谢的地方外,论文中不包含任何他人已 发表或撰写过的研究成果。与我一同工作的同学对本研究所做的贡献 均在论文中作了明确的说明。 本人授权中国科学技术大学拥有学位论文的部分使用权,学校有 权按照有关规定向国家有关部门或机构送交论文的复印件与电子版, 允许论文被畲i 蒯与借阅,可以将学位论文编入有关数据库进行检索, 可以采用影印、扫描或缩印等复制手段保存、7 r :编学位论文。 保密的学位论文在解密后也遵守此规定。 作者签名:羔 。妒 如jo 年岁月沙日 _ 币侈 p 2 第一章绪论 第一章绪论 说话人识别可看作是语音识别的一种,与语音识别不同的是,它并不关注语 音信号罩的语义信息,而是从说话人发出的语音中提取说话人信息,根据语音波 形中反映说话人生理和行为特征的语音参数,对说话人的身份进行鉴别的一个技 术。 从信源的角度来看,说话人生理上的发音器官,发音习惯以及说话时的心理 和情感等因素,都对说话人说话时的语音及其发音产生一定影响。它涉及到心理 学,声学,生物学等学科;从信号处理,信息提取和说话人识别的角度来看,它 涉及模式识别,数字信号处理等学科。因此,说话人识别是一个跨学科的综合性 应用研究领域。 随着信息化社会的发展,说话人识别的研究具有越来越重要的社会意义以及 实用价值,在司法、通信、机要等众多领域中有着广泛的应用。例如,可用于声 控装置、公安查对,银行信贷电话证实等方面中。在许多需要进行身份认证的场 所均得到了应用,因此,说话人识别的研究受到了广泛的关注。 本章主要内容安排如下:首先介绍了说话人识别系统的发展情况以及说话人 识别系统的基本结构;其次提出了噪声鲁棒性问题及当日矿的主要解决方法,然后 提出了缺失特征方法及本文重点研究的缺失特征检测技术,介绍了缺失特征捡测 的研究现状,最后给出了本文的研究工作和内容。 1 1说话人识别技术发展概述 说话人识别的研究始于自动语音谚 别,在2 0 世纪3 0 年代,研究工作主要是 用人耳进行听辨实验以及研究听音识别的可能性。说话人识别的研究始于上世纪 6 0 年代。1 9 6 2 年,贝尔实验室研究了用s o n o g r a p h 绘制i q j 的语谱图,发现同一 个人发同一个音比不同人发一样的音的谱更加接近,语音的自动识别就成为可 能。贝尔实验室提出了基于模式匹配及概率统计方差分析的方法,形成了说话人 研究领域的一个热点 p r u z a n s k ys ,l9 6 3 。 。 在上世纪7 0 年代初,说话人识别系统大都基于频潜和模板匹配法来实现。 说话人识别的研究转向了对各种卢学参数的线性和非线性处理。到7 0 年代后期, 动态时i 日j 规整和矢量量化技术应用到了说活人识别中。 8 0 年代,人工神经网络 h e r t zj ,k r o g ha ,p a l m e rrg ,1 9 9 1 和支持向量机 v a p n i kvn ,1 9 9 5 在语音识别中得到“泛应用。 进入9 0 年代,高斯混合模型( g m m ) 和隐码尔可大模型( h m m ) y o u n g s ,e ta l ,2 0 0 6 1 。 i 2 文本无关说话人识别系统 在说话人识别中成为了当前主流的技术。采用g m m u b m 结构主要有两个好处, 一是说话人模型是在( 全背景模型) u b m 上由说话人的训练语音经自适应得到, 这样对于训练语音覆盖到的发音,可用该说话人本身的语音建模得到,而对于未 覆盖到的发音,则可用u b m 中的发音近似得到,这样就可以减少测试与训练语 音由于在声学空问中不同的分布所产生的影响。二是在进行说话人身份确认中, 可利用测试语音在u b m 上的得分作为参考阈值。本文采用的系统就是基于 g m m u b m 结构的。 最近几年,说话人识别技术层出不穷,比如,在文本无关说话人识别中应用 大规模连续语音识另i j d a r e y n o l d s ,w a l t e ra n d r e w s ,j o s e p hc a m p b e l l ,e t c , 使用了g m m 的支持向量机( s v m ) 【s f i n e ,ln a v r a t i l ,r a g o p i n a t h ,2 0 0 1 】, 各种说话人评分规整技术t n o r m w m c a m p b e l l ,d e s t u r i m ,d a r e y n o l d s , 2 0 0 6 】,z n o r m f r e d e r i c b i m b o t ,j e a n f r a n c o i s b o n a s t r e , 2 0 0 4 】, h n o r m d a r e y n o l d s ,t h o m a sf q u a t i e r ia n dr o b e r tb d u n n ,2 0 0 0 ,针 对信道失配问题的说话模型合成技术 w e iw u ,t h o m a sf a n gz h e n g ,m i n g x i n g x u ,2 0 0 6 】,特征映射技术 d a r e y n o l d s ,2 0 0 3 】,联合因子分析 p a t r i c k k e n n y ,g b o u l i a n n e ,p o u e l l e t ,p d u m o u c h e l ,2 0 0 7 。这些技术使说话人识别 的性能得到了大幅度的提高。 如今,说话人识别技术在走向实际应用中,t :c o ha t & t 研制出的s m a r tc a r d 已用在自动提款机上。欧洲电信联盟在1 9 9 8 年完成的c a v e 计划,p i c a s s o 计 划,在电信网上实现了说话人识别。其他的一些商用系统包括,i t t 公司的s p e a k e r k e y ,k e y w a r e 公司的v o i c eg u a r d i a n 等等。 1 2 文本无关说话人识别系统 说话人识别是根据语音中反映人生理和行为特征的语音参数对说话人身份 进行识别的技术。说话人识别系统的框图,卜图1 1 所示。从图中可以看出,说话 人谚 别系统主要分为两个阶段,分别为训练阶段和i j 别阶段。在训练阶段中,提 取说话人的语音得到语音的声学特征,之后,系统为每个目标蜕话人建立模型, 并组成模型库。在识别阶段中,提取测试语音的语音特征,并与模型库中的模型 比较,根据一定的准则进行评分,就可以判断此说话人的身份。 对训练语音提取特征,不仅包括提取说话人特征的信息,还包括切除静音, 预加晕及后续处理等。对说话人特征建+ 莎模型,通常采用的说话人模型包括 g m m ,h m m ,s v m 等等。 1 2 文本无关说话人识别系统 训练阶段 输入训练语 特征提取 识别阶段 输入测试语爵 图1 1 说话人识别系统框图 识别结果 - 一一- 根掘说话人识别的应用范畴,说话人识别分为【兑话人辨认和说话人确认。前 者把未标记的语句削定为参考说话人中的某一个所说,是一个一对多的问题。后 者则根据说话人的语句确定是否与所声明的参考说话人相符,是一对一的问题, 即,或是肯定,或是否定。说话人确认相对说话人辨认,具有更好的灵活性及应 用性,因为混话人确认能够允许测试说话人不属于已知的集合,其识别性能不会 因系统说话人数量的增加而降低,但是说话人辨认要求测试说话人属于已知的数 据集,其性能会随说话人数量增加而下降。 按照对语音内容的要求束划分,可分为文本无关和文本有关。与文本无关说 话人识别,并不关心语音中的语义信息,而与文本有关的说话人识别则需说话人 提供语义的内容。与文本无关说话人识别,在实际应用中使用范l :翻。泛,不受晚 话人语义内容的限制,具有更好的灵活性。根掘测试语音的类别可以分为丌集识 别和c a j 集i = ! - 别,前者表示有的测试说话人语音不属于已知的说话人集合中,后者 表示所有的测试语音都属于已知的说话人集合中。 本文主要研究的是在噪声环境下,与文本无关的说话人辨认,并且采用的是 闭集测试。其中,说话人识别的特征参数采用的是m e l 频率倒谱系数,即m f c c 参数,以及相应的一阶差分。在识别中,采用的是基于高斯混合模型以及通用背 景模型,即g m m u b m 模型。 i 3 噪声鲁棒性问题 1 3 噪声鲁棒性问题 1 3 1 噪声鲁棒性方法概述 说话人在各种不同的环境下,录制的语音会受到不同类型噪声的影响,而语 音质量的优劣又直接影响说话人识别系统的性能。因此,说话人识别中,如何提 高噪声鲁棒性就成为一个关键的问题。目前提高噪声鲁棒性的研究主要包括: 1 ) 数据补偿法,比如谱减法 b o l lsf ,1 9 7 9 ,非线性谱减法 l o c k w o o dpa n d b o u d yj ,1 9 9 2 、维纳滤波等。这些方法直接或问接假设噪声是平稳或缓变的。在 噪声非平稳时,这些方法使识别系统性能下降。 2 ) 模型补偿法,通过改变统计模型的方法来描述噪声对语音的影响,以此 减少由噪声引起的数据不匹配。目前大多数模型补偿法,同样直接或| 1 1 j 接假设噪 声是平稳或缓变的。因此,这些方法在噪声非平稳时,同样使得系统性能下降。 3 ) 鲁棒特征法,由于人耳听觉系统的噪声鲁棒性,在语音特征中可以融入 反映入耳听觉特征的因素来提高识别系统的性能。根据人耳的听觉特征, h e r m a n s k y l 9 9 2 提出了r a s t a 法。r a j 等人,提出了缺失特征方法。缺失特征方 法在噪声平稳时对噪声的补充显示了它的优越性,这个方法的主要思想是:噪声 对语音时频区域有不同的影响,语音和噪卢的相对能餐在不同区域也会不同。 具有高s n r 的区域认为是可靠的,低s n r 区域认为是污染或缺失的,识别时仅 利用可靠特征进行识别。这些鲁棒特征方法使说话人谚 别系统取得了不断的提 高。本文主要研究的就是缺失特征方法。 1 3 2 缺失特征方法 在加性噪声环境下,特别是非平稳噪声环境f ,提赢说话人识别系统的鲁棒 性是本文研究的重点。在实验室环境下,说话人的g m m 模,型参数一般都足从某 特定环境下得到的语音库中训练得到,当测试与训练环境失配时,会导致说话人 泌别系统的性能下降。 人类的听觉系统具有良好的噪声鲁棒性。带噪语音识别实验表示,当忽略了 语音中受噪声污染的区域,识别率会增加。也就是根据入耳的听觉特性,语音谱 经过删减,并不影响其叮懂度 m p c o o k e ,a m o r r i s ,p d g r e e n ,1 9 9 6 】。人类的 听觉系统具有掩蔽效应,被掩蔽的成分认为是缺失的。根据入耳的听觉特性, s h e 缳e l d 大学的研究人员提出了缺失特征方法。在噪声非平稳时对噪声的补充显 示了它的优越性。f a v i z i n h o ,p g r e e n ,m p c o o k e ,a n dl j o s i f o v s k i ,l9 9 9 1 f m p c o o k e ,p g r e e n ,l j o s i f o v s k i ,a n da v i z i n h o ,2 0 0 l 】。这个方法的主要思想是: 4 1 4 缺火特征检测研究现状 语音信号谱用二维的时间一频率区域来表示,噪声对语音时频域有不同的影 响,语音和噪声的相对能量在不同区域也会不同。具有高s n r 的区域认为可靠, 低s n r 区域认为污染或缺失。 目前缺失特征方法主要分为两类: 一是进行缺失特征检测后,直接利用可靠特征进行识别,它需要改变分类器 的模型,并且该方法只能处理经缺失特征检测后的时间一频率域特征,而时间一 频率域特征的性能一般低于倒谱特征参数,因此该方法的性能较差。 二是称为缺失特征重建方法,这种方法首先通过一定的方法将缺失特征重建 进行处理,然后进行识别。经过重建后的完整语音谱可以转换为性能较好的倒谱 参数,比如经常采用的m f c c 参数,这样就能够提高系统的性能,比缺失特征 边缘化方法具有更好的性能。并且,数据重建后得到了完整语音谱,就不需要对 识别器做改变。本文主要采用的是基于聚类的缺失特征重建算法 r a j ,2 0 0 0 。它 是假设所有语音特征都来自高斯模型集。缺失特征检测之后,首先根据可靠特征 来估计语音特征在高斯模型集中的归属性,根拥概率分布和可靠特征,采用最大 后验概率准则重建出缺失特征。本文最后还采用了基于g m m 的数据重建方法 p r e n e v e y ,a d r y g a j l o ,( 2 0 0 0 ) 】,此方法是利用g m m 模型来描述语音特征,利用 噪声的统计模型对g m m 模趔补偿,基于统计方法进行缺失特征重建,以g m m 模型的均值作为缺失特征的估计。 缺失特征方法不用假设噪声是- y - 稳的,只要划分可靠特征和缺失特征,即进 行缺失特征检测,再利心可靠特征进行识别,这种方法具有良好的噪声鲁棒性。 缺失特征方法主要解决两个问题,一是如何标记语音谱的可靠性,即缺失特征检 测;二是如何利用可靠特征进行i j 别。由于缺失特征检测是利用可靠特征进行识 别的前提和基础,是提高说话人识别系统性能的一个关键问题,因此本文将缺失 特征检测作为研究的重点。 1 4 缺失特征检测研究现状 在进行识别前,需要标记语音潜的可靠性。这一步在最后的识别中起了关键 的作用。 当噪声平稳或缓变时,很多缺失特征检测方法性能良好。缺失特征检测一般 采用局部s n r 准则,它依赖于噪声估计技术。从噪声模型估计局部s n r ,通常 是用语音的无声段汁算,这类似于谱减法。1 9 9 8 ,d r y g a j l o 提出改进的谱相减技 术用二,二缺失特征枪测【a d r y g a j l oa n dm e 1 m a l i k i ,1 9 9 8 1 ,然而,这个方法的缺点 是对非平稳噪声缺乏噪卢鲁棒性。因此,提出了一些史复杂的算法束估计局部 1 5 论文的主要内容 s n r ,比如, r a j ,2 0 0 0 提出的泰勒级数方法。 b a r k e r ,j ,j o s i f o v s k i ,l ,c o o k e ,m , g r e e n ,p , 2 0 0 0 提出软阈值方法。硬阈值方法只能判断每个时频域要么语音占主 导,要么噪声占主导。而软阈值是将每个区域的可靠性归为o 一1 的概率,这个概 率可以解释为该区域受语音支配的程度。标记为接近1 的区域可以认为具有更多 的原始语音以及很少的噪声,而接近0 的区域则认为噪声较多,原始语音很少。 【d u p o n t r i s ,2 0 0 1 1 估计和比较了噪声估计的四种方法,也就是能量聚类、h i r s h 直方图,加权平均和低能量包络跟踪。虽然这些方法提高了噪声估计的准确性, 但是当噪声是非平稳的时候,提高并不明显。通常,将其他的信号特征,比如谐 波和幅度调制,与噪声模型结合来提高局部s n r 估计的准确性。比如,回声语音, p a l o m a k i2 0 0 4 1 提出利用调制滤波来检测没有受噪声污染的语音的丌始,并且从 这些特征得到缺失特征估计。【p a d i l l a ,2 0 0 6 提出针对s t f t 的缺失特征检测器。 在已知s n r 的先验知识的情况下,得到的缺失特征检测,使缺失特征方法 在补偿平稳以及非平稳噪声上面显示了良好的性能。但是当这些局部s n r 未知 时,这些技术是不可靠的。 目自仃主要存在的问题是: 一是,在一般的方法中,比如上面提到的谱减法,需要假设噪声信号是平稳 或缓变的,这样,在非平稳噪声情况下,噪声估计比较困难,得到的局部s n r 就不准确,直接影响缺失特征的检测以及最后的识别率。 二是,噪声影响很大的情况下,噪声估计会不准确。同样局部s n r 的准确 度造成影响,从而影响缺失特征可靠性的判决,造成系统的识别率卜降。 【m l s e l t z e r ,2 0 0 4 提出了在语音识别中用贝叶斯分类器用于缺失特征检测。 这个方法不用对噪声进行假设,与传统的方法相比,有了明显提高。然而,他们 为了方便而做了假设,缺失特征检测的性能就是次优的。比如,在浊音和清音段 使用了一个先验概率来避免大量计算。 1 5 论文的主要内容 本文主要研究在噪声环境下,缺失特征的自动检测方法,以此束提高缺失特 征方法在文本无关说话人识别中的噪声鲁棒性。我们提出了利j 丹语音特征来标记 语音谱的可靠性方法,而没有任何噪声的先验知谚 或语音的先验概率。 通过语音特征训练分类器,从而使得缺失特征检测问题变成了一个分类问 题,这种由语音特征训练的神经网络分类器在测试阶段显示了一定的泛化性。 本文 i 以下几章组成: 第二章,由文本无关说活人识别系统的噪声鲁棒性i u j 题的角度,提出了缺失 特征方法。由于缺失特征方法只利用1 1 j 靠 , r f i e 进行识别,并上i f i 需要假设噪卢足 1 5 论文的主要内容 平稳或者缓变的,因此具有良好的噪声鲁棒性。接着介绍了本文的实验平台,使 用的语音数据库和噪声数据库,以及采用的基准系统。从人耳听觉的生理基础出 发,提出了语音感知,以及掩蔽效应,人的听觉系统具有良好的非线性特性,而 m e l 滤波器组能够模型这一过程,这样就将语音信号频谱转换到感知域,更好的 模拟了听觉过程,这样就可以提取更有效的语音特征,比如m f c c 参数。最后 介绍了缺失特征方法,重点是本文主要采用的基于聚类的缺失特征重建方法。 第三章,由于缺失特征检测对说话人识别系统的性能起着关键的作用,因此, 本文重点研究了缺失特征检测的方法。本章主要介绍了两种缺失特征检测方法, 分别是理想缺失特征检测以及结合谱减的缺失特征检测方法,通过实验可以看 出,结合谱减的缺失特征检测在平稳噪声环境下,性能良好,但是在非平稳噪声 环境下,检测的准确性受到影响。因此,如何能够提高缺失特征检测在非平稳噪 声环境下的性能,成为了研究的重点问题。如果可以不用对噪声的稳定性作假设, 避开噪声估计的问题,仅利用带噪语音本身的特性进去缺失特征检测,那么缺失 特征检测的问题就转化为如何能够提取有效反映语音受噪声污染程度的语音特 征的问题上。 第四章,主要介绍了缺失特征的自动检测方法,也就足仅利用语音本身的特 征进行识别,而不用对噪声进行估计,其中关键的i 、口j 题就是语音特征的提取。这 罩主要针对浊音帧提出了四个语音特征,研究了四个语音特征。另外,从实验出 发,从语音特征在整个频带上不同信噪比的角度进行了整体分析。并且,从语音 特征在某个予带上所呈现的规律与实际中得到的s n r 进行了比较,实验结果表 明,二者具有一定的相关性,并且单一的语音特征并不能很好的描述语音在每一 帧上受噪声污染的程度,需要将四个特征结合起来使用,达到最好的利用已知语 音信息进行缺失特征检测的目的。 第五章,主要介绍了如何利用k 章得到的语音特缸e 来训练用于缺失特征检测 的分类器,介绍了神经网络分类器的训练方法。后面介绍了缺失特征检测的评判 标准,主要是从缺失特征检测的准确度以及最终的识别率角度进行评判,通过实 验,表明了缺失特征自动检测方法的有效性。之后,介绍了缺失特征的自动检测 一些扩展性问题,主要从两个方面进行了介绍,其一是分类器的i 噪声鲁棒性,此 处是采用在两种噪声环境下训练同过一个分类器的方法,束测试此分类器的噪声 鲁棒性,使此分类器在各种噪声环境下都能使用。其二是说明了基- 聚类的重建 存在的问题,为了进一步判决缺失特征自动捡测方法的优越性,采用基于g m m 的缺失特征重建办法,从识别率的提高f 譬度来看我们方法的有效性。 第二章缺失特征方法 第二章缺失特征方法 2 1介绍 缺失特征方法是对语音的带噪部分进行补偿,只利用可靠的( 高信噪比) 区 域进行识别,而忽略了受噪声污染的低信噪比区域。在这一章,我们将介绍语音 感知及f b a n k 参数,m f c c 参数,讨论噪声对语音谱的影响。之后介绍了本文 的实验平台以及基准系统,用于比较缺失特征方法的优越性。最后,我们讨论缺 失特征检测方法,即,低信噪比区域可以认为足缺失的,通过缺失特征检测来标 记这些区域。通过去除这些受噪声污染大的区域,采用缺失特征重建方法重建出 完整谱,进行说话人识别,达到降噪的目的,束提高说话人识别的识别率。 2 2 说话人识别的噪声鲁棒性问题 出于测试环境和训练环境的不匹配会造成说话人识别系统性能的下降。这些 不匹配町以由环境噪声或传输通道的不同导致。在这罩,我们只考虑背景噪声对 系统的影响,采用的是加性噪声,包括平稳噪声( f 1 6 噪声) ,非平稳噪声( f a c t o r y 噪声,b a b b l e 噪声) 。 基于g m m u b m 的文本无关说话人识别在信噪比较高的环境下,识别率较 好,但是在噪声环境下,特别是非平稳噪声环境下,系统性能下降。因此,如何 提高系统的噪声鲁棒性成为一个关键的问题。干净语音受背景噪声的影响,其语 音频谱受噪声污染,干净语音谱中,能星较噪声小的区域会被噪卢占据,这种频 谱失真会影响语音特征的提取,并最终影响识别率。 语谱图是语音信号的二维表示。横轴表示时i 日j ,纵轴表示频率。在语谱图中, 每个时问频率点代表在时l 日j ,和频率缈处的能最尸( ,) ,如公式2 1 所示,其中 x ( 1 ,缈) 是长度为2 l + i 的信号x n 的短时傅罩叶变换( s t f t ) 。 只( 细) 2 赤眦,国) 1 2 ( 2 1 ) 只( ,c o ) 描述了信号在时i 、i j 和频率上的二维表示。每个像素的能量密度为 l o g ( p ( ! ,缈) ) 的值,比如信号在时f h j ,和频率缈处的对数值。 图2 1 表示。r 净语音分别受f 1 6 噪声、f a c t o r y 噪声和b a b b l e 噪声污染的语 谱图。 2 3 语音感知和掩蔽效席 圈21 语谱蚓 四个倒分别表示干净语音,受f 1 6 噪卢、f a c t o r y 噪卢和b a b b l e 噪声污染的语谱剐 从图中可以看出,f 1 6 噪声的能量主要集中在1 6 0 0 h z 以下和2 7 0 0 h z 左右, 在语谱图巾,语音能量小于噪声能量的区域,噪声能量占主导,干净语音的相应 区域就会被淹没,这造成了频谱结构的失真,这样,由带噪语音提取的特征参数 和说话人模型的失配,影响了最终的识别率。后面两个图分别是受f a c t o r y 和 b a b b l e 影响的语音谱,同样地,下净语音的频谱受到噪声的影响。 由于环境失配造成测试语音的特征参数与晤者模型失配,而缺失特征方法能 有效解决这个问题。此方法足将被噪声严重污染的时频区域标已为缺失的,住谈 b 0 时,仅利用去除了缺失特征的频曙,也就是可靠特征进行识别,这样就减少了 噪声的影响。 23 语音感知和掩蔽效应 231语音信号产生的数字模型 人类的语音是由人体发音器官在大脑控制下的生理运动产q 瑚。人的发音器 官包括气管、肺、喉、口、鼻等。这些器官共同形成了一个形状复杂的管道,其 中喉以上的部分称为声道,而喉以下的部分称为声门,在发音器官中喉是主要 的声音生成机构,声道足对生成的声音进行调制。 语音是由空气流激励声道最后从口或畀或同时从口和弊辐射出束。语音声波 出振动们产生并且借助十介质质点的振动而传播。通常埘声道形状和发音系统作 某些假设。时太多数语音术说,卢道是山半径不同的无损声管级联而二,该传输 lllliiiiii、l“ 、 0,孽k1*t0:,o“=啦_ 。ff鼍 j j 旺 2 3 2 语音感知 函数是全极点函数,而只对鼻音和摩擦音加入一些零点。由于任何零点都可以用 多个极点逼近,因此用全极点模型模拟声道。 语音信号的产生框图如图2 2 所示。这个模型没有声道的物理特性进行描 述,而是采用的激励源驱动的模型。浊音的激励源采用的是冲激序列发生器,清 音的激励源则是用随机噪声发生器。声道,唇辐射,鼻音通道采用的是滤波器模 型。声门脉冲模型由冲激脉冲序列发生器激励。因此,浊音是通过周期冲激脉冲 序列,被声门脉冲模型,声道模型以及辐射模型滤波来描述的。清音则是由产生 的随机噪声被声道模型以及辐射模型滤波来描述的。 卜 蠢 銎 忱 籁 弧 期 语音信号 图2 2 语音信号的产生模型 2 3 2语音感知 人的听觉系统具有复杂的特性,其作用是接收声音并将声音转换为神经刺 激,人耳听到声音后,还需要经脑的处理变成确定的含义,这就是对语音的感知。 听觉机构不但非常灵敏,还具有选择性,判别声音的强弱、音色和音调。 人耳能听到的声音,其频率范闸火约为1 6 h z 至1 6 k h z 之问,年轻人的上限 频率可至2 0 k h z ,老年人的则衰减为1 0 k h z 。低频听起来像脉冲序列,高频声音 越来越小直到听不到。声乐有一个范围,过低听不到,过高入耳不能够承受。 人耳的听觉具有独特的特征。任何复杂的声音都可以用声强来表示,对于人 耳的感觉,可以用响度,音渊和音色柬描述。其中,响度是人耳对声音强弱程度, 即声皆轻向的主观反应。根j ) :实验,入耳对3 0 0 0 至4 0 0 0 h z 声音的强度感觉最 灵敏。音色也叫音质,反映了声齿属性。人根据音色在主观感觉e 区分具有相同 响度和音调的声音。 音调也称音高,也足一种一卜观,已、理量,足人耳对声音频率高低的感受,音调 丫 一 赭关丫蝴开 毯犟 9 纠c、,世毒一 2 3 2 语音感知 与声音频率有关。频率高的声音听起来音调高,频率低的声音,听起来音调低。 音调与声音频率不是完全线性的关系。若定义1 0 0 0 h z 处的频率对应1 0 0 0 m e l , 则这种对应关系在1 0 0 0 h z 以下近似为线性,在1 0 0 0 h z 以上近似为对数关系。 如下图2 3 所示。m e l 频率与实际物理频率f 的关系如下式所示。它的单位是 m e l 。 m e l ( f ) = 2 5 9 5l o g ( 1 + 厂7 0 0 ) ( 2
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 高中数学 加练 专题3 第28练 极值点偏移(二)
- 高中历史 加练 考点2 早期国家的治理
- 指数函数的图象和性质(二)-高一上学期数学课时作业人教版A版(含解析)
- 时尚婚恋活动策划方案模板(3篇)
- 机油泄露环保应急预案(3篇)
- 楼顶做防水施工方案(3篇)
- 永川综合应急预案公告(3篇)
- 泸州帷幕灌浆施工方案(3篇)
- 清明无噪音施工方案(3篇)
- 理财业务应急处理预案(3篇)
- 2025-2030美国社区银行倒闭潮成因分析与区域性金融风险预警报告
- 2026年江苏省高考地理试卷(含答案及解析)
- 公立医院行政管理岗招聘考试核心考点笔记:公共卫生应急管理
- 2026四川乐山市峨眉山发展(控股)限责任公司招聘17人易考易错模拟试题(共500题)试卷后附参考答案
- 2026年初级注册安全工程师《安全生产法律法规》真题(附答案解析)
- 2026年护理技能大赛试题附参考答案详解【考试直接用】
- 消毒管理办法、消毒技术规范培训试题(附答案)
- 直播营销与运营 课件 项目八 数据分析
- SEMI S2 半导体制造设备安全指南培训课件
- 仪器生产清场管理制度
- 无人机在交通设施巡检中的应用技术规范
评论
0/150
提交评论