(信号与信息处理专业论文)基于语音结构化模型的连续数字语音识别.pdf_第1页
(信号与信息处理专业论文)基于语音结构化模型的连续数字语音识别.pdf_第2页
(信号与信息处理专业论文)基于语音结构化模型的连续数字语音识别.pdf_第3页
(信号与信息处理专业论文)基于语音结构化模型的连续数字语音识别.pdf_第4页
(信号与信息处理专业论文)基于语音结构化模型的连续数字语音识别.pdf_第5页
已阅读5页,还剩53页未读 继续免费阅读

(信号与信息处理专业论文)基于语音结构化模型的连续数字语音识别.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

甚卡语爵结构化模型的连续数一语爵识别摘要 基于语音结构化模型的连续数字语音识别 摘要 汉语连续数字语音识别在现实中具有非常广泛的应用前景,在电话与电信系统的 自动语音拨号、身份证号码证实、智能家电中用于电视频道和空调温度的遥控等多方 面都有着重要的应用价值。 汉语连续数字语音识别是语音识别中的一个重要分支,其主要难点在于,首先不 确定数字串的长度,很难准确判别连续数字串中的字间边界:其次连续数字串中的数 字是任意组合的,没有可以借鉴的语法知识;再有汉语数字自身的发音特点导致识别 困难,如:数字语音间的混淆程度高,汉语连续数字串中各个数字的协同发音现象较 严重等。此外,语音通信中不可避免地会受到说话人差异、线路干扰、环境噪声等的 影响,引起信号失真,导致识别系统的鲁棒性相当脆弱。 本课题研究主要包括两个方面: ( 1 ) 采用全局声学结构描述的连续数字语音识别。依据描述语音内在关系的、 对传输和处理过程中的线路噪声和 兑话人变化具有鲁棒性的全局声学结构a u s ,提 出适合于连续数字语音识别的双层结构化语音模型匹配策略,在没有可以借鉴的语法 知识情况下,不需要大量的训练模板,只要使用较少的单个数字语音训练数据就可以 实现任意长度的连续数字语音识别,且不需要充分的训练语料和通用的信道归一化技 术,解决目前语音识别和连续数字语音识别中存在的说话人差异性等的鲁棒性问题。 ( 2 ) 采用直方图均衡的语音识别鲁棒性研究。在语音识别中,加性噪声也是导 致系统性能下降的重要原因。直方图均衡化方法是一种非线性补偿变换技术,较传统 的基于线性变换技术的抗噪声方法进一步提高了系统的鲁棒性。但实际识别系统中, 除了噪声引起语音特征的非线性失真外,还存在训练和测试数据的语音特征类分布不 一致问题,从而难以保证传统的直方图均衡化方法发挥其优势。本文提出一种基于特 征分类的直方图均衡化方法,实验结果表明,低信噪比时无论在平稳噪声还是非平稳 噪声环境下,与传统的直方图均衡化方法相比都进一步增强了识别系统的鲁棒性。 关键词:汉语连续数字语音识别,全局声学结构,直方图均衡化,特征分类 作者:姜莹 指导老师:俞一彪 c o n n e c t e dd i g i ts p e e c hr e c o g n i t i o nb a s e d o nt h ea c o u s t i cu n i v e r s a ls t r u c t u r e a b s t r a c t c o n n e c t e dd i g i ts p e e c hr e c o g n i t i o nh a sw i d ea p p l i c a t i o ni no u r d a i l yl i f e ,s t l c ha s s p e e c ha u t o d i a l e ri n t e l e p h o n e a n dt e l e c o m m u n i c a t i o n s s y s t e m s ,p e r s o n a ln u m b e r v e r i f i c a t i o n ,i n t e l l i g e n c eh o m ea p p l i a n c e s r e m o t ec o n t r o lf o ra i r c o n d i t i o n i n ga n d t e l e v i s i o nc h a n n e l ,e t c c o n n e c t e dd i g i t s p e e c hr e c o g n i t i o n i sac r u c i a lb r a n c ho fc o n t i n u o u s s p e e c h r e c o g n i t i o n t h ef o l l o w i n ga r et h ed i f f i c u l t i e st h a tc o n n e c t e dd i g i t ss p e e c hr e c o g n i t i o ni s f a c i n g :f i r s t ,i t su n c e r t a i na b o u tt h el e n g t ho fc o n n e c t e dd i g i t sa n dd i f f i c u i tt od e t e n n i n e t h e b o u n d a r yo fe a c hd i g i tu n i ta c c u r a t e l y ;s e c o n d ,c o n n e c t e d d i g i ts t r i n g s 锄et h e c o m b i n a t i o no fd i g i t sw i t h o u ta n yl i m i t a t i o na n d g r a m m a t i c a lk n o w l e d g e ;t h i r d ,t h ed i g i t s p e e c hp r o n u n c i a t i o nh a si t so w n c h a r a c t e r i s t i c s ,f o re x a m p l e ,h i g hd e g r e eo fc o n 如s i o n b e t w e e ns o m ed i g i t s ,t h ep h e n o m e n o no fc o a r t i c u l a t i o na n ds o o n i na d d i t i o n ,s p e e c h a c o u s t i c si s i n e v i t a b l yd i s t o r t e db yn o n l i n g u i s t i cf e a t u r e s a l lt h e s ef a c t o r sm a k et h e p e r f o r m a n c eo ft h er e c o g n i t i o ns y s t e mp o o r t h i sp a p e rm a i n l yf o c u s e so nt w o a s p e c t s : ( 1 ) c o n n e c t e dd i g i ts p e e c hr e c o g n i t i o nb a s e do nt h ea c o u s t i cu n i v e r s a ls t m c t u r e n 一。 l h l sp a p e ra p p l i e dan o v e la c o u s t i cr e p r e s e n t a t i o no fs p e e c ht oc o n n e c t e d d i g i ts p e e c h r e c o g n i t i o n ,c a l l e dt h ea c o u s t i cu n i v e r s a ls t r u c t u r ew h e r et h en o n 1 i n g u i s t i cv a r i a t i o n s s u c ha sv o c a it r a c tl e n g t h ,l i n e s ,n o i s e s ,e t e ,a r ew e l lr e m o v e d ,a n d p r o p o s e dad o u b l e 1 a v e f s t r u c t u r eo fs p e e c hm o d e lm a t c h i n gs t r a t e g y t h er e c o g n i t i o ns y s t e mc a nr e a l i z ev a r i a b l e l e n g t hc o n n e c t e dd i g i tr e c o g n i t i o ni n t h ea b s e n c eo fg r a m m a t i c a lk n o w l e d g e ,a l a r g e n u m b e ro ft r a i n i n g t e m p l a t ea n du n i v e r s a lc h a n n e ln o r m a l i z a t i o n s ot h er o b u s t n e s s p r o b l e mf o rs p e a k e rv a r i a t i o n sw h i c he x i s t si nc u r r e n ts p e e c ha n d c o n n e c t e d d i g i t r e c o g n i t i o ns y s t e mi sw e l ls o l v e d ( 2 ) r o b u s ts p e e c hr e c o g n i t i o nb a s e do nh i s t o g r a me q u a l i z a t i o n t h ea d d i t i v en o i s ei sa l s oa n i m p o r t a n tr e a s o nt h a tw e a k e n st h ep e r f o r m a n c eo f r e c o g n i t i o ns y s t e m c o m p a r i n gw i t hc l a s s i c a lm e t h o d s ,t h eh i s t o g r a me q u a l i z a t i o nc a i l r e d u c en o n - l i n e a rd i s t o r t i o na n di m p r o v et h er o b u s t n e s so fs p e e c h r e c o g n i t i o ns y s t e mq u i t e w e l l h o w e v e ri nm a n ya p p l i c a t i o n s ,t h ef e a t u r ed i s t r i b u t i o nb e t w e e nt r a i n i n ga n dt e s t i l 竺q 璺望! 里! ! 鱼! ! ! 墅! 兰巳! 笪! 墨呈! 旦g ! 里q 墅垒箜曼垒q ! ! ! 兰垒曼旦坠鲤堕璺! ! ! 竖型墨! 型! 坐堡垒垒! ! 塑 s p e e c hi su s u a l l yn o ti d e n t i c a lb e c a u s eo ft h e i rd i f f e r e n c ei np h o n e t i c so ra c o u s t i c s ,t h e n t h ev a l i d i t yo fh e qc a nb ew e a k e n t h i sp a p e rp r o p o s e dh i s t o g r a me q u a l i z m i o no f c l a s s i f i e df e a t u r e sa l g o r i t h m ,t h ee x p e r i m e n t ss h o wt h a tt h i sm e t h o di m p r o v e st h e p e r f o r m a n c eo fs y s t e mw i t hc o m p a r i s o no fu s u a lh i s t o g r a me q u a l i z a t i o n k e y w o r d s :c o n n e c t e dd i g i ts p e e c hr e c o g n i t i o n , t h e a c o u s t i cu n i v e r s a ls t r u c t u r e , h i s t o g r a me q u a l i z a t i o n ,f e a t u r ec l a s s i f i c a t i o n 1 1 1 w r i t t e nb yj i a n gy i n g s u p e r v i s e db yy u y i b i a o 基于语普结构化模型的连续数语爵识别 第一章引言 第一章引言 本章概述了语音识别的基本概念和系统分类,并介绍了语音识别的研究现状,分 析了目前语音识别所面临的困难。 1 1 语音识别概述 语言是人类特有的功能,也是人类最重要的交际工具。语音是语言的声学表现, 是人们构成思想疏通和感情交流最主要的途径,也是人类交流信息最自然、最有效、 最方便的手段。随着计算机技术同新月异的发展,人类进入了信息化时代,计算机已 经应用到人们生活的各个方面,人与人之间的信息交流方式已不局限于面对面的方 式,而是通过各种现代化的通讯设施在任何时间任何地点进行语音信息交流,如手机、 电话、计算机网络以及卫星通信等。而如何让计算机智能化地与人进行通信是人类长 久以来的梦想,人机交互变得自然、方便正引起越来越多人的关注和研究。 语音识别( s p e e c hr e c o g n i t i o n ) 技术就是指让机器“听懂 人说的话,即在各种 i 情况下,准确地识别出语音的内容,从而根据其信息,执行人的各种意图。它是一门 涉及面很广的交叉学科,与计算机、通信、语音语言学、数理统计、信号处理、神经 生理学、神经心理学和人工智能等学科都有着密切联烈。 ( 一) 语音识别系统的分类 语音识别系统按照不同的角度、不同的应用范围、不同的性能要求有不同的分类 【l 】【2 1 ( 1 ) 根据语音识别词汇量的大小,可以分为小词汇、中词汇和大词汇量语音识 别系统。一般来说,小词汇量系统是指能识别l 2 0 词汇的语音识别系统,中等词汇 量指2 0 1 0 0 0 个词汇、大词汇量指1 0 0 0 个以上的词汇。语音识别系统的识别率一般 会随着词汇量的增加而下降。 ( 2 ) 根据所要识别的对象,可以分为孤立字( i s o l a t e dw o r d ) 、连接词( c o n n e c t e d w o r d ) 、连续语音( c o n t i n u o u ss p e e c h ) 识别系统。孤立词语音识别系统要求说话人每 次只说一个字( 词) 、一个词组或一条命令让识别系统识别。其中的词组或命令在词 第一章引占堆十语音结构化模型的连续数。,语爵识别 汇表中是一个独立的词条。例如:单个数字识别、地名词汇识别等。连接词识别一般 特指十个数字( 0 9 ) 连接而成的多位数字识别,连接词识别系统在电话、数据库查 询以及控制操作系统中用途广泛。连续语音识别这个最自然的说话方式,将成为语音 识别研究及实用系统的主流。 ( 3 ) 根据对说话人的依赖程度,可分为特定人( s p e a k e r d e p e n d e n t ) 和非特定人 ( s p e a k e r - i n d e p e n d e m ) 语音识别系统。特定人语音识别系统比较简单,只能识别固 定某个人的语音,由特定人的用户输入大量的发音样本,对其进行训练。非特定人语 音识别系统的训练相当复杂,机器能识别任何人的发音,需要采集大量不同说话人的 发音样本。 ( 4 ) 根据语音的质量可以分为安静环境和噪声环境的语音识别。说话者的语音 质量取决于本人口齿是否清楚,也取决于是否采取合作的态度,这往往是识别器所能 控制的。 ( 二) 语音识别的发展历史 语音识别的历史可追溯到2 0 世纪5 0 年代。1 9 5 2 年,a t & tb e l l 实验室实现了 第一个可识别十个英文数字的语音识别系统- a u d r y 系统。随后1 9 5 6 年,普林斯顿 大学r c a 实验室开发了单音节词识别系统。 6 0 年代,计算机的发展以及数字信号处理理论和算法的进展提供了语音识别的 技术基础。这时期的重要研究成果是提出了动态规划技术( d p ,d y n a m i c p r o g r a m m i n g ) 和线性预测分析技术( l p ,l i n e a rp r e d i c t i o n ) ,其中后者较好地解决 了语音信号产生模型的问题,对语音识别的发展产生了深远影响。 7 0 年代,语音识别研究的重心是孤立词语音识别。动态时间归整技术( d t w , d y n a m i ct i m ew a r p i n g ) 、线性预测编码技术( l p c ,l i n e a rp r e d i c t i o nc o d i n g ) 和矢量 量化技术( v o ,v e c t o rq u a n t i z a t i o n ) 基本成熟。比较有代表性的系统有: c a r n e g i e m e l l o n 大学的h e a r s a y i i 系统,i b m 的大词汇量自动语音听写系统和b e l l 实验室用于通讯的与话者无关的语音识别系统。 8 0 年代,语音识别的研究从基于模板的方法向统计模型方法的转变,特别是转 向研究隐马尔可夫模型( h m m ) 的理论、方法和实现问题,成为大词汇量连续语音 识别的基础。h m m 模型的广泛应用应归功于a t & tb e l l 实验室r a b i n e r 等科学家的 努力,他们把原本艰涩的h m m 纯数学模型工程化,从而为更多研究者了解和认识。 2 基于语占结构化模型的连续数语音识别第一章引苦 此外,人工神经网络( a n n ,a r t i f i c i a ln e u r a ln e t w o r k s ) 也开始涉足语音识别领域, a n n 和h m m 模型建立的语音识别系统,性能相当。 9 0 年代,随着多媒体时代的到来,语音识别系统从实验室走向实用。许多著名 公司如i b m 、a p p l e 、a t & t 、n t t 等投以巨资丌发研究实用化的语音识别系统。比 如i b m 、m i c r o s o f t 、l & h 公司推出中文语音识别引擎;1 9 9 7 年9 月,i b m 在国内发 布了一款语音识别产品a i c e ,被认为是汉字输入的重要里程碑;索取航空旅行 信息、电话网络及呼叫中心系统中也采用了语音识别技术。 2 0 0 0 年后,人机语音交互成为研究的焦点。研究重点包括即兴口语的识别和理 解,自然口语对话,以及多语种的语音同声翻译。九十年代兴起的小波分析技术在语 音分析中的应用,又开启了语音识别的新领域,在识别的效率与精确度上又得到了提 高【3 】o 我国语音识别的研究较国外起步晚,国内丌展语音识别较早的机构有北京大学、 中科院声学所、中科院自动化所、清华大学等,先后把语音识别纳入国家“8 6 3 ”计 划,国家自然科学基金重点项目,并得到基金和社会的支持,取得了丰硕的研究成果。 ( 三) 语音识别的难点 , 语音识别是一个复杂的系统,其自身的复杂性决定其发展过程的艰巨性。尽管 语音识别目前取得了一些成就,但仍面l 临许多困难。图1 1 是含噪语音信号的简化模 型,以下从语音信号的发音和传输方面列举语音识别的难点。 含噪语音信号y ( t ) 图1 1 含噪语音信号的简化模型 1 说话人差异性 不考虑信道畸变办( ,) 以及加性环境噪声信号门( ,) 的影响,可以认为是纯净语音 识别。影响识别系统性能的因素有同一个体差异性( i n t e r - s p e a k e rv a f i a t i o n ) 和不同 个体差异性( i n t r a - s p e a k e rv a r i m i o n ) 。 第一章引言基于语爵结构化模型的连续数字语音识别 同一个体差异性:主要指说话人的身体健康状况( 如疲劳、生病) 、心理状态及 情绪等对语音特征参数的影响。特定人的语音识别系统中主要考虑同一个体差异性。 目前,基于h m m 的特定人纯净语音识别系统,能够取得非常好的识别率,然而需要 使用者录入大量的语音用于训练,给使用者带来很大的不便。 不同个体差异性:主要指不同说话人的性别、年龄、不同的声道长度和形状以及 说话的风格口音等对语音特征参数的影响。不同个体差异性对非特定人的语音识别系 统造成的影响有两个方面:( 1 ) 若使用该系统的说话人的语音与训练语音库中说话人 的语音有较大差别,识别系统的性能对该说话人而言严重恶化。( 2 ) 一个好的语音识 别系统需要采集大量说话人的语音用于训练,训练的语音库覆盖广泛的语音空间,虽 然可以减少第一个因素的影响,但会导致识别系统的参数分布较广,识别系统的性能 普遍下降。 2 环境噪声的影响 在实际应用中,信道畸变h ( 0 以及加性环境噪声信号甩( f ) 的影响是不可避免的, 含噪语音表示为:y ( t ) = s ( t ) 幸办( ,) + n ( t ) 。上述因素的引入加上说话人的影响( 说话 风格、口音、情绪以及健康状况等) ,识别效果却很难令人满意。这主要是因为训练 和测试语音之间的声学失配,使得统计模型不能正确描述语音的统计规律,导致识别 系统适应性差。因此语音识别系统的抗噪问题是真正实用化所必须解决的关键问题。 3 声音的不稳定性 声音的某些特征如语音长度、音量、声调等在不同的上下文中,由于前后语境的 影响,这些参数也会发生变化,使得该语音与其它语音发生重音。如中文中的第三声, 如果后面也是第三声,前一个第三声就会变成第二声,这就是汉语中的变音现象【3 】。 1 2 连续数字语音识别 1 2 1 连续数字语音识别意义及难点 汉语连续数字语音识别是语音识别中的一个重要分支,它在现实中具有非常广泛 的应用前景,在电话与电信系统的语音拨号、自动数据录入、身份证号码证实、工业 控制、智能家电中用于电视频道和空调温度的遥控等多方面都有着重要的应用价值。 4 桀于语普结构化模型的连续数j 语音识别 第一章引苦 另外,对汉语连续数字语音识别的研究也具有重要的理论意义,一方面,完成对汉语 连续数字语音识别可以促进其他词表的连续语音识别的研究,其声学模型和搜索算法 等都可以借鉴到其他系统中;另一方面,研究如何消除汉语数字语音的混淆性也可以 对其他易混淆语音识别任务起到参考作用。 目前汉语连续数字语音识别系统的识别率同实际应用的需求相比还有一定的差 距,主要难点在于【4 】:首先不确定数字串的长度,很难准确判别连续数字串中的字间 边界;其次连续数字串中的数字是任意组合的,没有可以借鉴的语法知识,缺少语言 模型对识别系统的支持,识别性能的好坏完全依赖于底层的识别算法。同时数字语音 自身的发音特点,如:( 1 ) 含有一些单元音数字,音节越少语音间的混淆程度越高, 识别越困难,如“2 和“8 是易混淆的数字对;( 2 ) 汉语连续数字发音连续程度较 高,这主要由于汉语数字发音中零声母语音出现的较多,如“2 ”和“5 ”,这些数字 的连续发音序列( 如“5 5 ”) 的识别相当困难:( 3 ) 数字串中各个数字的协同发音现 象较严重也给汉语连续数字语音识别带来了困难。 除此之外和其他语音识别系统一样,语音通信包含语音生成、编码、传输、解码 以及接听等几个环节,其中每一个环节不可避免地会引入“噪声”而造成信号的失 真,例如:说话人差异、线路干扰、环境噪声等,这些都使识别性能明显下降,系统 的广泛实际应用变得困难。 1 2 2 连续数字语音识别研究现状 近年来国内外一些研究人员开始对影响包括汉语数字语音识别在内的语音识别 成熟应用的关键性技术问题进行了研究。j b i l m e s 等提出了一种图形化语音结构描述 方法【5 】:j g l a s s 提出了基于段结构的统计分析方法框架【6 l ;e s h r i b e r g 对人类的识别 机理进行分析并提出了应该注意的一些问题i7 】l d e n g 等提出了隐轨道模型的结构 化语音描述方法【8 1 ;r c s h y u 等提出多层贝叶斯模型用于解决连续数字的协同发音 现象【9 】;j g e m m e k e 等将缺失数据技术应用于连续数字语音识别1 1 0 】;徐华等依据互 信息理论提出了基于互信息估计的连续数字语音识别算法【4 】;王守觉等使用高维空间 点分布原理,在仿生模式识别的基础上提出了一种基于高维空间覆盖动态搜索理论的 非特定人连续数字语音识别方法【1 1 1 。章文义等利用声调提高中文连续数字串语音识别 嚣 第一章引占摹于语爵结构化模型的连续数,语音识别 系统的性能【12 1 。 这些研究都在不同程度上提高了连续数字语音识别和语音识别的某些性能,但他 们的一个共同点是几乎所有的语音模型都采用声学特征参数来描述,而声学特征不可 避免地容易受到各种噪声和信号失真的干扰而变化。因此,虽然提出了各种所谓的鲁 棒性算法,但只要采用声学特征来描述模型,无论是采用自适应补偿的方法还是采用 归一化方法都无法真j 下解决目前语音识别和连续数字语音识别存在的鲁棒性问题。 1 3 本课题的主要研究内容 本课题研究内容包括以下两个方面: 一、采用全局声学结构描述的连续数字语音识别。 ( 1 ) 孤立数字识别是连续数字语音识别的基础,将全局声学结构a u s 理论运用 于汉语数字语音识别,比较了a u s 方法和h m m 方法在两种情形下的识别率,即: ( a ) 采用声道弯折方法模拟不同声道长度的说话人之间差异性;( b ) 实际说话人之 间的差异性。通过实验证明,在少量语料训练下,a u s 方法可以取得优于h m m 的 性能,能有效消除说话人声道长度的差异性。 ( 2 ) 将全局声学结构a u s 理论运用连续数字语音识别,提出适合于连续数字语 音识别的双层结构化语音模型匹配策略。使用较少的单个数字语音数据训练,分析不 同候选数字栅格层数下不同字长的连续数字语音的识别情况。通过实验证明a u s 方 法只要使用较少的训练数据量就可以对说话人声道长度差异具有自然鲁棒性,且具有 较高的识别率。 二、采用直方图均衡的语音识别鲁棒性研究。 考虑加性噪声的影响,研究鲁棒性语音识别中特征值处理模块,针对传统的非线 性变换技术直方图均衡化方法提出改进方法一基于特征分类的直方图均衡化方法 ( f c h e q ) ,解决训练和测试语音特征类分布不一致问题。实验结果表明,低信噪比 时无论在平稳噪声还是非平稳噪声环境下,与传统的直方图均衡化方法相比都进一步 增强了识别系统的鲁棒性。 6 幕十语音结构化模型的连续数,语哥识别第_ 二章语爵识别幕奉理论 第二章语音识别基本理论 本章主要介绍语音识别的基本原理及方法,详述了隐马尔可夫模型h m m 的 基本算法。 2 1 语音识别的基本原理 语音识别一般分为两个步骤:第一步是:系统“学习”或“训练阶段。主要任 务是建立识别基本单元的声学模型以及进行文法分析的语言模型等。第二步是:“识 别或“测试”阶段。根据识别系统的类型选择能够满足要求的一种识别方法,采用 语音分析方法分析出这种识别方法所要求的语音特征参数,按照一定的准则或测度与 系统模型进行比较,通过判决得出识别结果。语音识别系统本质上是一种模式识别系 统,它的基本结构如图2 1 所示。 输入语音 识别结果 图2 1 语音识别框图 图中,预处理主要对含噪语音信号进行端点检测,语音分帧以及预加重处理工作。 特征提取是对语音信号进行特征参数分析,目的是抽取语音特征,以使在语音识 别时类内距离尽量小,类间距离尽量大。 训练阶段是指由用户输入若干次训练语音,经过预处理和特征提取后得到特征参 数,然后通过特征建模建立训练语音的参考模式库,或对模式库中的参考模式作适应 性修正。 识别阶段是指将输入语音的特征矢量参数和参考模式库中的模式进行相似度比 较,将相似度最高的模式所属的类型作为识别的中| 、日j 候选结果输出。后处理判决则依 据更多的语音知识处理( 如语言模型、词法、句法等) 得出最终的识别结果。 7 第二章语音识别慕奉理论皋于语音结构化模型的连续数,语爵识别 2 2 语音信号预处理 录音阶段,原始模拟语音信号经过预滤波、采样、量化、a d 转化,转化成在时 间和幅值上均为离散的数字信号。预滤波的目的有两个:( 1 ) 抑制输入信号各频率分 量中频率超过z 2 ( z 为采样频率) 的所有分量,以防止混叠干扰。( 2 ) 抑制5 0 h z 的电源工频干扰。这样,预滤波器必须是一个带通滤波器,设定其上限和下限截止频 率。语音信号经过预滤波和采样后,由a d 转换器变换为二进制数字码。 由于语音信号的平均功率谱受声门激励和口鼻辐射的影响,高频端大约在8 0 0 h z 以上按6 d b 倍频程跌落。为了使语音信号的频谱变得平坦,保持在低频到高频的整 个频带中,能用同样的信噪比求频谱,我们采用一个数字滤波器实现预加重,以提升 高频部分: 日( z ) = 1 一胆叫( 2 1 ) 其中t 值接近于l ,一般取u = 0 9 7 5 。 进行预加重数字滤波处理后,对语音信号要进行加窗分帧处理。语音信号具有时 变性,是一种典型的非平稳信号,但在一个短的时间范围内( 一般认为在1 0 3 0 m s ) 可将其看做是一个准稳态过程,即语音信号具有短时平稳性。所以我们对语音信号进 行“短时分析”,将语音信号s ( 聊) 分成相继的短段信号,用可移动的有限长度窗口函 数以刀) 进行加权的方法来实现,定义为: s w ( 行) = s ( m ) w ( n 一所) ( 2 2 ) 在语音信号处理中,常用的窗函数是矩形窗和汉明窗。它们的表达式如下( 其中 n 为帧长) : 矩形窗: 汉明窗: w = :, :三篡肛1 ( 2 3 ) 吣,= r 乩4 6 c o s 口别u ? 篡肛1 亿4 , 基于语音结构化模型的连续数7 - 语肾识别第二章语音识别皋奉理论 2 3 特征提取 特征提取就是对语音信号的每一帧进行声学参数分析,提取有效的信号特征。语 音识别中最常用的两种特征参数是m e l 频率倒谱系数( m f c c ,m e lf r e q u e n c y c e p s t r u mc o e f f i c i e n t ) 和线性预测倒谱系数( l p c c ,l i n e a rp r e d i c t i o nc e p s t r u m c o e f f i c i e n t ) ,二者都属于倒谱域特征分析参数。前者是从人的发声模型出发,利用线 性预测编码技术求倒谱系数,而后者是构造人的听觉模型,将频谱转换到符合人耳听 觉特性的m e l 频率尺度上,然后进行离散余弦变换( d c t ) 。由于语音的信息大部分 集中在低频部分,而高频部分易受环境干扰,m f c c 参数将线性频标转化为m e l 频 标,强调语音的低频信息,从而突出了有利于识别的信息,屏蔽了噪声的干扰,而 l p c c 参数是基于线性频标的,所以在有信道噪声和频谱失真的情况下,m f c c 参数 能产生更高的识别精度f 1 3 1 。 大量的研究表明,m f c c 参数能够比l p c c 参数更好地提高系统的识别性能,本 文采用的是m f c c 参数。 m f c c 参数的计算是将语音的频率从线性频标变换为m e l 频标,m e l 频率与线性 频率的转换关系是: 厂 厶= 2 5 9 5 1 0 9 ( 1 + 南) ( 2 5 ) 咖吐丑1 圈叫献籼小, 匹丑钮譬 图2 2m f c c 计算流程 图2 2 是m f c c 的计算流程,解释如下: ( 1 ) 确定每一帧语音信号采样序列的点数,对每帧序列s ( 疗) 预加重处理后经过离 散f f t 变换,取模的平方得到离散功率谱s ( 刀) 。 ( 2 ) 将s ( 月) 转换为m e l 频率下的功率谱。这需要在计算之前在语音的频谱范围内 设置若干个带通滤波器:h 。( 玎) , m = o ,1 ,m l 刀= o ,1 ,以一1 。m 为滤波 器的个数,为一帧语音信号的点数。滤波器在频域上为简单的三角形,其中心频 率为厶,它们在m e l 频率轴上是均匀分布的。在线性频率上,当m 较小时,相邻的厶 9 第- 二章语音识别基奉理论基于语爵结构化模型的连续数7 语音识别 间隔较小,随着垅的增加,相邻的厶间隔逐渐拉丌。在频率较低的区域,厶和厂之 间有一段是线性的。带通滤波器的参数事先计算好,在计算m f c c 参数时直接使用。 ( 3 ) 计算s ( 刀) 通过m 个日。( 刀) 后所得的功率值巴,并计算其自然对数。 r 一- 厶= i n c = l n | s ( n ) h m ( 门) l m = o ,1 ,m 一1 ( 2 6 ) l n = o j ( 4 ) 对三。,厶,三州计算其离散余弦变换得到m f c c 参数c ( n ) : c = 薹。s ( 鼍产) 删幺,p 亿7 , p 为m f c c 参数的阶数。 2 4 隐马尔可夫模型( 玎m ) 隐马尔可夫模型( h i d d e nm a r k o vm o d e l s ,h m m ) 在语音处理各个领域中已获得 广泛的应用。本节主要介绍语音的h m m 描述,和基于h m m 模型的语音识别算法。 2 4 1 语音的h m m 描述 语音的产生是由于声门处的气流冲击声带产生振动,再通过声道响应变成语音。 声道的变化决定了语音信号的非平稳随机特性,声道的下一时刻仅与当前状况有关, 而与历史无关,对于观察者来说,只能观察到语音信号的状态输出而不能直接观测到 马尔可夫过程的内部状态序列及转移过程,所以可以用一个隐马尔可夫过程来描述语 音信掣4 1 。 h m m 模型可以分为离散h m m 模型( d i s c r e t eh m m ,d h m m ) 、连续h m m 模 型( c o n t i n u o u sh m m ,c h m m ) 和半连续h m m 模型( s e m i c o n t i n u o u sh m m , s c h m m ) ,下文以d h m m 为例介绍相关理论知识。 一个h m m 模型由若干个状态组成,随着时间的变化,各个状态之间可以发生转 移,也可以在一个状态内驻留。每个观察向量对不同的状态都有一个相应的输出概率。 如图2 3 所示的h m m 。 。 l o 摹十语爵结构化模型的连续数。语音识别第一二帝语啬识刖皋本理论 。 0 2 p ;魄: : 一 。 在语音识别中,观察序列是一帧帧的m f c c 参数,对应图中的o ,d :,0 r ,共r 帧,称为输入观察序列。h m m 模型中包含个状态s s v ,标记模型中的各个状 态为 1 ,2 ,n 。而每一时刻所处的状态却是隐含的,在,时刻所处的状态构成状态 序列q = ( g l ,q 2 ,q r ) 。 万= 【万l ,乃,万】,巧= 尸( 吼= f ) i = 1 ,2 ,n , 死- - 1 ( 2 8 ) 彳仁吲 亿9 , 其中是从状态s ,到状态一转移时的转移概率, 口口= p ( q ,+ l = ,| g r = 耽 1 f , n ( 2 1 0 ) 其中q ,满足条件: os 1 ,= 1 ( 2 1 1 ) 对于状态s 下的观察序列,用若干个高斯概率密度函数( 简称为p d f ) 的线性组 合来表示,每个p d f 有各自的均值矢量和协方差矩阵,这些是通过对大量的m f c c 第_ 二章语音识别挂奉理论基十语音结构化模型的连续数,语舀识别 表2 1 输出概率密度函数中的参数描述 参数 说明 d观察向量 m每个状态包含的高斯元个数 l l第歹状态第,个混合高斯函数的权 正态高斯概率密度函数 1 l 第,状态第,个混合高斯元的均值矢量 o n第歹状态第,个混合高斯元的协方差矩阵 对于每一个状态,输出观察值概率的集合b = 以( q ) ) ,乞( d f ) 表示处于状态l 时 输出0 ,的概率: b o ( d ,) = ( o f f r ( o ,“j i 盯,) ,1 ( 2 1 2 ) ,= 1 其中权系数国满足下面的条件: m c o j ,= l ,1 j n ( 2 1 3 ) i = i h m m 模型通常采用兄= ( a ,b ,万) 表示。形象地说,h m m 可以分为两部分,一个 是m a r k o v 链,由万和4 描述,产生的输出为状态序列。另一个是随机过程,由b 描 述,产生的输出为观察值序列,t 为观察值时间长度。 h m m 用概率或统计范畴的理论,解决了怎样辨识具有不同参数的短时平稳信号 段,怎样跟踪它们之间的转化,如何对语音的发音速率及声学变化建立模型等问题。 但也存在缺点和局限性,如给定状态下,它假定各个观察矢量即各个语音帧之间是相 互独立的,实际上语音帧之间存在相关性。h m m 的状态驻留分布与语音信号的实际 特性不符等。人们提出新的改进模型,如高斯h m m 和随机分段h m m 来试图解决这 些问题。 1 2 基于语音结构化模型的连续数7 语占识别第一二章语音识别幕奉理论 2 4 2 基于h m m 的语音识别算法 h m m 模型用于语音识别,有三个基本问题需要解决: ( 1 ) 输出概率的计算问题:给定观察序列o = ( d 。,0 2 ,0 ,) 和h m m 模型 旯= ( a ,b ,7 ) ,如何计算观察序列对h m m 模型的输出概率p ( ol 五) ? ( 2 ) 状态序列解码问题:给定观察字符号序列和输出该符号序列的h m m 模型 旯= ( 爿,b ,y ) ,如何有效地确定与之对应的最佳状态序列? ( 3 ) 模型参数优化问题:给定观察序列o = ( o i , 0 2 ,o r ) ,如何调整五= ( 彳,b ,万) 的参数,使得在模型五下产生观察序列o 的后验概率p ( o ia ) 最大? 下面结合讨论这三个问题的解决,介绍h m m 的基本算法。 一、前向后向算法一h m m 的输出概率的计算 1 h m m 的前向概率和后向概率 前向算法: 前向算法是按输出观察值序列的时间,从前向后递推计算输出概率。 首先定义h m m 的前向概率: 口r ( f ) = p ( 0 1 0 2 d r ;g ,= f i 力) ( 2 1 4 ) 表示给定h m m 的模型参数五,观察序列 0 1 0 :o r ) 在t 时刻处于状态f 的概率。 ( 1 ) 初始化 口l ( f ) = 乃6 ,( 0 1 ) 1 i n ( 2 1 5 ) ( 2 ) 迭代计算 rn l ( 力2 喀州f ) j + i ) ,l t t - 1 , 1 芦 ( 2 1 6 ) ( 3 ) 结束 p ( o i 五) = e 昕( f ) ( 2 1 7 ) 后向算法: 后向算法与前向算法类似,后向算法按输出观察值序列的时间,从后向前递推输 出概率。 第_ 二章语音识别基本理论 基于语普结构化模型的连续数语爵识别 首先定义h m m 的后向概率: i l l ( i ) = p ( d ,+ lo r + 2 0 tq ,= fi 旯) ( 2 1 8 ) 表示给定h m m 模型参数允,观察序列在,时刻处于状态f ,系统输出部分观察序 列 o ,+ l ,q + 2 ,0 r ) 的概率。 后向概率屈( f ) 也有类似的递推公式计算: ( 1 ) 初始化 ( 2 ) 迭代计算 ( 3 ) 结束 屏( f ) = 1 , 1 i n ( 2 1 9 ) 屈( f ) = i ( o ,+ 1 ) 屈+ l ( ,) ,1 ,丁一1 ,1 ,n ( 2 2 0 ) p ( o i 五) = 届( 忱= f l o ( 1 ) 1 = 1 前向和后向概率的递推关系可用图2 4 表示。 t qo ) f + 1 q + 1o ) t 羁( 1 ) s n t + 1 屈h ( i ) ( 2 2 1 ) 图2 4 前向概率和后向概率的递推 整个观察序列对h m m 模型的输出概率可以分成前、后两部分观察序列输出的概 率的乘积,即前向概率和后向概率的乘积,可以得到下面的输出概率的计算公式: n n p ( d l 五) = q ( f ) 层( f ) = 口r ( f ) ,l t _ t - 1 ( 2 2 2 ) ,= l t = l 也可以写成以下形式: 1 4 慕十语舀结构化模型的连续数语音识另0第二章语占识别幕奉理论 nn p ( o l 旯) = 口,( f ) 口。b j ( o 川) 屈+ 。( n 1 r 丁一1 ( 2 2 3 ) ,;lt = l 这就是对第一个问题的解答。 二、维特比( v i t e r b i ) 算法 v i t e r b i 算法解决的是给定个观察值序列o = ( 0 1 ,0 2 ,0 ,) 和一个模型 旯= ( 彳,b ,j r ) ,在最佳的意义上确定一个状态序列q = ( 吼,q 2 ,q r ) 的问题。这里的最 佳是指使p ( s ,0 l 五) 最大时确定的状态序列。v i t e r b i 算法的叙述如下: 首先说明下列符号定义

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论