数字语音信息处理 课件 第3章 语音特征提取_第1页
数字语音信息处理 课件 第3章 语音特征提取_第2页
数字语音信息处理 课件 第3章 语音特征提取_第3页
数字语音信息处理 课件 第3章 语音特征提取_第4页
数字语音信息处理 课件 第3章 语音特征提取_第5页
已阅读5页,还剩57页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

我们毕业啦其实是答辩的标题地方第三章语音特征提取马勇江苏师范大学2目录2频域特征3倒谱域特征4线性预测特征1时域特征0特征提取概述语音信号特征是语音信号处理的前提和基础,只有分析出可表示语音信号特征的参数,才能利用这些特征进行高效的语音通信、语音合成和语音识别等处理。语音特征分析是建立在“短时分析技术”基础上。语音信号从整体来看其特征及参数均是随时间而变化的,所以是一个非平稳随机过程,不能采用常规数字信号处理技术进行分析处理。

但是在一个短时间范围内(一般取10-40ms),其特性基本保持不变,即相对稳定,因而可以将其看作是一个准平稳过程,即语音信号具有短时平稳性。根据所分析参数的性质不同,语音特征可分为:

时域特征、频域特征、倒频域特征,线性预测特征等;不论是分析怎么样的特征参数以及采用什么分析方法,在按帧进行语音分析,提取语音特征参数之前,有一些共同的短时分析技术必须预先进行,如语音信号的数字化、预加重、加窗和分帧等,这些也是所有语音信号分析的关键基础。

语音分帧帧长与帧移的示例

分帧概念分帧是用可移动的有限长度窗口进行加权的方法来实现的,这就是用一定的窗函数ω(n)来乘语音信号s(n),从而形成加窗语音信号sω(n)=s(n)*ω(n)。在语音信号数字处理中常用的窗函数是矩形窗和汉明窗等,它们的表达式如下(其中N为帧长):矩形窗:汉明窗:一个好的窗函数的标准是:在时域因为是语音波形乘以窗函数,所以要减小时间窗两端的坡度,使窗口边缘两端不引起急剧变化而平滑过渡到零,这样可以使截取出的语音波形缓慢降为零,减小语音帧的截断效应;在频域要有较宽的3dB带宽以及较小的边带最大值。这里只以典型的矩形窗和汉明窗为例进行比较。1.窗的形状矩形窗与汉明窗的比较窗类型旁瓣峰值主瓣宽度最小阻带衰减矩形窗-134π/N-21汉明窗-418π/N-53从上表我们可以看出,汉明窗的主瓣宽度比矩形窗大一倍,即带宽约增加一倍,同时其带外衰减也比矩形窗大一倍多。矩形窗的谱平滑性能较好,但损失了高频成分,使波形细节丢失;而汉明窗则相反,从这一方面来看,汉明窗比矩形窗更为合适。因此,对语音信号的短时分析来说,窗口的形状是至关重要的。例如,选用不同的窗口将使时域分析参数的短时平均能量的平均结果不同。采样周期Ts=1/fs,窗口长度N和频率分辨率Δf之间存在下列关系:Δf=1/NTs可见,采样周期一定时,Δf随窗口宽度N的增加而减小,即频率分辨率相应得到提高,但同时时间分辨率降低;如果窗口取短,频率分辨率下降,而时间分辨率提高,因而二者是矛盾的。应该根据不同的需要选择合适的窗口长度。2.窗的长度窗口长度的选择,更重要的是要考虑语音信号的基音周期。通常认为在一个语音帧内应包含1~7个基音周期。然而不同人的基音周期变化很大,从女性和儿童的2ms到老年男子的14ms(即基音频率的变化范围为500~70Hz),所以N的选择比较困难。通常在10kHz取样频率下,N折中选择为100~200点为宜(即10~20ms持续时间)。这样,经过上面介绍的处理过程,语音信号就已经被分割成一帧一帧的加过窗函数的短时信号,然后再把每一个短时语音帧看成平稳的随机信号,利用数字信号处理技术来提取语音特征参数。

窗长选择标准3.1时域特征语音信号的时域特征就是分析和提取语音信号的时域参数。进行语音分析时,最先接触到并且也是最直观的是它的时域波形。语音信号本身就是时域信号,因而时域分析是最早使用,也是应用最广泛的一种分析方法,这种方法直接利用语音信号的时域波形信息。时域分析通常用于最基本的参数分析及应用,如语音的分割、预处理、分类等。时域特征分析方法的特点:①表示语音信号比较直观、物理意义明确。②实现起来比较简单、运算量少。③可以得到语音的一些重要的参数。

短时过零率表示一帧语音中语音信号波形穿过横轴(零电平)的次数。过零分析是语音时域分析中最简单的一种。对于连续语音信号,过零即意味着时域波形通过时间轴;而对于离散信号,如果相邻的取样值改变符号则称为过零。过零率就是样本改变符号的次数。定义语音信号xn(m)的短时过零率Zn为:式中,sgn[]是符号函数,即1.短时过零率特征分析利用短时平均过零率还可以从背景噪声中找出语音信号,可用于判断无声段和有声段的起点和终点位置。在孤立词的语音识别中,必须要在一连串连续的语音信号中进行适当分割,用以确定一个一个单词的语音信号,即找出每一个单词的开始和终止位置,这在语音处理中是一个基本问题。此时,在背景噪声较小时用平均能量识别较为有效,而在背景噪声较大时用平均过零率识别较为有效。但是研究表明,在以某些音为开始或结尾时,如当弱摩擦音(如[f]、[h]等音素)、弱爆破音(如[p]、[t]、[k]等音素)为语音的开头或结尾只用其中一个参量来判别语音的起点和终点是有困难的,必须同时使用这两个参数。

短时过零率特征分析设语音波形时域信号为x(t)、加窗分帧处理后得到的第n帧语音信号为xn(m),则xn(m)满足下式:xn(m)=ω(m)x(n+m)其中,n=0,1,2,…,N,N为帧长。设第n帧语音信号xn(m)的短时能量用En表示,则其计算公式如下:2.短时能量特征分析度量语音信号幅度值变化的函数,即短时平均幅度函数Mn,它定义为:Mn也是一帧语音信号能量大小的表征,它与En的区别在于计算时小取样值和大取样值不会因取平方而造成较大差异,在某些应用领域中会带来一些好处。3.短时平均幅度特征分析相关分析是一种常用的时域波形分析方法,并有自相关和互相关之分。这里主要讨论自相关函数。自相关函数具有一些性质,如它是偶函数;假设序列具有周期性,则其自相关函数也是同周期的周期函数等。我们可以把自相关函数的这些性质应用于语音信号的时域分析中。例如,对浊音语音可以用自相关函数求出语音波形序列的基音周期。此外,在进行语信号的线性预测分析时,也要用到自相关函数。和其他语音参数一样,在语音信号分析中,我们分析的是短时自相关函数。

4.短时自相关分析定义语音信号xn(m)的短时自相关函数Rn(k)的计算式如下:这里K是最大的延迟点数。短时自相关函数具有以下性质:(1)如果xn(m)是周期的(设周期为N),则自相关函数是同周期的周期函数,即Rn(k)=Rn(k+Np)。(2)Rn(k)是偶函数,即Rn(k)=Rn(-k)。(3)当k=0时,自相关函数具有最大值,即Rn(0)≥|Rn(k)|,并且Rn(0)等于确定性信号序列的能量或随机性序列的平均功率。

4.短时自相关函数3.2频域特征从广义上讲,语音信号的频域特征包括语音信号的频谱、功率谱、倒频谱、频谱包络分析等,而常用的频域分析方法有带通滤波器组法、傅里叶变换法等几种。因为语音波是一个非平稳过程,因此适用于周期、瞬变或平稳随机信号的标准傅里叶变换不能用来直接表示语音信号,而应该用短时傅里叶变换对语音信号的频谱进行分析,相应的频谱称为“短时谱”。

我们还可以上式写成另一种形式。设语音信号序列和窗口序列的标准傅里叶变换均存在。当n取固定值时,ω(n-m)的傅里叶变换为:根据卷积定理有:因为上式右边两个卷积项均为关于角频率ω的以2π为周期的连续函数,所以也可将其写成以下的卷积积分形式:即,假设x(m)的DTFT是X(ejω),且ω(m)的DTFT是X(ejω),那么Xn(ejω)是X(ejω)和W(ejω)的周期卷积。语音短时频谱的物理意义

在语音信号数字处理中,功率谱具有重要意义,在一些语音应用系统中,往往都是利用语音信号的功率谱。根据功率谱定义,可以写出短时功率谱与短时傅里叶变换之间的关系:或者:式中*表示复共轭运算。并且功率谱Sn(ejω)是短时自相关函数Rn(k)的傅里叶变换。语谱图特征

语谱图是语音信号分析常用的方法,之后人们在计算机上通过短时傅里叶变换实现语谱图的绘制。语谱图在二维空间中反应语音的不同频段的能量随时间变化的情况。语谱图为语音信号的时频表示,横坐标单位为时间,纵坐标单位为频率,语谱图的颜色深浅表示时频点能量大小。滤波器组特征

滤波器组特征,又称FBank(FilterBank)特征,是通过滤波器组分析语音信号频谱特征的方法。语音信号频谱经过Mel滤波器组,这些滤波器为带通滤波器,对每个滤波器频带求频谱能量,然后进行叠加,最后计算各频带对应的功率谱。语音信号

预加重分帧、加窗

短时傅里叶变换

计算功率谱

幅度取平方

梅尔刻度滤波器组

对数计算

FBank特征

信号的倒谱就是将该信号的离散傅里叶变换的对数幅度做离散傅里叶逆变换(IDTFT),Borgert等人在1963年首次提出倒谱(Cepstrum)概念。1967年,Noll把倒谱引入语音信号处理。语音信号的倒谱特征提取的过程,它可以通过同态处理来实现。同态信号处理也称为同态滤波,它实现了将卷积关系变换为求和关系的分离处理,即解卷。对语音信号进行解卷,可将语音信号的声门激励信息及声道响应信息分离开来,从而求得声道共振特征和基音周期,用于语音编码、合成、识别等。3.3倒谱特征

同态信号处理的基本原理我们日常生活中遇到的许多信号,它们并不是加性信号(即组成各分量按加法原则组合起来)而是乘积性信号或卷积性信号,如语音信号、图像信号、通信中的衰落信号、调制信号等。这些信号要用非线性系统来处理。而同态信号处理就是将非线性问题转化为线性问题的处理方法。按被处理的信号来分类,大体分为乘积同态处理和卷积同态处理两种。由于语音信号可视为声门激励信号和声道冲击响应的卷积,所以这里仅讨论卷积同态信号处理。

同态信号处理的基本原理

同态信号处理的基本原理第一个子系统D*[]完成将卷积性信号转化为加性信号的运算,即对于信号x(n)=xl(n)*x2(n)进行了如下运算处理:

由于x^(n)为加性信号,所以第二个子系统可对其进行需要的线性处理得到y^(n)。第三个子系统是逆特征系统D*-1[],它对y^(n)=

y1^(n)+y2^(n)进行逆变换,使其恢复为卷积性信号,即进行了如下处理:从而得到卷积性的恢复信号。

复倒谱和倒谱虽然D*[]与D*-1[]系统中的x^(n)和y^(n)信号也均是时域序列,但它们所处的离散时域显然不同于x(n)和y(n)所处的离散时域,所以我们把它称之为“复倒频谱域”。x^(n)是x(n)的“复倒频谱”,简称为“复倒谱”,有时也称作对数复倒谱。其英文原文为“ComplexCepstrum”,Cepstrum是一个新造的英文词,它是由Spectrum这个词的前四个字母倒置而构成的。同样,序列y^(n)也是y(n)的复倒谱。

复倒谱和倒谱在绝大多数数字信号处理中,X(z),X^(z),Y(z),Y^(z)的收敛域均包含单位圆,因而D*[]与D*-1[]系统有如下形式:D*[]=D*-1[]=设:则取其对数得:即复数的对数仍是复数,它包含实部和虚部。注意,这时对数的虚部arg[X(ejω)]由于是X(ejω)的相位,所以将产生不一致性。如果,我们只考虑X^(ejω)的实部,令:显然c(n)是序列x(n)对数幅度谱的傅里叶逆变换。c(n)称为“倒频谱”或简称为“倒谱”,有时也称“对数倒频谱”。倒谱对应的量纲是“Quefrency”,它也是一个新造的英文词,是由“Frequency”转变而来的,因此也称为“倒频”,它的量纲是时间。c(n)实际上就是我们要求取的语音信号倒谱特征。复倒谱和倒谱特点和关系(1)复倒谱要进行复对数运算,而倒谱只进行实对数运算。(2)在倒谱情况下一个序列经过正逆两个特征系统变换后,不能还原成自身,因为在计算倒谱的过程中将序列的相位信息丢失了。(3)与复倒谱类似,如果c1(n)和c2(n)分别是x1(n)和x2(n)的倒谱,并且x(n)=x1(n)*x2(n),则x(n)的倒谱c(n)=c1(n)+c2(n)。(4)已知一个实数序列x(n)的复倒谱x^(n),可以由x^(n)求出它的倒谱c(n)。(5)已知一个实数序列x(n)的倒谱c(n),能否用它来求出复倒谱x^(n)?

语音信号两个卷积分量的复倒谱语音信号可看做是声门激励信号和声道冲激响应两信号的卷积,因此下面将分别讨论这两个信号的复倒谱的性质。

复倒谱分析中的相位卷绕及避免相位卷绕的方法在复倒谱分析中,z变换后得到的是复数,所以取对数时进行的是复对数运算。这时存在相位多值性问题,称为“相位卷绕”。相位卷绕使得求语音的复倒谱,以及从复倒谱中恢复语音等运算都会由于不确定性而产生错误。下面来分析复倒谱分析中相位卷绕是怎样产生的。上式的相位也可表示为:式中,虽然φl(ω)和φ2(ω)的范围均在(0,2π)内,但φ(ω)的值可能不在(0,2π)之内,而计算机处理时总相位值只能用主值Φ(ω)(在(0,2π)内)来表示。所以可能存在下面的情况:(k为整数)此时即产生了相位卷绕。显然,相位卷绕的产生是由于相位的多值性问题。它会使后面求复倒谱以及由复倒谱恢复语音等运算存在不确定性而产生错误。求复倒谱时避免相位卷绕的方法有限制法、微分法、最小相位信号法等。其中,限制法的思想是将复倒谱的相位限制在-π<φ(ω)<π的范围内,从而有φ(ω)=Φ(ω)。但对于语音信号来讲,由于语音信号是随机的,所以这种限制是不科学的。下面介绍其他两种求复倒谱时避免相位卷绕的方法。

语音信号倒谱分析实例1.由同态分析求出的语音信号倒谱实例一个信号的倒谱定义为信号频谱模的自然对数的逆傅里叶变换(即设相位恒定为零)。设信号为s(n),则其倒谱为:根据语音信号产生模型,语音信号s(n)是由声门脉冲激励e(n)经声道响应v(n)滤波而得到,即:设三者的倒谱分别为s^(n)、e^(n)及v^(n),则有:2.MEL频率倒谱参数(MFCC)与普通实际频率倒谱分析不同,MFCC(Mel-FrequencyCepstralCoefficents,简称MFCC)的分析着眼于人耳的听觉特性,因为,人耳所听到的声音的高低与声音的频率并不成线性正比关系,而用Mel频率尺度则更符合人耳的听觉特性。所谓Mel频率尺度,它的值大体上对应于实际频率的对数分布关系。Mel频率与实际频率的具体关系可用式表示:这里,实际频率的单位是Hz。语音信号倒谱分析实例Mel频率尺度滤波器组MFCC特征提取框图MFCC特征

语音信号

预加重分帧、加窗

短时傅里叶变换

计算功率谱

幅度取平方

梅尔刻度滤波器组

对数计算

离散余弦变换

差分计算

MFCC一阶差分特征MFCC二阶差分特征

3.4语音信号的线性预测分析线性预测分析:由于语音样点之间存在相关性,所以可以用过去的样点值来预测现在或未来的样点值,即一个语音的抽样能够用过去若干个语音抽样或它们的线性组合来逼近。通过使实际语音抽样和线性预测抽样之间的误差在某个准则下达到最小值来决定唯一的一组预测系数。而这组预测系数就反映了语音信号的特性,可以作为语音信号特征参数用于语音识别、语音合成等。

线性预分析的基本原理线性预测分析的基本思想是:用过去p个样点值来预测现在或未来的样点值:预测误差ε(n)为:这样就可以通过在某个准则下使预测误差ε(n)达到最小值的方法来决定惟一的一组线性预测系数ai(i=1,2,…,p)。线性预分析的基本原理这里,系统的输入e(n)是语音激励,s(n)是输出语音,模型的系统函数H(z)可以写成有理分式的形式:采用全极点模型,辐射、声道以及声门激励的组合谱疚的传输函数为:在模型参数估计程中,把如下系统称为线性预测器:式中ai称为线性预测系数。从而,p阶线性预测器的系统函数具有如下形式:预测误差为:线性预测分析要解决的问题是:给定语音序列(显然,鉴于语音信号的时变特性,LPC分析必须按帧进行),使预测误差在某个准则下最小,求预测系数的最佳估值ai,这个准则通常采用最小均方误差准则。下面推导线性预测方程。把某一帧内的短时平均预测误差定义为:为使E{ε2(n)}最小,对aj求偏导,并令其为零,有:上式表明采用最佳预测系数时,预测误差ε(n)与过去的语音样点正交。由于语音信号的短时平稳性,要分帧处理(10-30ms),对于一帧从n时刻开窗选取的N个样点的语音段Sn,记Φn(j,i)为则有:

线性预测方程组的求解对于语音段Sn,它的自相关函数为:因此,可以定义Φn(j,i)为因此有:把上式展开写成矩阵形式:这种方程叫Yule-Wslker方程,方程左边的矩阵称为托普利兹(Toeplitz)矩阵,它是以主对角线对称的、而且其沿着主对角线平行方向的各轴向的元素值都相等。这种Yule-Wslker方程可用莱文逊-杜宾(Levinson—Durbin)递推算法来高效地求解。下面介绍Durbin快速递推算法。

线性预测方程组的求解完整的递推过程为:ifi<pgoto(1)

LPC谱估计和LPC复倒谱1.LPC谱估计当求出一组预测器系数后,就可以得到语音产生模型的频率响应,即:因此在共振峰频率上其频率响应特性会出现峰值。所以线性预测分析法又可以看做是一种短时谱估计法。其频率响应H(ejω)即称为LPC谱。

1.LPC谱估计LPC谱估计具有一个特点:在信号能量较大的区域即接近谱的峰值处,LPC谱和信号谱很接近;而在信号能量较低的区域即接近谱的谷底处,则相差比较大。这个特点对于呈现谐波结构的浊音语音谱来说,就是在谐波成分处LPC谱匹配信号谱的效果要远比谐波之间好得多。LPC谱估计的这一特点实际上来自均方误差最小准则。从以上讨论我们知道如果p选得很大,可以使|H(ejω)|精确地匹配于|S(ejω)|,而且极零模型也可以用全极点模型来代替,但却增加了计算量和存储量,且p增加到一定程度以后,预测平方误差的改善就很不明显了,因此在语音信号处理中,p一般选在8~14之间。2.LPC复倒谱LPC系数是线性预测分析的基本参数,可以把这些系数变换为其他参数,以得到语音的其他替代表示方单。LPC系数可以表示整个LPC系统冲激响应的复倒谱。按上式求得的复倒谱h^(n)称之为LPC复倒谱。LPC复倒谱由于利用了线性预测中声道系统函数H(z)的最小相位特性,避免了相位卷绕问题;且LPC复倒谱的运算量小,它仅是用FFT求复倒谱时运算量的一半;又因为当p→∞时,语音信号的短时复频谱S(ejω)满足|S(ejω)|=|H(ejω)|,因而可以认为h^(n)包含了语音信号频谱包络信息,即可近似把h^(n)当作s(n)的短时复倒谱s^(n),来分别估计出语音短时谱包络和声门激励参数。在实时语音识别中也经常采用LPC复倒谱作为特征矢量。对以上所介绍的进行总结可知,为了估计语音信号的短时谱包络,有三种方法:①由LPC系数直接估计语音信号的谱包络;②由LPC倒谱估计谱包络;③求得复倒谱s^(n),再用低时窗取出短时谱包络信息,这种方法称之为FFT倒谱。3.LPC美尔倒谱系数(LPCCMCC)由式(3-143)求得复倒谱h^(n)后,由c(n)=1/2[h^(n)+h^(-n)]即可求出倒谱c(n)。但是,这个倒谱c(n)是实际频率尺度的倒谱系数(称为LPC倒谱系数:LPCC)。根据人的听觉特性可以把上述的倒谱系数进一步按符合人的听觉特性的美尔(MEL)尺度进行非线性变换,从而求出如下所示的LPC美尔倒谱系数(LPCMCC)。感知线性预测预处理语音信号离散傅里叶变换临界频带分析等响度预加重强度-响度变换逆离散傅里叶变换线性预测分析PLP的提取主要步骤:

1)语音信号首先经过加窗、分帧和预加重等预处理。2)分帧后的语音信号经过离散傅里叶变换得到短时谱,这里还需要进一步计算短时谱的实部和虚部的平方和,最后得到语音的功率谱。3)通过Bark尺度的滤波器分析临界带功率谱。4)等响度预加重,近似人耳对信号不同频率分量的不同敏感度,进行强度-响度转换。5)傅里叶逆变换后,计算线性预测系

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论