版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、 语音端点检测的目的和意义 基于短时能量和短时平均过零率的端点检测 基于倒谱特征的端点检测 基于熵的端点检测 基于复杂性的端点检测(KCKC复杂性和C C0 0复杂性) 不同语音端点检测方法的实验结果对比第1页/共36页语音端点检测的目的和意义 目的 语音信号端点检测技术其目的就是从包含语音的一段信号中准确地确定语音的起始点和终止点,区分语音和非语音信号,它是语音处理技术中的一个重要方面。 意义 有效的端点检测技术不仅能在语音识别系统中减少数据的采集量,节约处理时间,还能排除无声段或噪声段的干扰,提高语音识别系统的性能,而且在语音编码中还能降低噪声和静音段的比特率,提高编码效率。 第2页/共3
2、6页基于短时能量和短时平均过零率的端点检测 短时能量 语音和噪声的区别可以体现在它们的能量上,语音段的能量比噪声段能量大,语音段的能量是噪声段能量叠加语音声波能量的和。在信噪比很高时,那么只要计算输入信号的短时能量或短时平均幅度就能够把语音段和噪声背景区分开。这是仅基于短时能量的端点检测方法。 信号x(n)x(n)的短时能量定义为: : 语音信号的短时平均幅度定义为: 其中w(n)w(n)为窗函数。第3页/共36页 短时平均过零率 短时过零表示一帧语音信号波形穿过横轴( (零电平) )的次数。过零分析是语音时域分析中最简单的一种。对于连续语音信号,过零意味着时域波形通过时间轴;而对于离散信号,
3、如果相邻的取样值的改变符号称为过零。过零率就是样本改变符号次数。 信号x(n)x(n)的短时平均过零率定义为: : 式中,sgnsgn为符号函数,即: : 第4页/共36页 过零率有两类重要的应用: :第一,用于粗略地描述信号的频谱特性; ;第二,用于判别清音和浊音、有话和无话。从上面提到的定义出发计算过零率容易受低频干扰,特别是50Hz50Hz交流干扰的影响。解决这个问题的办法,一个是做高通滤波器或带通滤波,减小随机噪声的影响;另一个有效方法是对上述定义做一点修改,设一个门限T T,将过零率的含义修改为跨过正负门限。 于是,有定义: : 第5页/共36页 检测方法 利用过零率检测清音,用短时
4、能量检测浊音,两者配合。首先为短时能量和过零率分别确定两个门限,一个是较低的门限数值较小,对信号的变化比较敏感,很容易超过;另一个是比较高的门限,数值较大。低门限被超过未必是语音的开始,有可能是很短的噪声引起的,高门限被超过并且接下来的自定义时间段内的语音超过低门限,意味着信号开始。 此时整个端点检测可分为四段:静音段、过渡段、语音段、结束。实验时使用一个变量表示当前状态。静音段,如果能量或过零率超过低门限,就开始标记起始点,进入过渡段。过渡段当两个参数值都回落到低门限以下,就将当前状态恢复到静音状态。而如果过渡段中两个参数中的任一个超过高门限,即被认为进入语音段。处于语音段时,如果两参数降低
5、到门限以下,而且总的计时长度小于最短时间门限,则认为是一段噪音,继续扫描以后的语音数据,否则标一记结束端点。第6页/共36页200040006000800010000 12000140001600018000-101Speech2040608010012014016018020022002040Energy204060801001201401601802002200102030ZCR数字“4”的短时能量与平均过零率第7页/共36页基于倒谱特征的端点检测 概念 信号倒谱的一种定义是信号的能量谱密度函数S S()()的对数的傅里叶反变换,或者可以将信号s s( (n n) )的倒谱c c( (n
6、n) )看成是loglogS S()()的傅里叶级数展开,即: 式中C Cn n=C=C-n-n为实数,通常称为倒谱系数,且 第8页/共36页 对于一对谱密度函数S(w)S(w)与S S(w)(w) ,利用Parseval定理,其对数谱的均方距离可用倒谱距离表示: : 式中,C Cn n与C Cn n分别代表谱密度函数S(w)S(w)与S S(w)(w)的倒谱系数。 第9页/共36页 方法: 倒谱距离的测量法步骤类似于基于能量的端点检测,只是将倒谱距离代替短时能量来作为特征参数。首先,假定前几帧信号是背景噪声,计算这些帧的倒谱系数,利用前几帧倒谱系数的平均值可估计背景噪声的倒谱系数,噪声倒谱系
7、数的近似值可按下述规则进行更新,即当前帧被认为是非语音帧: : 式中 为噪声倒谱系数的近似值, 为当前测试帧的倒谱系数,p p为调节参数。 倒谱距离可用下式近似计算: 式中 对应于 的噪声倒谱系数,计算所有测试帧与背景噪声之间的倒谱距离可得到倒谱距离轨迹类似于基于能量的端点检测过程利用倒谱距离轨迹可检测语音的端点。第10页/共36页基于熵的端点检测 基于信息熵的检测方法 对于离散型信源,当它由若干随机事件所组成时,随机事件出现的不确定度用其出现的概率来描述。事件出现的可能性愈小,概率就愈小,而所含信息量却愈大;相反,事件出现可能性愈大,概率就愈大,而所含信息量却愈小。则信源提供的平均信息量为:
8、 这里所定义的H(x)H(x)就是信息熵。第11页/共36页 由于语音信号的幅度相对于背景噪声而言其幅度的动态范围大。因此可以认为语音信号在范围( (一M,M)M,M)中的随机事件大,也就是熵值大,而无声状态( (信号中只含噪声) )的幅度小、分布相对集中,因而熵值小。 按照以上原理,在构造出了熵函数之后就可只计算出每帧信号的信息熵( (幅度熵) )。假设语音信号S(n)S(n)的帧长为N N,在一帧语音中最大幅度值与最小幅度值分别为M M、一M M,分别统计这一区域中S(n)=SS(n)=Si i,S Si i( (一M M,M)M)出现的次数n ni i,并将比例n ni i/N/N作为出
9、现S Si i这一值的概率:P:Pi i= n= ni i/N/N。将P Pi i代入前面的熵函数公式,即可得到语音信号的熵函数曲线。背景噪声信号的幅度熵的值较小而浊音信号的幅度熵值比较大,因此可以进行端点检测。首先通过实验确定一个阈值h h,然后对每帧语音的熵值进行比较,认为熵值大于等于h h时为语音帧,小于h h则为无声帧,即可检测出语音信号的端点。第12页/共36页 基于谱熵的检测方法 谱熵方法与信息嫡方法有着相似之处,信息熵方法是在时域内对信号进行熵值统计和计算,谱熵检测方法是从语音信号的频域来进行计算,然后从频谱分布概率来进行语音端点的检测。 谱熵的计算方法如下: :首先通过快速傅立
10、叶变换(FFT)(FFT)得到每一帧信号的频谱,其中每个频谱向量的系数表明了该帧信号在该频率点的大小分布。然后计算每个频谱分量在每帧总能量中所占的比例,将其作为信号能量集中在某频率点的概率,其概率密度函数定义为: : 式中,S(fS(fi i) )是f fi i的能量,P Pi i是相应的概率密度,N N是FTFFTF中频率成分的所有点数。由于语音信号的绝大部分能量集中200Hz200Hz350OHZ350OHZ之间,所以,为了集中计算谱熵以增加语音和非语音在概率密度函数中的区分性,我们把200HZ200HZ3500Hz3500Hz之外的频率分量置为0 0,即: :第13页/共36页 相应的每
11、一帧的谱熵定义如下: 通过熵函数就可以计算每帧语音信号的谱熵,并跟阈值比较,就可以检测出语音的起止点。第14页/共36页基于复杂性的端点检测(KCKC复杂性和C C0 0复杂性) 复杂性第15页/共36页 KolmogorovKolmogorov复杂度 即KCKC复杂性,它可以用来衡量序列的复杂程度如何,LemPelLemPel和ZivZiv定义了由有限集合的元素所构成的有限序列的复杂度C(n)C(n),它反映了序列接近随机的程度,按有限序列从头开始反复进行以下操作:每次添加一个元素构成一个检验子串,如果该子串在除去最后添加的那个元素之前所构成的序列中已出现过,那么所构成的新序列的复杂度保持不
12、变,并继续添加元素,直到由上述相继添加元素所构成的添加子串在除去最后添加的那个元素之前所形成的整个序列中从未出现过为止,此时整个序列的复杂度增加一,当往后继续添加元素时重新建立新的检验子串,如此反复进行,直到结束。如果最后一个检验子串在除去末尾一个元素之前的序列中出现过,复杂度也仍然加一。第16页/共36页 具体来说,分以下几个步骤: : 假如有一数列(x1,x2,xn)(x1,x2,xn),首先求得这个数列的平均值m m,再把这个数列重构。大于平均值m m的值,令它们为1 1,小于平均值m m的,令之为0 0,这样,就构成了(S1,S2,Sn)(S1,S2,Sn)新的(0,1)(0,1)序列
13、。 在这样的(0(0,1)1)序列中已形成的一串字符S=s1S=s1,s2,srs2,sr后,再加称之为Q Q的一个或一串字符S Sr+1r+1或者(S(Sr+1r+1,S,Sr+2r+2,S,Sr+kr+k) ),得到SQSQ,令SQSQ是一串字符SQSQ减去最后的一个字符,再看Q Q是否属于SQSQ字符串中已有的“字句”。如果已经有过,那么把这个字符加在后面称之为“复制”,如果没有出现过,则称之为“插入”,“插入”时用一个“.”.”把前后分开;下一步则把“.”.”前面的所有字符看成S S,再重复如上步骤。第17页/共36页 例如,序列00100010的复杂度可以由下列步骤而得: : 第一个
14、符号永远是插入:0.0. S=0 S=0,Q=0Q=0,SQ=00SQ=00,SQ=0SQ=0,Q Q属于SQ0.0SQ0.0 S=0 S=0,Q=01Q=01,SQ=001SQ=001,SQ=00SQ=00,Q Q不属于SQ0.01.SQ0.01. S=001 S=001,Q=0Q=0,SQ=0010SQ=0010,SQ=001SQ=001,Q Q属于SQ0.01.0SQ0.01.0,这时 C(n)=3C(n)=3。 如符号列00000000应是最简单的,它的形式应是0.000000.00000,C(n)=2C(n)=2。符号列0101010101010101应是0.1.01010.1.01
15、01,C(n)=3C(n)=3。 如上所述,就得到用“.”.”分成段的字符串。分成了段的数目就定义为“复杂度”C(n)C(n)。第18页/共36页 根据LmapelLmapel和ZivZiv的研究,对几乎所有的x x属于0,10,1区间的c(n)c(n)都会趋向一个定值: 其中b(n)b(n)是随机序列的渐进行为,用它来使c(n)c(n)归一化,称为“相对复杂度”。 定义相对复杂度: 通常就是用这个函数来表达时间序列的复杂性变化。从这种算法可以看出,完全随机的序列C(n)C(n)值趋向于1 1,而有规律的周期运动的C(n)C(n)值则趋向于0 0。第19页/共36页 检测方法 (1)(1)对语
16、音信号进行分帧、加窗,求解FFTFFT变换,得其频率分量 x(k)x(k); (2)(2)重构语音信号,首先根据 ,其中1 1kNkN求得语音 信号频谱均值,然后按照如下公式进行语音重构 (3)(3)对重构后的语音信号x x(k)(k)按所示流程图分别求出每帧的KCKC复杂 度。第20页/共36页第21页/共36页 C C0 0复杂性 一般认为复杂运动可以是由规则运动和随机运动混合而成的。随机运动所占的分额,就是C C0 0复杂性描述的基础。假设有一复杂运动的时间序列x(t)x(t),它包含了规则运动部分的时间序列及随机运动时间序列。它们是怎样组成x(t)x(t)的是一个复杂过程。假设规则运动
17、部分时间序列为xl(t)xl(t),它与x(t)x(t)的关系为函数f(x)f(x),于是有: : 从x(t)x(t)中去掉x1(t)x1(t),剩余部分就是随机运动部分。简单的,设有一变换g(x)g(x),使得: : A A0 0代表了整个复杂运动时间序列的某种量度,而A A1 1则代表了随机运动部分时间序列所占的份额。第22页/共36页 由此,可定义复杂性为: : 显然,当x1(t)x1(t)在x(t)x(t)中所占份额很大时,C C0 0趋向于O O。说明系统的动力学行为几乎是规则的不含随机成分。反之,当x1(t)x1(t)所占份额很小而随机运动部分时间序列所占的份额很大时,C C0 0
18、趋向于1 1时,说明系统的动力学几乎是完全随机的。所以,随着C C0 0的增加,意味着动力学中的随机成分增加。第23页/共36页 步骤 (1)(1)对x(n)x(n)作离散傅立叶变换F(F() ),有: : X(k)=Fx(n) X(k)=Fx(n) (2) (2)可求出幅度谱的平均值 , k k为频域变量,N N为X(k)X(k)的长度,即k k的最大值。大于平均值的频率成分被认为是规则部分的贡献,小于或等于平均值的成分则是随机部分的贡献,这里只取规则部分的贡献。第24页/共36页 (3)(3)对规则部分贡献的频谱X X(k)(k)作傅立叶反变换 ,即得 x1(n)x1(n)。 所以有: :
19、 至此,求得了x1(n)x1(n),即规则部分时间序列。 (4)(4)利用公式 求得复杂度C C0 0 。第25页/共36页不同语音端点检测方法的实验结果对比 实验条件(1)英文数据库第26页/共36页(2)(2)中文数据库(3)(3)孤立词库 中文数据库的采集由学生,都说普通话,个别人略带地方色彩。因语音信号主要集中在300一3400Hz,所以采用44100Hz的采样率,采样位数16位,采样通道选用立体声,每人读5次,每次通读十个词语一遍。共有250个有效测试session共有830MB的数据量。说话内容选择的词语考虑到了汉语中各个元音、辅音、摩擦音、爆破音和鼻音等各个不同的汉语因素。 孤立词中文数据库采集由50名大学学生,一般发音标准,个别人略带地方色彩,语音信号主要集中在300一3400Hz,采用44100Hz的采样频率,采样位数16位,采样通道选用立体声,读26个英文字母,每次读一个英文
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- T∕CPSS 102-2026 配电台区稳态电能质量协同控制技术规范
- 七年级信息技术 数据分析教学设计 青岛版
- 高中历史 专题三 中国社会主义建设道路的探索 二 伟大的历史性转折(2)教学教学设计 人民版必修2
- 六年级下科学教学设计-人的一生-青岛版(六年制三起)
- 2026自然资源法律实务完整试题及答案
- 项目五 描述洗衣机的洗衣流程-了解算法及其基本控制结构教学设计高中信息技术沪科版2019必修1 数据与计算-沪科版2019
- 人教版地理必修2第四章第2节《工业地域的形成》教学设计
- 2026年重庆公务员考试(计算机)强化训练试题及答案
- 2026第五次全国经济普查知识竞赛题库附含参考答案
- 孔子事迹知识问答及答案阐释
- 慢病患者居家康复护理指导手册
- 2026年注册营养师道真题(名校卷)附答案详解
- 食堂食材供货、配送服务保障方案
- 护患沟通人文关怀课件
- 高磷血症科普
- 设备管理技术培训课件
- 集装箱活动板房施工方案
- 一体化消防泵房水池施工方案
- 脊柱骨折的急救处理措施
- 中国2型糖尿病运动治疗指南(2024版)
- CJ/T 283-2017偏心半球阀
评论
0/150
提交评论