(通信与信息系统专业论文)音频分类算法研究与实现.pdf_第1页
(通信与信息系统专业论文)音频分类算法研究与实现.pdf_第2页
(通信与信息系统专业论文)音频分类算法研究与实现.pdf_第3页
(通信与信息系统专业论文)音频分类算法研究与实现.pdf_第4页
(通信与信息系统专业论文)音频分类算法研究与实现.pdf_第5页
已阅读5页,还剩89页未读, 继续免费阅读

(通信与信息系统专业论文)音频分类算法研究与实现.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

上海大学硕士学位论文 摘要 随着互联网技术的发展,人们有机会接触到大量的多媒体内容。由于多媒 体数据量的快速增长,对多媒体内容的分析和分类变得越来越迫切。作为多媒 体数据中标志性部分的音频数据,为人们的感知提供了重要的信息内容,因而 音频信号处理在多媒体信息处理中占有重要地位。 近年来,由于话者分割在音频检索、说话人身份鉴别和自动跟踪等方面的 广泛应用,众多学者在说话人分割方面做了大量研究。话者分割,是根据语音 波形中反应说话人生理和行为特征的语音参数,自动分割出说话人改变点的过 程,它是音频信息处理研究领域的一个重要研究方向,具有广泛的应用前景, 得到人们越来越多的重视。 区别于一般用能量分割静音的方法,本文采用一种新的似然比特征去除低 信噪比环境中的噪声,提高了系统的鲁棒性。同时,由似然比特征,导出了一 种新的特征参数1 以然比交叉率,该特征能很好的表征语音和音乐间的差别, 这个特征也适用于其他低信噪比环境。 文中对传统的贝叶斯话者分割算法存在的问题进行分析,提出了一种新的 改进型贝叶斯话者分割算法。该算法基于贝叶斯准则确定初选改变点,对其端 点的变化趋势做进一步分析,得出说话人改变的分割点。 支持向量机是在统计学理论上发展起来的一种模式识别方法,在解决有限 样本、非线性及高维模式识别问题中表现出许多特有的优势,同其他模式识别 方法相比主要有两个特点:一是它采用非线性核函数来表示特征空间的内积, 另外它采用分类间隔最大的最优分类超平面实现结构风险最小化原则。由于支 持向量机具有坚实的理论基础,得到越来越多的研究,并在各个领域中得到了 广泛应用。 通过用支持向量机学习方法对音频数据进行分类,本文对不同参数组合下 的分类精度进行了比较,并分析了参数对分类精度、支持向量个数及分类时间 的影响。进而提出了如何确定参数以提高分类精度并减少分类时间的新方法。 v 上海大学硕士学位论文 关键词:似然比,似然比交叉率,话者分割,支持向量机 v i 上海大学硕士学位论文 a bs t r a c t w i t ht h ed e v e l o p m e n to fi n t e m e tt e c h n o l o g y ,t h e r ea l eag r e a to fo p p o r t u n i t i e s f o rp e o p l et oh a v ea c c e s st ot h el a r g eq u a n t i t i e so fm u l t i m e d i ac o n t e n t st h r o u g ht h e i n t e m e t s i n c et h ef a s tg r o w i n go fd a t av o l u m e ,t h ea n a l y s i sa n dc l a s s i f i c a t i o no f m u l t i m e d i ac o n t e n t sb e c o m em o r ea n dm o r ee x i g e n t a sar e p r e s e n t a t i v ep a r to f m u l t i m e d i ad a t a , a u d i od a t ap r o v i d e si m p o r t a n tc l u e sf o rt h ep e r c e p t i o no f h u m a n b e i n g ,s oa u d i oi n f o r m a t i o np r o c e s s i n gh a ss i g n i f i c a n te f f e c ti nm u l t i m e d i a i n f o r m a t i o np r o c e s s i n g i nr e c e n ty e a r s ,m a n yk i n d so fa p p l i c a t i o n s ,s u c h 勰a u d i oi n d e x i n g ,s p e a k e r r e c o g n i t i o n ,s p e a k e rt r a c k i n ga n ds p e e c hr e c o g n i t i o n ,e r e a r er e l a t e dw i t ha u d i o s i g n a lp r o c e s s i n g s p e a k e rs e g m e n t a t i o ni st h ep r o c e s so fa u t o m a t i c a l l yr e c o g n i z i n g s p e a k e r s c h a n g ep o i n t sb a s e do ni n d i v i d u a li n f o r m a t i o ni n v o l v e di ns p e e c hs i g n a l s a sak i n do fb i o m e t r i c s ,i ti sa ni m p o r t a n tr e s e a r c ht o p i ca n ds t u d i e db ym o r ea n d d i f f e r e n tf r o mo t h e rm e t h o d su s i n ge n e r g yt or e m o v en o i s e ,w ee m p l o yan e w f e a t u r en a m e dl i k e l i h o o dr a t i ot or e m o v e p u r en o i s ef r o ma u d i os i g n a li nl o ws n r n o i s ye n v i r o n m e n t b a s e do nt h i sf e a t u r e ,w eo b t a i nl i k e l i h o o dr a t i oc r o s s i n gr a t e , w h i c hi sg o o da tr e p r e s e n t i n gt h ed i f f e r e n c eb e t w e e ns p e e c ha n dm u s i c t od e a lw i t ht h ep r o b l e mo fd e t e c t i n gt h es p e a k e rs e g m e n t a t i o np o i n t s ,a n i m p r o v e db a y e s i a ni n f o r m a t i o nc r i t e r i o n ( b i c ) a l g o r i t h mi sp r o p o s e di nt h i sp a p e r t h i sa l g o r i t h mi sb a s e do nb i ca n da i m sa tt h es e l e c t i o no ft h ep r i m a r y s e g m e n t a t i o np o i n ta tf i r s tt i m e f i n a l l yi ta n a l y z e st h ec h a n g et r e n dt od e c i d ew h i c h p o i n ti st h er e a lc h a n g ep o i n to fs p e a k e r s u p p o r tv e c t o rm a c h i n e ( s v m ) i sas u p e r v i s e dl e a r n i n gt e c h n i q u ei nt h ef i e l d o fm a c h i n el e a r n i n ga p p l i c a b l et ob o t hc l a s s i f i c a t i o na n dr e g r e s s i o n r o o t e di nt h e s t a t i s t i c a ll e a r n i n gt h e o r yd e v e l o p e db yv l a d i n m i ra n dh i sc o w o r k e r s ,s v mi s v i l 上海大学硕士学位论文 b a s e do nt h ep r i n c i p l eo fs t r u c t u r a lr i s km i n i m i z a t i o n ,a n dh a sg o tm u c ha t t e n t i o n i nm a n yd i f f e r e n tf i e l d sf o ri t ss u p e r i o rp e r f o r m a n c e t h em a i ni d e ao fs v mc a nb e c o n c l u d e d 丛t h ef o l l o w i n gt w op o i n t s :i tc o n s t r u c t san o n l i n e a rk e r n e lf u n c t i o nt o p r e s e n ta ni n n e rp r o d u c to ff e a t u r es p a c e ; i ti m p l e m e n t st h es t r u c t u r a lr i s k m i n i m i z a t i o np r i n c i p l ei ns t a t i s t i c a l l e a r n i n gt h e o r yb yg e n e r a l i z i n go p t i m a l h y p e r p l a n ew i t hm a x i m u mm a r g i nb e t w e e nt h et w oc l a s s e s b yu s i n gs v ml e a r n i n gm e t h o df o ra u d i o c l a s s i f i c a t i o n ,w ei n v e s t i g a t et h e c l a s s i f i c a t i o n a c c u r a c yo fd i f f e r e n tp a r a m e t e rc o m b i n a t i o n s a n da n a l y z et h e p a r a m e t e r s i m p a c to nc l a s s i f i c a t i o na c c u r a c y a n dn u m b e ro fs u p p o r tv e c t o r sa sw e l l a sc l a s s i f i c a t i o nt i m e b a s e do nt h ea n a l y s i s ,w ep r o p o s ean e wp a r a m e t e rs e l e c t i o n m e t h o da sh o wt oi m p r o v et h ec l a s s i f i c a t i o na c c u r a c ya n dr e d u c et h ec l a s s i f i c a t i o n t i m e k e y w o r d s :l i k e l i h o o dr a t i o ,l i k e l i h o o d r a t i o c r o s s i n gr a t e ,s p e a k e r s e g m e n t a t i o n ,s u p p o r tv e c t o rm a c h i n e v l l i 原创性声明 本人声明:所呈交的论文是本人在导师指导下进行的研究工作。 除了文中特别加以标注和致谢的地方外,论文中不包含其他人已发 表或撰写过的研究成果。参与同一工作的其他同志对本研究所做的 任何贡献均已在论文中作了明确的说明并表示了谢意。 签名:籀日期:趔:至:够 本论文使用授权说明 本人完全了解上海大学有关保留、使用学位论文的规定,即: 学校有权保留论文及送交论文复印件,允许论文被查阅和借阅;学 校可以公布论文的全部或部分内容。 ( 保密的论文在解密后应遵守此规定) 日期:沙_ 9 上海大学硕士学位论文 1 1 课题来源 第一章绪论 本课题来源于国家科技部国际合作项目,“有噪混合音乐及语音环境中的音 频信息检索,项目编号:c b 7 2 0 1 。 1 2 课题研究的目的和意义 随着网络信息的不断增加,如何在大量的信息媒体中检索出需要的内容成 为音频信号处理的一个重要研究方向。本课题就是基于这样一个目的,分别对 语音和音乐信号的内容作处理研究。 语音信号中的说话人改变点检测及分类是语音信号处理中一个重要内容, 在语音识别、基于说话人的检索中都有重要的应用。说话人改变点检测的目的 是为了找出输入语音信号的分割点,找出连续的属于同一个人的语音段。近年 研究人员在这方面作了很多工作,总结出了几类检测算法:基于模型的、基于 距离的、假设检验的。由于单一使用上述算法各有优缺点,近年来,也有大量 研究综合上面的算法。同时由于自然对话语音存在不连续及抢断的情况,目前 的研究还不能达到一个理想的水平,因而在这方面的研究有很大的意义。 在最近几年,有很多关于音频自动分类的研究。采用的方法一般是把不同 音频特征和各种分类算法相结合的办法。音频信号的特征包括过零率、短时能 量、梅尔倒谱系数等;采用的分类算法有神经网络( a r t i f i c i a ln e u r a ln e t w o r k , a n n ) 、隐马尔可夫模型( h i d d e nm a r k o vm o d e l ,h m m ) 、高斯混合模型 ( g a u s s i a nm i x t u r em o d e l ,g m m ) 和支持向量机等( s u p p o r tv e c t o rm a c h i n e , s v m ) 。研究表明基于支持向量机的分类算法是几种分类算法中性能最好的。因 此,本文在分类不同的音乐时采用支持向量机算法,并对该算法做进一步的研 究。 上海大学硕士学位论文 1 3 国内外研究概况 1 3 1 国外研究概况 到目前为止,有许多关于自动音频分类技术的研究。最显著的就是在1 9 9 1 年w 0 1 de ta 1 提出的成为“m u s c l ef i s h ”的系统 1 ;2 0 0 0 年,e 1 m a l e he ta 1 提出 了一个新特性的窄带( 音频抽样率8 k h z ) 语音音乐鉴别器系统 2 ;2 0 0 6 年, 希腊的k o t t i ,m 等人提出了无监督的说话人改变点检测算法 3 ,这种算法没有 说话人个数和特点等先验特征,结合了在说话人分割方面不常用的特征,如信 号谱包络和谱质心,采用的模型选择准则是贝叶斯算法。实验表明,这个算法 比其它算法有更优的性能。 在音频分类方面,采用的分类算法一般是神经网络、隐马尔可夫模型、高 斯混合模型和支持向量机。1 9 9 6 年,k i m b e r 和w i l c o x 用h m m 把会议讨论记 录分为语音、无声、笑声和其他声音 4 :1 9 9 7 年,s c h e i r e r 和s l a n e y 分别采用 g m m 和k n n 分类并比较它们的分类性能 5 ;2 0 0 3 年,l u 等人把音频分为无 声、音乐、背景音乐、纯语音和非纯语音五类 6 ,并把用s v m 、k n n 和g m m 得出的分类结果相比较,实验表明,s v m 的分类性能比k n e a r e s tn e i g h b o r ( k n n ) 和g m m 的分类性能好很多。由于s v m 优异的分类性能,目前大多 数的分类算法都采用s v m 分类。 1 3 2 国内研究概况 国内也有不少学者从事音频处理方面的研究。2 0 0 5 年,哈尔滨工业大学的 郑贵滨和韩纪庆等人提出了分段式音频检索 7 :2 0 0 6 年,清华大学的张一彬 等人提出了一种新的基于分类的音频流分割方法 8 。这种方法首先采用基于大 尺度分类的分割方法对音频流进行粗分割,然后采用基于小尺度分类的细分割 步骤在边界区域中进一步精确定位分割点。理论分析和实验结果均表明,当处 理类别变换频率较低的音频流时,这种分割方法在保持真实分割点检测率的同 时能够大幅降低虚假分割率;2 0 0 6 年,哈尔滨工业大学的郑贵滨等人根据人耳 听觉模型以归一化响度主分量为特征,采用模糊直方图检索音频信息,并根据 2 上海大学硕士学位论文 响度数据的统计分布对直方图编码进行优化 9 。实验结果表明,该方法在低信 噪比下具有较好的性能,对噪音具有良好的稳健性。为噪音下的固定音频检索 问题提供了有效的解决办法。 1 4 论文的主要研究内容 本论文是以作者攻读硕士学位期间承担课题的工作为基础,主要内容是完 成一个音频信号处理系统。对相关理论进行研究,并编写程序完成整个系统。 论文的安排如下: 第一章中阐述了课题研究的来源、目的、意义以及国内外研究的现状; 第二章介绍了音频信号的特征提取方法,分析不同特征在处理算法中 的应用: 第三章介绍了一个新的似然比特征,利用该特征可去除低信噪比音频 信号里的纯噪声。同时,通过分析语音和音乐的似然比特征之间的区 别,并结合一般的过零率特征算法,得出了似然比交叉率特征。这个 交叉率能够很好的表现语音和音乐信号的区别; 第四章阐述了基于贝叶斯的说话人分割算法:首先介绍了传统的贝叶 斯说话人分割算法,然后对算法存在的问题进行分析,最后提出解决 问题的方法,从而实现一个改进型的贝叶斯说话人分割算法; 第五章介绍了基于支持向量机的音乐分类算法:文中主要针对支持向 量机分类算法中的两个最重要的参数特性进行了分析,并统计了它们 对分类特性的影响,总结出了如何选择这两个最优参数的办法; 第六章介绍了整个音频信号处理系统:首先介绍了整个系统的结构, 然后阐述各个结构如何实现,最后对系统设计过程中遇到的问题进行 了分析并提出了解决方案; 第七章给出了全文总计以及对未来工作的展望。 上海大学硕士学位论文 第二章音频特征提取 音频特征分析与抽取是音频分类的基础,所选取的特征应该能够充分表征 音频信息频域和时域的重要特性,对环境噪声具有一定的鲁棒性。本章简要介 绍了音频特征抽取的相关技术,重点分析不同音频帧的层次、特征及其抽取方 法,最后对本文提出的特征的有效性进行了实验分析。 2 1 音频信号前端预处理 输入端采集到的数字音频信号在进行处理之前首先要经过预处理 1 0 ,1 1 , 主要目的是统一音频格式,以便后续音频处理的计算机实现,或增加一些抗干 扰性措施等,这主要包括高频预加重、加窗处理和幅度规一化等等。 2 1 1 抽样量化 计算机处理的数据都是时间和幅度上离散的信号,而音频信号在时间和幅 度上都是连续的,为了把它们变成时间和幅度都是离散的信号,必须对输入音 频信号在时间上进行抽样,在幅度上进行量化,从而得到的离散信号表达式如 下: 5 ( ,1 ) = b 。( n f ) 】 ( 2 1 ) 其中,s a ( r ) 为输入的模拟信号,s ( n ) 为输出离散信号,厂为语音的抽样频 率,的选取是根据奈奎斯特定理,即厂的值为音频信号最高有效频率的2 倍, 符号口为量化运算,一般采用均匀量化。 通过对音频信号发声过程的研究以及观察记录音频的各种波形,便可知道 音频信号的频谱分量主要集中在3 0 0 - 3 4 0 0 h z 的范围内,所以我按1 1 0 2 5 h z 采 样率对音频信号进行采样,就可以包含音频信号的大部分信息,满足一定的音 频信号处理要求。在本系统中,音频信号都采用11 0 2 5 h z 抽样,1 6 b i t 量化, 从而输出离散信号s ( n ) 。 4 上海大学硕士学位论文 2 1 2 高频预加重 采样后的数字音频信号s ( n ) 一般要经过高频预加重处理,以抑制5 0 h z 的低 频电源干扰。即通过一个特性为h ( z ) = 1 一彪- 1 的数字滤波器,本文中口取0 9 7 ( 一般情况下口在0 9 - - 0 9 7 之间选择) 。经过高频预加重后的信号变为: s ( 刀) = s ( n ) 一o 9 7 丰s ( ,z - 1 ) ( 2 2 ) 2 1 3 加窗处理 尽管音频是非平稳性信号,但它的特性随着时间变化缓慢,在很短的时间 内,音频信号的特性几乎不变,可以看作是平稳过程,所以对预加重后的音频 信号要进行加窗分帧得到音频处理的单位,即用窗函数乘以s 0 ) 形成帧,相邻 帧一般有一定的重叠部分,使提取的音频特征保持一定的完成性。就窗的类型 来说,常用的窗有矩形窗、哈宁窗和汉明窗 1 2 ,它们的时域和频域波形如图 2 1 所示,窗函数的具体性能见表2 1 : 图2 1 窗函数时、频域波形对比 顿瑷 上海大学硕士学位论文 表2 1 窗函数的具体性能 窗函数主瓣宽度 旁瓣峰值衰减( r i b )阻带最小衰减( d b ) 矩形窗4 兀n1 3- 2 1 哈宁窗8 n3 14 4 汉明窗8 兀i 4 15 3 选择窗函数时必须要考虑窗的长度和类型,窗宽太大,加窗相当于一个很 窄的低通滤波器,不能响应音频信号幅度的快速变化部分;窗宽太小则不能提 供足够的匀化,以产生平滑的时域短时特征。从图2 1 和表2 1 可以看出,汉明 窗带宽大约是同样宽度矩形窗带宽的两倍,且在通带外,矩形窗频谱旁瓣的衰 减小于汉明窗旁瓣衰减,且有吉伯斯效应,因此本文选用2 5 6 点汉明窗对音频 信号进行加窗处理,相邻两帧之间有1 2 重叠。特征提取如图2 2 所示: 音 频 段 持 征 li j i 。l ll k ,山j血j j l it【f 越jl 上k i f f i 量jl l l j - zj_ l f -f t l i山jm -l_ r 矿1 i i r 珊 l。r ,1 r t rl 。f 刚w” pm ” l 乒 l i li i1 吒 ll l 图2 2 加窗分帧 汉明窗表达式如式( 2 3 ) ,其中n 为窗宽: 6 上海大学硕士学位论文 以疗) :0 5 4 + 0 6 4 c o s 【( 需备一1 沙 ,万= o ( 一1 ) ( 2 3 ) 1 0 , 以= 其它值 加窗后的音频信号( ,z ) 变为: s ( ,1 ) = s7 ( ,1 ) w ( n ) ( 0 刀n - 1 ) ( 2 4 ) 2 2 特征参数提取 音频信号中含有丰富的信息,且具有很大的冗余性,特征提取就是利用时 域一频域分析、变换域处理等技术、并结合人的发音机理或入耳听觉特性从数 字音频信号中提取出对识别效果起至关重要的信息,同时摒弃那些冗余的、易 引起识别模糊性的特征。特征提取获得的参数即作为处理算法的输入,为了在 保证处理精度的基础上降低计算复杂度,它应当符合数据量小、且信息量大的 特点。 本系统用到的基本特征有:m e l 频率倒谱系数( m e l f r e q u e n c yc e p s t r a l c o e f f i c i e n t s ,简称m f c c ) 1 3 ,1 4 、过零率( z e r oc r o s s i n gr a t e ,简称z c r ) 、 频域短时帧能量( f r e q u e n c ys h o r tt i m ee n e r g y ) 、子带帧能量( s u b b a n d e n e r g y ) 、音频亮度( b r i g h t n e s s ) 、带宽( b a n d w i d t h ) 1 5 ,1 6 。 1 ) m e l 频率倒谱系数 研究表明m e l 频率倒谱系数( m f c c ) 比其它频谱系数更符合人耳的听觉特 征,特别是在有噪声和频谱失真情况下,能以更准确的特征来描述音频模型, 提高识别精度。m f c c 是建立在傅立叶频谱分析基础上的。它利用了人耳的感知 特性,人耳对频率的区分能力大致和频率成对数关系。m f c c 特征主要反映音频 的静态特征,音频信号的动态特征可以用静态特征的一阶差分谱和二阶差分谱 来描述。这些动态信息和静态信息相互补充,能很大程度提高系统的识别性能。 整个音频识别特征用m f c c 参数、m f c c 差分系数、归一化能量差分系数来构成。 为了解释m f c c 的提取过程,首先让我们了解一下人耳听觉系统模型,如图 7 上海大学硕士学位论文 2 3 所示,音频信号经过外耳、中耳,再经耳蜗基膜的频带分解作用,然后通 过内毛细胞的能量转换,最后形成听觉神经脉冲发放,沿听觉通路进入听觉中 枢系统。人的外耳中耳具有高频提升作用,在听觉模型模拟中,一般用高通滤 波器来代替;耳蜗基膜的频带分解是人耳的重要特性,它可以用临界频带 ( c r i t i c a l - b a n d ) 的概念来描述;内毛突触具有非线性压缩性能,因为听觉系 统可允许的输入信号的动态范围为1 0 1 2 ,而听觉神经上发放的的脉冲速率的动 态范围只有1 0 2 ,这种变换就是通过内毛突触的非线性压缩功能来实现的,在 听觉模型中,可以用一耦合a g c 压缩网络或其它变换模拟这一特点 1 7 。 f ? i 譬 碜锅麟h 内毛煳嘶能,l ”一” 哳觉巾艇 i外耳。巾耳 l 图2 3 人耳听觉系统模型 由于对人的听觉机理的研究发现,在声压恒定的情况下,当声音被限制在 某个带宽内时,其人耳感觉的主观响度是恒定的,而一旦声音突破了这个带宽, 则主观响度的变化便会被感知。同样地,当声压恒定时,在这个带宽内的一个 具有复杂包络的信号的响度等价于在这个带宽中心频率位置的一个纯音的响 度,而与信号本身的频率分布无关;但是当信号的带宽突破了临界带宽时,其 响度便不再等价。临界带宽指的就是这样一种令人的主观感觉发生突变的带宽 边界,当两个音调的频率差小于临界带宽时,人就会把两个音调听成一个,这 称之为屏蔽效应,m e l 刻度是对这一临界带宽的度量方法之一。根据z w i c k e r 的工作,临界带宽随着频率的变化而变化,并与感知频率( m e l 频率) 的增长 一致。在1 0 0 0 h z 以下,大致呈线性分布,带宽为l o o h z 左右;而在1 0 0 0 h z 以 上带宽呈对数增长。根据临界带的划分,可将音频频谱划分为一系列三角形的 滤波器序列,即m e l 滤波器组,如图2 4 所示。本文临界带滤波器组中滤波器 的个数m - - 2 4 ,而每个滤波m e l 频率与线性频率的转换关系如下: 聊出i n f l + 上1 ! 唑一 ( 2 5 ) l 7 0 0 l n ( 1 + 1 0 0 0 7 0 0 ) 上海大学硕士学位论文 6 帆 ) l w 山i| 图2 4m e l 滤波器组示意图 m f c c 的计算首先用f f t 将时域信号转化到频域,之后对其对数能量谱用依 照m e l 刻度分布的三角形带通滤波器滤波,最后对各个滤波器的输出构成的向 量进行离散余弦变换( d c t ) ,取前n 个系数。具体计算过程可以概括为下面几 个步骤( 可参照图2 5 的流程) 。 原蛤数 频 0 峙 图2 5m f c c 特征参数提取示意图 ( a ) 、求输入音频信号的离散功率谱 对输入音频帧加汉明窗后作离散傅利叶变换( d f t ,d i s c r e t ef o u r i e r t r a n s f o r m ) ,将时域信号转化为频域信号。 d f t 的运算表达式如下: s ( 后) = 阢埘川】 七= 0 ,一1 ( 2 6 ) 其中,s o 为s g ) 的傅立叶变换,通过d f t 运算将音频信号从时域转变到频域。 实验表明:人耳对信号相位变化不敏感,如果对音频信号的各频谱分量的相位 做随机的改变,然后重建时域信号,重建后的信号的听觉效果与原始信号的听 9 上海大学硕士学位论文 觉效果几乎一样。基于以上人耳的生理特性,我们在计算d f t 是不考虑相位特 性,只计算它的幅度。 ( b ) 、将线性频标转化为m e l 频标 转化方法是将频域信号通过2 4 个三角滤波器,其中中心频率在1 0 0 0 h z 以 上和以下的各1 2 个。滤波器的中心频率间隔特点是在1 0 0 0 h z 以下为线性分布, 1 0 0 0 h z 以上为等比数列分布。三角滤波器的输出则为: 即。萋篇跗卜。笺。糕跗钆2 2 4 弦7 , 其中s ( 尼) 为频谱上第七个频谱点的能量,日,为第j 个滤波器的输出,e 为第j 个滤波器的中心频率。 ( c ) 、求m e l 滤波器的的输出功率的对数频谱 由于人耳对声音信号的感觉呈现对数特性,这主要体现在声音信号的强度 和频率上,因此模拟人耳听觉特性的短时频谱分析一般针对对数能量谱。经过 对数处理后,m e l 输出功率变为: 厶= l n ( h ;) ( 2 8 ) ( d ) 、求倒谱系数 对输出功率求i f f t ,即可得m e lc e p s t r u m 。m e l 倒谱参数也可以通过求输 出功率自然对数的余弦变换得到。 2 4 1。 印矧l n ( l 加o s 瞰卜主) 丢 肛1 ,2 一p ( 2 均) 其中p 为m f c c 参数的阶数。d c t 处理模拟了人耳内毛细胞的非线性压缩整流特 性,通过对经过m e l 尺度变化的对数能量谱进行d c t 变换,将各维之间解相关 处理,以得到基本不相关的各分量,同时只保留d c t 变换后的低维部分,也达 到降低特征向量的维数,减小计算的目的。 由于能量参数对识别性能也有一定的提高作用,所以我们在音频特征中也 加入了能量。计算公式如下: l o 上海大学硕士学位论文 p = i n s 2 ( ,z ) ( 2 1 0 ) 一 、7 这样再加上音频信号的能量参数e 就组成了包含有p + 1 个参数的m f c c 基本 参数,其结构如下: 知,c l ,c 2 ,c p ( 2 1 1 ) 从实际效果上看,m f c c 基本参数对音频信号能量谱进行了平滑处理,勾勒出了 音频信号能量谱的轮廓。 。 ( e ) 、差分 由于音频信号是不断变化的,这种变化也是音频信号的重要特征,但这种 动态变化是基本的m f c c 参数不能够描述的,为了更进一步描述音频信号的变化 趋势,我们引入一阶及二阶差分参数: 假设时间t 的向量为u ,那么f 阶差分表达式为: f 函,- - f 叫函 一f 。1 函h ) ,0 c f ) = q ( 2 1 2 ) 通过计算差分将前后两个时刻的特征向量进行比较,从而体现出了特征向 量随时间而变化的趋势。按照公式( 2 1 2 ) 我们计算出了m f c c 基本参数的一阶及 二阶参数。这样基本m f c c 参数加上其一阶和二阶差分参数,构成了最后的m f c c 参数,其特征向量的结构如下: c = k ,e , g ,麓 ,2 奴) ,2 堋 ( 2 1 3 ) 2 ) 过零率 在离散时间信号情况下,相邻的抽样具有不同的代数符号就称发生了过零。 过零率是描述过零的速度,是信号频率量的一个简单的度量,计算公式如式 ( 2 1 4 ) 。 勰= 硒1 刁刍n - i i s 印k ( 川) 】一s g r l x ( m ) ( 2 1 4 ) 3 ) 短时帧能量 该特征用每帧信号总能量的对数来表示, 上海大学硕士学位论文 川肛吣彩 ( 2 1 5 ) 其中l f 0 】2 表示频率缈处的谱密度,= 5 5 1 2 5 h z 为信号采样频率的一半。 同时,信号的频谱被分为四个子带,分别为 o ,c o o 8 、 c o o 8 ,c o o 4 i 、 o ) 0 4 , a ,o 2 、 c o o 2 , ,并计算各子带能量的分布,计算公式如式( 2 1 6 ) 。:上s t e 勺f o 胁 ,l 。、叫 和日,为子带j 的上下边界频率。不同类型的音频,其能量在各子带区 间的分布有所不同。 4 ) 音频亮度 在一帧中音频亮度是用频率质心( f r e q u e n c yc e n t r o id ) 来度量的。计算公 式如式( 2 1 7 ) j 卵0 ) 1 2 d 缈 。= 鼍一 ( 2 :1 7 ) 舅f 0 ) 1 2 d 国 0 5 ) 带宽 带宽是衡量音频频域范围的指标。计算公式如( 2 1 8 ) 2 3 特征用途分析 b = - o - - ( - ) 。,白) 1 2 砌 0 f l r ( - 2 d 缈 本节主要介绍不同特征在不同算法中的应用。 1 2 ( 2 1 8 ) 上海大学硕士学位论文 2 3 1 说话人分割特征讨论 本文采用的说话人分割算法是经典的贝叶斯准则( b a y e s i a ni n f o r m a t i o n c r i t e r i o n ,b i c ) 。基于b i c 准则的改变点检测是一种带模型复杂度加权惩罚项 的极大似然准则方法。算法采用的特征是音频信号倒谱序列,因此本文采用m f c c 作为说话人分割的基本特征。在选择m f c c 的时候,考虑到不同说话人的声音在频 率分布上的不同及算法的复杂程度,用于说话人分割的m f c c 取1 2 维。 2 3 2 音乐分类特征 由于不同的音乐类型在时域和频域都有不同的特征表现,因此要充分的区分 音乐就要从时域和频域分别提取特征。我在区分音乐时采用的特征有过零率、帧 能量、音频亮度、带宽和m f c c 特征。在使用这些特征的时候并不是把这些所有特 征简单的组合成多维向量,而是把这些特征先作矢量量化。矢量量化( n 维) 就是 将音频信号的取样值或特征参数值分成若干组,每组构成一个矢量,然后分别对 每个矢量进行量化 1 8 。 首先,对帧特征进行处理,每一个1 s 的音频段中都含有很多音频帧,也 就是说帧层次上的特征在每一个音频段上是一个矩阵,不是一个向量。本论文 中:频率短时能量为1 维,子带能量分布为4 维,音频亮度为1 维,带宽为 1 维,过零率为l 维,m e l 倒谱系数为8 维,一共是一个1 6 维的矩阵。我 们对这个矩阵的每一列数据取平均值( 1 6 维) ,同时计算方差( 1 6 维) ,顺序 组合而成一个3 2 维的向量,把这个向量就作为帧层次映射到1 s 音频段层次 上的特征。 但是直接用这个特征进行分类的实验效果并不理想,原因是不同音频特征 的值有很大的差别,所以很多论文在这里对特征集合进行归一化处理: x j 生尝 ( 2 1 9 ) 6 : 以为均值,砰为均方差。归一化后的特征在分类实验中有了较好的分类效 果。提取归一化特征后的音乐以1 s 为单位进行分类。 上海大学硕士学位论文 2 4 本章小结 本章主要介绍了音频信号的前端预处理和用于音频处理的基本特征:m e l 频 率倒谱系数、过零率、短时帧能量、音频亮度和带宽的提取方法及其传达出的音 频信号的意义;同时分析了这些特征如何用于不同的音频处理算法。根据这些提 取好的特征,进一步的音频处理算法就可以实现了。 1 4 上海大学硕士学位论文 第三章低信噪比环境下的抗噪研究 目前去除含噪音频信号中的纯噪声一般采用基于能量的方法,但这种方法 适用于信噪比较高的情况,对于低信噪比情况就不适合了。本文采用一种新的 特征除噪,该特征在低信噪比情况下也有很好的除噪性能。同时,在该特征基 础上,得出了能很好表现语音和音乐区别的新特征。 3 1 经典检测理论和假设检验 统计假设检验 1 9 问题中,必须在几个假设中做出哪一个是正确的判决。 我们把假设看成是关于可能判决的陈述。产生这些陈述的机构称为源。例如, 雷达检测问题中,假设陈述是“目标不存在和“目标存在 。我们用h 0 和h 。 表示这两种可能的假设。称h 0 为“零”假设。这就是二元检测问题。 对于每一种假设,我们有一观测,它是按照某一概率规律产生的随机变量。 统计假设检验的任务就是根据对这个随机变量检测的结果z ,来判决哪个假设 是正确的。z 的取值范围构成观测空间。二元假设情况下的判决问题实质上是 把观测空间分割成z 。和z 。两个区域,当z 处在z 。中时,我们判决为h o 正确的假 设,而当处在z 。中时,判决为h 。正确的假设。区域z 。和z 。称为判决域,图3 1 示出了判决域。因此我们的任务就是在于选择这些判决域,使得在多次重复试 验中错误最少。 图3 1 判决域 上海大学硕上学位论文 为了把关于尽可能好地划分观测空间的办法定量表示,首先必须选择一个 合适的准则。假定选择最优可能产生观测值z 的假设作为正确的假设。若 p ( n 。iz ) ( i = 0 ,1 ) 表示在给定的具体观测值为z 的条件下,h 。为真的概率。我们判 决正确的假设为这两个概率中较大者所对应的假设。于是,若 p ( h oz ) p ( h 。iz ) ( 3 1 ) 则根据上述判决准则将选择h o ,否则就选h 。判决公式写作: h1 1 l ( 3 2 ) h o 前面用的这个准则就是最大后验概率( m a p ) 准则。 利用贝叶斯公式把这个准则写成更有用的形式,因为 旭= 帮瑚,- ( 3 3 ) 式中p ( n ,) 表示源n 。出现的概率,因此 研p ( h , 12)=渊p(zh ( 3 4 ) - - - = - - - - - - - - = - :- - - - - - - - - - - ? - - - - - ,- 】i , 尸旧oz )o ) 尸旧o ) 检验公式化为 4 p g1 日。) t * 1 尸( 风) p ( zh 。) 赢聃t ) ( 3 5 ) 比值人( z ) = p ( z i h 。) 1 p ( z i h 。) 称作似然比。它是一个特别重要的量。检 验就包括了把这个比值同名为门限的常数比较,并称这种检验为似然比检验 ( l r t ) 。图3 2 阐明了这些概念: 1 6 上海大学硕士学位论文 厂 义 p ( z l l l l ) 夕 l i o : l ! 型 尸1 日l j 乙卜一z l z 图3 2 源、传递概率和判决域 图3 2 阐明了判决问题的几个基本组成部分。第一部分是源;第二部分是 概率传递机构,它是哪个假设为真,按照某一概率规律产生观测量z ;第三部 分是观测空间z 。判决规则把观测空间分成两个区域z 。和z 。,并且对两个区域 中的每一点都赋于一个假设。 3 2 似然比特征提取 根据3 1 所讲的假设检测理论,这一节将求出噪声音频信号的似然比 ( l i k e li h o o dr a t i o ,l r ) 特征并讨论它如何应用到含噪音频信号,从而去除信 号中的纯噪声部分。 3 2 1 噪声音频信号似然比 首先假设音频信号里有不相关的加性噪声,则对每一帧音频存在以下两种 假设 2 0 e 0 :无音频信号:x = n :有音频信号:x = n + s 这里s ,n 和x 分别是音频信号,噪声和带噪声音频信号的l 维离散傅立叶变 换( d f t ) 系数向量,它们的第k 个元素分别为,m 和x l 。 1 7 上海大学硕士学位论文 假设h o 和h l 的概率密度函数表示为: o x p t k = 0 j t , 几n 一黠a , n , 6 , 。) = 兀了面一 , ( 3 6 ) p ,l、“,l 嘲训= 臻而赤羽唧 - 瓣x k2 t ( 3 7 , 这里“ ) 和以g ) 分别表示m 和瓯的方差,根据公式( 3 5 ) 知, 铡= 戆 希唧f ,t 一雌矧8 , 令厂。:i x 。1 2 九 ) ,氕:a 以 ) “ ) ,分别称为p o s t 舒。r is n r 和p r i 。r i 第k 个频段的似然l 匕( l i k e l i h o o dr a t i o ,l r ) 为: 小删= 志唧 簧) 9 , 3 2 2p o s t e r i o r is n r 讨论 p o s t e r i o r is n r y 。的求解需要知道两个参数值【x 。1 2 和扎 ) 。i x 。1 2 是含噪音 频信号的频域幅度平方,只要将音频信号的l 维离散傅立叶变换( d f t ) 系数向 量分别求幅度平方即可得到它的值。关键的就是求出噪声方差“ ) 。 首先通过前两秒没有输入音频信号的时间得到纯噪声;再由这两秒纯噪声求 出噪声的功率谱,噪声方差丸酝) 根据功率谱式( 3 1 0 ) 求得 2 1 ,2 2 。 丸 ) = s u 0 ) = s ( 2 n t c l l ) ( 3 1 0 ) s n 0 ) 表示噪声的功率谱。 现在求噪声方差的问题转换为求噪声功率谱了。随机信号的自功率谱密度函 数( 自谱) 是该随机信号自相关函数的傅立叶变换,记为砌)

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论