(电路与系统专业论文)压缩域音频特征的研究及其应用[电路与系统专业优秀论文].pdf_第1页
(电路与系统专业论文)压缩域音频特征的研究及其应用[电路与系统专业优秀论文].pdf_第2页
(电路与系统专业论文)压缩域音频特征的研究及其应用[电路与系统专业优秀论文].pdf_第3页
(电路与系统专业论文)压缩域音频特征的研究及其应用[电路与系统专业优秀论文].pdf_第4页
(电路与系统专业论文)压缩域音频特征的研究及其应用[电路与系统专业优秀论文].pdf_第5页
已阅读5页,还剩84页未读, 继续免费阅读

(电路与系统专业论文)压缩域音频特征的研究及其应用[电路与系统专业优秀论文].pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

上海大学硕士学位论文 摘要 在信息化和网络化时代,压缩音频已成为信息传输的主要媒体之一。因此, 根据压缩音频的特点进行数据的分析处理已成为学术界的一个重要研究方向。 本论文研究了压缩音频处理及应用的重要课题,通过对压缩音频处理的研 究目的、研究意义和主要方法进行讨论,对国内外研究现状进行综述,本文首 先对特征提取的原理和方法进行了分析,并对压缩域中音频的分割、分类检索 及用于压缩音频质量评价的时间调整算法进行了研究。 本论文的工作和研究方向主要包括以下几个方面: 研究了压缩音频中特征提取的方法,通过对压缩音频的部分解码,详细给 出了压缩音频中实现特征提取的具体过程,为压缩音频的特征提取方法提供了 一种思路。 给出了压缩域中音频分割的方法, i n f o r m a t i o nc r i t e r i o n ,b i c ) 分割算法, 分析了改进型贝叶斯信息准则( b a y e s 在有效提取压缩音频特征的基础上,使 用改进型b i c 算法进行了压缩域音频的分割。并通过实验证明了该压缩音频分 割方法的可行性和有效性。 在压缩音频中进行了支持向量机( s u p p o r tv e c t o rm a c h i n e ,s v m ) 分类方法 的研究,通过对径向基核函数参数的不同组合下分类精度的比较,分析了不同 参数组合对分类精度、支持向量个数及分类时间的影响,给出了如何最优化参 数并用于压缩域音频分类的新方法。在压缩音频分类的基础上,开展了基于直 方图的压缩音频例子检索算法研究,给出了使用改进型直方图匹配算法进行音 频例子快速检索的方法。 研究并实现了用于压缩音频质量客观评价的时间调整算法,采用信号包络、 频谱互相关及频谱直方图等方法解决了音频质量客观评价中的时间调整问题。 该时间调整算法的实现,对b s 1 3 8 7 算法的进一步应用是一个有效的补充。 关键词:压缩音频,特征提取,音频分割,音频分类,时间调整 v 上海大学硕上学位论文 a bs t r a c t a u d i oh a sb e c o m eo n eo ft h em a i nm e d i at r a n s m i t t e do nt h en e t w o r ki nt h e c u r r e n ti n f o r m a t i o nt i m e s h o wt oa n a l y z ea n dp r o c e s sc o m p r e s s e da u d i oa c c o r d i n g t ot h e i rc h a r a c t e r i s t i c sh a sa l r e a d yb e c o m ea l li m p o r t a n tr e s e a r c hd i r e c t i o n t h i sp a p e rf o c u s e so np r o c e s s i n ga n da p p l i c a t i o no fc o m p r e s s e da u d i o b y d i s c u s s i n gr e s e a r c hp u r p o s e ,s i g n i f i c a n c e ,t h em a i nt e c h n i q u e sa n dc u r r e n ts t a t eo f r e s e a r c hi n t h i sf i e l d ,t h ep a p e rf i r s ta n a l y z e st h e o r ya n dm e t h o do fa u d i of e a t u r e e x t r a c t i o ni n c o m p r e s s e dd o m a i n a tt h em e a n w h i l e ,t h er e s e a r c hi sm a d eo n c o m p r e s s e da u d i os e g m e n t a t i o n ,c l a s s i f i c a t i o n ,r e t r i e v a la n dt i m ea l i g n m e n tu s e df o r c o m p r e s s e da u d i oq u a l i t ye v a l u t i o n t h ew o r ka n dr e s e a r c hd i r e c t i o no ft h i sp a p e rm a i n l yc o n t a i n sf o l l o w i n g p a r t s : a u d i of e a t u r ee x t r a c t i o ni n c o m p r e s s e di ss t u d i e d b yp a r t l yd e c o d i n g c o m p r e s s e da u d i o ,t h ep a p e rg i v e st h ec o n c r e t ec o u r s eo fc o m p r e s s e da u d i of e a t u r e e x t r a c t i o ni nd e t a i l ,w h i c hp r o v i e d sa ni d e af o rc o m p r e s s e da u d i of e a t u r ee x t r a c t i o n a u d i os e g m e n t a t i o ni nc o m p r e s s e dd o m a i ni sa l s og i v e ni n t h i s p a p e r b y s t u d y i n gi m p r o v e db a y e si n f o r m a t i o nc r i t e r i o ns e g m e n t a t i o na l g o r i t h m ,am e t h o do f c o m p r e s s e da u d i os e g m e n t a t i o ni sp r o p o s e db a s e do nv a l i df e a t u r e s i na d d i t i o n ,t h i s k i n do fs e g m e n t a t i o nm e t h o di sp r o v e df e a s i b i l i t y w i t hs u p p o r tv e c t o rm a c h i n ef o ra u d i oc l a s s i f i c a t i o ni nc o m p r e s s e dd o m a i n , t h ec o m b i n a t i o n so fk e m e lf u n c t i o np a r a m e t e r sa n di t s i m p a c to nc l a s s i f i c a t i o n a c c u r a c y ,n u m b e ro fs u p p o r tv e c t o r sa sw e l la sc l a s s i f i c a t i o nt i m ei sa n a l y z e da n d s t u d y e d b a s e do na b o v ea n a l y s i s ,an e wp a r a m e t e rs e l e c t i o nm e t h o df o rc o m p r e s s e d m u s i cc l a s s i f i c a t i o ni sp r e s e n t e d a f t e rm u s i cc l a s s i f i c a t i o n ,s p e c i f i ca u d i or e t r i e v a l w i t hh i s t o g r a mi si n v e s t i g a t e da n da na d v a n c e dh i s t o g r a mm a t c ha l g o r i t h mt oc a r r y o u tf a s ts p e c i f i ca u d i or e t r i e v a li sc a r r i e do u t t i m ea l i g n m e n tw h i c hc a nb eu s e df o rc o m p r e s s e da u d i oq u a l i t ye v a l u a t i o ni s v i s t u d i e da n di m p l e m e n t e di n t h i sp a p e r s i g n a le n v e l o p ,f r e q u e n c ys p e c t r u mg r o s s c o r r e l a t i o na n dh i s t o g r a mh a v e b e e ne m p l o y e dt o r e s o l v et h ep r o b l e mo ft i m e a l i g n m e n ti np e a q ( p e r c e p t u a l e v a l u a t i o no fa u d i oq u a l i t y ) t i m ea l i g n m e n t a l g o r i t h mp r o p o s e dh e r e i sa ne x c e l l e n tc o m p l e m e n tf o rf u r t h e ra p p l i c a t i o no f b s 13 8 7c r i t e r i o n k e y w o r d s :c o m p r e s s e da u d i o ,a u d i of e a t u r ee x t r a c t i o n ,a u d i os e g m e n t a t i o n , a u d i oc l a s s i f i c a t i o n ,t i m ea l i g n m e n t v i i 上海大学硕上学位论文 原创性声明 本人声明:所呈交的论文是本人在导师指导下进行的研究工作。 除了文中特别加以标注和致谢的地方外,论文中不包含其他人已发 表或撰写过的研究成果。参与同一工作的其他同志对本研究所做的 任何贡献均已在论文中作了明确的说明并表示了谢意。 签名:牲日期:竺t 丛二 本论文使用授权说明 本人完全了解上海大学有关保留、使用学位论文的规定,即: 学校有权保留论文及送交论文复印件,允许论文被查阅和借阅;学 校可以公布论文的全部或部分内容。 ( 保密的论文在解密后应遵守此规定) 签名:牡导师签名:塞率日期:半绍 i i 上海大学硕士学位论文 1 1 课题来源 第一章绪论 本课题来源于上海市国际科技合作基金项目,“压缩域音乐的高效分类与检 索关键技术研究”,项目编号:n o 0 7 5 1 0 7 0 3 5 。 1 2 课题研究的目的和意义 随着压缩格式音频信息的海量增长,如何提取可高效表征压缩音频的特征 并实现快速的分类检索己成为音频信号处理的重要研究领域。同时由于各种音 频编码方式和在线音频系统的出现,如何进行编码效果的评价和音频系统的在 线监测也是音频处理中面临的重要问题。本文针对上述内容,对压缩音频信号 处理及音频质量客观评价中遇到的问题展开研究。 不同类别的音频分割和话者改变点检测是音频信号处理中的一个重要内 容,在音频的分类与检索中有着重要的应用。无论是不同类别音频的分割还是 说话者改变检测,其实质都是准确地找到不同音频间的分割点。虽然已经有许 多研究者在这方面开展了相关的研究,但这些研究大多集中在非压缩域中,而 对压缩域的研究涉及较少。因而研究一种快速有效的分割算法来实现压缩音频 的分割具有积极的意义。 当前,音频的自动分类尤其是基于内容的音频信息检索是音频信号处理领 域的研究热点。但在压缩音频的分类检索方面的研究处于开始阶段。针对压缩 域中的音频分类问题,本文选择了性能较好的支持向量机( s u p p o r tv e c t o r m a c h i n e ,s v m ) 分类算法用于压缩域音频的分类。在实现分类的基础上,研究 了基于改进形式的直方图算法,进行了压缩域中音频例子的快速检索的研究, 这为压缩域中的音频的分类检索提供了思路。 此外,各种编解码系统、电台广播系统以及音频通信系统的广泛使用,为编 码算法优劣性的衡量和设备正常与否的判断提出了挑战。基于b s 1 3 8 7 的音频质 上海大学硕士学位论文 量客观评价算法( p e r c e p t u a le v a l u a t i o no f a u d i oq u a l i 劬通过计算处理前后音频信 号参数间的差异,提供了音频质量的客观评价方法。本文分析了音频质量客观评 价算法的实现过程,并对算法的参数改进和时间延迟的估计进行了相关研究和实 现。 1 3国内外研究概况 1 3 1 国外研究概况 音频的分割及分类检索一直是音频处理领域的研究热点,已经有许多学者 和研究机构开展了相关的研究并取得了显著的成果。其中音频分割方面,一些 研究者通过计算两个模型的对数似然比( 1 0 9l i k e l i h o o dr a t i o ,简称l l r ) 的方 法进行说话人改变点检测【1 。2 】;文献 3 】采用基于隐马尔可夫模型( h i d d e nm a r k o v m o d e l ,简称h m m ) 的分割算法进行了话者改变点检测的研究;除此之外,基 于贝叶斯信息准则( b a y e s i a ni n f o r m a t i o nc r i t e r i o n ,简称b i c ) 的分割算法由 于其阈值无关性和收敛性等优点也在音频的分割中得到了广泛应用【4 _ 5 】,上述的 分割算法的研究多是集中于非压缩域,对压缩域音频分割的研究则较少。 音频的分类检索方面的研究开展较为广泛,早期的音频检索引擎m u s c l e f i s h t 6 】及马里兰大学的v o i c eg r a p h 检索系统就是典型的代表【7 1 。随后,有相当 一部分研究者开展了检索方面的研究,例如:g u o h u il i 等提出了使用小波的方 法进行音频检索的研究【8 】,k k a s h i n o 等人提出的基于直方图的音频例子检索, i b ma l m a d e n 研究中心的m a l c o l ms l a n e y 提出了音频例子和语句可互相转换 的m p e s a r 系统【9 】;较近的研究,例如:e l o ib a t l l e 等提出了基于h m m 的音 频检索系统【10 1 ,微软亚洲研究院2 0 0 6 年公布的“点播视音频搜索”系统等等。 在音频分类的方面,在非压缩域中的研究较多,例如:k i m b e r 等人使用h m m 将音频分为语音、笑声及其他声音【1 1 】;l u 等人把音频分为无声、音乐、背景音 乐、纯语音和非纯语音五类【1 2 】。随着压缩音频数据的增加,压缩音频的分类研 究也越来越多。例如:在一些研究中,作者使用统计学方法进行了压缩域中音 乐流派的分类 1 3 - 1 4 1 ;在文献 1 5 中,作者使用边带系数结合决策树的方法进行 2 上海大学硕士学位论文 了m p 3 音频例子的分类。但这些分类方法中,s v m 分类的性能要优于最近邻 ( k n n ) 和g m m 等分类性能【1 2 1 。 编解码系统、电台广播系统以及音频通信系统的增多,作为衡量音频系统 性能的音频质量客观评价算法也得到了广泛应用。从早期的p a q m ( p e r c e p t u a l a u d i oq u a l i t ym e a s u r e ) f 1 6 1 到i t u rb s 1 3 8 7 1 标泄1 7 1 及加拿大电信研究院的音 频质量客观评价的相关产品【l8 1 ,已经有许多学者对这一领域开展了研究。音频 质量评价中,参考信号与测试信号之间的时间调整是影响评价结果的关键性问 题,除了作者a n t o n yw r i x 等在文献中给出了时间调整在客观评价中所处的 位置以及对时间调整方法的大概描述外【l9 1 ,有关音频信号的延迟估计的资料也 相对较少,这是音频质量评价标准实现中的重要问题。 1 3 2 国内研究概况 国内也有众多学者从事检索的研究,但起步相对较晚。音频检索最早的研 究成果是一套基于内容的音频信息检索与分类系统a r s t 2 0 1 。但近几年发展迅 速,具有代表性的研究有台湾清华大学开发了基于语音识别的语音检索系统 s o v i d e ;上海交通大学开发的基于内容的音乐检索系统;哈尔滨工业大学的郑 贵滨和韩纪庆等人提出了分段式音频检索概念,并使用归一化的响度主分量进 行了基于模糊直方图的音频信息检索【2 l 】;清华大学的张一彬等人提出了一种新 的基于内容的音频流二级分割方法,利用大尺度分类的粗分割和小尺度分类的 细分割方式保证了真实分割点检测率的同时也大幅降低虚假分割率【2 2 1 。国内有 关音频质量评价的研究则较少,清华大学和西南交通大学等研究机构在音频质 量评价方面做了相关的研究。此外,国家8 6 3 智能计算机专家组为语音识别技 术研究专门立项,一定程度上推动了音频方面的研究。近年来,我国语音识别 技术的研究水平已经基本上与国外同步,由此也推动了音频分类检索研究的迅 速发展。 1 4 论文的主要研究内容 本论文以作者在攻读硕士学位期间参与的研究课题为基础,主要研究内容 3 上海大学硕上学位论文 是压缩域音频信号的处理及音频质量的客观评价。论文的安排如下: 第一章主要阐述了课题研究的来源、目的、意义以及国内外研究的现 状; 第二章介绍了音频信号处理中特征参数的提取,本章的重点是压缩域 特征参数的提取。 第三章介绍了基于贝叶斯信息准则的压缩域音频信号分割,主要包括 使用的分割算法、算法的具体实现及和非压缩域中实验结果的对比。 第四章阐述了基于支持向量机的压缩域音乐分类算法,文中通过对不 同音乐类别时支持向量机的分类算法特征参数的分析,给出了针对压 缩域音频分类情况下参数择优的方法。 第五章介绍了基于特征直方图的压缩域特定音频段检索算法,首先介 绍了直方图算法的基本思想,并对其做了改进,最后基于此算法进行 了压缩域音频例子的检索并给出了实验结果分析。 第六章主要介绍了音频质量客观评价中的时间调整实现算法,主要包 括:时间调整算法在音频质量评价中的重要性、时间调整算法实现的 二级结构及时间调整延迟估计的实验结果。 第七章主要对本论文做了总结并给出了未来工作的展望。 4 上海大学硕士学位论文 第二章压缩域中音频特征的提取 音频特征是指描述一段音频内容、属性、特点的参数。音频特征提取的好 坏,将直接影响到音频信息分类检索等后续处理,因此,所选特征应能充分表 征其频域或时域的特性,并且对环境具有一定的鲁棒性。本章主要介绍音频特 征提取的相关技术,并着重分析压缩域中音频特征及其提取方法,最后对本章 所提特征的有效性进行了实验说明。 2 1 非压缩形式下音频特征提取 非压缩形式下音频信号特征提取的一般过程为:预加重、分帧、加窗和计 算特征参数四步。特征参数又分为两种情况:一是直接对音频数据计算获取的 时域特征参数,二是对音频数据进行特定变换后提取的特征参数 2 3 】。 2 1 1 预加重处理 预加重处理指对输入的原始音频信号s ( n ) 进行加重,目的是为了滤除低频 干扰,尤其是5 0 h z 或6 0 h z 的工频干扰,将对于音频特征提取更为有用的高频 部分进行提升。其实现即是将s ( n ) j 匿过特性为h ( z ) = l 一钇。1 的数字滤波器,口 取值在0 9 - - 0 9 7 之间选择。经处理后的信号可表示为: 2 1 2 短时加窗 s 7 ( ,z ) = s ( ,z ) 一0 9 7 * s ( n 一1 ) ( 2 1 ) 数字音频信号是时变信号,为能用传统的方法对音频信号进行分析,通常 假设音频信号在几十毫秒的短时间内是平稳的。目前,非压缩音频的处理都是 在短时平稳这个假设条件下进行的。为得到短时的音频信号,要对音频信号进 行加窗操作。窗函数平滑地在音频信号上滑动,将信号分成帧。分帧可以连续, 也可以交叠分段的方法,交叠的部分称为帧移,一般取窗长的一半。窗口类型 5 上海大学硕士学位论文 选择将影响音频信号的分析结果,选择窗时要综合考虑窗形状和窗长度, 常用的窗函数如下: 汉明窗( h a m m i n g w i n d o w ) 如式( 2 2 ) ,其中n 为窗长 删4 + 0 4 6 c o s k 2 m 删。卜d l :三巍1 缇2 , 汉宁窗( h a n n i n gw i n d o w ) 如式( 2 3 ) ,其中n 为窗长 州- c o s q 腼“肛d 刀0 搿。 ( 2 3 ) 矩形窗如式( 2 4 ) ,其中n 为窗长 似加j1 黑三y 1 (24,i 叭刀) 2 o ,其他值 瞄4 j 这些窗函数的频率响应都具有低通的特性,不同的窗口类型将影响分帧后 短时特征的特性。此外,还有窗口长度的问题,不论什z , 样的窗口,窗的长度 对能否反映音频信号的幅度变化起决定性作用2 4 1 。加窗后的音频信号j ( 甩) 变 为: s ( 以) = j ( ,z ) 宰w ( n ) ( 0 n n - 1 ) ( 2 5 ) 2 1 3 特征参数的提取 由于声音的短时特性,原始音频的特征提取大都是基于帧进行的。一 般可以分为时域特征向量和频域特征向量。前者计算简单,但不能压缩维 数且不适于表征幅度谱特性。后者计算比较复杂,但能从不同的角度反映 幅度谱的特征。常用的基本特征主要有:短时能量( s h o r t t i m ee n e r g y , 简称s t e ) 、过零率( z e r oc r o s sr a t e ,简称z c r ) 、线性预测系数( l i n e a r p r e d i c t i o n c o e f f i c i e n t ,简称l p c ) 、m e l 倒谱系数( m e l f r e q u e n c yc e p s t r a l c o e f f i c i e n t s ,简称m f c c ) 、子带帧能量( s u b - b a n de n e r g y ) 及带宽( b a n d w i d t h ) 等【1 2 1 。 6 上海大学硕士学位论文 a 、短时能量( s t e ) 这是较常用的时域特征,短时能量分析给出了反应音频幅度变化的一个合 适的描述方法,它对高电平非常敏感。短时能量的描述函数为: 力+ 一l 色= j :( ,z ) ( 2 6 ) b 、过零率( z c r ) 单位时间内过零的次数称为“过零率”。在语音信号处理中是区别清音与浊 音、有声与无声的重要参数,但也可用来作为不同音频类别的区分,如语音信 号的过零率一般都大于音乐的过零率,其计算公式为: z c r = 习寿面篓l s 盟 s 7 ( 掰+ ) 一s 弘 s r ( 聊) ( 2 7 ) c 、m e l 倒谱系数( m f c c ) m f c c 参数是语音识别,音频分类中的关键特征,广泛用于语音识别及音 频的分类检索中。m f c c 是建立在傅里叶变换和倒谱分析的基础上,主要依据 是人耳听觉系统对人的内耳基膜对外来信号会产生调节作用。由于不同的频率 段内的信号会在基膜的不同位置产生震动,根据这种原理将频率区间分成n 个 不同的非线性临界频率段,并使用带通滤波器组来模仿这一过程从而提取n 维 的m f c c 特征参数,具体实现方式将在后面章节介绍。 d 、边带帧能量分布( s u b b a n de n e r g y ) 该特征通过计算每帧信号中,不同频率区间内信号的能量与总能量的比获 取,首先计算帧的总能量,然后计算不同边带能量与总能量比率,计算过程如 下: 川4 肛哪缈 弦8 , 其中,i f ( c o ) 1 2 表示频率缈处的谱密度,为信号采样频率的1 2 。同时, 将信号频率划分为四个子带,分别为 0 ,0 9 0 8 、 8 ,c o o 4 、 4 , c o o 2 、 c o o 2 ,c o o ,并计算各子带能量的分布如式( 2 9 ) 7 上海人学硕士学位论文 。= 吉l ,( 国) 1 2 d 国 ( 2 9 ) l ,和h 为子带j 的上下边界频率。不同类型的音频,其能量在各子带区 间的分布有所不同。 e 、信号带宽( b a n d w i d t h ) 信号带宽是一个重要的频率特征,其计算过程是,首先求出信号的谱中心, 而后计算偏离的距离。具体的计算公式如下所示: j i 积0 ) 1 2 d 缈 。= 去一 ( 2 1 0 ) i i r ( o , ) 1 2d o 0 = i 午式( 2 1 0 ) 的基础e ,则带帘的计算如( 2 1 1 ) 所示: b = o ) 0 0 - - 0 ) 。f 白) 1 2 d c o 0 m 0 f l f b 、1 1 2d 疗, 2 2 压缩域音频特征的提取 ( 2 1 1 ) 相比于非压缩音频中提取特征,压缩音频中的特征提取较为复杂。随着压 缩音频数据的增多,很多学者对此领域开展了相关研究。例如,一些音频研究 者通过对在m p 3 和a a c 相关压缩音频的特征提取,进行了语音识别、音频分 类和歌唱者辨别的研究工作2 5 。2 7 1 。然而,类似于上述的压缩音频处理文章大都 集中在分割分类等算法描述上,对特征提取部分少有介绍,缺少从压缩码流到 特征提取实现的详细过程。鉴于此,本节对压缩域中特征提取及具体应用进行 了研究,并给出了实现压缩域特征提取的详细过程。 2 2 1 压缩音频的部分解码 作为一种开放、先进、可分级的高性能感知编码方案,m p e g l 一l a y e r 3 音频 上海大学硕士学位论文 在许多领域得到了广泛的应用。它是利用人耳的听觉特性对声音进行压缩。m p 3 压缩音频的预处理,主要指通过部分解码的方式建立可体现压缩音频数据谱特 性的m d c t 矩阵。基本的m p 3 编解码原理框图如图2 1 所示: 图2 1 基本m p 3 编解码框图 m p 3 等压缩音频经过子带滤波、声学模型和h u f f m a n 编码等过程,是不能从 其原始码流中提取音频特征的。可以有两种处理方式对压缩音频数据提取特征, 是把压缩数据完全解码还原成p c m 信号,采用非压缩域中的数据处理方法。二 是对压缩数据不解码或部分解码后提取特征。若采用前者的处理方法,解码必然 会使复杂度和计算量大增,不利于实时实现,也缺少实际意义。本文采用的方法 是对压缩音频数据部分解码后再进行处理。 由m p 3 编解码的知识可知,m p 3 码流是m d c t 系数经量化、编码、帧组合所 形成的。数据帧是构成m p 3 数据的基本单位。对于一个特定的数据帧其基本的构 成如图2 3 所示 图2 2m p 3 帧结构示意图 帧头( h e a d e r ) 中包含的采样率、声道模式和音频层可得到信号的频率分布 范围、m p 3 数据保存方式等信息。边带( s i d ei n f o ) 中的一些信息可以反映不同 音频的特点,窗口类型信息反映了窗口切换的频率可以用来判断音乐中的节拍信 息,尺度因子信息反映了子带中数据的能量特征。这些信息虽然体现了音频数据 的一些特征,但尚不够精确。因此,利用帧数据提取音频特征信息主要集中在对 主数据( m a i nd a t a ) 的操作上。由于主数据中的缩放因子很少体现数据特征,所 以我们只需要考虑h u f f m a n 编码数据部分。h u f f m a n 编码是一种概率编码方式, 9 上海大学硕士学位论文 需要对其解码才能得到有意义的数据。h u f f - m a n 解码后的数据即是量化后的 m d c t 系数,由于编码过程中的量化造成了数据的损失,为保证精确度,我们采 用了反量化后的数据来提取特征。这一过程实际是对m p 3 数据的部分解码处理。 2 2 2m d c t 系数矩阵 由上节可知,h u f f m a n 主数据是m d c t 系数量化后的编码并不具有实际的物 理意义,所以不能直接对h u f f m a n 码流进行操作来提取特征。由m p e g 编码的知 识可知,m d c t 系数是对滤波信号的余弦变换,反映了音频数据经子带混合滤波 后类似于频域的特征,表明了信号在不同频率上所占的分量。对每帧数据中的一 个颗粒而言,其在不同频率上的m d c t 系数分布可用图2 3 表示。 从图2 3 中可以清楚地看出,每一颗粒p c m 信号( 5 7 6 个) 经混合滤波器组滤 波后的输出是未量化的5 7 6 个m d c t 系数,在不同频率上分别对应不同的分量。 对于长窗而言,5 7 6 个系数均匀分布在整个信号频率范围内,在短窗情况下,由 于每一子带上加有三个m d c t 窗,所以每一子带的m d c t 系数被分成了三组,每 组包含六个系数。不同情况下,每一颗粒的m d c t 系数是不同的,长窗时,5 7 6 个系数在信号频率范围内均匀分布如图2 3 的l 所示,短窗时5 7 6 个系数形成了三 组,每一组都在信号频率范围内等间隔分布,如图2 3 中的s 所示。 p c m 音期i + m d c t 系数 + l2 3 5 7 55 7 6 1 - 1 9 21 1 9 21 1 9 2 卜 卜 图2 3m p 3 q b m d c t 系数矩阵( s 短窗、l 广长窗) 假定采样频率为风时,根据n y q u i s t 采样定理信号的最高频率是厶矿= f s 2 。 据此,可以在不同情况下,计算出o 一厶矿频率范围内各个系数所对应的实际频 l o 上海大学硕士学位论文 率。其具体的计算公式如下: f = u + 1 ) 惫 无混合窗 + 1 ) 丽f w 厂 3 6 一f w + 竖二! 翌兰厶竖厂3 6 1 61 9 2 。 混合窗 ( 2 1 2 ) 为更清晰的对m p 3 部分解码后的m d c t 系数有一个直观地了解,我们给出了 一段音乐中的m d c t 系数示意图,如图2 4 。该图是对4 4 1 k z 、单声道、8 7 帧约2 3 1 秒的m p 3 音乐提取的m d c t 系数示意图。8 7 帧数据共有8 7 x 5 7 6 x 2 = 1 0 0 2 2 4 个 m d c t 系数。从中可以看出m d c t 系数分布的情况。在一帧数据约5 7 6 各点中, 数值较大的集中在前面,数值较小的集中在后面,这是余弦变换的结果。 2 2 3 特征参数的提取 在这部分中将给出一些常用特征的计算方法。考虑到m f c c 的重要性,我们 将对其重点介绍。计算公式及方法都是以m p e g 1l a y e ri i i 音频样本为例,以解 码得到的反量化m d c t 系数为基础进行处理。对每个颗粒定义研w 】 f 】表示子 带样本,其中w 表示窗个数,对于长窗w = l ,短窗w = 3 ,i 表示子带序号,j 表示子 带中样本序号。 ( 1 ) 均方根r m s ( r o o tm e a ns q u a r e d ) 该参数可以看作是音频信号的包络,体现了信号的能量变化。从人的感觉特 性而言此参数反映正弦波或宽带噪声中能量的主观感知属性。对一个颗粒而言计 算公式如式( 2 1 3 ) 所示: r m s =( 2 1 3 ) 其中,n 是一个颗粒中的系数个数,w 是窗的序号,i 表示子带序号,j 表示子 带中样本序号。这个特征可以用来做无声与有声的分割参数以去掉静音段。设定 一个门限t ,当一段音频中此参数小于门限值就判为无声,反之为有声段。 上海大学硕士学位论文 m p 3 帧的m d c t 系数示意图 一一一一一广 一 一- 一一一一1 一- 一一一一一1 一l i i -_-_ - l j杯 l ? - j_ 址l 【l l | l 一坩一4出砸枞嘏 -_ _ 肌唧j渤1 1 j 娅:i 丽l h i i 叶”。 ! _ 。1 - - 州 卜一 i _,i 。 hm。 | | i _ 。! i : 一一洲;一一自盯7t 、 、1 1 。r j , l - 酾c | i !j l 驸川y七坩 卅!【if! 删f “删” 一1 _ ff : i l 0l23456789l o 系数序号 x 1 0 4 图2 4m p 3 域中m d c t 系数示意图 ( 2 ) 谱中心距( s p e c t r a lc e n t r o i d ) 该参数即是m d c t 系数能量分布的平衡点,其计算公式如式( 2 1 4 ) 所示: ( i x j ) w 川 锄忙1 童小丽 q 1 4 wi 其中,w 是窗的序号,i 、j 表示的是边带序号和边带内系数的序号,谱中心 距体现了大多数信号能量所集中的频谱区域,和时域信号中的过零率很接近。从 不同的音频信号考虑,当不同的音频信号过零率显著不同时,可以用这一参数进 行区分。 ( 3 ) 边带能量比率( b a n de n e r g yr a t i o ) 在信号频率范围内以一个频率丘做划分,把低于和高于z 的频率所对应的 m d c t 系数能量做比即得到边带能量比率。假定,二与第1 个边带,第j 个m d c t 系 数所对应的频率最接近。边带能量比率b e r 可表示为式( 2 1 5 ) b e r =( 2 1 5 ) 其中,w 是窗的序号,i 、j 表示的是边带和边带内系数的序号,研w f 1 2 5 4 3 2 o l 2 3 4 5 o o o o o m 翠螽h u 昼z 上海大学硕士学位论文 表示系数样本值,m 表示窗类型,长窗时m = 1 8 ,短窗时m = 6 ,对不同的信号 而言,其低频部分与高频部分的比率显然是不相同的。 ( 4 ) 信号带宽( b a n dw i d t h ) 我们定义每一子带的能量均方根为s r m s i ,1 f 3 2 表示3 2 个子带序号,如 果如果我们设定一个边带能量门限毛凇,那么信号的带宽可表示 b w = m a x is r m s i 互冗懈) 一m i n ia r m s i 互浓懈) ( 2 1 6 ) 对不同的音频信号其带宽是不相同的,如:语音与音乐,机器轰鸣声与自然 界的声音等。 ( 5 ) m f c c ( m e l f r e q u e n c yc e p s t r a lc o e f f i c i e n t s ) 参数 m f c c 参数是语音识别,音频分类中的关键特征,可利用它在非压缩域中实 现语音识别和音乐的分类 2 6 - 2 7 】。根据数字信号处理的知识,f f t 系数体现了信号 频率范围内等间隔频率上的频谱分量,m e l - - - 角滤波器对信号的滤波类似于听觉 临界带的划分,它根据听觉特性对不同的频率段做不同的处理,从而使滤波得到 的参数特征更符合人类的听觉习惯。根据文献 2 8 】对m d c t 系数的分析可知, m d c t 系数很大程度上是d f t 频谱的一个线型近似,尤其是我们只考虑其能量值 时。因此,可以在压缩域中利用这些系数求解每帧的m f c c 特征参数。 然而,在m p 3 压缩域中我们不可能采用非压缩域中的处理方式。有的研究者 将每一帧的m d c t 系数重新定义到六个相似临界带中,以5 0 重叠的m e l = 角滤 波器组对这些系数滤波,得到1 0 维的m f c c 特征向量【2 9 】。本文计算过程中,并未 考虑临界带的重新定义,而是采用了不同的方法:根据要求的滤波器组数或特征 向量维数,确定m e l 三角滤波的中心频率并设计滤波器组( 5 0 重叠率) ,使用 m e l - - 角滤波器组对每一帧m d c t 能量系数滤波,最后对滤波器输出结果做余弦 变换即可得到m f c c 特征参数。在本文中设定滤波器的个数为1 6 ,选取除第一维 以外的1 5 维的特征向量。相比于非压缩域中高于5 7 6 点的f f t 变换,由于点数较 少且使用的是余弦变换系数,故在精度上有一定的不足,但从实验结果来看满足 实际的需要。具体计算流程如图2 5 所示: 1 3 上海大学硕士学位论文 参数获取算法描述: 图2 5 压缩域m f c c 计算流程 c a 、帧内能量的求取 为获得m f c c 参数,文献 2 8 1 的作者采用了对m d c t 系数直接滤波的方法,但 考虑到噪声和谱估计误差有更好的鲁棒性,我们对m e l 滤波后的m d c t 频谱取对 数能量。 m d c l 3 = ( m d c t 2 + m d c 7 2 2 ) 2 0 ( 2 1 7 ) 其中m d c t l 2 为第一个颗粒的能量,m d c t 2 2 为第二个颗粒的能量。 b 、m e l 三角滤波器函数 人耳对频率的感知是一个非线性过程,在1 0 0 0 h z 以上感知能力与频率成 对数关系。为实现对( 2 1 2 ) 中得到的m d c t 能量谱进行类似的处理,我们需 要定义一个m e l 三角滤波器组。考虑到计算的复杂性,本文所定义的滤波器个 数为1 6 个,则其对应于m e l 频率下的1 6 个中心可如下计算: f c ( m ) = 万nb - 1 ( 毗m 警) ( 2 1 8 ) 其中,= 5 7 6 ,b = l n ( 1 + 去) 是实际频率与m e l 频率的转化关系,b - 1 是其 逆函数。曰( 无) ,b ( 厶) 分别是最低和最高频率的m e l 频率表示。m e l 频域的三 角滤波其实是计算落入三角滤波器范围内的频域分量,并将m d c t 能量幅度乘上 对应的因子。三角滤波对不同频率分量的频率响应如式( 2 1 9 ) 所示。 1 4 上海大学硕士学位论文 巩( 后) = f c ( m - 1 ) k f c ( m ) k f c ( m ) ( 2 1 9 ) f c ( m ) k f c ( m + 1 ) 其中,1 ( f c ( m ) 一f c ( m 一1 ) ) ,1 ( f c ( m + 1 ) 一f c ( m ) ) n - t 看作是三角滤波中心 两侧的滤波因子,不同的三角滤波器,因其带宽的非线性,对应因子也各不相同。 m 表示对应的滤波器序号,这里m 的范围是0 m 1 5 且为整数。k 表示频率线的 序号,这里k 的范围为0 尼5 7 5 分别和图2 3 中5 7 6 个m d c t 系数对应。 c 、滤波后能量输出 5 7 5 x ( 聊) = l n ( m d c 7 a x h , ( k ) ) o m 1 5 ( 2 2 0 ) 其中,m 是滤波器序号,k 是m d c t 2 序号,m d c t 2 可由( 2 1 7 ) 式得出。 在高频部分,其值有可能为0 。 d 、利用离散d c t 变换将滤波输出变化到倒谱域 1 5 均= c 】0 s z n ( m + 0 5 ) 1 6 o n o ( 3 3 ) 其中,五是惩罚因子,根据实际应用进行调整,本章在处理中将力取为l 。 p 是与模型复杂度相关的惩罚项,它的值可由下式来决定 尸= 三( d + j 1d ( d + 1 ) l 。g : ( 3 4 ) 其中,d 表示特征向量空间中的维数。 使用b i c 准则对一段音频进行具体分割时,通常先取一个长度为n 的分析 窗,然后计算窗内的每一帧对应的b i c 值,最后选出最大的一个甄,如果 虬0 ,则它对应的那一帧即为音频分割点,否则,将新的音频帧加入到分 析窗中重复上述过程,直到检测到分割点或者音频流的结束为止。 上述的分割方法,只适用于一个分割点或没有分割点时检测音频数据,当音 频包含多个分割点时,要将每次假设的改变点位置逐帧后移,进行所有可能改变 2 1 上海大学硕士学位论文 点的搜索,其原理性的说明可参考多改变点检测算法示意图3 1 ,其中a b i c ( t i ) 表 示每次移动一帧后,经过计算所获得b i c 值。 实现方式可采用以下步骤进行。 1 ) 、初始窗长 a ,b :a = l ,b = 2 ; 2 ) 、上述的b i c 单个改变点检测算法检测 a ,b 间有无改变点; 3 ) 、音频帧在逐帧后移的同时,并判断是否有分割点,用程序语言说明如下: i f ( a ,b 间没有改变点) b = b + l ; e l s e ( t 为检测出的改变点; a = t + 1 ;b = a + l : ) e n d i f ( 文件剩余长度是否满足分割要求) t r u e 返回2 ; e l s e 分割结束,所有改变点已经检测完成。 糖 嘲一一 f l a b i c ( t z ) 0; i a b i c ( t 2 ) j二 曲i c q 0 a s l

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论