已阅读5页,还剩51页未读, 继续免费阅读
(通信与信息系统专业论文)新型高保真宽带音频编码算法的研究和实现.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 摘要 随着通信系统和计算机网络的高速发展,通信传输的速度和带宽不断增加, 高保真音频作为一种媒体方式在通信系统和消费类产品中变得越来越重要。文中 介绍了一种新型高保真音频编码技术算法,并且阐述了新算法面向实际应用的硬 件平台的实时实现方法。 本文首先介绍了音频编码技术的基本理论和研发概况,然后研究和分析了音 频编码的框架和算法的主要模块。接下来针对计算复杂度较高的时频变换、心理 声学模型、立体声信号处理、量化和编码等模块的在算法级进行优化,再对优化 后的算法进行定点化并将其移植到t id m 6 4 2 平台上,然后就这个定点化的算法 针对该平台进行优化。 主观和客观的测试和评估结果表明,新型高保真音频编码算法具有高质量和 低复杂度的特点,因此容易在市面上流行的d s p 上进行实现实时处理。事实上, 本文提出的新算法很快会应用于实际通信系统之中。 关键词:音频编码时频分析熵编码心理声学模型多媒体通信 a b s t r a c t3 a b s t r a c t w i t ht h er a p i dd e v e l o p m e n to fc o m m u n i c a t i o ns y s t e m sa n dn e t w o r k s ,a n dt h e i n c r e a s i n go ft h et r a n s m i s s i o ns p e e da n db a n d w i d t h , h i f i d e l i t ya u d i oi sb e c o m i n ga v e r yi m p o r t a n tm e d i ai nc o m m u n i c a t i o ns y s t e m sa n dc o n s u m e rp r o d u c t i a n s an e w t y p eo fh i - f ia u d i oc o d i n gs c h e m ea n da l g o r i t h mi si n t r o d u c e di nt h et h e s i s ,a n dt h e w a yo fp o r t i n gt h ea l g o r i t h mi n t oh a r d w a r ep l a t f o r m sf o rr e a la p p l i c a t i o n si sa l s o p r e s e n t e d f i r s t l y , t h ef u n d a m e n t a lp r i n c i p l ea n dt h ed e v e l o p m e n to ft h ea u d i oc o d i n g t e c h n o l o g ya r ei n t r o d u c e d ,t h e n ,t h es t u d ya n da n a l y s i so f t h ef r a m ew o r ka n dt h em a i n b l o c k so ft h ec o d i n ga l g o r i t h ma r ea d d r e s s e d a f t e rt h a t , s e v e r a lm o d e l sw h i c hh a v e h i g h e rc a l c u l a t i o nc o m p l e x i t y , s u c h 弱t i m e - f r e q u e n c yt r a n s f o r m p s y c h o a c o u s t i c m o d e l ,s t e r e oa u d i os i g n a l sp r o c e s s i n g ,q u a n t i z a t i o na n dc o d i n g , a r eo p t i m i z e di n a l g o r i t h ml e v e l f o l l o w i n g ,t h eo p t i m i z e da l g o r i t h mi sf i x e d - p o i n ti m p l e m e n t e da n d p o r t e dt ot id m 6 4 2d s pp l a t f o r m ,a n df i n a l l yt h ef i x e d - p o i n ta l g o r i t h mi sf u r t h e r o p t i m i z e df o rt h i sp l a t f o r m o b j e c t i v ea n ds u b j e c t i v ee v a l u a t i o n sh a v es h o w nt h a tt h ed e s i g n e dh i - f i d e l i t y a u d i oc o d i n ga l g o r i t h mi sg o o di nq u a l i t y , l o wi nc o m p l e x i t y , a n ds oi sn o th a r dt ob e i m p l e m e n t e dw i t l lc o m m e r c i a la v a i l a b l ed s p a c t u a l l y , t h ep r o p o s e da u t oc o d i n g s c h e m ew i l lb eu s e di nr e a lc o m m u n i c a t i o ns y s t e m ss o o n k e yw o r d s :a u d i oc o d i n gt i m e - f r e q u e n c ya n a l y s i se n t r o p ye n c o d i n g p s y c h o a c o u s t i cm o d a l m l i l 廿m e m ac o m m u n i c a t i o n s 创新性声明 本人声明所呈交的论文是我个人在导师指导下进行的研究工作及取得的研 究成果。尽我所知,除了文中特别加以标注和致谢中所罗列的内容以外,论文 中不包含其他人已经发表或撰写过的研究成果;也不包含为获得西安电子科技 大学或其它教育机构的学位或证书而使用过的材料。与我一同工作的同志对本 研究所做的任何贡献均已在论文中做了明确的说明井表示了谢意。 申请学位论文与资料若有不实之处,本人承担一切相关责任。 本人签名 到璋彤 日期也! :堑 关于论文使用授权的说明 术人完全了解西安电子科技大学有关保留和使用学位论文的规定,即:研 究生在校攻读学位期间论文工作的知识产权单位属西安电子科技大学。本人保 证毕业离校后,发表论文或使用论文 _ 作成果时署名单位仍然为西安电子科技 大学。学校有权保留送变论文的复印件,允许查阅和借阅论文;学校町以公布 论文的全部或部分内容,可以允许采用影印、缩印或其它复制手段保存论文。 ( 保密的论文在解密后遵守此规定) 本学位论文属于保密,在一年解密后适用本授权书。 本人签名 导师签名 日期盆监:整 日期型2 : :琢 第一章绪论 第一章绪论 1 1 前言 人类社会已进入信息时代,面对浩如烟海的多媒体信息,数据压缩技术越来 越为人们所关注。近年来随着多媒体通信和多媒体计算机领域的发展,特别是数 字音频广播和高质量数字音频设备及系统的发展,人们已不满足于窄带语音压缩 编码,对宽带音频信号越来越感兴趣,因此,宽带音频压缩己成为研究的热点。 在上世纪8 0 年代中期,声音编码还主要集中在通信系统中的窄带语音压缩编 码,现在则扩展到宽带语音编码和高质量音频编码,高质量音频编码强调在特定 的码率下,有效提升编码质量,满足对编码质量的苛刻要求,高质量数字音频记 录媒体的代表产品如c d 唱片和d a t 磁带,其记录音频的码率分别为 4 4 1 k h z x 2 x 1 6 b i t s = 1 4 1 m b s 和4 8 k h z 1 6 b i t s 2 - - - - 1 5 6 m b s ,其应用领域包括 高密度激光视盘、数字电视和数字电影等。m p e g 音频压缩算法利用人耳听觉掩 蔽效应,可将上述声音信号压缩到2 5 6 k b s 以下听不出任何区别。 宽带音频压缩的应用领域十分广泛i l 】,主要包括d a b 、数字话音通信、高清 晰度电视、v c d 、d v d 、多媒体音频处理、电视会议、远程教学、高质量音频节 目的传送、分配与交换及数字存储等。高质量的音频编码算法的研究与系统实现 为这些领域开辟了广阔的前景,从而对多媒体技术的全面发展及信息高速公路的 建设起到积极的作用。 总之,高质量宽带音频信号压缩算法的研究有重要的理论价值,同时还极具 实用价值。 1 2 高保真宽带音频编码技术的发展 近年来,随着现代通信的发展,人们对各种多媒体业务的需求日益增长,消 费者要求得到更多更好的音频产品和服务。数字声音作为一种存储、处理和传输 高保真声音的方法,在消费电子、专业声音等众多领域已得到广泛应用。但是如 果没有通用有效的高质量视频和音频编解码方案,数字存储和传输技术的进一步 发展将会受到严重的束缚,这就促进了各种声音压缩技术的出现。 信源编码的主要目的是力求以最小的数据量表示更多的信息,因此,信源编 码也称为压缩编码。音频信号数字化之后,所面临的第一个问题就是如何实现数 字音频的有效存储和传输,因此,为了降低传输或存储的费用,对数字音频信号 2 新型高保真宽带音频编码算法的研究和实现 进行有效的压缩极为重要【2 1 【3 1 。统计分析表明,无论是语音信号还是音乐信号, 都存在着多种冗余,主要包括时域冗余、频域冗余和感知冗余,这是我们进行压 缩编码的事实依据。 按照压缩原理的不同,可将音频压缩编码分为波形编码【4 】、参数编码【5 】以及 多种技术相互融合的混合编码【6 】等。对于各种不同的压缩编码方法,其算法复杂 度、重构音频信号的质量、压缩比以及编解码算法延迟等都有很大的不同,因此 其应用场合也各不相同。 目前现存的有o g gv o r b i s 、a a c l d 、m p 3 等音频编码算法。 o g gv o r b i s 音频压缩算法是一种源码完全开放的,具有较大编码灵活性的通 用感知音频标准。o g g 代表的是开发一种有损音频压缩技术的计划,该计划有意 设计一个完全开放源码的多媒体系统。而o g gv o r b i s 是这种音频压缩算法的名称, 它是o g g 计划的一部分。o g g v o r b i s 支持多种编码方式( 平均比特率- a b r 、固定 比特率c b r 、可变比特率一v b r ) ,长短窗切换、立体声通道耦合及比特池等技术 的应用,使得o g gv o r b i s 在提高音频质量上取得了相当的成功。o g gv o r b i s 的编 码性能得到广泛好评,一般认为,v o r b i s 可获得比m p 3 更优质的音质。 m p e g 7 音频发展的趋势是多采样率、低编码速率、高压缩率、低时延等。 在低时延方面,有a a c l d ,其主要思想是通过减小变换窗的长度来降低总时延, 同时结合t n s 及噪声替代技术,在满足低时延要求的同时,可以获得较好的音频 质量。 m p e g - 1 音频编码共有三个层次( l a y e r ) ,随着层次的提升,压缩的效果越 来越好,当然其编解码的复杂性也越大。m p 3 是在层l 和层2 的基础上发展而来 的,它舍弃脉冲编码调制( p c m ) 音频数据中对人类听觉不重要的数据,从而大 大压缩了文件,在m p 3 中使用了许多技术其中包括心理声学以确定音频的哪一部 分可以丢弃,m p 3 音频可以按照不同的编码速率进行压缩,提供了在数据大小和 声音质量之间进行权衡的一个范围。 近年来,m p e g - 4 音频编码又有了长足的发展,在m p e g 一1 和m p e g 2a a c 基础上,压缩比更高的音频编码算法,如a a cp l u s 和e n h a n c e d a a cp l u s 等,相 继出台。目前m p e g 音频专家组正在汇聚各方面研究力量制定统一音频和语音高 质量高效率编码算法。 1 3 本文研究的内容和主要成果 本课题是“高保真宽带音频编码算法的研究和实现”,涉及了以感知编码为基 础的高效、高质量宽带音频和宽带语音编解码算法,是一种新型音频压缩编码算 法。在较低的编码速率下做到较高的音频和语音编码质量,适合于面向网络通信、 第一章绪论 全双工音频和语音通信。 论文所涉及的主要工作和内容包括三个方面:这三个方面研究了该课题关键 模块的理论以及这些关键模块的定点化和优化。理论研究主要涉及到时频分析模 块、心理声学分析模块、立体声处理模块、预回声处理模块以及量化和编码模块, 针对其实时处理不足的地方,本文作了相应的改进;基于d s p 的工作主要是针对 上述模块进行定点化和优化的一些方法,根据t m s 3 2 0 d m 6 4 2 芯片结构的本身特 点,提出了一些新的定点化和优化的方案,并使用国际标准化的测试方法对定点 化和优化后的程序分别进行了主客观测试。 论文研究的主要成果包括:降低了原有音频编码算法的复杂度;提高了音频 编码的质量;在d s p 上实时运行了改进后的算法。 1 4 论文的结构安排 本论文共分为六章,具体内容和结构安排如下: 第一章主要对音频编码技术的发展、意义及技术分类作了简单介绍,最后简 述了本论文的研究内容。 第二章主要介绍了高保真宽带音频编解码算法的基本原理和编解码流程,并 且对算法中的时频分析技术,立体声处理技术、预回声处理技术以及量化和编码 技术进行了简单的背景知识介绍。 第三章针对音频压缩算法高质量和基于d s p 实时处理的要求,本文提出了新 型高保真宽带音频编码算法,并且介绍了该算法的基本原理和编解码流程。对改 进后的模块进行了详细的论述,研究时频分析模块和量化编码模块及其缺陷,并 采用了新的快速算法;研究和分析传统立体声编码技术,应用了正方形极坐标映 射和声道交织耦合的方法;研究和分析预回声现象,提出了一种基于组合心理声 学模型的预回声处理新算法。 第四章首先介绍了t m s 3 2 0 d m 6 4 2 平台,针对该平台的特点我们采取了相应 的定点化和优化方案,对时频分析中的f f t 算法应用了基于减少存储空间的新的 快速算法,以满足d s p 的实时处理。 第五章首先介绍了音频质量评估标准,对定点化和优化后的音频编码算法的 音质作了主、客观测试,最后对测试结果进行了对比分析。 第六章总结了新型高保真宽带音频编码算法的设计思想、实现方式、特点以 及对高质量音频压缩编码算法的发展的意义 4 新型高保真宽带音频编码算法的研究和实现 第二章高保真宽带音频编码算法概述 2 1 引言 随着对网络多媒体需求的增长,如何在低码率下提高音频编码的质量日益受 到人们关注。为了获得更高的压缩比,一种追求在主观感知意义上更接近的高质 量、低码率的音频编码技术越来越成为数字音频压缩技术的主导,因而设计重点 从由精确恢复原始信号波形转向充分利用人类的听觉感知特性,不仅要去除信号 的固有冗余,且要能有效去除感知冗余,这种方法称为感知音频编码( p a c : p e r c e p t u a l a u d i oc o d i n g ) 【7 】【8 】【9 】。本章首先介绍了以感知音频编码为基础的高保真 宽带音频编码算法及a a c 、m p 3 、和v o r b i s 等音频编码算法,然后对算法中的主要 模块进行了研究和分析。 2 2 高保真宽带音频编码基本原理 2 2 1 高保真宽带音频编码概述 高保真宽带音频编码器主要利用信号的统计特性和人类听觉的感知特性,一 方面力求去除信号的统计冗余【1 0 】【1 1 1 ,另一方面利用心理声学现象中的掩蔽效应, 使用心理声学模型,去除人耳不能感知的声音成分,同时也不一味追求最小的量 化噪声,而是力求使量化噪声不被人耳感知即可,这样,既实现了音频数据压缩, 又不影响解码端重构音频信号的主观音质。由于子带编码和变换编码的优点,使 得两者在高保真宽带音频编码算法中被广泛应用。高保真宽带音频编码器的基本 结构框图如图2 1 所示【8 】【9 】【1 2 】: 编码器将一个短周期内的连续时间采样信号( 即数据块) 送入子带滤波器中, 滤波器组将信号分成多个限带信号,以近似人耳的临界频带( c r i t i c a lb a n d ) 响应。 各子带信号再经过时频变换,得到的频域参数被输入到量化编码模块。由于子带 滤波器和变换滤波器级联,所以通常称为混合滤波器组。 心理声学模型是编码器的核心,它利用了心理声学中的掩蔽现象,提出了临 界频带的概念。心理声学模型对一个数据块进行分析,以临界频带为单位分析信 号的掩蔽特性和掩蔽效果,模型输出掩蔽阂值曲线,以此为依据去除听觉不相关 成分,掩蔽阈值提供给比特分配模块来控制量化噪声的大小,决定比特分配方案。 比特分配模块根据心理声学模型提供的信息拟定比特分配方案,供量化编码 第二章高保真宽带音频编码算法概述 5 模块参考。量化编码模块按照给定的比特分配方案进行比特分配,对频域参数进 行量化和编码,并将结果送给复合器进行比特流封装,即组帧,在数据流中加入 必要的边信息形成最终的输出码流。量化编码模块一方面要考虑心理声学模型的 分析结果,力求去除听觉不相关成分并尽可能地将量化噪声控制在掩蔽阈值之下, 同时还要考虑编码比特率,因此,量化编码模块要在给定的编码比特率下力求获 得最好的音质,或在给定的音质要求下,力求最小的编码比特率。 数据流 无 组 损 熵 编 边信息 帧 码 图2 1 感知音频编码器的基本结构框图 2 2 2a a c 音频编码概述 1 9 9 7 年4 月i s o 通过了m p e g 2 a a c t ”】音频编码标准、编号i s o i e c l 3 8 1 8 - 7 。 在目前所有的音频编码方案和标准中,a a c 的编码效率最高、重建音质最好、功 能最强。a a c 编码器的流程图见图2 2 图2 2 是m p e g 2a a c 编码器方框图。修正离散余弦变换m d c t 作为输入 信号的滤波器组,在滤波器组中可以使用正弦窗和k a i s e r - b e s s e l 窗。通过对m d c t 输出的频谱数据进行滤波,用时域噪声整形t n s 来控制每个窗口的量化噪声。 t n s 用预测值来代替原始频谱系数,以利于在编码器中窗内的滤波器组控制时域 的预回声。在m p e g 2a a c 中使用了两种立体声编码技术:强度立体声编码和 m s 立体声编码。这两种方法可以根据信号的频谱有选择地使用,也可以混合使 用。 为了折中音质和算法复杂度,m p e g 一2a a c 定义了主类( m a i np r o f i l e ) 、低复 杂度类( l o wc o m p l e x i t yp r o f i l e ) 和可变采样率类( s c a l a b l es a m p l i n gr a t ep r o f i l e ) 。 主类保证在任意给定的编码比特率下都有最高的音频质量。低复杂度类不使用预 测和增益控制模块,t n s 滤波器的阶数也很有限,音频质量比主类低。在可变采 样率类中,增益控制用来执行四阶多相位滤波、增益检测和增益改变。 6 新型高保真宽带音频编码算法的研究和实现 输入音频信号 图2 2m p e g - 2 a a c 编码器方框图 2 2 3m p 3 音频编码概述 m p e g 标准的音频部分( i s o i e c1 1 1 7 2 3 和i s o i e c1 3 8 1 8 - 3 ) 制定了三层 压缩算法l a y e ri ,l a y e ri i 和l a y e ri i i 。其中l a y e ri i i 的算法最复杂,同等压缩 比情况下的音质最佳。m p 3 1 4 】【1 5 】【1 6 1 即是m p e gl a y e ri i i 的简称,低数据量和高播 放品质的优点使其成为音乐存储,数字广播,网上音乐传输的主要方式。人们不 仅可以使用计算机软件,还可以通过数字随身听来欣赏m p 3 音乐。 图2 3 是m p e g 1 第1 层或第1 i 层音频编码器,图2 4 是m p e g 1 第1 i i 层音 频编码器。第1 i i 层与第1 层和第1 i 层相比,具有更高的复杂度,在低数据传输速 率时依然能保持好的保真度。第1 i i 层根据“临界频带”的概念,使用非均匀的子 带滤波器组,将输入信号的频带划分成不等带宽的子带。按临界频带划分子带更 符合人耳的听觉特性,可以改善对低频信号压缩编码的失真。除此之外,第i 第二章高保真宽带音频编码算法概述 层还使用了修正离散余弦变换( m d c t ) ,m d c t 将子带的输出在频域里进一步 细分以提高频域分辨率,同时可以部分消除多相滤波器组引入的混叠失真。 频 子带r 1 。r _ : 数据流 _ 滤波器组亡二二二:l 或任基代亡二: 无比 i 子带 i 。 i 损特 熵流 田田 编封 码 边信息 装 5 1 2 或1 0 2 4 点 学模型 图2 3m p e g 1 第1 层或第层音频编码器 频失真 - - r - i t 数据流 + 控制 无比 弼| 上 损 特 非均熵流 冈r 习 匀量编封 化控 码 边信息 装 _ 竺皇广 竺竺 制环 图2 4m p e g 1 第1 i i 层音频编码器 用噪声分配代替第1 层和第1 i 层的比特分配,基于分析合成的方法来量化频 谱,以满足掩蔽阈值要求的噪声。频谱的量化过程可以根据给定的比特率的限制 来调整,并采用非均匀量化。根据音频信号的统计特性采用h u f f i n a n 或游程编码 可进一步提高压缩比。为了利用立体声声道间的相关性,第1 i i 层应用了联合立体 声编码技术。 m p e g 1 第1 i i 层采用m d c t ,属于变换编码。 2 2 4o g gv o r b i s 音频编码概述 o g g v o r b i s 1 7 】【1 8 】【1 明是一个通用的基于人类感知特性的音频编解码器( c o d e c , c o d e r d e c o d e r ) 。其中o g g 是) ( i p h o r g 对音频、视频和元数据进行承载和封装 的格式;而v o r b i s 则是封装在o g g 格式中的音频压缩方案或音频编码算法的名字。 o g gv o r b i s 是一种新型音频压缩编码算法和格式,在存储和播放数字音频方面大 体上与m p 3 和a a c 等相同,不同之处在于o g g v o r b i s 音频编码格式和算法是开 新型高保真宽带音频编码算法的研究和实现 放、免费且无专利保护的。 v o r b i s 音频编码算法的设计具有很大的适应性。首先它支持具有竞争性的较 宽的编码速率范围并具有良好的音频质量:在高保真高速率端,v o r b i s 音频编码 可以与m p e g 2 音频编码相媲美;在低速率端,v o r b i s 音频编码可以在4 8 k b p s 以下进行高质量立体声音频编码。v o r b i s 音频编码的设计也欲意支持很低和很高 的音频采样速率,包括从8 k h z 话带语音到1 9 2 k h z 数字原版音频。同时v o r b i s 音频编码还能够表示和再现从单声道、立体声、5 1 环绕立体声声道到多达2 5 5 声道的声源信号。 2 3 高保真宽带音频编码算法关键技术 2 3 1 时频分析技术 分析合成技术广泛应用于语音和音频编码,分析合成系统的基本结构包括一 个分析滤波器组和一个合成滤波器组【2 0 】【2 ,分析滤波器将输入信号x ( n ) 分为多个 连续的频带或多个通道信号x ( k ) ,合成滤波器将多个通道的信号合成以得到原始 输入信号的重构。对于分析合成技术,有两种最基本的实现方式: 一种是用带通滤波器或低通滤波器结合调制器。这种方式在频域中很容易分 析信号重构的条件各通道分析厶成滤波器的频率响应的叠加为一常数。基于 这个原则已经设计出了许多经典的滤波器组。 另一种实现方式是基于块的变换,原始的时域信号加窗后变换成为频域表示, 这种变换可以很好地在频域中解释信号的特性,常用的变换有d f t ( 离散傅里叶 变换) 、d c t ( 离散余弦变换) 和d s t ( 离散正弦变换) 。合成时,经反变换后的 时域序列与合成窗相乘,再与先前的部分数据叠接相加。 已经证明,以上两种方式存在对偶性,基于块变换的d c t 或d f t 与由多个 带通滤波器组成的滤波器组在功能上是等效的。由于基于块处理的编码方式是对 每一数据块单独量化编码,容易引起边界噪声,时域混叠抵消滤波器组在处理语 音和音频信号时有一个额外的优点:由于相邻块之间有5 0 的混叠,可以有效地 消除块效应。 2 3 2 心理声学分析技术 声音的响度就是声音的强弱。在物理上声音的响度使用客观测量单位来度量, 即用声压或声强;在心理上,主观感觉的声音强弱使用方( p h o n ) 或宋( s o n e ) 来度量。 第二章高保真宽带音频编码算法概述 9 声音信号不仅可在时域表示,在频域中表示也很方便。频谱分量的能量可通 过傅立叶变换系数获得,对于离散频谱的信号,整体能级就是各部分频谱分量的 和。通常语音信号的带宽大约取4 k h z ,音频信号则由于其音源范围广而频谱较为 丰富,大约为2 0 2 0 k h z ,c d 音质信号的采样为4 4 1 k h z 。 人耳对声音的频谱分析是通过一种频率位置映射来实现的2 2 2 3 1 。这个映 射过程在内耳进行。实验发现信号的不同频率分量是由耳膜的不同部位来处理的。 即耳膜的不同部位只对声波信号的特定频段敏感:耳膜内侧的部位对高频敏感, 外侧对低频敏感。鉴于此,我们可以把耳膜从外向内分成许多段,每段等效于一 个带通滤波器,这样整个耳膜可以看成一组频带重叠的带通滤波器组。这些滤波 器的频率响应是非线性且非对称的,它们把整个频谱划分为一个个不等宽的频带, 即所谓的临界频带。关于临界带宽,可以认为它是引起主观感觉变化明显的带宽, 经研究人员的大量实验和测试,频率厂与临界频带带宽b w ( 厂) 的对应关系可用下 式描述: b i g = 2 5 + 7 5 i + 1 4 ( l o o o ) 20 6 9 ( h z ) ( 2 - 1 ) 从上式可以看出,不同频率的临界带宽是不相等的,频率越高临界带宽越宽。 为了分析方便,往往将临界频带带宽用巴克来表示,巴克频率方程为: z ( f ) = 1 3 a r c t a n ( 0 0 0 0 7 6 f ) + 3 5 a r e t a n 眇7 5 0 0 ) 2i ( 2 - 2 ) 但是,人耳对声音的感知并不是绝对的,还要受到所谓“掩蔽效应”的影响。 当两个声音同时或一前一后进入听觉系统时,强的声音( 掩蔽音,m a s k e r ) 能阻 碍听觉系统感知弱的声音( 被掩蔽音,m a s k e e ) ,这种现象称为掩蔽效应。掩蔽 现象表明了人的听觉系统对频率和时间的分辨力的有限性。通过实验观察发现, 掩蔽效应可以分为频域掩蔽和时域掩蔽。当掩蔽音和被掩蔽音同时进入听觉系统 时发生的掩蔽称为频域掩蔽或者称作同时掩蔽( s i m u l t a n e o u sm a s k i n g ) ;时域掩 蔽指的是掩蔽音超前于被掩蔽音或者落后于被掩蔽音。前者称为后向掩蔽 ( b a c k w a r dm a s k i n g ) ,后者称为前向掩蔽( f o r w a r dm a s k i n g ) 。在音频编码中, 原始音频信号是掩蔽音,被掩蔽音可以是量化的噪声,也可以是原始音频信号中 的某些弱的频率分量。 图2 5 中包括了上述各种情况的掩蔽,其中掩蔽音从0 毫秒出现延续到2 0 0 毫秒结束,实线表示掩蔽音信号,虚线则表示它产生的掩蔽阈值。从图中可以看 出,同时掩蔽从0 毫秒开始到2 0 0 毫秒结束,前向掩蔽发生在掩蔽音出现之前, 而后向掩蔽则从掩蔽音撤销之后开始。 1 0 新型高保真宽带音频编码算法的研究和实现 耵阿沌敝厢l 可沌敞 l 、 j 、 、 、 , , 、 , 、。一。 , 一, o 2 3 3 立体声处理技术 时同细 图2 5 各种听觉掩蔽示意图 音频编码中,人们发现左右声道之间往往存在一定的相关性和冗余度,就像 我们在欣赏立体声音乐时,感觉左右声道发出的音乐很相似一样。去除这些相关 性与冗余度可以进一步提高压缩比。高保真宽带音频编码系统中包括两种立体声 编码技术:中间旁边( m s ) 立体声编码与强度立体声( i s ) 编码【2 4 】【2 5 】【2 6 1 。由于 m s 编码不传送左右声道信号,而是使用标称化的“和”信号与“差”信号,前 者用于m ( m i d d l e ) 声道,后者用于边s ( s i d e ) 声道,因此m s 编码也叫做“和 一差编码( s u m d i f f e r e n c ec o d i n g ) 。适当的利用m s 立体声编码与i s 立体声编 码可以避免由于两耳掩蔽电平降低所引起的过量编码,显著降低数据率。 音频编码的频带为6 k h z 2 0 l 沮z 时都可以采用i s ,这是因为,高频段人耳对 声音的感知主要是基于声音强度的,对相位不敏感。对高频段频谱,左声道表示 实际左声道强度,右声道替换为零,同时记录左右声道各子带的能量比。i s 至少 能使右声道的编码比特数减少1 3 。 当左右声道信号频谱相似性较好时, 右声道数据,令m = ( l + r ) 2 ,s = ( l - r ) 2 , 可以使用m s 。若用l 、r 表示初始左 当l 、r 正相相似时,m 与l 能量相近, s r ;当l 、r 反相相似时,m : :眦:一,- _ ,嘶 : :7 【:¥,坼,w 图4 7 应用提出的方法后的基2 1 6 点d i t f f i 图 4 4 2 使用优化器进行优化 t m s 3 2 0 c 6 0 0 0 编译器可以让我们更有效地使用c 语言进行编程,然后通过命令 行的切换开关把c 源代码直接转变为汇编语言代码。在这一过程中,编译器还可以 通过优化器( o p t i m i z e r ) 完成全局优化和循环优化。这些优化措施包括: 1 ) 代数式改变、字符简化和常数合并; 2 ) 别名澄清; 3 ) 数据流优化; 4 ) 优化转移简化控制流; 5 ) 循环相关变量的优化和强度减弱; 6 ) 循环转置; 7 ) 循环中不变的代码转移; 珊瑚削硼砌删醐酬剐削删醐硎驯硎删 帅啦邢坩坩邢印邢巾邺州舭邶州郴 第四章新型高保真宽带音频编码算法平台实现和优化 4 l 8 ) 函数调用的内联扩展。 编译t m s 3 2 0 c 6 0 0 0 程序时,是否对其进行优化是个可选项。c 源文件被分析后, 可以选择使用优化器对中间文件进行处理,以提高其执行速度,并减少c 程序的规 模。优化器读中间文件时,会按所选择的优化级别对其进行优化,最后产生一个 与原中间文件有着相同格式的文件,但此文件能使代码产生器产生更有效的代码。 优化器共有4 个优化级别:0 级优化是寄存器优化;1 级优化是在0 级优化的基础 上附加局部优化;2 级优化是在1 级优化的基础上附加全局优化;3 级优化是在2 级 优化的基础上附加文件优化。 通过使用优化器对程序进行优化,我们的d s p 代码效率提高了大约6 0 。 4 5 本章小结 本章首先介绍了t i 公司的d m 6 4 2 硬件开发平台,接着详细论述了新型高保真 宽带音频编码算法浮点程序定点化的方法和过程。并且针对运算量比较大的f f t 变 换进行算法优化,利用了指数旋转因子具有周期性这一特点,首先对蝶型符号进 行分类,然后用特定公式进行归一化,减少了计算旋转因子的次数,使f f t 运算的 存储复杂度大大降低。通过对音频编码算法的优化,最终实现了新型高保真宽带 音频编码算法的实时运行。 新型高保真宽带音频编码算法的研究和实现 第五章定点化及优化结果性能测试分析 5 1 引言 我们的新型高保真宽带音频编解码程序是在浮点程序的基础上,经过定点化 处理和各种优化措施开发出来的。在浮点转定点程序过程中,误差是最重要的问 题之一。 本章首先将对定点程序结果进行分析,包括客观测试和分析两个方面,然后 给出音频编码算法的d s p 实现结果以及各项技术指标。 5 2 定点算法结果测试 5 2 1 误差产生机理及测试信号的选用 如前所述,程序的开发流程是从开发浮点程序开始的。我们开发的浮点程序 通过了主客观测试,证明是可靠的。然后我们在浮点程序的基础上将其算法定点 化以适应d s p 的要求,这就必然存在浮点算法转定点算法所引起的误差。这一误差 是由系统受定点表示数据的有限精度限制造成的,这种现象称为有效字长效应。 例如,系统内部运算时为了提高运算速度、节省存储单元而对某些中间运算结果 进行截断处理,如截尾处理或舍入处理。有效字长效应在定点d s p 实现程序的各个 模块中都存在,因此定点化结果对本课题的最终优化结果也是一个关键。 定点化完成后,我们从主客观两方面对定点程序的性能进行了分析测试。所 选用的测试序列十分重要,有效的测试序列还可以帮助定位编码器的缺陷究竟出 在哪一帧里。用于测试的音频序列采用4 8 k h z 、3 2 k h z 和1 6 k h z 三种不同采样率 的音频信号,其内容主要由多种著名乐器( 包括打击乐) 奏出的音乐组成。音频 文件是双声道立体声,音频长度为1 4 6 秒。用于测试的音频素材还包括一段采样 率为1 6 k h z 的宽带语音信号,包括男、女声以及男女混合声,语音文件长度为1 2 秒。 5 2 2 主观测试标准 时至今日,大规模控制得很好的听音测试仍是比较不同编码算法性能的唯一 办法。国际电信联盟无线电通信分部( i t u 鼢在多家广播业者以及m p e g 音频小 第五章定点化及优化结果性能测试分析 组的协助下,制定了一套非常详细的听音测试规则。这套规则的目的在于在最苛 刻的环境下,由专家级听者对编码器的表现打分。在多年对音频编码算法的研究 中,人们发现了许多典型的材料,其编码信号中常常会出现人耳可感知的、甚至 是令人不快的噪声,听音测试中即使用这些最难于编码的音频材料来测试编码器 的性能。 i t u - r 的测试过程要求有数量相对较多的测试主体( 听者) ,测试是双盲的( 即 在举行测试的房间内,包括听者在内的所有的人员都不知道所播放的压缩材料出 自哪一种编码器) 。参与者比较不同的编码信号样本,并把它们同未经压缩的原始 信号比较,之后对各编码器打分。最后评估结果以分为五级的平均意见分( m o s : m e a no p i n i o ns c o r e ) 或比较平均意见分( c m o s :c o m p a r i s o nm e a no p i n i o ns c o r e , 通常采用七级分制) 的形式给出。 无察觉 刚察觉但不讨厌 察觉有点讨厌 讨厌但不反感 极讨厌令人反感 图5 1m o s 五级音质判定尺度图示 表5 1m o s 五级音质判定尺度的解释 分数质量级别失真级别 5 优( e x c e l l e n 0 无察觉 4 良( g o o d ) 刚察觉但不讨厌 3 中( f a i r ) 察觉有点讨厌 2 差( p o o r ) 讨厌但不反感 l 劣( b a d ) 极讨厌令人反感 5 2 3 客观测试标准 感知评估方法基本思路是通过精细地对人类听觉系统建模,模拟一个“机器 o o o o o 5 4 3 2 l 新型高保真宽带音频编码算法的研究和实现 耳”,另外建立一套音频质量识别系统,模拟人脑对声音的感知,由它们作为主体 对编码音频质量打分。在感知测评技术标准化的工作进行多年之后,i t u r 1 0 4 工作组提出了音频质量客观评估标准的建议一一i t u rb s 1 3 8 7 ,即p e a q ( p e r c e p t u a le v a l u a t i o no f a u d i oq u a l i t y ) 3 9 1o 另一种是i t u tp 8 6 2 所建议的语音 质量的感知评估方法一p e s q ( p e r c e p t u a l e v a l u a t i o no f s p e e c hq u a l i t y ) 方法 4 0 l 。 p e a q 测试方法主要适用于高采样率的音频信号,而p e s q 测试方法主要适合于 语音和窄带音频信号。 与m o s 五级音质判定尺度( 参见图5 1 和表5 1 ) 相类似,p e a q 测试和p e s q 测试也都采用了五级音质判定尺度,提供了类似于m o s 质量得分的音质等级。 不同的是它们的尺度范围不尽相同:p e a q 测试的音质等级得分范围为0 至- 4 ,0 分对应于m o s 的5 分,而4 对应于m o s 的0 分;而p e s q 测试的音质等级得分 范围为4 5 至一0 5 ,4 5 分对应于m o s 的5 分,而0 5 对应于m o s 的0 分。 考虑到这两种音频质量评估方法的各自优缺点,为了测试的全面性,我们采 用上述两种方法进行音频算法质量的客观测试和评估。表5 2 是p e s q 测试结果, 表5 3 和5 4 是p e a q 测试结果,表中“一”表示对应的编码器在相应的采样速 率下不支持对应的编码比特率。 表5 2 采样速率为1 6 k h z 时的测试对比结果 工作模式 c b rv b r 实现方法 浮点定点 浮点定点 p e s q 测试 4 0 0 93 6 2 6 3 9 7 13 8 7 5 m o s 测试 4 0 0 3 7 83 9 03 8 2 测试条件 1 ) 音频文件:音频采样速率为1 6 k h z ,双声道立体声; 2 1 编解码器设置:编码速率为1 2 8 k b p s ,双声道立体声 耦合编码模式,窗长1 0 2 4 样点。 表5 3 采样速率为3 2 k h z 时的测试对比结果 工作模式 c b rv b r 实现方法浮点定点浮点定点 p e a q 测试 3 6 42 7 93 3 9- 2 2 1 m o s 测试 4 1 64 1 04 2 74 1 3 测试条件1 ) 音频文件:音频采样速率为3 2 k h z ,双声道立体声: 2 1 编解码器设置:编码速率为1 2 8 k b p s ,双声道立体卢 耦合编码模式,窗长1 0 2 4 样点。 第五章定点化及优化结果性能测试分析 表5 4 采样速率为4 8 k h z 时的测试对比结果 工作模式 c b r v b r 实现方法 浮点定点浮点定点 p e a q 测试 2 3 2- 2 3 92 3 21 4 0 m o s 测试 4 2 34 0 84 4 74 2 5 测试条件1 ) 音频文件:音频采样速率为4 8 k h z ,双声道立体声; 2 ) 编解码器设置:编码速率为1 2 8 k b p s ,双声道立体声 耦合编码模式,窗长1 0 2 4 样点。 5 2 4 算法复杂度测试 测试和比较新型高保真宽带音频编码算法的浮点实现版本与定点实现版本的 运算复杂度,用它们在p c 机上针对特定编码模式和特定音频文件运行所需的时 间( 毫秒) 来估算。 表5 5 是采样速率为1 6 k h z ,3 2 k h z 和4 8 k h z 时,浮点实现版本与定点实现 版本的运算复杂度的对比结果。 表5 5 不同采样速率下复杂度对比结果 采样速率 1 6 k h z3 2 i 【 i z4 8 k h z 实现方法 浮点定点浮点定点浮点定点 a b r 编码模式 1 2 9 0 6 35 9 8 2 82 6 3 6 0 91 2 7 3 1 33 6 3 5 1 51 8 2 8 9 l c b r 编码模式 1 5 9 6 8 76 5 1 5 73 3 8 5 1 51 3 5 8 5 94 6 6 6 1 01 9 3 4 6 9 v b r 编码模式 3 5 5 9 42 9 4 8 58 1 1 5 76 6 1 7 19 7 4 6 99 6 6 4 0 测试条件1 ) 音频文件:音频采样速率为1 6 k h z ,3 2 k h z ,4 8 k h z ,双声道立体声,长度 为1 4 6 秒: 2 ) 编解码器设置:编码速率为3 2 k b p s ,4 8 k b p s ,6 4 k b p s ,双声道编码模式, 窗长1 0 2 4 样点: 3 ) 运算量是指在p c 机上特定编码模式针对特定音频文件的运行时间( 毫 秒) 。 表5 6 是主要模块优化结果。 表5 6 主要模块优化结果 模块名称时频分析模块心理声学模型模块立体声处理模块量化和编码模块 优化前 1 0 8 5 8 1 59 3 3 6 8 3 7 3 4 6 5 4 4 7 82 7 1 8 5 9 7 优化后 1 0 5 1 4 01 6 4 7 4 8 4 7 5 3 1 9 92 9 6 9 9 2 测试条件1 ) 音频文件:音频采样速率为4 8 k h z ,双声道立体声,长度为1 4 6 秒; 2 ) 编解码器设置:编码速率为6 4 k b p s ,双声道编码模式,窗长1 0 2 4 样点; 3 ) 运算量是指在p c 机上
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 商业综合体物业管理中心建设项目建筑废弃物运输车辆密闭化改造技术创新总结报告
- 应急救援预案合规性评审总结报告
- 监理企业维修工运行操作安全操作规程
- 国家执业药师资格考试全真模拟试题及答案
- 管道非开挖修复施工安全技术交底
- 污水处理企业安全例会制度
- 给排水、暖通考试备考差异分析适配设计院新人的刷题方案
- 新课标变化之“一致性”-数学讲的是一回事儿
- 消防安全重点单位驾驶员定期维护安全操作规程
- 学校食堂食品安全总监职责
- T CPCIF 0239-2023 石油和化工企业开车前安全审查导则
- JJG 596-2026 安装式交流电能表检定规程
- 河北河北省事业单位2025年面向新疆巴州兵团二师生源高校毕业生招聘15人笔试历年参考题库附带答案详解
- 【解题模型】专题05受力分析 摩擦力突变-2026高考物理(解析版)
- 眼镜验光员(四级)2025年考试真题及模拟试卷
- 泰康人寿新人岗前考试卷及答案解析
- 难产护理查房记录
- 降压药药物知识培训课件
- 单板五级理论题目及答案
- 项目风险识别与应对措施清单模板
- 网约车人证考试题目及答案
评论
0/150
提交评论