(信号与信息处理专业论文)mpeg2aac解码算法研究及其在dsp平台上的实现.pdf_第1页
(信号与信息处理专业论文)mpeg2aac解码算法研究及其在dsp平台上的实现.pdf_第2页
(信号与信息处理专业论文)mpeg2aac解码算法研究及其在dsp平台上的实现.pdf_第3页
(信号与信息处理专业论文)mpeg2aac解码算法研究及其在dsp平台上的实现.pdf_第4页
(信号与信息处理专业论文)mpeg2aac解码算法研究及其在dsp平台上的实现.pdf_第5页
已阅读5页,还剩72页未读 继续免费阅读

(信号与信息处理专业论文)mpeg2aac解码算法研究及其在dsp平台上的实现.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 作为目前最新和最有效的高保真数字音频编码手段之一,m p e g - 2a a c 具 有压缩比高、重建音频质量好、编解码过程模块化和声道配置灵活等特点,在数 字声音的存储、多媒体的网络传输和数字音频广播等领域得到日益广泛的应用。 因此,对m p e g 2a a c 进行研究和实时实现具有重要的意义。 由于m p e g 2a a c 编解码的算法复杂度较高,对处理器的运算能力和存储 空间都有着很高的要求。d i a m o n d3 3 0 h i f i 音频处理器是t e n s i l i c a 公司开发的音 频专用d s p ,其针对音频处理所提供的系统配置和加速指令,为面临实时性要求 的a a c 解码器提供了良好的应用环境。 本文的目的是在d i a m o n d3 3 0 h i f i 音频处理器开发平台上实现一个高效实时 的m p e g 2a a c 音频解码器。首先阐述了m p e g 2a a c 的算法原理,对a a c 解码器中的重要模块进行了详细的介绍。根据各模块的复杂度分析,对解码器的 关键模块进行了算法上的优化,主要包括针对h u f f m a n 解码模块的多种快速算法 的实现,针对量化模块和滤波器组模块的降低运算复杂度的优化等。在此基础上, 针对d i a m o n d3 3 0 h i f i 音频处理器的硬件结构和指令特点,对h u f f m a n 解码模块 和滤波器组模块的核心运算用音频引擎平台专用的扩展指令改写,使解码复杂度 明显降低,大大提高了解码效率。 最后的测试分析结果表明,在d i a m o n d3 3 0 h i f i 平台上优化后的解码器可以 对码流进行正确解码,且保证了较好的主观音频质量。在该平台上实现实时解码 需要8 6 1 3 m h z 的时钟。 本文的研究工作实现了m p e g 2a a c 解码器在专用的音频处理d s p 平台上 的实时解码,对于a a c 标准的研究、推广和应用具有一定的实际意义。 关键词:a a c 音频解码d i a m o n d3 3 0 h i f i 音频引擎软件优化 a b s t r a c t a san e wg e n e r a t i o na u d i oc o d i n gs t a n d a r d ,m p e g - 2a a cp r o v i d e sm a n y u s e f u l c h a r a c t e r i s t i c s ,i n c l u d i n gh i g hc o m p r e s s i o nr a t e ,g o o dq u a li t y , m o d u l a r i z a t i o n o f c o d e ca n df l e x i b l ec o n f i g u r a t i o no fc h a n n e l s a n di th a sb e e nw i d e l yu s e di nt h ef i e l d o fd i g i t a la u d i os t o r a g e ,m u l t i m e d i at r a n s m i s s i o n o ni n t e r n e ta n dd i g i t a la u d i o b r o a d c a s t t h u s t h er e s e a r c ho na n dr e a l i z a t i o no fm p e g 一2a a c i sv e r yi m p o r t a n t h o w e v e r , t h ec o m p l i c a t e da l g o r i t h m o fm p e g - 2a a cr e s u l t s i n g r e a t c o m p u t a t i o na n ds t o r a g ec o n s u m p t i o n d i a m o n d3 3 0 h i f i a u d i op r o c e s s o r , d e v e l o p e d b yt e n s i l i c a i sad s ps y s t e m t h a tt a r g e t sa ta u d i op r o c e s s i n g w i t hi t ss p e c i f i c c o n f i g u r a t i o na n di n s t r u c t i o n s ,i tc a np r o v i d eag o o da p p l i c a t i o ne n v i r o n m e n tf o rt h e r e a l t i m er e a l i z a t i o no f a a cd e c o d e r t h ed i s s e r t a t i o ni st oi m p l e m e n ta ne f f i c i e n tr e a l t i m em p e g 一2a a c d e c o d e r f i r s t t h ec o r ea l g o r i t h m si nm p e g 2a a cs t a n d a r d sa r ei n t r o d u c e d ,a n dad e t a i l a n a l y s i so fs o m em o d u l e sw i t h t h eh i g hc o m p l e x i t yi sp r e s e n t e d t h e ns o m e i m p r o v e m e n t so nt h er e f e r e n c ed e c o d e ra r e i n t r o d u c e df r o ma s p e c t so fd e c o d i n g s p e e da n dm e m o r yc o s ta c c o r d i n g t ot h ea n a l y z e dr e s u l t t h ed e c o d e rr e a l i z a t i o no nd i a m o n d3 3 0 h i f ia u d i oe n g i n ef o c u s e so nt h e f e a t u r eo ft h ep r o c e s s o ri n s t r u c t i o n s t h ec r u c i a lm o d u l e sl i k eh u f f m a nd e c o d i n ga n d f i l t e r sw i t hi m d c ta r er e w r i t t e nw i t ha ei n s t r u c t i o n s t h es p e c i a li n s t r u c t i o n s a r e q u i t e e f f e c t i v ei n i m p r o v i n g t h e d e c o d i n g s p e e d ,e s p e c i a l l y f o rt h e c o m p u t a t i o n i n t e n s i v ec o d e s 。 f i n a l l a c c o r d i n gt o t h et e s tr e s u l t ,t h er e a l t i m e a a cd e c o d e rr e q u i r e s 8 6 13 m h zo nd i a m o n d3 3 0 h i f ia u d i oe n g i n ep l a t f o r m t h e r e s u l to ft h i s d i s s e r t a t i o ni su s e f u lf o rt h es p r e a da n da p p l i c a t i o no f a a c s t a n d a r d k e yw o r d s :a a c ,a u d i od e c o d i n g ,d i a m o n d3 3 0 h i f i a u d i oe n g i n e , s o f t w a r eo p t i m i z a t i o n 独创性声明 本人声明所呈交的学位论文是本人在导师指导下进行的研究工作和取得的 研究成果,除了文中特别加以标注和致谢之处外,论文中不包含其他人已经发表 或撰写过的研究成果,也不包含为获得墨鲞盘堂或其他教育机构的学位或证 书而使用过的材料。与我一同工作的同志对本研究所做的任何贡献均已在论文中 作了明确的说明并表示了谢意。 学位论文作者签名:雌 签字日期: ) 。矿年月年日 学位论文版权使用授权书 本学位论文作者完全了解丕鲞盘堂有关保留、使用学位论文的规定。 特授权墨壅盘堂可以将学位论文的全部或部分内容编入有关数据库进行检 索,并采用影印、缩印或扫描等复制手段保存、汇编以供查阅和借阅。同意学校 向国家有关部门或机构送交论文的复印件和磁盘。 ( 保密的学位论文在解密后适用本授权说明) 学位论文作者签名:兹j 咩也 导师签名: 签字日期:j 田9 年石月s _ 日 签字日期:d 扩年多月y - 日 第一章绪论 1 1 音频压缩编码的产生 第一章绪论弟一早珀。比 随着计算机技术和通信技术的发展,人类开始追求真正意义上的多媒体信息 处理和交互,自然界中的各种信息,包括文字、声音和图像,都成为处理的对象。 但是,这些媒体信息都是模拟的,只有对其数字化后才能由计算机平台进行各种 处理和综合。而各种媒体数字化后的信息数据量十分庞大,对于存储器的容量、 计算机的处理速度以及网络通讯线路的传输带宽都提出了非常苛刻的要求。实践 证明,如果对多媒体信息数据进行压缩,可以明显降低存储量或减少传送时间。 在人类的几种感觉器官中,听觉和视觉接收的外界信息最多,与之相适应, 这两种器官接收的声音与图像成为了多媒体的主要媒体数据,也是信号处理领域 重要的研究对象。根据所处理的声音信号特征的不同,可以将声音信号分为如下 两类: 1 语音信号 目前常见的话音通信系统,如长途通信、移动通信和卫星通信,主要面向这 种信号,其信号频带限于0 3 k h z 3 4 k h z ,数字化时采样频率多取8 k h z 。在新兴 的通信系统,如视频会议和综合业务数字网( i n t e g r a t e ds e r v i c ed i g i t a ln e t w o r k , i s d n ) 话音服务中,宽带语音信号的频带可加宽至u 5 0 h z - 7 k h z t l | 。 2 音频信号 一般认为人耳的听觉范围为2 0 h z 2 0 k h z ,这正是我们所需处理的音频信号 的频带。也就是说,如果我们能够完整地保留下该频带内的所有声音信息,就意 味着不失真的保存了所需音频。在实际应用中,这种信号还可分为: 1 ) 电视和无线广播质量音频:信号频带从4 0 h z 或5 0 h z 至u 7 k h z ( 调幅) 或1 5 k h z ( 调频) ,广泛用于收音机和电视伴音。 2 ) c d ( c o m p a c td i s k ) 质量音频:频带2 0 h z 2 0 k h z ,主要用于传输或存 储高品质音乐信号,数字化时采样频率可取4 4 1 k h z 或4 8 k h z 。 3 ) 高质量h i f i 音频:和c d 音频相比,频带更宽,量化更细。这种质量 的声音使听众具有现场感,即犹如置身于音乐厅中,而且多采用多 声道混放输出,形成环绕,并提供低音增强等功能。数字化时采样 频率最高达9 6 k h z 。 最常用的数字声音存储方式是p c m ( p u l s ec o d em o d u l a t i o n ) 技术。p c m 技术 第一章绪论 是1 9 3 7 年由a h r e e r e s 最先发明的,它简单地将模拟声音信号用固定的抽样频率 与固定的最大量化比特数进行量化。p c m 声音可以用各种量化比特数与采样率进 行量化,但对最常见的c d 质量的音频信号,一般都用4 4 1 k h z 采样并用每个样点 1 6 比特进行量化。根据n y q u i s t 准则,4 4 1 k h z 的采样率可以重建带宽小于2 2 0 5 k h z 的信号,比人耳通常能感知的频带略宽,多余的一点带宽可以用来修正滤波器的 一些失真1 2 】。 数字音频作为一种存储、处理和传输h i f i 声音的方法,在数字音频广播、 网络音频和多媒体通信等许多领域中得到广泛的应用。然而,要存储和传输原始 音频数据需要很高的比特率。以c d 为例,每声道比特率高达7 0 6 k b p s ,一张 6 5 0 m b 容量的光盘只能存储一小时的立体声,如果直接传输需占用一个t 1 或 e l 的1 2 个话路,极不经济。在现有信道的传输能力限制下,为了能从广播电视 获得c d 音质的音乐,并使存储介质的单位成本更小,人们想到了压缩码率,力 求在保证声音质量的前提下使其占用的存储空间更小,传输速率更低,这就是音 频压缩编码产生的原因。从上世纪8 0 年代c d 问世之日起,高效率的数字音频 压缩编码的研究工作几乎同时开展。 1 2 音频压缩编码的发展 音频压缩编码发展至今,已拥有多种不同的算法标准,适用于不同的场合和 要求。m p e g ( m o v i n gp i c t u r ee x p e l sg r o u p ) 组织自19 8 8 年开始致力于高质量音 频压缩编码标准制定工作,1 9 9 2 年该组织制定了数字音频压缩领域的第一个国 际化标准m p e g 1 。m p e g 1 是最早的国际化音频压缩编码标准,共分为三个层 次,每个层次的复杂度、压缩比特率和压缩质量有所不同,用户可以根据需要进 行选择。 m p e g 1l a y e r1 【3 】 这是m u s i c a m ( 掩蔽型通用子带综合编码及复用) 算法的简化版本, 编码器和解码器的复杂度都很低,但压缩比也很低。l a y e rl 的帧长为 8 m s ( 4 8 k h z 采样率) ,所以最适合于演播室应用,对于压缩比要求不高的应 用,例如家庭数字磁带记录器等,l a y e r1 也很适合。 m p e g 1l a y e r2 1 4 】 这一层的压缩比有所提高,但编码器也更复杂,l a y e r2 算法与 m u s i c a m 算法相同,帧长为2 4 m s ( 4 8 k h z 采样率) ,它采用了更为精确的量 化,并进一步利用了子带量化因子的相关性,能在较低码率下获得较好的压 缩质量。l a y e r2 的算法标准在消费和专业音频领域都有广泛的应用,例如 2 第一章绪论 v c d 伴音编码、数字音频广播( d i g i t a la u d i ob r o a d c a s t ,d a b ) 、数字音频工 作站( d i g i t a la u d i ow o r k s t a t i o n ,d a w ) 等。 m p e g 1l a y e r3 1 5 】 这是m u s i c a m 与a s p e c 的混合算法,简称m p 3 。通过使用混合滤波 器组,提高了频率分辨率,使其更接近人耳的频率分辨率。l a y e r3 的帧长与 l a y e r 2 相同,采用非均匀量化和熵编码提高编码增益,降低码率。在短时间 内,l a y e r3 还可以使用比特池技术进行变码率控制,促使比特数更有效地分 配。l a y e r3 适用于电信通讯,例如窄带i s d n 、卫星链路和卫星d a b 系统 等,另外一个最突出的应用为m p 3 网络音乐。 d o l b ya c 2 和a c 3 1 6 】 这是d o l b y 公司推出的两类算法,主要基于变换域感知音频方案。a c 2 适用于低成本的编码器和解码器,a c 3 的目标则是包括动态压缩、多种回 放配置、扩展用户信息传输等功能的编解码系统。表1 1 作出了m p e g 1 与 a c 2 及a c 3 的对比。 表1 1几种商业音频压缩编码系统的比较 系统 比特率压缩质量复杂度 主要应用 m p e g 1 低复杂度编解码d c c ( d i g i t a lc o m p a c t 3 2 抖8 k b s19 2 k b s c h 时较好 l a y e r1器 c a s s e t t e ) m p e g 1 3 2 4 4 8 k b s1 2 8 k b s c h 时较好 低复杂度解码器 d a b ,c d i ,d v d l a y e r 2 m p e g 1i s d n ,卫星广播系统, 3 2 3 2 0 k b s 9 6 k b s c h 时较好低复杂度解码器 l a y e r3 网络音频 d o l b y低复杂度编解码 1 2 8 19 2 k b s12 8 k b s c h 时较好p o i n tt op o i n t ,c a b l e a c - 2器 d o l b y 3 8 4 k b s 5 1 c h 时较 p o i n tt om u l t i p o i n t , 3 2 6 4 0 k b s 低复杂度解码器 a c 3好h d t v ,c a b l e ,d v d m p e g 2b c 标准7 】 随着对多声道、环绕立体声应用需求的普及,音频编码也由单声道、立 体声向多声道编码扩展,m p e g 2b c ( b a c k w a r d sc o m p a t i b l e ) 即是对m p e g 一1 的扩展,通过如下转换: 三= l + a 木c + b 木三 c s 第一章绪论 r = r + a 术c + 6 奉尺 cs ( 1 - 2 ) 其中,工和r 表示左、右环绕声道,c 表示中央声道 苫 m p e g 1 解码器可以解m p e g 2b c 的码流。在m p e g - 2b c 中,根据对 多声道的不同扩展,分为三个层次,与m p e g 1 一样,m p e g 2b c 的第三 层扩展最为灵活,扩展声道数可以灵活选择。 m p e g 2 a a c 1 9 9 4 年,在d e u t a c h et o l e k o m 和b b c 举行的测试中,m p e g 2b c 标准 在3 2 0 k b p s 5 c h 时不能达到欧广联的广播音质要求,而在同样条件下,a c 3 与a t & t 的m p a c ( m u l t i c h a n n e lp e r c e p t u a la u d i oc o d e r ) 虽然也没有达到目 标,但在总体上比m p e g 2b c 的效果好很多。鉴于这种情况,m p e g 组织 开始致力于非后向兼容的音频压缩标准的制定,这就是先进的音频压缩编码 标准a a c ( a d v a n c e da u d i oc o d i n g ) 。a a c 具有以下特点: 1 支持采样率包括4 8 k h z ,4 4 1 k h z ,3 2 k h z 。 2 支持输入声道配置包括i 0 ( 单声道) 、2 0 ( 立体声) 和其它多声道配 置,例如3 2 + 1 配置( 环绕立体声加超重低音) ,最多可支持4 8 个声道 编码。 3 。支持从多声道码流中恢复出较少声道的信号。 4 在3 8 4 k b p s 5 1 c h 条件下,达到i t u r ( 国际电联无线电通信部门) 广 播音质。 5 预先定义可访问单元,使剪辑粒度最小化。 6 在误码环境下保持正确的同步,并支持误码隐藏。 a a c 系统开发以模块为基础,而m p e g 2b c 及m p e g 1 是以整个系 统为基础的,所以在有利于提高整个系统的前提下,a a c 的每个模块或工 具都可以单独优化。如果不同的优化方法获得了相同的改进质量,则其它标 准,例如复杂度、可剪辑度、可调整度、误码健壮性等因素将被纳入考虑范 围。 m p e g 4 伴音标准f 8 】 m p e g - 4 是m p e g 2 基础上的扩展,它被称为“全能”标准。在音频方 面,m p e g 4 将以前分离的高质量音频压缩编码、语音编码和计算机音乐融 合。通过m p e g 4 音频编码,可以存储或传输以下信息: 1 高质量音频信号( 单声道、立体声和多声道) 。 2 中间质量音频信号。 4 第一章绪论 3 宽带语音信号( 如7 i 此带宽) 。 4 窄带语音信号。 5 可理解语音信号。 6 合成语音信号( 如文本合成语音) 。 7 合成音频。 m p e g 4 是现阶段所能提出的音视频标准的最高目标,具有智能化和全面性 等特点。在高质量音频压缩方面,a a c 很有竞争力,已经成为m p e g 4 音频编 码标准的一部分。 1 3 音频压缩编码的原理 初期,人们对数字化音频压缩系统持怀疑的态度,一种观点是:在去除7 5 甚至更多数据的情况下,要满足入耳对音乐的欣赏,特别是满足所谓“金耳朵” 的要求是不可能的。传统的中高码率的数字波形编码压缩技术注重尽量保持输入 波形不变,即重建信号波形与原始信号波形相同。现代编码系统的比特率越来越 低,重点已由精确恢复波形转向充分利用人类的听觉感知特性,越来越多的新型 数字音频系统都采用了感知音频编码方法,利用信号中的客观冗余度和人类的主 观听觉感知机理,建立合适的心理声学模型,在保持音质、限制码率和降低编码 计算量三方面达到平衡。为了进一步加深对感知音频编码方法和心理声学模型运 用的理解,本小节对感知音频编码的相关理论做一介绍。 首先是听觉阈值的概念。感知音频编码主要利用人类听觉的感知特性和信号 的统计特性,一方面去除信号之间的统计相关性,另一方面把量化噪声引入信号, 而不用担心音质的损伤,因为这些噪声会被隐藏在与信号幅频特性有关的听觉阂 值之下。听觉阈值是当声音小到人的耳朵刚刚可以听见时的强度。测试表明听觉 阈值是随频率变化的,对不同频率的声音测试听觉阈值,可以得出一条“听阈一 频率”曲线,如图1 1 所示。低于这条曲线的声音,人耳是听不到的,因此听阈 又称绝对听觉阈值。从图1 1 中可以看出,人对3 k h z 5 k h z 的声音最敏感,这和 一上勺生理构造是相符的。 5 第一章绪论 l 1 ;ii ,。| 1 - , “h 图1 1 绝对听觉阈值曲线 其次是临界频带的概念。它的具体定义为:一个纯音可以被以它为中心频率 并且具有一定频带宽度的连续噪声所掩蔽,如果在这一频带宽度内的噪声功率等 于该纯音的功率,则该纯音刚好处于可以被听到的临界状态,就称这一频带宽度 为临界带宽,单位为巴克( b a r k ) 【9 1 。以任何频率为中心都有相对应的临界带宽, 它的位置是不固定的,因为人耳只能感知2 0 h z 2 0 k h z 的声音信号,人们对这段 频带内的临界带宽做了实验,大致可以分为2 5 个巴克。表1 2 列出了前2 4 个巴克 的具体分布情况。 表1 2 人类感知域内的临界频带分布 临界带中心频率带宽临界带 中心频带宽 频带( h z )频带( h z ) ( b a r k )( h z )( h z )( b a r k )率( h z ) ( h z ) 15 02 0 1 0 08 01 31 8 5 017 2 0 2 0 0 02 8 0 21 5 01 0 0 2 0 0 1 0 01 42 1 5 02 0 0 0 2 3 2 03 2 0 32 5 02 0 0 3 0 01 0 01 52 5 0 0 2 3 2 0 2 7 0 03 8 0 4 3 5 0 3 0 0 4 0 0l o o1 62 9 0 02 7 0 0 3 1 5 0 4 5 0 54 5 0 4 0 0 5 1 01 1 01 73 4 0 031 5 0 3 7 0 05 5 0 65 7 05 1 0 6 3 01 2 0 1 84 0 0 03 7 0 0 4 4 0 07 0 0 77 0 06 3 0 7 7 01 4 01 94 8 0 0 4 4 0 0 5 3 0 09 0 0 88 4 0 7 7 0 9 2 01 5 02 0 5 8 0 0 5 3 0 0 6 4 0 0 1 1 0 0 91 0 0 09 2 0 10 8 01 6 02 17 0 0 0 6 4 0 0 7 7 0 01 3 0 0 1 0l1 7 01 0 8 0 1 2 7 01 9 02 28 5 0 07 7 0 0 9 5 0 0 1 8 0 0 1 l1 3 7 01 2 7 0 1 4 8 02 1 02 31 0 5 0 09 5 0 0 1 2 0 0 0 2 5 0 0 1 21 6 0 01 4 8 0 一1 7 2 0 2 4 02 41 3 5 0 01 2 0 0 0 - 15 0 0 03 5 0 0 6 第一章绪论 一般可以近似地认为,在低于5 0 0 h z 的频带内,临界带宽为1 0 0 h z ,在高于 5 0 0 h z 的频带内,临界带宽大约是中心频率的2 0 。这说明人耳对低频信号的分 辨率较高,而对高频信号的分辨率相对低。因为临界带宽可以更好地反映人耳对 信号频率的感知特性,所以对人耳的听觉特性的研究都是建立在临界带宽的基础 上的。 再次是掩蔽效应的概念。人们都有过这样的体验,在嘈杂的环境中很难听清 他人的讲话,这种一个声音的听觉感受受到另一个声音影响的现象,称为掩蔽效 应。前者称为被掩蔽音,而后者称为掩蔽音。掩蔽效应是一个复杂的心理和生理 现象,在感知音频编码理论中起着重要的作用。目前的研究成果表明,人耳在时 域和频域上都存在掩蔽效应。频域掩蔽效应发生在掩蔽音和被掩蔽音同时出现的 时候,所以也称为同时掩蔽。频域掩蔽效应主要有两点,纯音最有效的掩蔽出现 在它的频率附近,低频纯音可以有效地掩蔽高频的纯音,而高频纯音对低频纯音 的掩蔽作用则很小。时域掩蔽效应发生在掩蔽音和被掩蔽音不同时出现的时候, 所以也称为非同时掩蔽。它分为前向掩蔽和后向掩蔽,前向掩蔽是指被掩蔽音在 时间上早于掩蔽音出现,前向掩蔽的作用时间大概为2 0 m s ,在这段时间内,只 要掩蔽音的强度足够大,就有可能掩蔽掉被掩蔽音。后向掩蔽是指一个声音结束 后仍然对另一个声音的听觉能力有影响,后向掩蔽的作用时间大概有2 0 0 m s ,远 大于前向掩蔽作用时间,而且掩蔽效应也更加明显。虽然后向掩蔽的效果更加明 显,但是没有得到很好的利用,目前的音频编码主要还是运用频域掩蔽效应。相 反,较弱的前向掩蔽效应被用来抑制预回声。众所周知,音频编码中都采用块变 换将时域信号变换到频域,解码时再由频域变换到时域,这样量化时引入的频域 量化噪声会在全时域扩散,由于前向掩蔽时间短,效果不明显,就会出现爆发音 之前的量化噪声无法被掩蔽的现象,这被称为预回声。为了消除预回声的影响, 人们采用了窗切换技术,当出现预回声的时候,采用较短的块代替原来的长块, 这样扩散的量化噪声就可以被控制在前向掩蔽的作用时间内,从而得到抑制【1 0 】。 前面已经对心理声学模型的相关概念作了介绍,目前虽然有很多种感知音频 编码方法,在具体的实现上各不相同,但是采用的都是感知音频编码的一般原理, 其总体的结构大致相似,如图】2 所示。 第一章绪论 叫时频分析 坝茵 重化输出狈茵毅韬 jk 制信息 噪声比特 比特,r 分配与量无损编码比特拼装 监站闰估 化 边带信息 边带信息 叫心理妻学模l 珊瞅一凰 比特 图l 一2 感知音频编码器结构 在进行感知音频编码时,为了更好地模拟人耳对声音的处理,需要首先将时 域信号变换到频域。目前的时频变换方法有很多种,如快速傅立叶变换( f a s t f o u r i e rt r a n s f o r m ,f f t ) 、离散余弦变换( d i s c r e t ec o s i n et r a n s f o m ,d c t ) 和小 波变换( w a v e l e tt r a n s f o r m ,w t ) 等。其次,为了模拟临界带宽的概念,人们通 常又把频域信号分成许多个子带进行处理,以上的工作一般都是由滤波器组来完 成。表1 3 对一些主要感知音频编码器在4 8 k h z 采样率下的滤波器组性质作了比 较,由表1 3 中可以看出,m p e g 1a u d i o 的三层都采用了多相正交滤波器组 ( p o l y p h a s eq u a d r a t u r ef i l t e r b a n k ,p q f ) ,由于多相滤波器的频域泄露比较严重, 将分析滤波器的输出直接输入综合滤波器也无法完备重建原始输入信号,而且多 相滤波器的3 2 个子带宽度相同,4 8 k h z 采样时每个子带宽度为7 5 0 h z ,和表1 2 所 列出的临界带宽对比发现,这种方法不能很好地模拟临界带宽的概念,在低频段 的频率分辨率远远不够,正因为如此,l a y e ri i i 引入了改进的离散余弦变换 ( m o d i f i e dd i s c r e t ec o s i n et r a n s f o i t i i ,m d c t ) 来提高频率分辨率,m d c t 是一种 可以完备重现原始信号的变换,也就是说,将m d c t 的输出作为对应的i m d c t 的输入,就可以还原出m d c t 的输入信号。尽管这样提高了频率分辨率,但仍然 不能消除p q f 所带来的缺点,因此a c 3 和a a c 都放弃p q f ,只采用了m d c t 变换。 表1 34 8 k h z 采样下的滤波器组 编码滤波器 帧长( m s )频域分辨率( h z )时域分辨率( m s ) l a y e rip q f 87 5 00 6 6 l a y e ri i p q f 2 4 7 5 00 6 6 l a y e r p q f 和m d c t 2 44 1 6 6 4 a c 3m d c t 3 29 3 7 52 6 6 a a c m d c t2 32 3 4 42 6 6 得到了声音的频域信息后,就可以利用听觉特性中的频域掩蔽效应计算掩蔽 第一章绪论 阈值,这通常由心理声学模型来完成。心理声学模型的好坏直接影响到感知音频 编码的质量,因为编码算法的后续工作只要将编码过程中引入的噪声控制在掩蔽 阈值之下,人耳就听不出重建信号与原始信号的差别。在码率较高的时候,由于 编码引入的噪声通常较小,心理声学模型的作用不是很明显,而当码率较低的时 候,心理声学模型造成的影响就可以很容易被人耳感知到。正是由于心理声学模 型在感知音频编码中的重要性,人们在这方面进行了很多的研究。m p e g 1a u d i o 标准中就提供了两种模型供参考,并且推荐前两层用模型一,而第三层用模型二。 m p e g 2a a c 标准也推荐了模型二j 。 得到信号的频域信息和掩蔽阈值之后,就可以将频域信息编码到输出码流, 这是感知音频编码方法进行信息压缩的核心部分,目标是在尽量保证编码引入的 噪声低于掩蔽阂值的前提下,达到尽可能高的压缩比。压缩的方法可以分为有损 压缩和无损压缩两种。无损压缩只是根据信息理论去除相关信息之间的客观冗 余,重建出来的信号和原始信号完全相同。在音频压缩编码中常用的h u f f m a n 编 码就是一种无损压缩方法。有损压缩在压缩时引入误差,无法重建出和原始信号 完全相同的信号。在m p 3 和a a c 算法中都采用了一种非线性量化的有损压缩方 法,因为频谱值较小的谱线相对频谱值较大的谱线受相同量化噪声的影响更大, 所以希望频谱值较小的地方量化阶较小,这样引入的量化噪声也会比较小。目前 优秀的感知音频编码器都综合运用了这两种压缩方法。 通常随着码率的降低,量化噪声会随之增大。这时,可以根据心理声学模型 分析的结果,在时域和频域对噪声进行整形,将量化噪声尽可能分配至人耳感知 灵敏度较低的地方,从而达到既降低码率又尽量减少音质损伤的目的,这就是噪 声分配。除了噪声分配以外,还可以根据心理声学模型计算出来的掩蔽阈值,对 不同的频带进行比特分配。这是因为,首先,在掩蔽阈值以下的声音频谱分量是 无法被感知的,所以不需要进行编码,也就不需要分配比特;其次,量化过程中 产生的噪声经频域或时域整形后如果低于掩蔽阈值,也是不可听到的,因此,对 于那些掩蔽闽值较高的频段,可以适当少分配一些编码比特。虽然较少的编码比 特会引入较多的量化噪声,但是只要这些量化噪声仍然低于掩蔽阈值,就不会引 起主观音质的下降。比特分配是和量化、心理声学模型密切相关的重要模块【l2 1 。 1 4 本文的任务与结构 本文主要研究如何在d i a m o n d3 3 0 h i f i 音频引擎开发平台上实现高效实时的 m p e g 2a a c 音频解码器。 m p e g 2a a c 音频解码采用了比较复杂的解码算法,解码器由多个模块组 9 第一章绪论 成,每个模块的复杂度和对解码性能的贡献也各不相同,因此在第二章中对解码 模块进行了详细的分析,期望采用各种快速算法降低解码系统复杂度,实现解码 器在d i a m o n d3 3 0 h i f i 音频引擎开发平台上的实时处理。 第三章中对硬件开发环境进行了介绍,概述d i a m o n d3 3 0 h i f i 音频引擎开发 平台的特点,以及针对这些特点可以进行的优化工作,这些优化技术在解码器的 实现中得到了比较充分的利用。 第四章在分析解码器的复杂度的基础上,针对关键模块进行定点化和算法优 化等工作。第五章基于d i a m o n d3 3 0 h i f i 音频引擎平台特性,考虑充分利用其并 行处理能力及硬件加速指令,使解码器计算量密集的模块得到最大限度的并行和 加速,合理优化存储开销。经过这些优化后,解码复杂度会大大降低,使解码器 在d i a m o n d3 3 0 h i f i 音频引擎开发平台上通过软件优化来实现实时处理成为可 能。最后的分析结果证明了软件优化方法的有效性和硬件平台专用加速指令的高 效性。 1 0 第二章m p e g 2a a c 算法原理 第二章m p e g 2a a c 算法原理 2 1a a c 分层框架 m p e g 2a a c 系统最多支持4 8 个声道,常用的配置为单声道、双声道( 立 体声) 和5 1 声道( 左中右三个主声道,左右环绕声道外加一个低频增强声道) 。 同时,在编码器中还可以灵活定义各种配置。 为了允许在音频质量、存储开销和处理能力之间进行折中,m p e g 2a a c 系 统提供了以下三层框架( p r o f i l e ) 1 1 3 : 1 主框架( m a i np r o f i l e ) :在这层框架中,a a c 系统能对任何给定的码率 提供质量最好的重建音频。除了增益控制模块以外,a a c 系统包含了其 它所有模块,使其对于存储器和c p u 处理能力的要求是三种框架中最 高的。同时,主框架a a c 解码器能够对采用低复杂度框架编码的码流 进行解码。 2 低复杂度框架( l o wc o m p l e x i t y ,l cp r o f i l e ) :在这层框架中,系统不包 括时域预测和增益控制模块,并且t n s 的阶数也受到限制。低复杂度 框架在音频质量很高时,对存储器和c p u 处理能力的要求比主框架小。 3 可分级采样频率框架( s c a l e a b l es a m p l i n gr a t e ,s s rp r o f i l e ) :在这层框 架中,增益控制模块是必须的,但是没有预测模块,并且t n s 的阶数 和信号带宽受限。该框架的复杂度比其它两个框架都要低。 m p e g 2a a c 解码器应能正确解出由相同框架编码器所编码的,通道配置 在解码器能力范围以内的任何码流。而不同框架的编解码器之间的互操作性如表 2 1 所示: 表2 1不同框架解码器与编码器的互操作性 编码器框架 解码器框架 主框架低复杂度框架可分级采样频率框架 主框架可以解出可以解出不可以解出 低复杂度框架不可以解出可以解出不可以解出 可分级采样频率框架不可以解出不可以解出可以解出 第二章m p e g 2a a c 算法原理 需要注意的是如果主框架或低复杂度框架能够正确分离出码流中的增益控 制信息但不处理它们,则s s r 码流是可以解出的,但重建音频的带宽受限。另 外l c 码流可以由第一个p q f 频带的非混叠部分解出,但重建信号的带宽被限制 在5 k h z 以内。 m p e g 2a a c 总结了m p e g 1 、m p e g 2 和d o l b ya c 3 等音频压缩标准的 长处,对相关模块作了不同程度的改进并加入了很多新的技术,在复杂度增加不 大的情况下,有效地增加了压缩比,提高了音频质量。 首先,a a c 改进了心理声学模型,提高了压缩效率。其次,丰富了立体声和 多声道的处理技术,同时对h u f f m a n 码本也作了改进,并在时频变换中使用了自 适应的长短窗切换机制。 此外,a a c 还提出了时域噪声整形( t e m p o r a ln o i s es h a p i n g ,t n s ) 技术,对 时域噪声进行控制。为进一步去除帧间的相关性,a a c 提出了预测的概念。在进 行长块变换时,即假设信号为准平稳,对相邻帧相同频率位置的分量进行预测编 码。另外,a a c 还新增了增益控制模块。 经过这一系列的改进,a a c 提高了频率分辨率,使码流格式更加灵活,采 样率范围更宽,可从8 k h z 扩展到9 6 k h z 。 2 2a a c 的解码流程 m p e g 2a a c 解码器是一个模块化的结构,如图2 1 ,其主要功能模块包括 比特流拆包、无噪解码、反量化、应用比例因子、m s 立体声解码、强度立体 声解码、预测、时域噪声整形、滤波器组和增益控制。 解码时,对编码数据直接进行h u f f m a n 解码后进行反量化,而对比例因子数 据,要先读取全局增益,再将其它的比例因子经差分解码和h u f f m a n 解码解出。 最后,在每个比例因子带中将反量化频谱数据乘以比例因子,得到实际的频谱值。 由于量化和编码都在频域进行,因此解码的最后一个模块一滤波器组的作用就 是把频域数据转化为时域数据。首先,根据指定的窗长对频谱数据进行i m d c t 变换,i m d c t 后需进行加窗处理。a a c 使用k b d 窗和正弦窗来匹配不同信号的 掩噪比特性,编解码使用的窗必须一致。加窗处理后的数据与前一帧经过5 0 的 叠加后,得到最终解码输出的时域音频数据。 第二章m p e g 2a a c 算法原理 图2 1a a c 解码模块 若编码器中用到t n s ,则解码时需将频谱数据通过一组t n s 滤波器,滤波器 的系数由控制信息中的t n s 数据导出。在强度立体声模式下,左声道传输的是实 际值,而右声道包含的数据为“强度立体声位置,解码时,在每个缩放因子带 中将左声道值乘以相应“强度立体声位置”即得实际的右声道值;在m s 立体声 模式下,两路频谱数据所传输的是左右声道频谱的和与差,解码时必须通过相应 的矩阵变换恢复左右声道;在a a c 编码器中,还可能用到一种“耦合声道”技术, 它的实质是将多声道中的相同部分提取出来单独进行编码,而原来的声道只需传 输不相同的部分,与之相对应,解码时需根据编码器的规定在时域或频域将该声 道叠加到目标声道上。 1 3 第二章m p e g 2a a c 算法原理 a a c 解码器使用自适应二阶预测器来进行预测解码。如果当前声道编码时选 用了预测工具,则其所传输的值为频谱的预测残差,解码时叠加上预测器的输出 才成为真正的频谱值。预测器的系数自适应更新,而且还要根据预测重置信息作 相应的重置。 a a c 可以根据应用的不同,在不同编码质量和复杂度条件下取舍某些模块, 因此解码部分会根据相关配置信息,相应地选择对应模块进行解码。在不同的框 架中使用了不同的功能模块,其具体如表2 2 : 表2 2 各个框架模块的选择 模块 m a i nl cs s r 无噪解码必选必选必选 反量化必选必选 必选 比例因子必选必选 必选 m s可选可选可选 i s 可选可选 可选 预测必选 t n s滤波器级数2 0滤波器级数1 2滤波器级数1 2 滤波器组必选必选 必选 增益控制 必选 2 3a a c 解码的关键模块 2 3 1 无噪解码 在a a c 编码过程中,无噪编码用来对前面经过m d c t 和量化处理后的数据 进行处理,以进一步减少比例因子和量化后频谱数据的冗余。在a a c 标准中, 这一处理是采用h u f f m a n 编码实现的。 作为著名的熵编码方法,h u f f m a n 采用的变长编码。它的基本思想为:对于 经常出现的数据采用较短的码字进行编码,而对出现概率较小的数据采用较长的 码字编码。在已知数据的概率分布的情况下,h u f f m a n 可以达到最优编码。 但是在音频编码的过程中,数据出现的概率难以准确统计。a a c 标准根据 对大量音频样本的统计计算,编制了1 2 个h u f f m a n 码表( c o d e b o o k ) ,编码的时 候通过查表来进行h u f f m a n 编码。在这1 2 个h

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论