已阅读5页,还剩68页未读, 继续免费阅读
(信号与信息处理专业论文)ac3音频编码器研究与实现.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
中文摘要 a c 3 是9 0 年代初由杜比实验室开发的数字音频编码技术。该技术可以传输 和存储多达5 个全频带声道和一个低频效果声道,而所占用的存储空间比c d 上 一路线性p c m 编码所占用的空间还要少。因此,a c 3 在数字电影、h d t v 、d v d 等领域得到了广泛应用。目前国内外关于解码器实现的研究已经非常丰富,但相 关的a c 3 编码技术的研究却相当有限,本论文将在相关问题上进行探索和尝试。 本文从分析研究a c 3 标准所涉及的核心技术入手,实现了a c 3 编码器和 解码器的c 模型,并分别移植到t m s 3 2 0 d m 6 4 2 e v m 和t m s 3 2 0 c 6 7 1 3 d s k 上。 由d m 6 4 2 实现实时的音频采集和a c 3 编码,并将编码后的比特流经串行口 m c b s p 发送给c 6 7 1 3 进行实时解码与播放,从而形成了一个a c 3 音频编解码 平台。 本论文主要对a c 3 的编码算法进行了分析:首先对编码器结构框架进行了 分析;其次,详细研究了a c 3 音频编码算法的关键技术:输入p c m ,滤波器组, 耦合模块,矩阵重置,指数编码,比特分配,尾数编码及帧的生成。对于下列模 块进行了算法上的改进和实现优化:对n 点m d c t 模块采用了n 4 点的f f t 快 速算法,并进行了手工汇编优化;采用了高效的定量比特迭代算法,提高了编码 质量;采用了耦合技术,可以在多声道的条件下,满足低码率的要求。 该编码器被移植到t m s 3 2 0 d m 6 4 2 e v m 平台上,并针对d s p 平台的特点 进行了移植优化以满足实时要求。目前,该编码器已经过1 2 个测试序列的音频 主观测试。在1 2 8 k b p s 码率下,平均m o s 得分为3 8 8 分。在时钟频率为1 1 2 m h z 频率下可实现双声道实时编码。 关键词:a c 3 音频编码t m s 3 2 0 d m 6 4 2编解码系统 a b s t r a c t a c - 3i sad i g i t a la u d i oc o d i n gt e c h n o l o g yd e v e l o p e db yd o l b yl a bi nt h ee a r l y l9 9 0 s b y a d o p t i n gt h i st e c h n o l o g y ,5f u l l 行e q u e n c yb a n d c h a n n e l sa n dal o w f r e q u e n c ye a e c tc h a n n e lc a nb et r a n s f e r r e do rs t o r e d ,w h i l et h es p a c er e q u i r e di sl e s s t h a no n ec h a n n e ll i n e a rp c md a t ai nc d s oa c 3t e c h n 0 1 0 9 yh a sb e e nw i d e l y a d o p t e df o rt h ea u d i oc o d e ci nd v dn l m s ,h d t vd i g i t a lm o v i e s ,e t c c u r r e n t l v t h e s t u d yo nt h er e a l i z a t i o no fd e c o d e ri sv e 搿m a t u r e ,b u tc o n c e m i n gt ot h es p e c i 6 cs t u d y o nt h ee n c o d i n gt e c h n o l o g yo f a c 一3 ,t h ea c h i e v e m e n ti sr a t h e r l i m i t e d t h e r e f o r e ,t h i s p a p e rm a i n l yd i s u s s e so ns e v e r a lr e l a t i v ei s s u e so f a c 3e n c o d i n g t h i st h e s i sf i r s t l yd e s c r i b e st h ec o r ee n c o d i n gt e c h n o l o g yo ft h ea c 3s t a n d a r d , a n dr e a l i z e st h ee n c o d e ra n dd e c o d e rb ycl a n g u a g e ,t r a n s p l a n t scc o d e st ot h ed s p d e v e j o p i n gp 】a t f o r n lt m s 3 2 0 d m 6 4 2 e v ma n dt m s 3 2 0 c 6 7 13 d s k t h ea u d i o i n f o m a t i o ni sc o l l e c t e da n dc o d e di nd m 6 4 2 t h e nc o d e da u d i os t r e a mi st r a n s f e r r e d t oc 6 713 d s kt h r o u g ht h es e r i a lp o r t ,a n dd e c o d e di nr e a l t i m e s oa c 3a u d i oc o d e c s y s t e mi se s t a b l i s h e df i n a l l y t h i sp a p e rm a i n l yf o c u s e so nt h ea n a l y s i so ft h ee n c o d i n ga l g o r i t h mo fa c 3 f i r s t l y ,t h e6 a m e w o r ko ft h ee n c o d e ri sa c c o m p l i s h e d s e c o n d l y ,t h ec o r ea r i t h m e t i c n l o d u l e si na c - 3e n c o d e ra r ed i s c u s s e di nd e t a i l ,i n c i u d i n gi n p u tp c m ,a n a l y s i sf i l t e r b a n d , c o u p “n gt e c h n o i o g y ,r e m a t r i x ,e n c o d ee x p o n e n t ,b i ta i l o c a t i o n , q u a n t i z e m a n t i s s a sa n dp a c ka c 一3f r a m e t h i r d l y ,t h ek e ym o d u l e sa r eo p t i m i z e di no r d e rt o i m p r o v ec o d i n gq u a l i t ya n di n c r e a s i n gc o d i n gs p e e d :t h enp o i n tm d c tf a s t a l g o r i t h mb yn 4p o i n tf f ti su t i l z e d ,a n dr e a l i z e db yt h ea s s e m b l yl a n g u a g e an e w m e t h o db a s e do nt h eq u a n t i t a t i v ea n a l y s i si sp r o p o s e ds ot h a tt h eb i ta l l o c a t i o nc a nb e a c c o m p l i s h e dm o r eq u i c k l yu n d e rc e r t a i na c c u r a c ya n dag r e a ta m o u mo ft i m ec a nb e s a v e d w i t ht h ec o u p “n gm o d u l e ,t h ee n c o d e rc a np r o c e s st h em u l t i c h a n n e la u d i oi n al o w b i ts t r e a mr a t e t h ee n c o d e ra l g o r i t h mi s t r a n s p l a n t e da n do p t i m i z e db a s e do nd m 6 4 2h a r d w a r e p j a t f 0 册n o wt h ee n c o d e ri sp a s s e dt h r o u g ht h es u b j e c t i v et e s tw h i c hi n c l u d e s12t e s t s e q u e n c e s ,w i m12 8 k b p sb i ts t r e a mr a t et h ea v e r a g em o sp o i n ti s3 8 8 f o rt h e m o m e n tt h ee n c o d e rc a nr u nr e a l t i m eo nd m 6 4 2p l a t f o r n la t1 12m h zf o r t w o c h a n n e la u d i oc o d i n g k e y w o i m s :a c 一3 ,a u d i oe n c o d i n g ,t m s 3 2 0 d m 6 4 2 ,a u d i oc o d e cs y s t e m 独创性声明 本人声明所呈交的学位论文是本人在导师指导下进行的研究工作和取得的 研究成果,除了文中特别加以标注和致谢之处外,论文中不包含其他人已经发表 或撰写过的研究成果,也不包含为获得墨鲞苤堂或其他教育机构的学位或证 书而使用过的材料。与我一同工作的同志对本研究所做的任何贡献均已在论文中 作了明确的说明并表示了谢意。 学位论文作者签名:鸯砍 签字日期: 溯年6 月乒日 学位论文版权使用授权书 本学位论文作者完全了解丞鲞盘堂有关保留、使用学位论文的规定。 特授权苤注盘堂可以将学位论文的全部或部分内容编入有关数据库进行检 索,并采用影印、缩印或扫描等复制手段保存、汇编以供查阅和借阅。同意学校 向国家有关部门或机构送交论文的复印件和磁盘。 ( 保密的学位论文在解密后适用本授权说明) 学位论文作者签名:摩f 1 欠 导师签名: 圈哟兮 签字日期:沙蛆年6 月卜目签字日期:0 2 刃护年占月乒日 第一章绪论 1 1 引言 第一章绪论 自从1 9 6 6 年日本广播协会研制出第一台数字磁带录音机开始,数字音频技 术在几十年内得到了迅速的发展,与传统的模拟技术相比,数字技术使高质量音 频信号的采集、存储、后处理、交换和分配更为方便,质量也更高,并且易于大 规模集成,所以一经出现便得到了迅速发展。但它也存在一定的缺点,即数字化 后音频信息数据非常庞大,它给信息的存储和传输造成较大的困难,例如采样率 为4 4 1 l 此量化精度为1 6 比特的c d 唱片,其1 分钟的立体声音频信号需占约 1 0 m 字节的存储容量,容量为6 7 0 m 字节的c d r o m 只能存放1 5 首歌左右。如 何减少处理和传输的数据量就成为一个关键的技术问题。研究发现,直接采用脉 冲编码调制( p u l s ec o d e dm o d u l a t e ,p c m ) 码流进行存储和传输存在非常大的 冗余度。事实上,在无损的条件下对声音至少可进行4 :1 压缩,即只用2 5 的数 字量保留所有的信息,而在视频领域压缩比甚至可以达到几百倍。因而,为利用 有限的资源,压缩技术从一出现便受到广泛重视。对音频压缩技术的研究和应用 由来己久,如a 律、p 律编码就是简单的准瞬时压扩技术,并在l s d n ( i n t e g r a t e d s e n ,i c ed i g i t a ln e m o r k ) 话音传输中得到应用。对语音信号的研究发展较早,也 较为成熟,并己得到广泛应用,如自适应差分p c m ( a d a p t i v ed i 艉r e n t i a lp c m , a d p c m ) 、线性预测编码( l i n e a rp r e d i c t i o nc o d i n g ,l p c ) 等技术。在广播领域, 准瞬时压扩音频复用( n e a r i n s t a n t a n e o u sc o m p a n d e da u d i om u l t i p l e x ,n l c a m ) 等系统中都使用了音频压缩技术。到了2 1 世纪9 0 年代,音频压缩编码在数字音 频广播、数字音频工作站、卫星广播和高清晰度电视伴音等方面都有着广泛的应 用。 1 2 数字音频编码标准 鉴于数字音频技术的优点,各国、各大公司都竞相开发数字音频信号的压缩 编码技术。其中,根据编码压缩后的音频能否完全重构出原始声音,可以将音频 压缩技术分为无损编码及有损编码两大类。而按照编码方案的不同,又可将其划 分为时域编码、变换编码、子带编码,以及多种技术相互融合的混合编码等等。 第一章绪论 各种不同的编码技术,其算法的复杂程度( 包括时间复杂度和空间复杂度) 、音 频质量、算法效率( 即压缩比例) 以及编解码延时等都有很大的不同。 音频编码技术的发展最初是从无损编码开始的。7 0 年代初,开始采用的类似 p c m 的瞬时压扩技术和块压扩( b l o c k c o m p r e s s i n g ,b c ) 技术。这种技术的编 码效率较低。8 0 年代,数字信号处理技术的发展,使复杂的音频编码算法的运用 成为可能。压缩比较高、算法较复杂的音频编码技术的探索取得了重大成果,出 现了从音质尚可到音质卓越的一系列频域编码算法。8 0 年代末至9 0 年代初涌现的 编码算法普遍采用了一种高效率编码技术,即利用人耳的掩蔽效应和临界频带等 特性来进行子带编码和变换编码。其中有:掩蔽型通用子带综合编码复用系统【2 】 ( m a s k i n gp a t t e ma d a p t e du n i v e r s a ls u b b a n di n t e g r a t e dc o d i n ga n dm u l t , m u s i c a m ) 、l2 8 k b p s 的音频压缩标准( a u d i oc o m p r e s s i o n ,a c 2 ) 编码器、 a c 一3 系统、自适应频谱感知熵编码( a d a p t i v es p e c t r a lp e r c e p t u a le n t r o p yc o d i n g , a s p e c ) 和子带自适应音频脉冲编码( s u b b a n da d a p t i v ed i 艉r e n c ep u l s ec o d e m o d u l a t i o n ,s b a d p c m ) 算法等。9 0 年代至今,有损音频编码把音频数据的压 缩率提高到1 2 :1 ,付出的代价是音质的下降。如果人们根据不同的应用要求把 音频质量同数据压缩率进行折衷,这些方案就显得非常有用。比较著名的有: m p 3 、高级音频编码( a d v a n c e da u d i oc o d i n g ,a a c ) 、r m 等。同时,能给最终 用户提供最佳的听觉体验的无损编码技术也取得了新的突破,m e r i d i a n 无损编码 ( m e r i d i a nl o s s l e s sp a c k i n g ,m l p ) 是一种应用所有权技术的音频编解码计划。 它能传送多声道环绕声,并以可能的最高的动态范围和更高的取样频率来确保任 何声音细节都表现完美。 m p e g 1 p j 音频编码以m u s i c a m 和a s p e c 为基础形成了三个不同层次的音 频编码算法,对应不同的应用要求并具有不同的编码复杂度。在m p e g 1 的音频 编码标准中,按照复杂度规定了三种模式( 层i 、层i i 、层) 。广泛使用的v c d 的音频压缩方案为层i ,即简化的m u s i c a m ,典型码流19 2 k b p s 。层i i 等同于 m u s i c a m ,称为掩蔽模式通用子带集成编码与多路复用,典型码流1 2 8 k b p s , 广泛应用于数字音频广播、数字演播室等数字音频专业的制作、交流、存储和传 送。层是综合了层和a s p e c 的优点提出的混合编码技术,它的复杂度相对较 高,编码不利于实时,它是m u s l c a m 和a s p e c 两个算法的结合,典型码流 6 4 k b p s ,低码率下仍能保证很高的音质。 m p e g 1l a y e ri 是l s o i e cm p e g 在1 9 9 2 年提出的,之后1 9 9 4 年1 1 月又 进行了多声道扩展,通过了一种多声道环绕声音频编码技术m p e g 2 后向兼容方 式( b a c k w a r dc o m p a t i b l e ,b c ) ,即i s o i e c1 3 8 1 8 3 。m p e g 2b c 主要是在 m p e g 1 和c c i rr e c 7 5 5 的基础上发展起来的。与m p e g 。l 相比较,m p e g 2 主要 2 第一章绪论 在两方面做了重大改进,一是支持多声道声音格式;二是为某些低码率应用场合, 如体育比赛解说等进行的低采样率扩展。同时,标准规定的码流格式还可与 m p e g 。l 的第1 和第2 层前、后向兼容,并可依据c c i rr e c 7 5 5 与双声道、单声道 格式向下兼容。在m p e g 2b c 中采用了多种新技术,如动态传输通道切换、动 态串音、自适应多声道预测、中央声道幻象编码( p h a n t o mc o d i n go f c e n t e r ) 、 预矫正( p r e d i s t o r t i o n ) 等。 m p e g 2a a c 【4 堤m p e g 2 标准中的一种非常灵活的感知音频编码标准。它 主要利用听觉系统的掩蔽特性来减少声音的数据量,并且把量化噪声分散到各个 子带中,通过全局信号把噪声掩蔽掉。在m p e g 2 的正式听音测试中,码率为 3 2 0 k b p s 的a a c 可以提供比数据流速率为6 4 0 k b p s 的m p e g 2b c 更好的音质。因 此,a a c 是一种比m p e g 2b c 编码算法更好的音频压缩算法,而且可以适用于 各种环境,如可以做电视信号的伴音,网络流媒体等。 d o l b y 数码( 又称作杜比环绕影音) ,是由美国杜比实验室开发的性能卓越的 数字音频编码系统,其中a c 1 用于卫星通信和数码有线广播,a c 2 用于专业音 频的传输和存储,a c 3 采用第三代a t c 技术,被称为感知编码系统,它将特殊的 心理音响知识、人耳效应的最新研究成果与先进的数码信号处理技术很好地结合 起来,形成了这种“多声道数字音频处理技术”。d 0 1 b ya c 3 最初是针对影院系统 开发的,但目前已成为应用最为广泛的环绕声压缩技术之一,是美国的d v d 、 卫星数字广播( d i g i t a lb r o a d c a s ts 犯雌t e ,d b s ) 和a t s ch d t v 伴音的通用标准。 另外,i n t e lm m x 技术也支持a c 3 作为未来计算机多媒体音频方案,以实现 i n t e m e t 实时音频传输。d o l b ya c 3 从时域到频域的映射是通过一个时变滤波器组 实现的。对于稳态信号采用5 1 2 点的m d c t ,而对于瞬态信号采用2 5 6 点的m d c t 。 心理声学模型用于两个过程,首先使用完全心理声学模型简化控制操作过程,然 后进行参数化,这些参数将出现在编码器和解码器中。 d o l b ye 是专为数字电视广播传送和后期制作而设计的一种专业级音频编码 系统。利用杜比e 技术,一个a e s e b u 信道就可以传送多达8 个声道的高质量音 频数码流,同时还可以加载杜比数字的控制数据信号( 常称为m e t a d a t a ) 。杜比e 的音频可以与各种格式的视频信号良好的匹配,不会因视频干扰导致盲音、声音 的毛刺或其它失真。更为重要的是,利用这种新型编码技术,现有的广播电视系 统不经大规模改造就能传播多声道的数字电视音频信号,从而大大降低了系统成 本。杜比e 信号还与其它数字音频设备相兼容。它与其它数字音频信号一样可以 转换、记录、编辑( 切入或插入组合编辑) 。杜比e 的标准数据传输率是1 9 2 m b p s ( 针对2 0 b i 似8 l 此的音频信号) ,典型的工作模式是“5 1 + 2 ”,即用6 个声道传送 5 1 声道环绕声信号,另2 个声道传送双声道的矩阵编码信号或双声道的立体声信 第一章绪论 号。 表1 1 列出了各种编码方式的5 个参数的比较,从表中可以清楚地比较出5 种 编码方法压缩比、数据率和适用的通道数等。 表1 1 音频编码方式的比较 采样频率k h z量化精度b i t声道数 数据率厂b p s数据帧大小1 6 b i t s 线性p c m 4 8 9 61 6 2 0 2 486 1 4 4 m7 6 8 2 3 0 4 m p e g 一2b c3 2 4 4 1 4 81 6 2 41 5 1 3 2 1 1 3 0 k3 8 4 1 1 5 2 m p e g 2a a c8 9 61 6 2 4l 4 8 5 7 6 k ( m a x ) 1 0 2 4 d o i b va c 33 2 4 4 1 4 81 6 2 41 5 13 2 6 4 0 k1 5 3 6 d o l b v e4 81 6 2 0 2 4l 81 9 2 m7 6 8 1 1 5 2 1 3d o l b ya c - 3 的发展和特点 a c 3 技术起源于为高清晰度电视( h i g hd e f i n i t i o nt e l e s i o n ,h d t v ) 提 供高质量声音。美国联邦通信委员会( f e d e r a lc o m m u n i c a t i o nc o m m i t t e e ,f c c ) 的高级电视咨询委员会( a d v i s o r yc o m m i t t e eo na d v a n c e dt e l e v i s i o ns e r v i c e , a c a t s ) 于1 9 8 7 年开始美国h d t v 制式的研究。最初的h d t v 系统方案是模 拟图象和数字声音传输,其中声音编码采用d o i b ya c 1 数字音频编码算法。a c 1 通过4 2 4 多声道矩阵方式把声道数减少一半( 这样就可以降低传输信道的带 宽) ,然后采用增量调制技术进行数字编码。因此,a c 1 的压缩比为2 :1 。到 1 9 8 9 年,随着声音编码技术和数字信号处理器( d i g i t a ls i g n a lp r o c e s s o r ,d s p ) 的进步,a c 1 系统发展成为基于变换编码技术的a c 一2 系统,在提高质量的同 时,压缩比提高为4 :1 ,但是多声道矩阵处理技术仍然保留着。 为了最大限度地发挥矩阵方式的优势,必须把编码的信号再解码,而且要边 监听效果边加以确认,对于电视现场节目,有时一次解码很难确认其效果,所以 用两声道码率提供多声道编码性能的a c 3 系统由此诞生。 到了1 9 9 1 年中期,a c 3 逐渐被公众所知,并被美国h d t v 组织所接受。 1 9 9 3 年1 1 月,a c a t s 正式批准大联盟( g r e a ta l l i a n c e ,g a ) h d t v 系统采用 a c 3 编码方案。1 9 9 4 年a t s c 的建议草案的声音部分采用a c 3 算法,1 9 9 6 年 底美国f c c 采纳a t s cd t v 标准,将a c 3 作为未来高清晰度电视的伴音标准。 北美及日本这些采用n t s c 制式的国家将d o l b ya c 3 作为新一代影碟d v d 的 音频标准。事实上,a c 3 很快被其它国家接受为多声道音频编码标准。 d v d r o m 、个人计算机产品、家庭影院、数字有线电视系统以及一些直播卫星 4 第一章绪论 系统都采用a c 3 作为音频编解码器。 a c 3 的编解码器被设计成一个完整的音频子系统的解决方案,它拥有普通 的低码率编解码所没有的许多特性。这些特性包括适用于消费类音频回放系统 的动态范围压缩特性( d y n a m i cr a n g ec o m p r e s s i o n ) 、兼容性和扩展性、对话归 一( d i a l o gn o r m a l i z a t i o n ) 以及下混特性( d o w n m i x i n g ) 。动态范匪i 控制( d y n a m i c r a n g ec o n t r 0 1 ) 的控制字嵌在a c 3 码流内,并被解码器应用,可以由听众选择 全动态范围、部分压缩动态范围和高度压缩动态范围的重建声音;兼容性和扩展 性使它可根据特定的应用选定比特率和声道数,所有的类型采用相同的原理,保 证了格式问的兼容性和对将来需求的扩展性;下混技术可使a c 3 解码器根据输 出设备的实际声道数提供最优的声道缩减方案,将多声道音频转换为特定数目的 声道输出。 1 4 课题的研究意义 随着我国经济的高速发展,人民消费水平进一步提高,我国必将会形成一个 庞大的数字家庭影院系统市场。在这个大市场中,d o l b ya c 3 是广泛使用的家 庭影院环绕声系统,通过采用a c 3 宽带音频压缩技术,在数字家庭影院系统中 实现了用十分之一的标准数字音频空间来存储高质量的多声道声音数据。并且 d o l b va c 3 在美国的h d t v ,卫星数字广播,数字演播室等领域也广泛应用, 潜力很大。但我国具有自主知识产权的d o l b va c 3 编码器还极少,而且需求量 较大的国产d v d 机中的解码芯片也几乎全为美国及日本的厂家所垄断,它限制 着国内d v d 产业及音响产业的迅速发展。因此研究a c 3 编解码技术对我国有 着重大的现实意义,它既可以改变依赖进口的馗尬局面,也可以增强开发各种数 字多媒体编解码器的能力。 1 5 论文的研究内容及章节安排 本文主要研究如何在t m s 3 2 0 d m 6 4 2 e v m 开发平台上实现高效实时的a c 3 音频编码器。对a c 3 标准中的m d c t 时频变换,多声道耦合,比特迭代等核心 算法进行了分析研究,并对其进行了基于t i 平台的移植优化,以达到实时效果。 本文的另一重点内容是基于t m s 3 2 0 d m 6 4 2 e v m 和t m s 3 2 0 c 6 7 1 3 d s k 开发 平台,完成了a c 3 音频编解码演示系统。此系统是一个具有实时编解码能力的 音频a c 3 系统,可以对音频信号进行采集、编码、传输、解码、播放、评价等 功能。 第一章绪论 本文主要分为五章,其中第一章为绪论,概述了音频压缩技术的发展和a c 3 - 标准的概况,说明了研究此课题的重要意义;第二章主要讨论了a c 3 编码算法, 对m d c t 算法,多声道耦合,比特迭代等模块进行了重点研究;第三章介绍了 t m s 3 2 0 d m 6 4 2 e v m 编码平台,阐述了如何将c 代码移植到t i 的开发环境,以 及进行优化提高的方法步骤;第四章是本文的一个重点,介绍了a c 3 音频编解 码平台的搭建,详细说明了如何使用开发板上的外设,如何配置寄存器等等;第 五章,对编码器的质量和性能进行了分析和总结。 6 第二章a c 3 音频编码算法研究 第二章a c 3 音频编码算法研究 本章主要介绍a c 3 音频编码算法。在a c 3 标准中只对码流作了语法规定, 而没有限定编码器的实现方法,只要输出的基本比特流符合a c 3 的语法即可, 也就是所有符合a c 3 标准码流格式的编码码流,都能得到正确解码,这就为算 法的改进提供了很大的空间,同时也保证了解码器的广泛适用性。因此可根据具 体要求设计复杂度不同的编码器,而解码器不需变动。复杂度越高,级别越高的 编码器提供的声音表现力越好,并可以支持更低的码率模式。对编码器进行的改 进将使所有的解码器受益。 2 1a c 一3 系统结构 图2 1 是a c 3 编码器系统的结构框副5 1 。图中给出了各个主要模块在系统中 的位置。脉冲编码调制的音频样点进入编码器之后,首先通过分析滤波器组分解 为频率系数,这个过程可以等效为m d c t 变换。此后,频率系数被拆解为指数和 尾数信息分别编码。图中的比特分配管理模块对系统的全局功能产生重要的控制 作用。比特分配管理模块需要接收指数包络提供的信息作为控制的依据,直接作 用于尾数量化过程,从而控制尾数信息的编码。最后,指尾数信息经过码流形成 单元输出恒定码率的码流。 一p c m 样本 图2 1 a c 3 音频编码器结构框图 第二章a c 一3 音频编码算法研究 图2 2 为a c 3 标准编码器进行编码时的流程框图。其中,位于图中右侧, 包含音频样点具体内容的信息被称为主信息。位于图中左侧,对编码过程起控制, 约束作用的信息被称为边信息。中间的框图表示了音频样点编码时,所需要经过 的功能模块。在下一个小节中将详细的对各个核心模块进行介绍。 图2 2a c 3 音频编码流程图 第二章a c 3 音频编码算法研究 2 2a c 3 音频编码的关键技术 根据编码流程,将编码器的设计主要分为滤波器组、耦合模块、矩阵重置、 指数编码、比特分配、尾数量化等几个模块来进行讨论。 2 2 1 输入p c m 首先,编码器需要音频源。输入的文件格式可以是w a v e 格式文件,也可 以是16 位定点脉冲编码调制( p u l s ec o d em o d u l a t e ,p c m ) 的样点序列。 正确读入多声道音频文件必须首先做到正确分析多声道w w e 文件头信息。 w a v e 文件格式( w a v ea u d i o ) 是一种简单的资源互换文件格式( r e s o u r c e s i n t e r c h a n g ef i l ef o r n l a t ,r j f f ) 的文件【6 】。r j f f 文件是一种树状结构。其基本单 位是c h u n k ( 即块) ,每个c h u n k 由辨识码、数据大小和数据组成。辨识码一般占 4 个字节,数据大小占4 个字节,所以一个c h u n k 的长度就是数据的长度加上8 个字节。 一般而言,c h u n k 本身不允许内部再包含c h u n k ,但有两个例外:以“r i f f ” 和以“l i s r 为辨识码的c h u n l ( 。针对这两种c h u n k ,r i f f 又从原先的数据中,拿 出4 字节,作为“格式辨别码”。 表2 1 r i f fc h u n l ( 块结构 辨识码 4 b v t e s 4 个a s c i i 码 数据大小4 b v t e s 紧跟其后的数据长度 数格式辨识码 4 b v t e s 4 个a s c i i 码( 例如w a v e ) 据数据 基本的w a v 格式包含两个c h u n k :f m tc h u n k 和d a t ac h u n k 。这两个子块都 是一个w a v 文件必须包含的。也可以包含f a c tc h u n k ,这个是可选项。f m tc h u n k 子块描述了波形数据的基本格式,包括声道数,采样率,每个样点的比特数等等。 d a t ac h u n k 里存放着真正的声音数据,当存放的是双声道16 比特采样时,存放 的顺序是:左声道低8 比特,左声道高8 比特,右声道低8 比特,右声道高8 比 特。 表2 2 两声道w a v e 文件格式 标识符( r i f f ) 4 b v t e s5 24 94 6 4 6 数据大小 4 b v t e s 格式辨识码( ”w a 、,e ”)4 b v t e s5 74 15 6 4 5 第二章a c 一3 音频编码算法研究 舳t “f - m t ”4 b v t e s6 66 d7 42 0 子块 s i z e o 足,a v e f o r m a t e x ) 4 b v t e s1 20 00 00 0 、 ,a v e f o r m a t e x1 8 b v t e s f a c t“f _ a c t ”4 b v t e s6 66 16 37 4 子块 子块大小 4 b v t e s0 40 0 0 00 0 子块数据4 b v t e s 0 00 ld 10 0 d a t a“d a t a ”4 b v t e s6 46 17 46 1 子块 波形声音值字节数 4 b v t e s 波形声音值 对于多声道的音频w a v 文件,格式与双声道w a v 文件不太相同。在f m t 中,不使用w a v e f o r m a t e x ,而是使用w w e f o r m a t e x t e n s i b l e 结构, 增加了一些多声道的附加消息。其中c h a n n e l sm a s k 字段共4 个字节,表示包 括的多声道类型和数量。 多声道的音频w a v 文件,最多可支持1 8 个声道的音频数据。数据的组合 方式也不相同,以每样点2 4 比特量化的5 1 声道来说,其数据顺序为:左前声 道低8 比特,左前声道中间8 比特,左前声道高8 比特;右前声道低8 比特,右 前声道中间8 比特,右前声道高8 比特;中声道低8 比特,中声道中间8 比特, 中声道高8 比特;低频增强声道低8 比特,低频增强声道中间8 比特,低频增强 声道高8 比特;左后声道低8 比特,左后声道中间8 比特,左后声道高8 比特; 右后声道低8 比特,右后声道中间8 比特,右后声道高8 比特。 表2 3a c 3 音频声道模式选择 第二章a c 一3 音频编码算法研究 a c 3 标准中,采用a c m o d 变量( a u d i oc o d i n gm o d e ) 来表明音频所涉及的 声道数,从3 2 到i 0 。a c m o d 共有3 位,最高有效位表示环绕声道是否被使用, 为o 时表示没有使用环绕声:最低有效位表示是否使用中央声道。 根据输入音频的声道数来确定a c m o d 的值,如表2 3 所示。另外,在读取音 频文件的同时还要确定采样率,每样点比特数,帧容量等等辅助信息。 2 2 2 滤波器组 a c 3 的编码系统总体上来说属于变换编码的范畴。它要把时域值转换为频 域分量,再对其进行指尾数编码。时频转换是通过滤波器组来实现的,方法是先 进行加窗再进行m d c t 变换。可见,滤波器组的实现是编码过程的基础。 在编码端,首先对输入的音频进行高通滤波以去除信号中的直流分量。这是 因为d c 分量能量很大,会占据很多的编码比特,但是人耳却感觉不到。去除后 可以节约一些比特,用来对高频分量进行编码。一个典型的滤波器是截止频率为 3 h z 的单极点i i r 型滤波器,可以采用切比雪夫i 型滤波器。 在a c 3 中,采用了t d a c ( t i m ed o m a i na 1 i a s i n gc a n c e l l a t i o n ) 技术,以防 止块效应的产生。因为在编码一帧的过程中,a c 3 人为地将音频数据分为六个 块,每个块2 5 6 个样点,以块为最小单位进行编码。虽然块边界在变换时是连续 的,但在后续编码过程中会引入噪声,而且不同的块变换之间的噪声是不相关的, 对于原来连续的前后两块数据,在解码端经过反变换后,有可能在块的边界上变 得不连续,而且这种不连续性很容易被人耳捕捉到,造成编码感知质量的下降。 第二章a c 3 音频编码算法研究 2 m 卜一m d c thm 1 ,- jl _ jl - - _ j 2 mh m d c th m | 广 广 r 1 ,。_ j 1 一i 一 图2 3t d a c 技术在编解码两端的应用 为了消除这种块边界上的不连续性,a c 3 使用了时域混叠抵消技术。这种 方法对于长度为5 1 2 样点的数据块,相邻块之间将存在2 5 6 样点的重叠,即:每块 的前2 5 6 样点实际重复了前一块的音频信息,后2 5 6 样点才表示新的音频信息。然 后对此5 1 2 个样点进行加窗处理,再进行m d c t 变换。这样,因为各窗口数据间 存在5 0 的重叠,所以可以有效的消除块效应。 为了满足完全重建原始信号的要求,窗函数必须满足偶对称和重叠部分的平 方和等于l 两个条件。在实际应用中,因为窗函数需要比较大的计算量,在初始 化时将其制作成表,使用时直接查表即可。 在进行时频变换以前,先要进行暂稳态判决以确定使用长窗或短窗。当采样 频率不变时,窗口宽度增加,频率分辨率相应的得到提高,但是时间分辨率降低; 如果窗口取短,频率分辨率下降而时间分辨率上升,所以两者是矛盾的。长窗更 适于时域静态的信号压缩,但是对于那些幅度变化较快的信号,效果则会很差; 短窗对瞬态信号的编码音频质量较好,但是它的总体编码压缩效率较低,故对音 频变换块大小的选择是对编码效率和音频质量的折中。在a c 3 算法中,对于稳 态音频信号,它的频谱在时间上保持稳态,或者变化缓慢,需要高的频率分辨率, 1 2 第二章a c 3 音频编码算法研究 选择51 2 个样值的长块;反之,对于快速变化的瞬态信号,要求有高的时间分辨 率,选择2 5 6 个样值的短块。 进行暂稳态判决时,主要分4 个步骤: 1 ) 高通滤波:首先将信号通过一个截止频率为8 l 此的级联双向直接i l 型i i r 滤波器 2 ) 块分割:2 5 6 个经过高通滤波的样点分为3 个等级的树,等级l 表示一 个2 5 6 长度的块,等级2 表示两个长度为1 2 8 的块,等级3 表示四个长 度为6 4 的分割块。 3 ) 峰值检测:找出各个等级,各个块的最大幅度值 4 ) 阈值比较:首先将当前块的最大值p 1 1 】与静态阈值进行比较。如果当 前块的最大值小于阈值,则将其判定为稳态,使用长窗;其次,则将每 个等级的相邻段的最大值进行比较,如果两个峰值比大于某个设定的阈 值时,则判定为暂态。公式如下: 聊昭( 尸 】 七】幸, 】) m a 苫( p 【】 七一1 】) ( 2 - 1 ) 这里,m a g 代表幅度,t d 是预定义的各等级的比较阈值。 对于暂稳态判决模块,特别需要说明的一点是:实际上由于t d a c 变换的原 因,所以进行暂稳态判决的5 1 2 点,只有后2 5 6 点才是新的数据。前2 5 6 点的数据 不过是前面的重叠。因此,在具体的实现时只需要对后2 5 6 点进行判断,前面2 5 6 点的相对峰值关系可以从上一块的比较中得到。 暂稳态判决后,要对数据进行m d c t 变换了。m d c t 的公式如( 2 2 ) 所示。 删= 号塾小。s ( 焉鼢+ 1 ) ( 2 川) + 弘+ 1 ) ( 1 叫) 协2 , f o ro 后 坐: 2 长变换时& = o ;短变换时,前2 5 6 点变换口= 1 ,后2 5 6 点变换口= 1 。, 从公式来看,在编码过程中。如果是稳态,编码器对数据进行5 1 2 点长变换; 当音频块存在暂态时,对前2 5 6 点进行口= 1 短变换;对后2 5 6 点进行口= 1 短变换, 最后将两个2 5 6 点变换的结果进行交织,重组成为一组长度为2 5 6 点的频率系数。 m d c t 有很多种快速算法1 7 】因为在a c 3 中,m d c t 的变换长度均可被4 整 除,所以本课题中采用基于n 4 点f f t 的算法作为m d c t 的快速实现手段。基于 f f t 的快速算法流程分为3 部分构成:f f t 变
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年叉车作业安全事故应急处置预案
- 7月1日期末综合考试试卷(含详细答案)
- 网络安全教育课件模板中小学
- 合规转利润:降本增效全指南(2026)《GBT 39366-2020皮革 色牢度试验 耐摩擦色牢度》
- 技术交底监理监督方法
- 合规转利润:降本增效全指南(2026)《GBT 39132-2020燃料电池电动汽车定型试验规程》
- 辽宁辽阳市第一中学2026-2027学年上学期八年级学期初练习数学学科试卷(含简单答案)
- 2026年浙江省公务员申论写作能力提升训练题库
- 2026年浙江省人教版初中数学下册第4章同步练习题
- 河南青桐鸣2026-2027学年高三上学期学情调研数学试卷(含答案)
- 护理安全风险评估及记录
- 控告申诉业务竞赛含答案
- 顾方舟课件教学课件
- 货币鉴定师(初级)职业资格认定参考试题库(附答案)
- 玉米远期销售合同范本
- 4.1人的认识从何而来 课件 2025-2026学年统编版高中政治必修四哲学与文化
- 江苏苏州市2025-2026学年七年级上学期期中阳光测试语文卷(无答案)
- 应急演练组织与实施方法
- 设备维修部门绩效考核与提成办法
- 2025北京市事业单位就业援藏专项招聘21人考试参考试题及答案解析
- 茶饮店店长职位聘用协议
评论
0/150
提交评论