已阅读5页,还剩49页未读, 继续免费阅读
(通信与信息系统专业论文)低延时宽带音频编码算法的研究和实现.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 本文介绍了一种新的音频编码算法l d x ,它是一种高效低延时的感知音频编 码方法。这种低延时宽带音频编码框架引用了一些全新的编码模块,比如心理声 学模型、频域残差处理、立体声耦合以及高效的h u f f m a n 编码模块等等。所以在 面向交互音频和多媒体通信的应用中,l d x 可以在低码率的情况下提供高质量低 延时的音频编解码服务。 本文研究的目的是将低延时感知音频编码算法l d x 在t m s 3 2 0 d m 6 4 2d s p 硬件平台上实现,并对其进行优化以达到实时编解码。首先,我们研究了现时流 行的一些感知音频编解码算法,并对低延时感知音频编码算法l d x 进行了详尽 剖析。在实现了低延时感知音频编码算法的定点源程序、全面分析l d x 的软件 流程和各个编解码模块功能的基础上,针对算法中运算复杂度高的几个模块进行 c 语言的简化优化。完成l d x 定点代码向t m s 3 2 0 d m 6 4 2d s p 硬件平台上的移 植,结合d m 6 4 2 的硬件特点对代码其进行全面的平台优化,最终达到定点代码 在d s p 平台上实时运行的目的。 全面测试和性能评估表明:优化效果明显,l d x 的低算法延时足以进行实时 编解码,编解码音质效果令人满意,本文的研究为低延时音频编解码算法走向实 际应用奠定了基础。 关键词:低延时音频编解码数字信号处理算法优化 a b s t r a c t a sm a n yl o wd e l a yh i g he f f i c i e n tp e r c e p t u a la u d i oc o d i n ga l g o r i t h m s ,an e w l y d e s i g n e da u d i oc o d i n ga l g o r i t h m - l d xi si n t r o d u c e di nt h et h e s i s t h i sl o wd e l a ya n d w i d e b a n da u d i oc o d i n gs c h e m eu t i l i z e ss e v e r a lm o d i f i e dp r o c e s s i n gb l o c k s ,s u c ha s p e r f e c tp s y c h o a c o u s t i cm o d e l ,f r e q u e n c yr e s i d u a lp r o c e s s i n g ,s t e r e oa u d i op r o c e s s i n g , h i 曲e f f i c i e n th u f f m a nc o d i n ga n ds o0 1 1 a sar e s u l t ,i ti sa b l et op r o v i d eh i 曲q u a l i 坝 l o wd e l a ya n dl o wb i tr a t ea u d i oc o d i n gm e t h o d sf o rr e a l t i m ea u d i oa n dm u l t i m e d i a c o m m u n i c a t i o n sa n do t h e rr e l a t e da p p l i c a t i o n s t h i st h e s i si l l u s t r a t e sh o wt oi m p l e m e n tt h ep r o p o s e dl o wd e l a ya n dh i g hq u a l i t y a u d i oc o d i n ga l g o r i t h mw i t ht h et id m 6 4 2d s pp l a t f o r m ,a n dd i s c u s s e st h ew a yt o o p t i m i z et h ec o d es oa st or u n i nr e a lt i m eo nt h e s ed s p s f i r s t l y , t h i st h e s i sd i s c u s s e s 自o m eo fp e r c e p t u a la u d i oc o d i n ga l g o r i t h m sa n df o c u s e so nl d x , t h e np r e s e n t st h e m e t h o do ff i x e d p o i n ti m p l e m e n t a t i o no ft h e 嘶咖a lf l o a t i n g - p o i n ts o u r c ec o d e , t h e w a y t op o r tt h ef i x e d - p o i n ta l g o r i t h mt ot id m 6 4 2d s pi sa l s oa d d r e s s e di nt h et h e s i s a f t e rt h 札t h ef i x e d - p o i n tc o d ei so p t i m i z e do nt h ed s pt oa c h i e v et h ep e r f o r m a n c e g o o de n o u g hf o r r e a l t i m ei m p l e m e n t a t i o n c o m p l e t et e s ta n de v a l u a t i o nr e s u l t sh a v ep r o v e dt h a t ,t h ed e s i g n e da u d i oc o d i n g a l g o r i t h mh a sag o o da u d i oc o d i n gq u a l i t y 谢t hr e a s o n a b l el o wd e l a y i tc a nb e o p t i m i z e do ns o m ep o p u l a rd s p t op r o v i d et h ep o s s i b i l i t yf o rp r a c t i c a la p p l i c a t i o n si n a u d i oa n dm u l t i m e d i ac o m m u n i c a t i o ns y s t e m s k e y w o r d :l o wd e l a y a u d i oc o d i n gd s p o p t i m i z a t i o n 创新性声明 秉承学校严谨的学风和优良的科学道德,本人声明所呈交的论文是我个人在 导师指导下进行的研究工作及取得的研究成果。尽我所知,除了文中特别加以标 注和致谢中所罗列的内容以外,论文中不包含其他人已经发表或撰写过的研究成 果:也不包含为获得西安电子科技大学或其它教育机构的学位或证书而使用过的 材料。与我一同工作的同志对本研究所做的任何贡献均已在论文中做了明确的说 明并表示了谢意。申请学位论文与资料若有不实之处,本人承担一切的法律责任。 申请学位论文与资料若有不实之处,本人承担一切的法律责任。 本人签名: 关于论文使用授权的说明 本人完全了解西安电子科技大学有关保留和使用学位论文的规定,即:研究 生在校攻读学位期间论文工作的知识产权单位属西安电子科技大学。学校有权保 留送交论文的复印件,允许查阅和借阅论文;学校可以公布论文的全部或部分内 容,可以允许采用影印、缩印或其它复制手段保存论文。同时本人保证,毕业后 结合学位论文研究课题再撰写的文章一律署名单位为西安电子科技大学。 本人签名: 导师签名: 日期丝堡:l ! 篁 日期型釜:! :兰罗日期2 竺2 :! :兰疹 第一章绪论 第一章绪论 1 1 课题研究的必要性和意义 随着现代多媒体和网络通信技术的飞速发展,数字音频技术己经在数字影音 系统、高清晰度电视、数字音频广播、电话会议系统、无线通信、互联网多媒体 业务等领域中得到了广泛的应用【l 】。但由于数字化后的音频信号数据量非常大, 如未经处理,其存放、网络传送都存在很大问题,因此音频的数据压缩就显得尤 为重要【3 】【4 】。现在,音频压缩存在很多的压缩编解码方案,有w m a ,a a c ,m p 3 等,其中最常用的是m p 3 。但随着时代的进步,这种音频压缩算法己越来越不能 满足需要,比如压缩率落后,低码率下音质不理想,仅有两个声道等等。 传统的音频编码技术都是通过去除音频信号中的统计冗余来达到降低编码比 特率的目的【5 1 ,感知音频编码技术则是利用了人耳听觉系统的掩蔽特性【2 】,根据 心理声学分析,有效地去除音频信号的感知冗余,从而在保证良好感知音质的同 时进一步降低编码比特率。由于变换编码( 也称频域编码) 不仅能有效去除统计 冗余,而且也便于心理声学分析,因此,目前高效的音频编码算法大多都属于变 换的感知音频编码。从m p e g 和杜比一系列音频标准可以看出,音频编码技术的 发展主要朝向高压缩比、高音质、高灵活性,对于侧重存储的应用及数字广播有 着重要的意义。 低延迟高质量的音频编解码算法( l d x ) 主要面向实时全双工音频或多媒体 通信的应用,其特点是编解码算法延迟小,同时具有其它感知音频编码的高压缩 比、高音质的优点。相较于m p 3 而言,l d x 具有压缩比高,重建音质好,编解 码过程模块化等特点。 t m s 3 2 0 d m 6 4 2 是t i 公司推出的一款高性能可编程数字信号处理器,它的设 计初衷就是适用于多媒体处理,该芯片支持浮点数的操作,但是为了使运算更为 高效快速,我们对浮点程序进行定点化实现,以降低其运算复杂度和具备更好的 移植性。本课题研究目的就是要利用t m s 3 2 0 d m 6 4 2 硬件平台,使用定点化c 程 序以及汇编语言在d s p 平台上实现l d x 音频编解码算法并对其进行优化,达到 实时编解码要求。 1 2 数字音频编码概述 音频信号数字化之后,所面临的第一个问题就是如何实现数字音频的有效存 储和传输,因此,为了降低传输或存储的费用,对数字音频信号进行有效的编码 2 低延时宽带音频编码算法的研究和实现 处理就变得极为重要。数字音频编码的主要目的是力求以最小的数据量表示更多 的信息,故也称为压缩编码。按照压缩原理的不同,可将音频压缩编码方式分为 以下四种:波形编码、参数编码、混合编码以及感知编码。对于各种不同的压缩 编码方法,其算法复杂度、重构音频信号的质量、压缩比、编解码延迟等都有很 大的不同,因此其应用场合也各不相同。 1 1 波形编码 波形编码是指直接对音频信号时域或频域波形样值进行编码1 6 】,核心思想是 不利用生产音频信号的任何知识产生的一种重构信号,它编解码后的波形会和原 始波形尽可能地一致。最常见的波形编码方法就是脉冲编码调制p c m ( p u l s ec o d e m o d u l a t i o n ) 。p c m 编码仅仅是对输入信号进行采样和量化,不同的量化级固定地 分布在输入信号的整个幅度范围内。其改进方法a d p c m 则是采用可变的量化级, 先将差分信号利用自适应编码因子进行缩放,再根据固定的量化曲线进行量化。 由于波形编码保留了信号原始样值的细节变化,从而保留了信号的各种过渡 特征,所以,波形编码适应性强,算法复杂度低,编解码延迟小,重构音频信号 的质量一般较高,但压缩比不高,编码效率比较低。 2 1 参数编码 参数编码是是根据对声音形成机理的分析,从话音波形信号中提取生成话音 的参数,对这些参数进行编码【”,解码的时候使用这些参数通过语言生成模型重 构出话音,针对话音的音源编解码器叫做声码器( v o c o d e r ) 。它由白噪声作无声话 音段激励或者由脉冲段做有声话音段激励。常用的音频参数有滤波器组、发声或 者不发声的标志和有声话音的音节周期等。 这种编码技术的优点是压缩比高,但计算量大,重构音频信号的质量较差, 自然度低,不适合于高保真度要求的场合,一般多用于语音信号的压缩。 3 1 混合编码 混合编码是将波形编码与参数编码结合起来,它不使用两个状态( 有声或无 声) 的模型来切换滤波器的输入激励信号,而是采用一种可变的激励信号,使得 该信号激励产生的波形尽可能接近原始话音的波形。采用混合编码的方法,可以 在较低的编码比特率下获得较高的音质【s 】。如码激励线性预测( c e l p :c o d e e x c i t e dl i n e a rp r e d i c t i v e ) 、多脉冲线性预测编码( m p l p c :m u l t i p u l s el i n e a r p r e d i c t i v ec o d i n g ) 等。 4 1 感知编码 感知音频编码器主要利用信号的统计特性和人类听觉的感知特性【9 】【1 0 】f l l 】,首 先编码器会分析输入信号的频率和振幅,然后将其和人类听觉感知模型进行比较, 一方面力求去除信号的统计冗余,另一方面利用心理声学现象中的掩蔽效应0 2 , 去除人耳不能感知的声音成分,同时也不一味追求最小的量化噪声,而是力求使 第一章绪论 3 量化噪声不被人耳感知即可,尽管这样做损失了一部分音频成分,但是人的耳朵 却感觉不到编码信号质量的下降,因此,既实现了音频数据压缩的目的,又不影 响解码端重构音频信号的主观音质。 在最近十几年间,数字音频技术得到了迅猛发展,世界几大公司和研究机构 已经开发出了多种高效的音频编码算法,目前流行的感知音频编码器在十几比一 的压缩比下,仍然能提供近c d 的“透明”音质。然而,这并不意味着音频编码 技术的发展近乎完美,由于各种编码方法最初应用定位的不同,也决定了各自的 发展方向,随着网络多媒体的出现和发展,人们对音频的需求种类不断增多,获 取方式也呈多样化,这就造成了音频编码出现了技术上的“盲区”如何提供 实时的、高质量的音频服务。第一个需要解决的就是如何降低编解码算法延迟的 问题。语音编码算法在低延迟方面虽然有优势,但对于宽带的音频信号( 如音乐) , 根本无法保证音质。而另一方面,比如m p e g 音频标准,在研究低延迟音频编码 算法上也鲜有作为,尽管推出了m p e g - 4a a c l d t ”】,但基本上沿袭以往的技术 路线。因此,开发一种面向交互式的实时通信应用的低延迟高质量音频编码算法 必是大势所趋。 1 3 研究内容和主要成果 本课题的研究内容是对l d x 音频编解码算法进行原理分析,将其中的心理 声学模型、立体声耦合处理以及h u f f :m a n 编解码等模块进行深入剖析,实现自主 音频编码算法的定点源程序,对定点源程序进行c 语言优化,对算法的实现语句 进行进一步的精炼,取得一定优化效果之后将其移植到d s p 平台,并结合d m 6 4 2 芯片硬件和指令特点对程序做进一步的平台优化。以实现在t ms 3 2 0 d m 6 4 2 平台 上的实时编解码运行为目标。 研究的主要成果有: 1 实现了低延时高质量自主音频编解码算法的定点化源程序,其中使用了 库函数法,表格法,混合法等多种定点化方法。结合其中数据流特点进 行了合理的精度控制来维系精度与运算复杂度的平衡。 2 结合t ms 3 2 0 d m 6 4 2 芯片的特点,将低延时高质量自主音频编解码算法 的定点化源程序移植到d s p 平台上,使其能顺利进行编解码运算。 3 对代码的算法进行了一定程度的c 语言优化,并对其中一些计算复杂度 高的地方结合d m 6 4 2 硬件原理进行平台优化,使其运算速度得到了一定 程度的提升,最终实现了在t m $ 3 2 0 d m 6 4 2 平台的实时运行。 4 将以d s p 平台为载体的低延时编解码定点源程序和以p c 为载体的低延 时编解码浮点程序进行了综合对比测试,计算复杂度和存储复杂度上取 4 低延时宽带音频编码算法的研究和实现 得的优化效果令人满意,而且定点编解码输出和浮点编解码输出音质不 相伯仲。 1 4 论文的结构安排 本论文共分为五章,具体内容和结构安排如下: 第一章主要对音频编码技术的发展、意义及技术分类作了简单介绍,最后简 述了本论文的研究内容。 第二章介绍了l d x 低延时编解码算法的基本原理,以及其中的心理声学模 型,掩蔽曲线的计算和立体声耦合算法的实现。 第三章介绍了定点化的主要方法和l d x 编解码算法的定点化实现过程。 第四章介绍了t ms 3 2 0 d m 6 4 2 平台,主要描述对l d x 编解码算法的优化, 包括v c 平台下的c 语言优化和d s p 平台的优化。 第五章是评测定点化优化之后的程序编解码性能,包括主客观测试以及和浮 点程序的性能对比。 第六章是对论文工作的总结以及对项目前景的展望。 第二章低延时高质量音频编解码算法 第二章低延时高质量音频编解码算法 2 1 感知音频编码 音频编码或音频压缩算法是为了有效地存储或传输高质量的音频信号,其主 要目的是以尽量少的比特数来描述原始信号,且要尽可能地保证重构的信号不失 真。若要以最少的位数来做编码,可经由量化器移除一些不必要或不相关的信号 数据,以达到最少的位编码目的。借着人类听觉的感官模型,可使感知式音频编 码器更容易达到这个目的。 为了获得更高的压缩比,一种追求在主观感知意义上更接近的高质量、低码 率的音频编码技术越来越成为数字音频压缩技术的主导,因而设计重点从由精确 恢复原始信号波形转向充分利用人类的听觉感知特性,不仅要去除信号的固有冗 余,且要能有效去除感知冗余,这种方法称为感知音频编码( p a c :p e r c e p t u a l a u d i o c o d i n g ) 。 不同感知音频编码器在具体实现上可能略有差异,但其算法原理与过程基本 相同如图2 1 所示,大致分为时频分析、心理声学模型、比特分配、量化编码和 组帧几个部分。编码器用变换窗对输入的数字音频信号进行加窗分块处理,为了 消除边界噪声,相邻数据块之间往往相互重叠。时频分析( 滤波器组) 不仅提供 基本的分析综合系统,它是实现变换编码和子带编码的基础。而时频分析工具的 选择,主要取决于编码系统在时域分辨率和频域分辨率方面的权衡。 无损熵编码 组帧 图2 1 感知音频编码器的基本结构框图 编码器将一个短周期内的连续时间采样信号( 即数据块) 送入子带滤波器中, 滤波器组将信号分成多个限带信号,以近似人耳的l 临界频带( c r i t i c a lb a n d ) 响应。 各子带信号再经过时频变换,得到的频域参数被输入到量化编码模块。由于子带 滤波器和变换滤波器级联,所以通常称为混合滤波器组。 心理声学模型是感知编码器的核心,它利用了心理声学中的掩蔽现象,提出 6低延时宽带音频编码算法的研究和实现 了临界频带的概念。心理声学模型对一个数据块进行分析,以临界频带为单位分 析信号的掩蔽特性和掩蔽效果,模型输出掩蔽阈值曲线,以此为依据去除听觉不 相关成分,掩蔽阈值提供给比特分配模块来控制量化噪声的大小,决定比特分配 方案。比特分配模块依据心理声学模型提供的信息拟定比特分配方案,供量化编 码模块参考。 量化编码模块按照给定的比特分配方案进行比特分配,对频域参数进行量化 和编码,并将结果送给复合器进行比特流封装,在比特流中加入必要的边信息形 成最终的输出码流。量化编码模块一方面要考虑心理声学模型的分析结果,力求 去除听觉不相关成分并尽可能地将量化噪声控制在掩蔽阀值之下,同时还要考虑 编码比特率,因此,量化编码模块要在给定的编码比特率下力求获得最好的音质, 或在给定的音质要求下,力求最小的编码比特率。 感知音频解码器相对于编码器而言要简单,由于没有心理声学模型,所以计 算量也小得多,除此之外,解码过程基本上是编码过程的逆过程。解码时,编码 比特流经拆帧后,得到数据流和边信息,两者经熵解码,即得到频域参数,再经 时频反变换,形成重构的数字音频输出。感知音频解码器的基本结构框图如图2 2 所示: 图2 2 感知音频解码器的基本结构框图 感知音频编码器主要利用信号的统计特性和人类听觉的感知特性,一方面力 求去除信号的统计冗余,另一方面利用心理声学现象中的掩蔽效应,使用心理声 学模型,去除人耳不能感知的声音成分,同时也不一味追求最小的量化噪声,而 是力求使量化噪声不被人耳感知即可,这样,既实现了音频数据压缩的目的,又 不影响解码端重构音频信号的主观音质。由于子带编码和变换编码的优点,使得 两者在感知音频编码算法中均被广泛应用。 2 2 低延时高质量音频编解码算法 l d x 是一种低延迟的感知音频编码算法,主要面向实时、全双工和交互音频 及多媒体通信的应用,其特点是在低算法延迟下提供实时的高质量的音频服务。 l d x 音频编解码算法是在文献【1 4 】【15 1 中提出的一种全新的感知音频编码方法,其 中引入了许多感知编码的新概念。本文的工作就是在现有l d x 浮点代码的基础 上,对其进行整理完善之后开展定点化和优化的。 第二章低延时高质量音频编解码算法 为了降低编解码算法延迟,l d x 并未完全沿袭传统的感知音频编码的技术路 线,而是采用了相对较短的、长度固定的变换窗,从而大幅度地降低了算法延迟。 同时,为了在高压缩比下获得高质量的音频,l d x 对现有的心理声学模型算法、 立体声编码算法作了改进,运用了f f t 和m d c t 相结合的心理声学分析方法, 在降低了算法复杂度的同时提高了心理声学分析精确度:l d x 运用正方形极坐标 映射的声道耦合算法,相对于传统的i v l s 立体声编码算法,具有更高的编码效率; 针对变换的音频编码中预回声现象,l d x 提出了一种时域拆分频域合成的、 基于组合心理声学模型的预回声处理新算法,能有效地抑制预回声,从而保证了 音频质量。因此,l d x 具有以下性能特性:在相同编码比特率下,音质要远好于 i t u tg 7 2 2 1 e 和m p 3 ;算法延迟低,1 6 k h z 、3 2 k h z 和4 8 k h z 采样率下最小算 法延迟分别为1 6 m s 、8 m s 和5 3 3 m s ,能够满足交互式的实时通信;支持较大范围 的编码比特率和采样率:中等算法复杂度。 l d x 中的主要算法还是采用m d c t 技术,由于未使用子带滤波器组,编码 器能在不进行下采样的条件下,可将c d 高质量立体声信号压缩到低于4 8 k b s 比 特率,输出比特率支持变速率( v b r :v a r i a b l eb i tr a t e ) 和恒定速率( c b r :c o n s t a n t b i tr a t e ) ,范围为1 6 1 2 8 k b s c h ,输入音频信号支持:采样率8 1 9 2 k h z ;量化 分辨率1 6 2 4 b i t 样点。l d x 支持单声道、立体声、4 声道、5 1 声道,最高可支 持2 5 5 独立声道【1 6 】。l d x 编码流与g 7 2 2 1 c 相似,编码器仅仅接收输入的音频数 据块,并压缩成数据包,因此l d x 数据包可用于任何能够提供帧格式、同步、 定位及差错保护的一种传输机制。 2 2 1 低延时高质量音频编码基本原理 图2 3 给出了l d x 音频核心编码算法框架原理框图,跟其它感知音频编码算 法一样,l d x 是通过去除感知冗余和统计冗余来获得编码增益【1 7 1 1 8 】【1 9 】,因此, 时频分析模块与心理声学模型是l d x 音频编码器的核心。 听觉剩余信号 剩余信号 无失真编码 分析 音频包形成 图2 3l d x 音频编码器框图 8 低延时宽带音频编码算法的研究和实现 l d x 音频核心编码算法框架的编码过程为:原始p c m 音频信号在经过加窗 处理后分成两路,一路进行时频分析和心理声学分析。时频分析完成音频信号从 时域到频域的变换,从而得到信号的频域参数( 频谱) 。时频变换的主要目的是为 了将信号的能量集中于少数的几个频谱系数,便于量化和编码。另一路加窗后的 数据块f f t 后作心理声学分析,结合m d c t 频谱系数,计算掩蔽曲线。为了以 尽量少的比特,且又能较精确地表示掩蔽曲线,l d x 结合临界频带的概念,对全 局掩蔽门限通过线性分段逼近的方式获得掩蔽曲线( m a s k i n g t h r e s h o l d ) ,然后用 掩蔽曲线对m d c t 频谱进行白化处理,得到去除感知冗余之后的残差信号,由于 残信号的动态范围明显变小,从而可以减少量化误差或节省编码比特数。 对于多声道,采用声道耦合技术可以进一步降低冗余度。耦合主要是将左右 声道数据从直角坐标映射到正方极坐标,再将掩蔽门限和剩余信号进行无失真编 码( 如h u f f m a n 编码) ,以消除信源统计多余度,进一步压缩比特率。最后,将 l d x 编码比特流送入信道 2 2 2 低延时音频编码算法时频分析技术 分析合成技术广泛应用于语音和音频编码,分析合成系统的基本结构包括一 个分析滤波器组和一个合成滤波器组,分析滤波器将输入信号工( ,z ) 分为多个连续 的频带或多个通道信号一七) ,合成滤波器将多个通道的信号合成以得到原始输入 信号的重构。对于分析合成技术,有两种最基本的实现方式: 一种是用带通滤波器或低通滤波器结合调制器。这种方式在频域中很容易分 析信号重构的条件各通道分析合成滤波器的频率响应的叠加为一常数。基于 这个原则已经设计出了许多经典的滤波器组。 另一种实现方式是基于块的变换,原始的时域信号加窗后变换成为频域表示, 这种变换可以很好地在频域中解释信号的特性,常用的变换有d f t ( 离散傅里叶 变换) 、d c t ( 离散余弦变换) 和d s t ( 离散正弦变换) 。合成时,经反变换后的 时域序列与合成窗相乘,再与先前的部分数据叠接相加【2 】。 已经证明,以上两种方式存在对偶性,基于块变换的d c t 或d f t 与由多个 带通滤波器组成的滤波器组在功能上是等效的。由于基于块处理的编码方式是对 每一数据块单独量化编码,容易引起边界噪声,时域混叠抵消滤波器组在处理语 音和音频信号时有一个额外的优点:由于相邻块之间有5 0 的混叠,可以有效地 消除块效应。 在编码算法中,设计一个基于时域混叠抵消的滤波器组需要选择一种可行的 变换方式。有许多具有良好的频域分辨率的变换用于数字信号处理中,常见的有 d f t 、d c t 、h t ( h b a t t r a n s f o r m ) 、w i i t ( w a l s hh a d a m a r dt r a n s f o r m ) 。在实用 第二章低延时高质量音频编解码算法 9 中,d c t 是工程上性能最接近最佳变换的一种,并且独立于信源的统计特性。此 外,d c t 还可以采用快速算法,在使用快速算法的d c t 交换中加入时域混叠抵 消的作用,修改了变换对的变换基之后,得到m d c t 变换对如下: x ( k ) - - 2 篓荆刊c o s 陪。+ ) ( 后+ 拼一,舢一协t , 而) = 万2 忡j n 刍- i x 伍) c o s l - - 弩( n + ) ( 七+ 丢) ,蚪= o ,1 ,一- c :之, 其中是变换块长度,:掣是一个固定的时间偏移量,“玎) 为窗函 数,其长度等于变换块的长度,加窗的目的是为了降低边界效应对谱分析的影响, 同时提高频域分辨率。为了重构输入信号,窗函数须满足以下条件: “一1 一盯) = w ( n )( 2 3 ) 矿( n ) + w 2 ( 2 + 栉) = 1 ( 2 - 4 ) 即窗函数必须是偶对称,且平方的重叠相加为1 。 与d f t 相比,m d c t 只需作余弦变换,而d f t 需同时作余弦和正弦变换, 而且m d c t 应用了时域混叠抵消技术,可以避免d c t 造成的边界噪声。这些特 点使得m d c t 非常适合于变换的音频编码算法中。l d x 的时频分析算法选择 m d c t 还考虑到它与d f t 的联系与区别,由于在l d x 编码算法中,m d c t 谱系 数在时频转换的功能之外,还将用作心理声学分析,这是许多其它感知音频编码 算法所不具有的特点。 2 2 - 3 心理声学分析技术 人耳的听觉系统是一个相当复杂的生理系统,它一般只能感知频率在 2 0 - 2 0 k - i z 的声音。在这个频率段内的声音通过神经传输到大脑皮层,然后由大脑 将声音转化成不同的感知信号。l d x 算法及其它许多音频压缩算法都是基于人 耳的主观感知特性来编码。心理声学模型是包括l d x 和a a c 在内的所有感知音 频编码的核心,主要利用了音频三个特性来进行压缩编码:响度、频率和掩蔽效 应。 1 响度 声音的响度就是声音的强弱。当声音弱到人的耳朵刚刚可以听见时,称此时 的声音强度为“听阈”,当声音强到使人耳感到疼痛时,称此时的声音强度为“痛 阈”。不同的频率对人的耳朵来说具有不同的“听阈”和“痛闽”,研究表明,具 有不同频率不同声强的声音信号在人耳听起来可能具有相同的响度。其中人耳对 1 0 低延时宽带音频编码算法的研究和实现 2 4 k h z 范围的信号最为敏感,相比在低频区和高频区,能被人耳听到的信号幅 度要高得多 2 频率 正常人所能听到的频率范围约为2 0 h z 2 0 k h z ,强度范围约为5 1 3 0 d b 。人 耳所能听到的最低声压级称为绝对阈值( a b s o l u t e t h r e s h o l d ) ,与声音的频率有关, 是人耳对声音各频率分量所能听到的最小声压,也叫安静阈值( t h r e s h o l di n q u i e t ) 。声压级低于安静阈值的频率分量不能被人耳听到。 3 掩蔽效应 人耳对声音的感知并不是绝对的,还要受到所谓“掩蔽效应”的影响。当两 个声音同时或一前一后进入听觉系统时,强的声音( 掩蔽音,m a s k e r ) 能阻碍听 觉系统感知弱的声音( 被掩蔽音,m a s k e 圮) ,这种现象称为掩蔽效应。掩蔽现象 表明了人的听觉系统对频率和时间的分辨力的有限性。通过实验观察发现,掩蔽 效应可以分为频域掩蔽和时域掩蔽。 1 ) 频域掩蔽 通常将频域掩蔽分为两种情况:音调掩蔽噪声和噪声掩蔽音调。在前者中, 音调信号出现在临界频带中心,它对临界频带内的噪声进行掩蔽。第二种情况与 之相反,噪声信号掩蔽音调信号。从生理学可以这样解释:由于较强的音调或噪 声的存在使得在耳蜗的对应部位产生了很强的刺激,足以阻止同一个临界频带 内的较弱信号对该部位产生有效的激励作用。 当两个或多个频率不同的声音同时进入听觉系统时,也可能会发生频域掩蔽。 这是由于一个强纯音会掩蔽在其附近同时发生的弱纯音,例如一个声强为6 0 d b , 频率为1 0 0 h z 的纯音,另外还有一个2 0 d b ,8 0 0 h z 的纯音,在这种情况下我们的 耳朵就只能听见1 0 0 0 h z 的强音。从图中我们可以看出,两个声音的频率越是接 近,掩蔽效应越是明显,而且高频纯音对低频的掩蔽作用不如低频纯音对高频的 掩蔽作用明显。 第二章低延时高质量音频编解码算法 1 1 7 0 5 0 4 0 幻 o 轨0 2 仉5l51 02 0 频率( 1 d t z ) 图2 4 频域掩蔽效应 时域掩蔽 除了同时发出的声音之间有掩蔽现象之外,在时间上相邻的声音之间也有掩 蔽现象,称为时域掩蔽,也称为异时掩蔽。时域掩蔽又分为超前掩蔽( p r e m a s k i n g ) 和滞后掩蔽( p o s t - m a s k i n g ) 。被掩蔽声音作用于掩蔽声以前,即一个声音影响了时 间上先于它的声音的听觉能力,这称为超前掩蔽。当掩蔽声作用在前,被掩蔽作 用在后,即当一个声音已经结束,它对另一个声音在听觉上还产生影响,这称为 滞后掩蔽。产生时域掩蔽的主要原因是人的大脑处理信息需要花费一定的时间。 一般来说超前掩蔽很短,只有大约5 2 0m s ,而滞后掩蔽可以持续5 0 2 0 0m s 。 前掩蔽和听觉疲劳有些相似。在实际中,后掩蔽更为重要。当被掩蔽声在时间上 越接近于掩蔽声,阈值就越高。掩蔽声和被掩蔽声时间上相距很近时,后掩蔽作 用大于前掩蔽作用。 对音频信号进行掩蔽效应分析是心理声学模型的主要工作。由于音调掩蔽和 噪声掩蔽的掩蔽特性存在较大差异,因此,在心理声学分析过程中,如何对输入 的音频信号进行定性尤为重要,也就是该如何区分音频信号的音调( t o n a l ) 成分 和非单调( n o n - t o n a l ) 成分。掩蔽阈值的获得来自于对功率谱密度的估计,而 f f t 可以获得很好的频域分辨率,在m p e g 音频标准的两个心理声学模型中,其 心理声学分析都是基于对原始音频信号进行f f t 变换,根据f f t 系数并按照相应 的准则计算出掩蔽阈值。尽管m p e g 音频标准的两个心理声学模型在各个细节上 已经非常考究,但也有不足之处,如计算量大,心理声学模型用音调估计的预测 方法计算心理声学参数,即用音调预测f f t 变换后的幅值和相位来计算要求的信 噪比,从而确定每个阈值计算分区内信号的掩蔽阈值和一系列的信掩比。在该方 1 2 低延时宽带音频编码算法的研究和实现 法中,f f t 相位的分析将耗费大量的时间进行三角转换,直接影响音频编码器的 实时实现。一个更值得注意的问题就是:待量化的频域参数是原始音频信号经 m d c t 后得到的系数,而掩蔽阈值的结果来自对原始音频信号的f f t 分析,由于 m d c t 的某些特性,使得基于d f t 分析的心理声学模型的结果不总是适合对 m d c t 系数进行量化,针对这一事实,l d x 作了相应的改进,从而得到了一个新 的心理声学模型框架。 l d x 心理声学模型既利用了f f t 具有高的频域分辨率的特点,又考虑到 m d c t 与d f t 的差异,其算法原理如下: 1 、计算噪声掩蔽曲线。方法是根据m d c t 后输出频谱系数的对数值,按简 单线性回归分析得到相应的近似平滑曲线,再结合噪声频谱偏移量,得到最终的 噪声掩蔽曲线; 2 、计算音调掩蔽曲线。音频掩蔽曲线的计算是对f f t 后的各个频谱系数分 别计算掩蔽曲线,结合绝对阂值,得到总的音调掩蔽曲线: 3 、计算全局掩蔽曲线。取噪声掩蔽曲线和音调掩蔽曲线的较大者作为最终的 全局掩蔽曲线。 图2 5l d x 心理声学模型 2 2 4 低延时高质量音频编码低算法延时技术 对于一个通用音频编码器而言,其算法延迟主要与以下参数或因素有关: 音频帧的长度 滤波器组延迟 第二章低延时高质量音频编解码算法 窗型预判延迟 比特池引入的延迟 1 、组帧延迟 一个基于块处理的音频编码器,首先必须花一定的时间收集样点以构成一个 完整的数据块,这一过程引起的延迟称为组帧延迟( f r a m i n gd e l a y ) ,组帧延迟 与帧长成正比,如果以样点数为单位,组帧延迟可表示如下: 加m g = f r a m e s i z e ( 2 - 5 ) 其中,f r a m es i z e 为帧长,单位为样点数。 2 、滤波器组延迟 为了利用人耳听觉系统的掩蔽特性,以便更好地去除感知冗余,感知音频编 码算法中应用了分析合成滤波器组,时兴的有m d c t ,如m p e g - 2a a c 和 m p e g 4 ,由于其相邻窗有5 0 的重叠,解码重构音频输出时需叠接相加( o v e r l a p a d d ) ,因此,此类滤波器组会引入额外的延迟,其延迟与组帧延迟相等,可表示 如下: mmm = f r a m e s i z e ( 2 - 6 ) 3 、窗型预判延迟 众所周知,时兴的多数音频编解码器都应用了m d c t 滤波器组,可以在很低 的编码比特率下获得较高的频域分辨率。对于时域的平稳信号,选用长变换窗可 以获得较高的编码效率,而对于时域的瞬变信号,长变换窗将会出现“预回声” 现象,为了避免这种现象,可以选用短变换窗。根据时域信号的特点,动态地进 行窗切换( w m d o ws w i t c h i n g ) ,但由于可用窗型的限制,在作长短窗切换时,需 要引入一个过渡窗,因此,为了决定选择合适的窗型,需要进行预判,从而引入 了窗型预判延迟。窗型预判延迟可表示如下: 一。= f r a m u i z e 甓罴裂 陆, 其中,n u m s h o r t w i n d o w s 是覆盖一个长数据块( 一个长变换窗所能包含的数据) 所需的短窗数量,如在m p e g 2a a c 中,n u m s h o r t w i n d o w s 为8 。 4 、比特池延迟 因为并非所有的音频帧或数据块都需要进行等同的编码,因此,编码不同的 帧所需的比特数也有尽相同。为了满足恒定的编码比特率输出,比特池机制是一 种非常有效的措施。应用比特池相当于允许局部的编码比特率可变,因此,解码 器的输入缓冲区的容量必须自动调整大小以满足局部的最大编码比特率。解码器 在音频输出之前必须等待,直至能完全解码的数据全部被读取,因此,比特池容 1 4 低延时宽带音频编码算法的研究和实现 量越大,编解码器算法延迟越大,而实际中,因为比特池的容量一般都很大,所 以音频编解码的算法延迟很大一部分是因为比特池引入的。比特池引入的延迟可 表示如下: m = b i t i r e s _ _ s i z e c ( 2 8 ) o l i r ( 1 g 其中,b i t r e ss i z e 为比特池的容量,单位为比特数,b i t r a t e 为编码比特率,单位 为b i t s ,f 为采样速率,单位为h z 。 基于以上分析,音频编解码总的算法延迟可表示如下: k :生亘必必譬丝业坐k ( 秒) ( 2 - 9 ) ,5 在变换的感知音频编码算法中,编码效率和算法延迟存在着矛盾,即高的编 码效率对应较大的编解码算法延迟,而要降低编解码算法延迟,则会牺牲编码效 率,而且,在低编码比特率下将会导致音质严重下降,所以,如何解决和调和算 法延迟与音质之间的矛盾是设计低延迟音频编码算法的关健。首先,在算法延迟 方面,l d x 充分考虑了以上因素,并采取了相应策略采用相对较短的、长度 固定的变换窗,从而实现了低的算法延迟;而在编码效率和音质方面,l d x 在 传统的感知音频编码算法之上,对心理声学模型、立体声编码算法作了修改和改 进,同时应用了新的预回声处理技术,从而保证了编码效率和音质。下面着重分 析l d x 的算法延迟。 l d x 帧长和滤波器组延迟 音频帧长度是指一帧数据包含的时域样点数。l d x 共有三种长度的音频帧, 分别是1 2 8 、2 5 6 和5 1 2 ,而对应的变换窗长度分别为2 5 6 、5 1 2 和1 0 2 4 。结合 m d c t 的特性,分帧延迟和滤波器组的延迟可解释如下: 以帧长1 2 8 为例,在编码开始之前,编码器首先要接收第一帧的1 2 8 个时域 样点,这就是所谓的分帧延迟,其值为帧的长度,然后对接收到的第一帧1 2 8 个 时域样值作线性预测,得到1 2 8 个预测值,并置于原始样点之前,形成长度为2 5 6 的数据块,对该数据块作m d c t 。由于l d x 相邻块有5 0 的重叠,由m d c t 的 性质可知,为了恢复第一帧的1 2 8 个样点,需要结合其相邻的数据块,因此,编 码器还需接收第二帧的1 2 8 个样点,由此可知,l d x 的组帧延迟和滤波器组延迟 相等,均为帧长。 l d x 窗型预判延迟 l d x 提供了三种长度的变换窗,目的是为了适用于不同延迟的要求,通过选 用不同的编码模式,从而确定所选的变换窗,而在某一种编码模式之下,变换窗 的长度保持不变,因此不存在窗切换。 l d x 通过采用固定长度变换窗的方式,从而避免了窗型预判延迟。然而,采 第二章低延时高质量音频编解码算法 1 5 用固定长度的变换窗有其固有的缺陷,因为在变换编码中,对于类平稳的时域信 号,如果选用较长的变换窗,变换后可以得到较高的频域分辨率,从而可以获得 高的编码效率;而对于时域中含“突变”的信号,则应选用短变换窗以提高信号 的时域分辨率,并可以抑制预回声,此时若采用长变换窗,则会产生可闻的预回 声,由于预回声对音频质量影响很大,针对采用固定长度变换窗的缺点,l d x 提 出了一种基于组合心理声学模型的预回声处理技术,较好地解决了音质下降的问 题。 l d x 比特池延迟 比特池的作用主要是一定程度上实现编码比特的“按需分配”,从而实现音质 的“平滑”,在无延迟要求的应用中对音质的改善具有重要的意义,因此也只能用 于可变比特率( v b r :v a r i a b l eb i tr a t e ) 编码模式和平均比特率( a b r :a v e r a g e b i tr a t e ) 编码模式下,而这两种方式均不太适用于流式传输,相比而言,在交互 式的实时通信系统中,固定比特率( c b r :c o n s t a n t b i t r a t e ) 编码模式更具有实 际意义,基于此,l d x 摒弃了比特池技术,进一步降低了算法延迟。 综上所述,l d x 通过采用相对较短、长度固定的变换窗,同时摒弃了传统的 窗切换和比特池技术,实现了低延迟的编码算法;而在传统感知音频编码算法之 上,通过对心理声学模型的改进,可以实现更合理的比特分配;应用基于组合心 理声学模型的预回声处理技术,可以有效地解决因采用固定长度变换窗所带来的 音质下降问题;掩蔽曲线的引入、声道耦合技术的应用,所有这些技术都保证了 l d x 的编码效率和音质。 l d x 的编解码的算法延迟可表示如下: k :丝业t 单( 2 - 1 0 ) , 表3
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2027届高考语文散文阅读一轮复习(六):重要词句理解题-答题“5方法”
- 苏教版小学一年级语文下册第1单元第2课《升国旗》教案
- 卫生健康委员会年度工作述职报告
- 2026红十字初级急救员证考试题及答案
- 校长该如何听评课
- 线上安全教育会
- 如何讲好健康评估课件
- 户外广告投放执行计划
- 二类医疗器械经营质量管理制度及工作程序
- 文物保护工程从业资格实务操作试题(含评分标准)
- 配电室安全运行日常管控规范
- 宾利汽车车主专属服务体验设计
- 2026年高考广东卷物理高考真题(网络 收集版)(解析版)
- 交通法规学法减分题库及答案(2026年)
- 破碎机安全操作规程
- 2026年高考全国1卷语文高考真题含答案
- 重症医学科(ICU)脑出血术后护理指南
- T CPCIF 0239-2023 石油和化工企业开车前安全审查导则
- JJG 596-2026 安装式交流电能表检定规程
- 河北河北省事业单位2025年面向新疆巴州兵团二师生源高校毕业生招聘15人笔试历年参考题库附带答案详解
- 【解题模型】专题05受力分析 摩擦力突变-2026高考物理(解析版)
评论
0/150
提交评论