已阅读5页,还剩66页未读, 继续免费阅读
(计算机应用技术专业论文)基于h264avc的率失真优化和码率控制算法研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
西南交通大学硕士研究生学位论文第1 页 摘要 视频压缩编码的主要目标就是在比特率受限条件下,尽量使编码失真最小。 为了取得最优化的压缩效率,确保编码数据在信道成功传输,并在接收端获得 最佳的视频质量,率失真优化和码率控制技术具有重要的地位。h 2 6 4 a v c 宏 块编码采用率失真优化策略,在多种编码模式中众里挑一,使得编码效率取得 了最优。然而,h 2 6 4 a v c 定义的宏块类型较多,各种精细预测技术的采用加 上率失真技术的自身特点导致计算复杂度成倍增长,编码时间大大增长。另外, 实验证明同一帧的宏块之间具有显著差异性,这类差异的宏块采用相同量化参 数编码显然不是最理想的。 本文实验统计多种q c i f 测试序列的编码结果,分析发现不论图像类型是 i 、p 还是b 帧,图像编码的宏块类型在空间域都具有极强的相关性。为更好地 分析宏块类型的相关性,本文分别引入方差度量i 帧宏块的空域复杂性,绝对 差分和( s a d ) 度量p b 帧宏块的时域活动性。然后根据宏块的活动性或复杂 性制定出宏块类型预测的准则。依照这些预测准则,本文提出基于宏块类型空 域预测的自适应宏块编码算法,并在h 2 6 4 a v c 验证模型j m 7 6 上实现了所提 出的自适应算法。大量的实验表明,本文提出的自适应算法不仅大大提高了图 像编码的速度,而且图像编码质量和压缩效率基本不受太大影响。从而缓解了 率失真优化算法的缺陷,极大提高了编码器的工作效率。 另外,为了进一步提高码率分配的合理性,根据p 帧宏块活动程度的显著 差异性,本文提出在宏块级采用自适应量化策略,对j m 7 6 码率控制算法做出 了改进。最终的实验结果表明,宏块的自适应量化改进了图像的编码质量,而 且使得输出的码率更加接近目标比特率。 关键词:率失真优化;宏块类型:码率控制;预测编码:h 2 6 4 a v c ;视频编 码 西南交通大学硕士研究生学位论文第1 t 页 a b s l :r a c t t h em a i no b j e c to fv i d e oc o d i n gj st om i n i m i z et h ed i s t o r t i o n s u b j e c tt o a c o n s t r a i n tb i tr a t e r a t e d i s t o r t i o na n a l y s i sa n dr a t ec o n t r o lp l a yak e yr o l ei nv i d e o c o d i n g a n dc o m m u n i c a t i o n s y s t e m sb yp r o v i d i n g t h er a t e - d i s t o r t i o n o p t i m i z e d c o m p r e s s i o np e r f o r m a n c e ,a s s u r i n gt h es u c c e s s f u ln e t w o r kt r a n s m i s s i o no ft h ec o d e d v i d e od a t a ,a n da c h i e v i n gt h eb e s tv i s u a l q u a l i t ya t t h e r e c e i v e r a m o n gv a r i o u s m a c r o b l o c kt y p e s ,h 2 6 4 a v co b t a i n st h eb e s tc o m p r e s s i o np e r f o r m a n c eb yt h e r a t e - d i s t o r t i o no p t i m i z a t i o n ( r d a l g o r i t h m ,h o w e v e ,d u et ot h ec h a r a c t e r i s t i co f r d oa l g o r i t h ma n dt h eu s eo fs o m er e f i n e dm o t i o n e s t i m a t i o nm e t h o d s t h e c o m p u t a t i o nc o m p l e x i t yi n c r e a s e sl i n e a r l yw i t ht h en u m b e ro fm a c r o b l o c k ( m b ) t y p e , a n dt h ev i d e o p r o c e s s i n g t i m ei n c r e a s e s g r e a t l y i na d d i t i o n ,m ba c t i v i t y c h a r a c t e r i s t i ci s d i s t i n c t l y d i f f e r e n ta m o n gt h em b si nt h es a m ef r a m e t h es a m e q u a n t i z a t i o up a r a m e t e r i su s e df o ra l lt h em b s a p p a r e n t l yi ti sn o t p e r f e c t i nt h i st h e s i s ,f r o mt h ee x t e n s i v ee x p e r i m e n tr e s u l t so fv a r i o u so c i fv i d e ot e s t s e q u e n c e ,i ti sc l e a rt h a tt h es t r o n gc o r r e l a t i o no fm bt y p ee x i s t si ns p a t i a ld o m a i n n om a t t e ri n t r aif r a m eo ri n t i f f p bf l a m e i no r d e rt o a n a l y z et h em bt y p e r e l a t i o n s h i pb e t w e e nt h en e i g h b o rm b s ,m e a no fs q u a r e dd i f f e r e n c ea n ds u mo f a b s o l u t ed i f i f e f e n c e ( s a d ) a t ei n t r o d u c e dt om e a s u r et h ec o m p l e x i t yo fm bi ni f r a m eo rt h e a a i v i t y o fm bi np bf r a m e r e s p e c t i v e l y t h e nt h es t r i c tp r e d i c t i o nr o l e i ss e td o w n f i n a l l y , a na d a p t i v em b e n c o d i n ga l g o r i t h mi sp r o p o s e db a s e do um b t y p es p a t i a ld o m a i np r e d i c t i o n a n dt h ea l g o r i t h mi si m p l e m e n t e d o nh 。2 6 越n ct e s t m o d e lj m 7 。6 e x t e n s i v e e x p e r i m e n t a l r e s u l t ss h o wn o to n l yv i d e oc o d i n gt i m e d e c r e a s e sg r e a t l y , b u ta l s ov i d e oq u a l i t ya n dc o m p r e s s i o np e r f o r m a n c er e t a i nn o w o r s e a c c o r d i n g l y t h ed i s a d v a n t a g eo fr d oa l g o r i t h mi s l e s s e n e ds ot h a tt h e e n c o d e rw o r k e f f i c i e n c yi si m p r o v e de f f e c t i v e l y i na d d i t i o n ,d u et ot h ed i s t i n c td i f f e r e n c ea m o n gt h em b si nt h es a m ef r a m e ,i n o r d e rt o i m p r o v eb i ta l l o c a t i o n ,o n e m bl a y e r a d a p t i v e - q u a n t i z a t i o ns t r a t e g y i s p r o p o s e db a s e d o nj m 7 6r a t ec o n t r o la l g o f i t l u n t h ee x p e r i m e n t a lr e s u l t ss h o wt h e m o d i f i e da l g o r i t h mi m p r o v e st h ev i d e oq u a l i t ya n de n s u r e st h eo u t p u tb i ts t r e a m m o r ec l o s et ot a r g e tb i tr a t e k e yw o r d s :r a t ed i s t o r t i o no p t i m i z a t i o n ;m a c r o b l o c kt y p e ;r a t ec o n t r o l ;p r e d i c t c o d i n g ;h 2 6 4 1 a v c ;v i d e oc o d i n g 西南交通大学硕士研究生学位论文第1 页 1 1 引言 第1 章绪论 多媒体信息主要包括文字、声音、图像等内容,其中具有直观、形象、准 确、高效和应用广泛等特点的运动图像( 视频) 是最重要的组成部分。这是因 为视觉是人类获取信息最为重要的途径,外部世界丰富多彩的信息大部分是通 过视觉感知的。据统计,人类通过视觉获取的信息占全部获取信息的6 0 。 但与文本、语音相比,未经压缩的数字视频几乎没有什么实用价值。从传输角 度看:一路广播级的彩色数字电视,若按4 :4 :2 的分量编码视频格式,用 1 3 5 6 7 5 6 7 5m h z 频率采样。每像素( p i x e l ) 用8 位编码,数码率为2 1 6 m b p s ; 另外,一路高清晰度电视,数码率更高达1 3 2 7 m b p s 。3 。这样的数据量,以今天 的技术或在不久将来采用可接受价格的硬件而言,都是不现实的。 可喜的是近二十多年来,经过世界众多的专家共同合作和刻苦钻研,多媒 体数据压缩技术取得了巨大的发展。而且,数据压缩技术取褥的科研成果已经 越来越广泛地被应用于可视电话、视频会议、数码相机、数字化视频光盘( o v o ) 、 数字高清晰度电视( h d t v :h i 窑hd e f i n i t i o nt e l e v i s i o n ) 等领域。尤其在网络通 信技术高速发展的今天,对多媒体通信的需求越来越丰富。如此丰富的需求 为多媒体技术的发展提供了无穷的动力,同时从过去v c d 、v o d ( v i d e oo n d e m a n d ) 、电影、电视、电子游戏、卡拉o k 等领域中取得的成功,让全世界对 多媒体技术的发展更加憧憬。 1 2 视频编码技术发展历史和现状 1 2 1 图像压缩编码技术的发展历史 1 9 4 8 年,s h a n n o n 等人。1 联合发表了对电视信号进行脉冲编码调制( p c m : p u l s ec o d em o d u l a t i o n ) 的论文,这标志着数字图像压缩编码技术的开端。 1 9 5 2 ,贝尔实验室的c c c u r e r 取得了差分脉冲编码调制( d p c m ) 系统的 专利。i ,奠定了真正实用的预测编码系统的基础。 西南交通大学硕士研究生学位论文第2 页 1 9 6 8 年h c a n d r e w s 等人“1 基于大多数自然图像的高频分量相对幅度可能 较低,可完全舍弃或只用少数码字编码雨失真不大的认识提出了不对图像本 身编码,而对其二维离散傅立叶变换( 2 d d f l 0 ) 系数进行编码和传输。此后 相继出现了性能更佳的沃尔什一哈达玛( w a l s h - h a d a m a r d , ) 变换“i 、k - l ( k a r h u n e n l o e v e ) 变换、二维离散余弦变换( d c t ) 等“1 。其中1 9 7 4 年,n a i a m e d 等人提出的d c t 奠定了当前视频标准变换编码的基础。 1 9 6 9 年在美国召开的首届“图像编码会议”表明图像编码以独立的学科跻 身于学术界。接下来的时间里,对图像编码技术的研究进入了高峰,7 0 年代开 始了对帧间预测编码的研究;8 0 年代开始了对运动补偿( m c :m o t i o n c o m p e n s a t i o n ) 所用的运动估计( m e :m o t i o ne s t i m a t i o n ) 算法进行研究等等。 1 9 9 0 年正式通过了国际电话电报咨询委员会( c c l l r t 现并入国际电信联盟 i t u ) 1 9 8 8 年形成草案的删矗h 2 6 1 建议。珏2 6 1 建议是运动图像编码技术 4 0 年研究的结晶,标志着图像编码技术开始走入实用。随后出现的m p e g - 1 , m p e g 一2 ,h 2 6 3 ,m p e g 4 ,h 2 6 4 a v c 等视频标准都是在h 2 6 l 的基础上发展 和改进的。 1 2 2 视频压缩编码技术 视频除了在时域和空域上存在大量冗余外,还存在信息熵冗余( 也称编码 冗余) 、结构冗余、知识冗余和视觉冗余等。视频编码主要目的是在保证一定 重构质量的前提下,以尽可能少的比特数来表征视频信息。整个处理过程的核 心思想是去相关,即降低视频信息的冗余度,实现对视频的压缩。 视频压缩编码是以s h a n n o n 信息论为基础的。一般而言。信源编码的方法 按照压缩数据能否被准确恢复分为两大类:无损压缩和有损压缩。其中,无损 压缩虽可以无失真的恢复原始数据,但是压缩效率十分有限。在实际应用中通 常都是将二者结合使用,视频压缩编码也不例外。 视频压缩主要的编码方法有以下几种: 1 、预测编码 预测编码方法是较为实用且被广泛采用的一种压缩编码方法,其理论基础 主要是现代统计学和控制论。原理是从相邻像素之间的相关性特点考虑,不是 西南交通大学硕士研究生学位论文第3 页 对一个像素直接编码,而是用同一帧( 帧内预测编码) 或相邻帧( 帧间预测编 码) 中的像素值来进行预测,然后对预测残差进行量化、编码、传输。预测编 码实际是利用了视频信息的时空域冗余。预测编码一般分为线性预测和非线性 预测两种,其中线性预测编码即d p c m 。 2 、统计编码 数据压缩技术的理论基础是信息论。根据s h a n n o n 信息论的原理,数据压 缩的理论极限是信息熵,如果要求在编码过程中不丢失信息量,则要求保存信 息熵。这种信息保持的编码就是熵编码。它是建立在随机过程的统计特性基础 上的。图像编码中应用最广的有基于概率分布特性的哈夫曼编码( h u f f m a n c o d i n g ) 和算术编码,以及基于相关性的游程编码等三类。 3 、变换编码 变换编码通常是将空域相关的像素点映射到另一个矢量空间,使得图像的 能量集中在低频区域,表示图像中缓慢变化的内容,而图像的边缘、细节的纹 理等细节部分集中在变换域的高频区,然后对这些交换系数进行量化、编码处 理。k l 变换是均方误差下的最佳正交变换,但实现困难。当图像相邻像素间 的相关系数接近1 时,k - l 变换的基函数接近d c t 变换的基函数。而且d c t 存在快速算法“”1 ,易于硬件实现,因此被广泛应用于多种图像视频编码国际 标准中。 变换编码除了采用正交变换编码外,还有子带编码“”和小波编码“。子带 编码则是将图像分裂成几个不同频段的子带( s u b - b a n d ) ,对不同的子带设计不 同的编码参数,提高图像质量。小波变换编码充分的利用了小波分析在时域和 频域同时具有良好的局部化特征,与人眼视觉特性相符的多分辨率能力,分解 系数分布平稳,自然分级的金字塔式数据结构等优点,在视频压缩领域引起广 泛的关注。 上述预测编码、统计编码、变换编码的组合可形成混合编码。是目前m p e g 系列和h 2 6 x 系列视频标准的基础。这些编码方法都是依照视频图像固有的特 性进行压缩的。伴随着感知生理一心理学的发展,人们越来越清楚地认识到: 人的视觉感知特点和统计意义上的信息分布不一致。统计上需要更多的信息量 才能表征的特征,对视觉感觉可能并不重要。从感知角度而言,无需详细表征 西南交通大学硕士研究生学位论文第4 页 这部分特征,这时压缩技术的研究就突破了传统信息论的框架。 随着数学理论,如小波变换、分形几何理论、数学形态学等以及模式识别、 人工智能、生理心理学等学科的发展,高效的,新型的压缩编码方法相继产生, 如分形编码、基于模型的编码、基于对象的编码等“,本文不再详细赘述。 1 2 3 视频质量的评价 如何客观地度量视频编码失真,并且使客观度量结果和人的视觉感受一致, 是视频处理的一个重要问题。一般来说,视频质量评价方法分为主观评价和客 观评价两种。 1 ) 客观评价是用重建图像与原始图像的误差来衡量,常用的有均方误差 ( m s e :m e a n s q u a r ee r r o r ) 和峰值信噪比( p s n r :p e a ks i g n a l t on o i s er a t i o ) 。 m s e 定义为: 1m - i n - l rf m 踞t m n 一荟善扩( f ,) 八f ,j ) j ( 1 _ 1 ) 向铂7 、。 其中:、表示图像宽和高的像素点数;,f ,j 表示原始图像的像素值,厂伍 表示重建图像的像素值。 p s n r 定义为: p s n r = 1 0 x l o g l o 篙 ( 1 - 2 ) 可见二者是一一对应的,实际应用中,p s n r 比m s e 更经常被使用。 2 ) 主观评价方法是由评价者直接对一段视频进行观察,从感觉上去度量其 失真度,给出质量评价级别,对所有评价者给出的分数进行加权平均,所得结 果即为主观评价结果。这种评价结果必然符合人的视觉感受。但人的主观感受 不能用数学模型对其进行描述,无法直接用于视频压缩编码过程中的质量评价 与控制;另外,主观评价容易受到个体因素的影响,如年龄、性格、教育程度、 背景以及评价时的心情等。 西南交通大学硕士研究生学位论文第5 页 1 3 视频编码标准发展概况 目前,全球主要有i t u t ( i n t e r n a t i o n a l t e l e c o m m u n i c a t i o nu n i o n 。 t e l e c o m m u n i c a t i o ns t a n d a r d i z a t i o ns e c t 0 0 和i s o t t o c ( i n t e r n a t i o n a l o r g a n i z a t i o n f o rs t a n d a r d i z a t i o n i n t e r n a t i o n a le l e c t r o t e c h n i c a l c o m m i s s i o n ) 两个制定视频标准 的国际组织。另外,我国也在2 0 0 2 成立了音视频标准化组织,目前音视频国家 标准a v s 即将正式颁布。 自h 2 6 1 后,i t u t 相继发布了h 2 6 x 系列标准,而i s o i e c 则推出了 m p e g 一1 、2 、4 等标准。这些视频编码标准都是基于块的混合编码框架“”如图 1 - 1 所示,具有非常类似的结构。基于块的混合视频编码系统是将图像分割为 的像素块,然后每个块相对独立的进行编码处理。“混合”的意思是每个块 是联合运用运动补偿帧间预测和变换编码进行编码的。整个编码器利用帧间预 测编码消除图像序列中的时域冗余,利用变换编码消除频域冗余,然后量化变 换系数,熵编码,输出比特流。 图1 - 1 基于块的混合视频编码器 2 0 0 3 年r r u t 和i s 叩e c 联合推出的h 2 6 4 a v c 代表着当前视频编码技术 的最高水平。另外,l s o c 倡导的m p e g 7 ,m p e g 2 1 和我国的音视频国家 标准a v s 的视频部分尚未正式颁布。 众多的资料“”对这些标准进彳亍了详细的介绍,本文不作详述。 西南交通大学硕士研究生学位论文第6 页 1 4 论文研究的主要内容 自t h o m a s w i e g a n d 等人“6 1 提出编码模式选择的率失真优化技术,其优越的 性能远远超过了以前的绝对差分和( s a d :s u mo f a b s o l u t ed i f f e r e n c e ) 准则。 尤其h 2 6 “a v c 定义宏块类型的增多,在众多的编码模式中决定最佳编码模式, 率失真优化技术的压缩性能更为突出 1 7 1a 不过,率失真优化技术牺牲了计算复 杂度。宏块类型的增多和率失真技术的自身特点导致视频编码时间成倍增长“, 因此,减少计算复杂度,提高编码速度,改进率失真优化技术的宏块编码算法 成为了研究的热点。目前,众多文献从不同领域出发提出了不少改进的方法, 如b o j u nm e n g 等提出的帧内预测改进“,a n d yc h a n g 等提出的快速运动估计 方法“8 “2 。这些方法因为自身的局限性,虽能在减少视频编码时间上取得了一 定的成效,但仍无法改变率失真优化技术本身带来的缺陷,所以效果仍不够理 想。 本论文通过分析宏块类型的空域相关性,提出一种新颖的自适应宏块编码 算法。在h 2 6 4 a v c 验证模型j m 7 6 模拟,给出了该算法的仿真结果。 另外,基于同一基本单元的宏块活动显著差异性,本论文提出了宏块级的 自适应量化策略改进h 2 6 4 a v c 的码率控制算法;并给出了仿真结果。 1 5 论文结构 第一章绪论部分介绍图像压缩编码技术发展历史,视频压缩编码方法以及 视频编码国际标准的概况,论文研究的主要内容和论文结构。 第二章阐述h 2 6 4 a v c 的编解码工作框架,扼要介绍该标准的关键技术。 第三章剖析h 2 6 4 a v c 宏块编码的率失真优化算法,提出基于宏块类型空 域预测的宏块自适应编码算法,在h 2 6 4 a v c 测试模型j m 7 6 上实现该算法, 并给出实验结果。 第四章扼要介绍四种经典的码率控制算法,然后分析j m 7 6 码率控制算法, 从宏块活动程度的显著差异性,提出宏块级自适应量化策略,对j m 7 6 码率控 制算法进行改进:给出改迸算法与原有算法的实验结果对比。 最后是全文总结,并对下一步工作提出展望。 西南交通大学硕士研究生学位论文第7 页 第2 章h 2 6 4 a v 0 视频标准 2 1h 2 6 4 止w c 的产生及应用前景 1 9 9 6 年在初步完成h 2 6 3 的制定工作后,r r u t 确定了近期f n e a rt e r m ) 和 长期的( l o n gt c 肋) 两个工作目标。近期目标是进一步扩展和增加h 2 6 3 的特 色,增强低比特率编码能力,并产生了h 2 6 3 的增强版,即h 2 6 3 + ,h 2 6 3 + + 。 长期目标是制定一种新的视频编码标准,以更好的质薰、更高的压缩比支持视 频会议等低比特率应用,由此产生了h 2 6 l 草案。”。与此同时,i s o i e c 也在继 续进行m p e g 4 高级视频编码a v c ( a d v a n c e dv i d e oc o d i i l 曲的研究。 最近几年来,随着通信技术和电信市场的发展,基于口的、融合互联网与 电信网络的全新下一代网络( n g n ) 逐渐浮出,这为视频应用的发展创造优越 的条件。但是,进一步提高视频压缩编码效率,在同样带宽的信道中传输更多 路视频信号仍是一个亟待解决的技术难题,而且随着i n t e m e t 和移动通信的迅猛 发展,如何在i p 和无线环境下提高抗误码能力,保真压缩后视频信号的服务质 量( q o s ) ,成为视频通信发展的另一关键技术难题。 2 0 0 1 年,m p e g 对h 2 6 l 草案进行了评估并认识到h 2 6 l 潜在的优越性, 于是m p e g 和v c e g 组成了联合视频专家组( j v t :j o i n tv i d e ot e a m ) ,进一步 完善h 2 6 l 模型,共同发展新的视频编码国际标准。新标准于2 0 0 3 年3 月正式 颁布”“,官方名称分别为:r r u t r e c h 2 6 4 和i s o i e cm p e g 4 p a r t1 0 a v c ( 简 称为h 2 6 4 a v c ) 。 与以往视频标准相比,h 2 6 4 a v c 虽未做出重大改进,但在多编码模式、 编码参数自适应选择、上下文自适应熵编码、多参考帧的灵活选择、高精度预 测、去方块滤波以及抗误码能力等方面进行了精雕细刻,采取了一系列的切合 实际的技术措施,较好地实现了预定的两个主要目标:1 ) 相对于h 2 6 3 和 m p e g 4 ,视频压缩比提高一倍,或节约5 0 的码率,2 ) 对网络特别是口和无 线网络具有良好的抗误码能力。 r r u t 在发展和制定h 2 6 4 a v c 的前身h 2 6 l 时,主要是为甚低比特率编 码提供一种高性能的编码国际标准,但随着m p e g 的加入以及更多新技术的采 西南交通大学硕士研究生学位论文第8 页 纳,h 2 6 4 a v c 以其卓越的压缩性能在电视、h d t v 、卫星电视、存储媒体、 无线多媒体应用等方面显示出了巨大的应用潜力。 显然h 2 6 4 a v c 这个新世纪制定的面向高质量到低比特率,从有线到无线 各种应用的视频编码国际标准,有望成为新世纪最为成功的国际标准之一。 2 2h 2 6 4 a v c 的编解码框架 和以往的视频标准相同h 2 6 4 a v c 也是基于块匹配的混合编码框架:通 过帧内帧间预测和运动补偿来消除视频序列中的时空域冗余,经过变换编码消 除频域冗余,因此,基本的功能模块,例如预测、交换、量化、熵编码都没有 发生根本的变化。图2 - 1 是h 2 6 4 a v c 编码器结构,其中阴影部分为编码器内 嵌的解码器。 图2 - 1h 2 6 4 a v c 的编码器框图1 然而,h 2 6 4 a v c 为了在相同的编码框架下实现更高的视频压缩性能和更 广泛的适应性,在各个模块中都引入了更先进的新技术,使各功能模块的实现 细节发生了重要的改变,例如多方向的帧内预测、1 4 像素精度的运动估计、多 种块编码模式、多参考帧选择、去块效应环路滤波、自适应二进制算术编码等“”。 西南交通大学硕士研究生学位论文第9 页 2 3h 2 6 4 a v c 的关键技术 2 3 1v c l 与n a l 的分层设置 h 2 6 4 a v c 为了达到上述两个预定的主要目标及应用多变性,从功能上分 为两层:视频编码层( v c l :v i d e oc o d i n gl a y e r ) 和网络提取层( n a l :n e t w o r k a b s t r a c t i o nl a y e r ) ,如图2 - 2 所示。 数 -书vcl片,分割数据 据 控 制 丁 n a l i h 3 2 0im p 4 f fih 3 2 3 i p m p e g - 2 i 图2 - 2h 2 6 4 a v c 的v c l 和n a l 分层示意图“” v c l 主要负责对数字视频进行高效编解码,提供具有高质量、高压缩比、 健壮性、可分级等特性的视频编码码流。这一部分也是整个h 2 6 4 a v c 视频编 码标准的核心部分,同时也是本文研究的重点。但如同前面所提到的,编码视 频比特流对于不同的传输网络和传输协议并不是具有普遍的适应性。为此 h 2 6 4 a v c 在视频编码层的外部定义了n a l n a l 主要负责将v c l 产生的数据正确地、恰当地映射到不同的传输网络 中去。当v c l 产生的比特流将在某种特定网络中传输时,n a l 针对这种网络 及其传输协议的特性,对v c l 的编码码流进行适合该网络及其传输协议的封装。 这样h 2 6 撕w c 就可以在面向不同的传输网络时,灵活地提供不同的封装方式, 增强了网络的适应性。n a l 的提出不但使h 2 6 4 a v c 对目前现存的各种不同网 络有很强的网络友好性,而且使它对未来的网络同样具有很强的适应性。”“。 2 3 2 帧场编码的自适应选择 众所周知,每帧图像包含两场,一般帧中的邻近行空间相关性较强,场中 西南交通大学硕士研究生学位论文第1 0 页 的邻近行时间相关性较强,因此,帧编码可用于运动性较小或静止图像的编码, 而场编码用于运动性较大的图像编码。h 2 6 4 a v c 可以根据图像运动剧烈程度 自适应地选择编码方式,即图像自适应帧,场编码。如果一帧图像包含一些混合 区域,即有的区域是运动的,有的区域是相对静止或运动小的,则前一区域采 用场模式编码,后一区域采用帧模式编码。帧场编码的判决由同一帧的每一垂 直宏块对( 1 6 x 3 2 亮度区) 做出,这种编码称为宏块自适应帧,场编码“”。 2 3 3 帧内预测 帧内预测编码的基本原理是利用已解码重构的邻近块像素来实现对当前编 码块的预测,对预测块和实际块的残差进行变换,量化,熵编码。通常,视频 序列空间相邻像素之间具有强相关性,存在大量的空域冗余。特别是在变化平 缓的背景区域,如图2 3 所示,测试序列c l a i r e 第4 6 1 帧。 图2 - 3 0 c i f 序列c l a i r e 的第4 6 1 帧 显然在变化相对平缓的背景区域,由于相邻像素值相近,利用帧内预测可 以大大提高帧内编码的效率。在以往的编码标准中( 在h 2 6 3 + 中,帧内预测只 是可选的编码工具之一,而且当时采用的预测方法非常简单”1 ) ,帧内编码只是 直接对像素值进行变换、量化和熵编码,编码输出的比特数很多。考虑到消除 空间冗余,降低帧内编码的比特数,进一步提高压缩比,h 2 6 4 a v c 将帧内预 测作为必须的编码工具固定下来,并且进行了大量改进。 然而,图像的不同区域空间变化是不相同的。尤其是不同物体交接的边界 区域,通常是图像空间变化最复杂的地方,例如图2 3 中人的脸部区域。如果 在这类区域采用的帧内预测方式与背景区域相同,编码效果一定会更差。为了 提高帧内预测的质量,h 2 6 4 a v c 提供三种帧内预测方式。1 : 西南交通大学硕士研究生学位论文第1 1 页 1 ) 4 x 4 亮度块帧内预测 2 ) 1 6 1 6 亮度宏块帧内预测 3 ) 8 x 8 色度宏块帧内预测 并且为每一种预测方式提供多种预测模式。 一般,图像相对变化较大的区域,需要更细小的块分割和更多可选的预测 模式,以提供足够的预测精度,因此4 4 亮度块帧内预测采用9 种预测模式。 而1 6 1 6 亮度宏块帧内预测,更适合用在变化较平缓且面积较大的区域,预测 模式也相应有所减少,只有四种。另外,由于人类视觉系统( h v s :h u m a nv i s u a l s y s t e m ) 对色度变化的敏感性低于亮度,因此8 x 8 色度块帧内预测所需预测模 式少于4 x 4 亮度块帧内预测,共有四种模式。 2 3 2 14 4 亮度块帧内预测 图2 4 为4 x 4 亮度块帧内预测的像素及预测方向图。 ab cde fg h f 百可 e :l i 翌兰! i 心易 砀1i 。p 图2 44 x 4 亮度块帧内预测和预测方向不葸图 图2 - 4 ( a ) 中大写字母a q 表示相邻块已解码重构的像素( 当这些像素在 图像外部或编码次序上滞后于被预测像素时称为不可得) ,小写字母a _ p 表示被 预测的4 x 4 亮度块的1 6 个亮度像素。 由于预测模式2 为d c 预测,不包括在预测方向图中,所以图2 - 4 ( b ) 中 所示只是4 4 亮度块其余8 种预测模式的预测方向图。 九种预测模式分别为: q ,j k l m n o p 西南交通大学硕士研究生学位论文第1 2 页 模式0 : 模式1 : 模式2 : 模式3 : 模式4 : 模式5 : 模式6 : 模式7 : 模式8 : 垂直预测 水平预测 d c 预测,没有表明在图中 下左对角线预测,与模式0 成4 5 度角 下右对角线预测 垂直右斜线预测 水平下斜线预测 垂直左斜线预测 水平上斜线预测 与模式1 成4 5 度角 与模式0 成2 2 6 度角 与模式 与模式 与模式 成2 2 成2 2 成2 2 度角 度角 度角 需要特别说明韵是:上述各种预测模式的选择以相邻块的像素是否可得为 前提。不同预测模式下的像素a p 的预测值计算公式可参考文献 2 2 1 。 2 3 2 21 6 x1 6 亮度宏块帧内预测 1 6 1 6 亮度宏块帧内预测共有4 种预测模式,模式o :垂直预测;模式l : 水平预测;模式2 :d c 预测;模式3 :平面预测( v l 孤0 ,采用一个线性平面函 数,这在亮度变化平缓的区域预测效果非常好。如图2 5 所示,其中a ,b 分别 表示相邻宏块已解码重建的像素。 模式0 ( 垂直)模式1 ( 水平) 模式2 ( d c )模式3 ( p l a n e ) 励虐橱翰 图2 - 51 6 1 6 亮度宏块帧内预测模式示意图 各种预测模式下的像素a - p 的预测值计算公式可参考文献【2 2 】。 2 3 2 38 8 色度块帧内预测 与1 6 1 6 亮度宏块帧内预测的预测模式相比,除了d c 预测有点细微区别 西南交通大学硕士研究生学位论文第1 3 页 外,其他预测模式十分类似。预测模式分为模式0 :d c 预测,模式1 :水平预 测,模式2 :垂直预测,模式3 :平面预测。 色度宏块包含u 、v 两个色度分量宏块。在进行8 8 色度宏块帧内预测时, 对两者采用相同的预测模式。预测值计算公式参考文献【2 2 】。 2 3 4 先进的帧间预测技术 2 3 4 1 多种块模式的帧间预测 与以往的视频编码标准类似,h 2 6 4 a v c 的帧闻预测也是基于块的运动补 偿预测。过去的标准中只定义了两种块的大小,分别为1 6 x1 6 和8 x 8 的正方 形块( 8 8 的块是在h 2 6 3 和m p e g 4 中定义的) 。但是由于视频图像的复杂 性,在较大的块中可能包含多个具有不同运动状态和不同形状的对象。特别是 在运动剧烈的局部区域中,用一个宏块或4 个( 8 ) 运动矢量并不能准确地 描述一个宏块全部的运动细节。 因此,为了更为准确地描述宏块的运动细节,h 2 6 4 a v c 定义了7 种不同 尺寸和形状的宏块划分“,如图2 - 6 所示,一个1 6 1 6 亮度块可以按以下四种 方式划分:1 6 1 6 ,1 6 8 ,8 1 6 ,8 x 8 ;一个8 8 的图像块可以分为:8 8 , 8 4 ,4 8 ,4 4 。 1 6 1 61 6 x 88 x 1 68 x 8 图2 - 6 帧间预测的宏块划分模式 这种将宏块分割成多种块大小的运动补偿予块的方法称作树结构运动补 偿。这种多模式的灵活和细致的划分,可以更好的实现运动隔离,大大提高运 动估计的精确程度。 西南交通大学硕士研究生学位论文第1 4 页 在这种方式下,每个宏块中可以包含1 、2 、4 、8 或1 6 个运动向量。对于 每个分割或予分割都需要一个独立的运动向量,每个运动向量必须被编码和传 输,同时宏块类型也要编码传输。选择一个大的分割尺寸意味着需要少量的比 特来表示运动信息,但是预测的粗糙使得残差值较大。选择小的块模式,运动 估计更准确,残差值更小,但是需要要更多的比特来表示运动信息。因此宏块 类型的选择对于编码压缩性能县有重要的影响。总的来说,较大尺寸的块模式 适宜于运动程度低的区域,而精细的分割适宜于细节丰富的区域。 对于宏块中每个色度分量( u ,v ) 采用亮度分量的一半采样精度。每个色 度块分割方式与亮度块相同。只是水平和垂直的大小各一半。 2 3 4 21 4 像素精度运动估计 运动估计是利用视频图像的时域相关性产生运动矢量,尽可能准确地描述 对象( 块或宏块) 的时域运动。因此运动矢量的精度越高,运动估计的残差越 小,这样在降低码率的同时又能提高重建视频质量。 口口因圈图日口 口口固回回口口 固 回 圈 固 圈 回 田 回 园 田 团 回 口口园圃固口口 口口囤圃回口口 图2 7 亮度信号1 ,2 像素和l 4 像素示意图。 从h 2 6 1 到m p e g 4 ,运动矢量的精度也从整像素提高到了1 4 像素。 h 2 6 4 a v c 采用运动估计精度为1 4 像素,并详细定义了相应分数像素的插值 实现算法。如图2 7 所示,其中灰色块位置为亮度整像素位置( 如a ,b 。c , d ,e ,f ,g ,h 等) ,两个整像素位置之间是1 2 像素位置( 图中的a a ,b b , 西南交通大学硕士研究生学位论文第1 5 页 c c ,d d ,e e ,f f 等) ,而图中a ,c ,d ,e ,f , g 等表示1 4 像素位置。 1 2 分数像素由相邻的整像素利用6 抽头滤波器( 1 3 2 ,5 3 2 ,5 8 ,5 8 , 5 3 2 ,1 3 2 ) 获得。1 4 像素由相邻的分数或整数像素线性插值产生。详细的计 算方法和色度小数像素相关内容可以参阅文献 z 2 1 。 2 2 4 3 多参考帧预测 与过去标准中的单参考帧不同,h 2 6 4 a v c 支持多参考帧预测。通过在多 个参考帧中进行运动估计,寻找出当前编码块( 或宏块) 的最佳匹配。在一些 特定的情况下,如快速的周期运动、快速的场景相互切换、物体存在遮蔽现象 等,多参考帧的使用会有非常好的效果“。 2 2 - 54 4 整数变换和量化 以往标准中,广泛使用的8 x 8 d c t 变换,是浮点运算,因此在变换和反变 换之间存在误差偏移。而在帧间预测时,这种由变换引起的误差将不断的积累、 放大。当误差积累到一定程度,必将引起编码质量的迅速下降,通常需采用强 制帧内更新来解决这个问题。 在h 2 6 4 a v c 中,不但采用帧间预测编码,而且帧内编码也使用了预测技 术,因此h 2 6 4 a v c 对预测残差变换前后的误差更加敏感。变换带来的误差将 会由帧内预测带给l 帧其他宏块,从而为后续的p 帧带来更大的误差。此外,8 8 的块变换,降低了相邻块之间的相关性,容易产生令人讨厌的块效应。因此, h 2 6 4 a v c 中使用了4 4 的整数变换。这样变换和反交换都是整数运算,避免 了浮点操作带来的四舍五入误差,使得变换与反变换准确匹配。此外,采用小 尺寸的块有助于降低块效应和明显的人工处理痕迹,而且整数运算能减少运算 量和运算复杂度。 h 。2 6 4 a v c 采用的变换公式: a 2 a :i 2 口目2 b 2 4 a 2 a f t 2 4 曰2 b 2 4 a 2 口2 a j 2b z 4 a 2 口2 4 “2 b 2 4 ( 2 1 ) ,也以 ,以o 2,d 也 n眩u 置 = _ 叫叫叫 d 4 2 ,以也 n陀n一 i 謇y 西南交通大学硕士研究生学位论文第1 6 页 其中,a = 1 2 ,b = 1 层,“o ”表示皿捌7 矩阵中每一个元素与矩阵e 对应位置 - 的元素相乘。这样,在h x h r 的变换部分,只有系数1 和2 ,在大多数硬件平台 上只有加法和和移位操作,避免了计算开销大的乘操作。而“ e ”部分可以移 入量化阶段的常系数矩阵q p q p _ r e m i l 【 ,通过查表执行。这样就获得了一种高 性能的且计算简单的4 x 4 整数变换。 h 2 6 钔w c 定义了3 种不同的变换操作类型。“。 1 ) 4 4 残差值 变换公式:记残差值为爿,变换系数为口,则b = 皿 f 。,其中变换矩阵: 一 11
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 国外老年人使用手机情况调查研究报告
- 地下工程施工智能化方案
- 数据中心光纤网络架构优化分析方案
- 2026化妆品物流行业市场发展分析及前景趋势与投融资发展机会研究报告
- 2026中药行业的市场发展现状评估咨询规划报告
- 策略分析师工作绩效评价表
- 采购经理采购流程优化绩效考评表
- 2025年江苏省泰兴市高二生物上册期末考试真题及答案【名师系列】
- 酒店服务人员顾客反馈与服务质量KPI考核表
- 地块转让协议(商业住宅用)4篇
- 07SD101-8电力电缆井图集
- 2026-2027学年人教版七年级上册数学第一次月考全真模拟卷(含答案)
- 2026 年教师师德师风建设专题学习课件
- 注册消防工程师继续教育2025年部分题目与答案(126题)
- 九年级语文早读材料 素材
- 文库发布:如皋介绍
- 曲臂登高车安全培训课件
- 地下检查井隐蔽工程验收标准
- 急性心肌梗死PCI术后早期运动康复方案
- GB/T 45898.1-2025医用气体管道系统终端第1部分:用于压缩医用气体和真空的终端
- 伤口造口专科发展
评论
0/150
提交评论