(计算机软件与理论专业论文)h264编码算法研究与汇编优化.pdf_第1页
(计算机软件与理论专业论文)h264编码算法研究与汇编优化.pdf_第2页
(计算机软件与理论专业论文)h264编码算法研究与汇编优化.pdf_第3页
(计算机软件与理论专业论文)h264编码算法研究与汇编优化.pdf_第4页
(计算机软件与理论专业论文)h264编码算法研究与汇编优化.pdf_第5页
已阅读5页,还剩64页未读, 继续免费阅读

(计算机软件与理论专业论文)h264编码算法研究与汇编优化.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要h 2 6 4 是由i t u tv c e g 和i s o i e cm p e g 联合推出的新一代国际视频编码标准,它采用的依然是基于块的运动补偿和变换的混合编码方案,但和其它视频编码标准相比,它采用了一种全新的近似d c t 变换技术整数变换技术以避免以前标准中使用d c t 变换所带来的反变换匹配误差,采用帧内预测编码以提高帧内及帧间编码效率,帧间采用灵活多变的不同块大小来准确描述物体的实际运动情况,且使用了高精度的分数像素运动估计与补偿以及多参考帧选择技术来增加预测的准确度,采用自适应滤波器以去除图像的边界效应,采用基于上下文的二进制编码技术以缩减编码所需的位数等等,这些新技术的综合运用使得h 2 6 4 编码器和以前的视频编码标准相比在同等重建图像质量下能够节约大约5 0 的码率,但h 2 6 4 编码器所使用的新技术也直接导致了其实现的高复杂性,作者通过对各种视频编码标准的仿真比较发现,h 2 6 4 虽然获得比其它标准更高的编解码质量,但编解码速度比其它视频标准慢,从而限制了其在实时领域里的应用,因此,如何以较低的实现复杂度获得较高的编码效率就成了h 2 6 4 视频编码技术走向实时应用的一个重要研究课题。为了达到实时的编码效果,必须寻找相应的快速实现算法来替代h 2 6 4 中那些复杂度极高的算法;同时为了进一步提高h 2 6 4 的编码速度,除了对算法进行优化以外,可以对编码器中反复使用的一些功能模块根据平台的特点进行指令级的优化,此外,还可以根据实际需要对整个h 2 6 4 编码器的程序结构和数据结构进行适当的优化,本文依据这一思路对h 2 6 4 编码器中所使用的部分关键算法进行了比较。把上述有关算法综合运用到h 2 6 4 编码器中,在参考软件j m 8 6框架下对程序与数据结构进行了适当优化,并对些关键模块如整像素运动估计中求残差的绝对误差和s a d ,分数像素运动估计中求残差的h a d a m a r d 变换及对变换后的残差矩阵求取绝对值和s a t d ,整数变换及其逆变换,亚像素内插等模块利用p c 机的多媒体指令系统进行指令级优化,取得了比较满意的加速效果。关键词:h 2 6 4 ,实时编码,视频编码标准,运动估计,指令优化a b s t r a c th 2 6 4i st h en e w e s ti n t e r n a t i o n a lv i d e oc o d i n gs t a n d a r dp r o p o s e db yt h ej o i n tv i d e ot e a mo fi t u tv c e ga n di s o i e cm p e g h 2 6 4a l s ou s e sh y b r i dv i d e oc o d i n gs c h e m eb a s e do nm o ti o nc o m p e n s a ti o na n dt r a n s f o r m i no r d e rt oa v o i dt h em a t c h i n ge r r o ri ni d c tc a u s e db yd c ti np r i o rv i d e os t a n d a r d s ,h 2 6 4u tili z e san e wa p p r o xi m a t ed c tt r a n s f o r m - - i n t e g e rt r a n s f o r m h 2 6 4u s e si n t r ap r e d i c t i o nt op r o m o t et h ei n t r ae n c o d i n ge f f i c i e n c y i ta d o p t sv a r i a b l eb l o c ks i z e s ,h i g he x a c tf r a c t i o n a lm o ti o ne s t i m a t i o na n dc o m p e n s a t i o na n dm u l t i r e f e r e n c ef r a m es e l e c t i o nt od e s c r i b ee x a c t l yt h ea c t u a lm o ti o nv e c t o ro fo b j e c t s i no r d e rt oe li m i n a t et h em a r g i n a le f f e c t ,h 2 6 4u s e sa d a p t i v ei n l o o pd e b l o c k i n gf il t e r h 2 6 4u s e sc a b a ct od e c r e a s et h eb i t sn e e d e df o re n c o din ga n ds oo n h 2 6 4c a nd e c r e a s ea b o u t5 0 p e r ce n to fb i tr a t e sw i t ht h es a m er e c o n s t r u c t e dp i c t u r eq u a l i t yc o m p a r i n gw i t hp r i o rs t a n d a r d sb yu s i n ga b o v ea d v a n c ei nv i d e oc o d i n gt e c h n o l o g y b u tt h eh i g he f f i c i e n c yl e a d st oh i g hc o m p l e x i t yo fi m p l e m e n t a t i o nd i r e c t l y t h ev a r i o u sv i d e oc o d i n gs t a n d a r ds i m u l a t i o nc o m p a r i s o ns h o wt h a th 2 6 4o b t a i nah i g h e rq u a li t yt h a na n yo t h e rv i d e oc o d i n gs t a n d a r d ,b u te n c o d es p e e ds l o w e rt h a no t h e rv i d e os t a n d a r d ,t h i sw i l ll i m i tt h ea p p l i c a t i o no fh 2 6 4i nr e a lti m ev i d e oc o d i n g s oi ti si m p o r t a n tt oi m p l e m e n tt h eu 2 6 4c o d e rw i t hl o wh a r d w a r ec o m p l e x i t ya n dh i g he n c o d i n ge f f i c i e n c y i no r d e rt oa c h i e v eh i g he n c o d i n ge f f i c i e n c y ,a 2 6 4u s e sag r e a td e a lo fe n c o d i n ga l g o r i t h m sw i t hh i g hc o m p l e x i t y t h e s ec o m p l e x i t ya l g o r i t h m sw i l ll i m i tt h ea p p l i c a t i o no fh 2 6 4i nr e a lt i m ev i d e oc o d i n g s ow em u s tf i n dc o r r e s p o n d i n gf a s ta l g o r i t h m sn it or e p l a c et h o s ew i t hh i g hc o m p l e x i t yi nh 2 6 4r e f e r e n c es o f t w a r e i nt h em e a nti m e ,i no r d e rt oa c c e le r a t eh 2 6 4e n c o d e r ,t h o s em o d u l e su s e dr e p e a t e d l yi nh 2 6 4s h o u l db eo p t i m i z e di nm u l t i m e d i ai n s t r u c t i o n m o r e o v e rt h es t r u c t u r eo fp r o g r a ma n dd a t af o rh 2 6 4e n c o d e rc a nb em o d i f i e da c c o r d i n gt ot h ea c t u a ln e e d s a c c o r d i n gt oa b o v ei d e a s ,t h i sd i s s e r t a t i o ng i v e sd e e pr e s e a r c ho ns o m ek e ya l g o r i t h m sa n dt h ei m p l e m e n t a t i o no fh 2 6 4e n c o d e ru n d e rt h er e f e r e n c es o f t w a r ej m 8 6i np cw i t hh i g hs p e e da n de f f i ci e n c y t h em a i nc r e a ti v ew o r k sa r ea sf o ll o w s t h ea b o v em e n t i o n e da l g o r i t h m sw e r ee m b e d d e di nt h eh 2 6 4r e f e r e n c es o f t w a r ej m 8 6a n dt h es t r u c t u r eo fp r o g r a ma n dd a t aa r ea l s oo p t i m i z e dp r o p e r l ya c c o r d i n gt oa c t u a ln e e d s s o m ek e ym o d u l e ss u c ha sc o m p u t i n gt h es u mo fa b s o l u t ed i f f e r e n c es a di ni n t e g e rp i x e lm o t i o ne s t i m a t i o n ,c o m p u t i n gt h eh a d a m a r d、t r a n s f o r mo fd i f f e r e n c em a t r i xa n dc o m p u t i n gt h es u mo fa b s o l u t ed i f f e r e n c es a t d ,i n t e g e rt r a n s f o r ma n di t si n v e r s et r a n s f o r m ,s u b p e li n t e r p o l a t i o nw e r eo p t i m i z e dw i t hm u l t i m e d i ai n s t r u c t i o n so fp c i ta c h i e v e ds a t i s f i e de f f e c t s k e yw o r d s :h 2 6 4 ,r e a lt i m ee n c o d i n g ,v i d e oc o d i n gs t a n d a r d ,m o t i o ne s t i m a t i o n ,i n s t r u c t i o no p t i m i z ei v湖南师范大学学位论文原创性声明本人郑重声明:所呈交的学位论文,是本人在导师的指导下,独立进行研究工作所取得的成果。除文中已经注明引用的内容外,本论文不含任何其他个人或集体已经发表或撰写过的作品成果。对本文的研究做出重要贡献的个人和集体,均已在文中以明确方式标明。本人完全意识到本声明的法律结果由本人承担。学位论文作者签名:峭孓自罗年占月妒日湖南师范大学学位论文版权使用授权书本学位论文作者完全了解学校有关保留、使用学位论文的规定,同意学校保留并向国家有关部门或机构送交论文的复印件和电子版,允许论文被查阅和借阅。本人授权湖南师范大学可以将本学位论文的全部或部分内容编入有关数据库进行检索,可以采用影印、缩印或扫描等复制手段保存和汇编本学位论文。本学位论文属于l ,保密口,在年解密后适用本授权书。2 、不保峦口。( 请在以上相应方框内打“)作者始中。肾导师签名:l 茄纨日期:纱猊车6 月妒日日期:知产易月r 日h 2 6 4 编码算法研究与汇编优化第一章绪论随着科学和技术的飞速发展,人类早已经步入了信息化时代,在信息化社会中人们对信息的需求与利用表现出了前所未有的渴望,相对于语言、文字等较抽象的信息表示形式而言,图形图像等视觉信息具有直观、生动、通用性强、易于理解和接受等诸多特点。事实上,视觉是人们获取信息的最为重要的途径,外部世界的信息大部分是通过视觉感知的,据统计,人们从外部获取的信息约有6 0 , - - - 7 5 来自视觉系统n m l 。因此,在信息化社会中必然要大力发展与视频信息密切相关的加工处理、传输等一系列先进的技术,以满足人们日益增长的对视觉信息的需求,而对视觉信息进行加工处理首先就涉及到如何对视频信号进行编码的问题,因此,视频编码技术一直是视频信号处理领域里的一个热点问题,高效率的视频编码技术将会给多媒体信息处理带来革命性的变化,也必将为满足人们对丰富多彩的视频信息的需求提供更加便利的条件,因此高效率的视频编码一直是人们孜孜以求的目标。源视频信号包含着巨大的信息量,以c i f ( c o m m o ni n t e r m e d i a t ef o r m a t ) 格式的视频信号为例,假如不经过任何压缩,以每秒3 0 帧的速度来进行传输的话,源视频信号的传送码率达到了7 0 m b p s ( 3 0 3 5 22 8 8 3 8 = 7 2 9 9 0 7 2 0 ) 。现有的许多宽带通信网络中,由于要传输多路信号,单路的信道带宽并不是固定不变的,尤其是要在p s t n ( 公用电话网) 和移动通信网等窄带通信网络中传输数字视频信号,必须对源视频信号进行大幅度的压缩,否则是不可能传输的。同样地,如果上述源视频信号不经过压缩就进行存储的话,那么一张容量为7 0 0 m b 的普通光盘能存储的节目仅为7 0 0 8 7 0 = 8 0 秒,可见,高效率的视频压缩编码技术对突破网络带宽限制和降低存储成本具有非常重要的意义。硕士学位论文1 1 视频编码技术的发展1 。1 。1 概述视频编码的一个主要冒的是在保证定重构图像质量的前提下以尽量少的比特数来表征视频信息。传统的压缩编码是以香农信息论为出发点的,采用统计概率模型来描述信源。编码实体是像素或像素块,以显示器件为图像视频系统的最后环节。这种基于数据统计的、以消除视频数据相关冗余为目的的第一代视频编码技术获得了巨大成功。j p e g ,m p e g 一1 ,m p e g - 2 ,m p e g - 4 ,h 2 6 1 ,h 2 6 3 以及h 2 6 4 等压缩编码国际标准的制定及其对多媒体产业的巨大影响就是有力的证明。这些国际标准主要采用了第一代视频编码技术,如熵编码、变换编码、预测编码以及运动补偿等。虽然表示图像和视频信息需要大量的数据,但这些数据往往是高度相关的,这些相关会引起信息冗余,因此可以通过去除冗余信息来实现对图像视频数据的压缩。静态图像压缩的主要目标是保证可接受的重建图像质量前提下,尽量去除图像本身存在的空间冗余信息。而视频信号的压缩是在去除空闻冗余的同时,还可通过去除时间冗余以达到较高的压缩比。除了时间和空间冗余外,在一般的图像视频数据中还存在着其它一些冗余信息乜】,主要有:信息熵冗余也称编码冗余,由信息论的有关原理可知,为表示图像数据的一个像素点,只要按其信息熵的大小分配相应的比特数即可。然而对于实际图像数据的每个像素,很难得到它的信息熵,在数字化幅图像时,对每个像素用相同的比特数表示必然存在冗余。信息熵冗余、空间冗余和时间冗余统称为统计冗余,因此它们都决定于图像数据的统计特性。h 2 6 4 编码算法研究与汇编优化结构冗余在某些图像的部分区域内存在着非常强的纹理结构,或是图像各部分之间存在某种关系,例如自相似性等,这些都是结构冗余的表现。知识冗余在有些图像中包含的信息与某些先验的基础知识有关,例如在头肩序列中,头、眼睛、鼻子和嘴巴的相对位置等信息就是一些常识。这种冗余就是知识冗余。视觉冗余大多数情况下,重建图像的最终接收者是人的眼睛。人类的视觉系统是世界上最好的图像处理系统,但它远远不是完美的,因此可以利用人类视觉系统的特点来取得较高的压缩比。人类的视觉系统对于图像的注意是非均匀的、非线性的,并不是对于图像中的任何变化都能感知的,例如图像系统的量化误差引起的图像变化在一定范围内是不能被人眼所察觉的。因此,如果编码方案能利用人类视觉系统的一些特点,是可以提高压缩比的。上述各种形式的冗余是压缩图像视频数据的出发点。图像与视频编码方法就是要尽可能的消除这些冗余信息,以降低表示图像与视频数据所需的数据量。综上所述,图像视频编码的目的就是在保证一定的重构图像质量前提下,以尽可能少的比特数来表征视频信息。按有无损失对图像编码进行分类,可以将其分为无损编码和有损编码。无损编码能够精确重建原始图像,而有损编码则会引入失真,只是要尽量做到使失真不明显。一个具体的压缩编码方法常常需要用多种特点来表征。表1 1 列出了各种不同图像编码方法的特点。硕士学位论文表1 1 图像视频编码方法的特点特点描述无损无失真准确恢复原始数据有损有失真对称编解码时间几乎相等非对称编码时间比解码时间长得多实时编解码时间延迟不应超过5 0 m s帧内独立完成帧编码帧间参考前( 后) 面的帧对当前帧进行编码,并考虑帧间时间冗余1 1 2 常用图像视频编码方法的分类常用的图像视频编码分类及实例如表1 2 所示。表1 2 图像视频编码方法的分类编码方法实例算术编码熵编码霍夫曼编码游程编码差分脉码调制离散余弦变换离散小波变换源编码傅立叶变换迭代函数系统运动补偿预测分形图像压缩h 2 6 1h 2 6 3混合编码j p e gm p e g 视频编码小波图像压缩4h 2 6 4 编码算法研究与汇编优化熵编码是基于信号统计特性的编码方法,它是一种无损编码,解码后能无失真的恢复原始图像。熵指的是具体数据的平均信息量,定义为在不丢失信息的前提下描述该信息所需的最小比特数。熵编码的基本原理是给出现概率较大的符号一个短码字,而给出现概率小的符号一个长码字,这样使得最终的平均码长很小。一个精心设计的熵编码器,其输出的平均码长接近信源的信息熵,即码长的下限。熵编码把已压缩的数据流看作简单的数字序列,而并不关心这些数据的具体语义。源编码常用于能够把原始数据中的相关数据与不相关数据区分开的场合。该方法要考虑原始数据的语义,通过消除不相关数据达到对原始数据流的压缩。与熵编码不同,源编码常常是有损编码。在有损压缩方法中,原始数据流与已编码数据流相似但不相同。混合编码是熵编码和源编码方法的组合,通常由源编码过程产生的输出数据流用作熵编码过程的输入数据流。长期以来,基于像素的方法一直是图像视频编码的主流方法,它从消除图像视频数据的相关冗余出发,以像素或像素块为编码实体,以显示器件为图像视频系统的最后环节,并没有充分考虑人眼的视觉特性对编码图像的影响。1 1 3 基本编码方法常用的熵编码有游程编码,霍夫曼编码与算术编码三类。当已被采样的图像视频数据拥有相同字节序列时,可以采用更紧密的序列来代替这些相同的字节序列,从而实现压缩,这就是游程编码。最常见的一种情况是当采样量化后出现大量零系数的情形,利用游程编码来表示连零码,从而降低为表示连零码所用的数据量。霍夫曼编码b 3 方法能对已知的数据给出最佳编码,即能够根据已知概率分布决定最小编码位数。因此,编码字符的位长度是变化的,最短的码字分配给出现最频繁的字符,而概率小的字符则分配较长的码字,从而提高编码效率。霍夫曼编码是一种变长变码方法,这里最佳硕士学位论文指的是对相同概率分布的信源来说,它的平均码长比其它任何一种有效编码方法都短。但是它必须知道信源的概率分布,这一般是无法做到的,通常是用对于大量数据进行统计后得到的近似分布来代替,但是不同的图像类型其系数分布总有所差异,这导致了实际应用时无法达到最佳性能。常常可以根据输入数据序列来自适应匹配信源概率分布,从而较好的改进霍夫曼编码的性能,但是这种方法运算复杂且不适合硬件实现。算术编码是2 0 世纪8 0 年代发展起来的一种熵编码方法。算术编码基本原理是任何一个数据序列均可表示成0 和l 之间的一个间隔,该间隔位置与输入数据概率分布相关。可以根据信源的统计特性来设计具体的编码器,也可以针对未知模型的信源设计能够自适应适配其概率分布的算术编码器,并且这两种形式的编码器均可硬件实现。上述三种熵编码方法均已被各种图像编码标准所采纳,常见的是以游程编码加霍夫曼编码或游程编码加算术编码的形式对源编码之后的图像系数实施进一步编码。应该强调指出的是熵编码方法是通过无损压缩来消除冗余信息以达到信息压缩。如果需要进一步压缩图像视频数据就必须考虑人的视觉缺陷。源编码方法把初始数据分为相关信息和不相关信息两种,然后陆续执行消除不相关数据的处理步骤,与熵编码不同,源编码允许失真。如何划分相关信息与不相关信息与具体的源编码方法有关。更重要的是,不同的源编码方法利用了人的视觉缺陷的各种特点。分离相关数据和不相关数据的一种方法是编码转换,把数据转换成更适用于分离目的的数学模型。变换编码是通过信号变换来消除图像数据空间相关性的一种有效方法。尽管图像变换本身不能对数据进行压缩,但由于变换后系数间相关性明显降低,图像大部分能量只集中到少数几个变换系数上,采用适当的量化和熵编码可以有效的压缩图像的数据。而且图像经过某些变换后,系数的空间分布和频率特性与人眼视觉特性能较好的匹配,h 2 6 4 编码算法研究与汇编优化因此可以利用人类视觉系统的生理和心理特点得到较好的编码系统,实际编码工作中,人们常采用离散余弦变换( d c t ) 。对变换后图像系数的编码一般采用门限编码加区域编码的形式且对不同区域采用不同的门限值。比如d c t 变换后幅值较大的系数大多数集中在图像的左上角,与其它系数相比,这些低频系数具有的能量较大,包括了图像的大部分内容,在变换图像中地位最重要,应使他们量化误差最小。变换系数中许多系数幅值较小,只具有原图像中很小比例的能量,对图像质量影响相对较小,因此一般采用设定阈值的方法,置小于阈值的变换系数为零,从而大大提高编码效率。经门限编码后的变换图像的大部分系数为零。在d c t 图像编码中对变换系数进行“之 形排序非常巧妙的解决了将连零系数有效组织起来的问题。预测编码可以在一幅图像内进行( i n t r a ) ,也可以在多幅图像间进行( i n t e r ) 。预测编码实际上是基于图像数据的空间和时间冗余特性,用相邻的已知像素( 或图像块) 来预测当前像素值,然后再对预测误差进行进一步的处理,这些相邻像素或图像块可以是来自同一行的也可以是来自前几行或前几帧的。1 2 视频质量评价体系视频压缩技术按是否可完全恢复到原始数据分为有损压缩和无损压缩。无损压缩可完全恢复原始视频,但压缩比低,对带宽和存储空间要求较高,因此在带宽和存储资源有限的环境下,一般采用有损压缩。但是,压缩比过高经常会导致视频质量差,在很多应用中,视频质量是一个关键指标,因此必须对视频的质量进行有效度量。视频质量评价从方法上可以分为主观质量评价和客观质量评价,主观质量评价是观察者对视频进行评定,因为视频的最终使用对象是人,所以主观评价是最可靠的方法。主观评价可对照某种绝对的尺度进行。表1 3 给出了一种对电视图像质量进行绝对评价的尺度,这里根据图像绝对质量进行判断打分。评价也可以通过将f7 g ,夕) 与y ( x , y ) 比较并按照某种相对尺度进行。如观7硕士学位论文察者将如,夕) 与仗y ) 逐个对照,则可得到相对质量分。例如用 - 3 ,一2 ,一l ,0 ,1 ,2 ,3 ) 来表示相应的主观评价( 很差,较差,稍差,相同,稍好,较好,很好 。表1 3 电视图像质量评价尺度评分评价说明l优秀图像质量非常好,如同人所能想象出的最好质量2良好图像质量高,观看舒服,有干扰但不影响观看3可用图像质量可接受,有干扰但不影响观看4刚可用图像质量荠。干扰有甚妨碍观看。观察者希望改讲5差图像质量很差,妨碍观看的干扰始终存在,几乎无法观看6不能用图像质量极差,不能使用主观评价需进行多次实验,费时费力,难以操作,一般可利用主观评价结果对客观质量评价模型进行校正。客观质量评价则利用数学模型测量视频质量,常用的方法是有峰值信噪比( p s n r ) 和均方误差( m s e ) ,它的优点是简单和方便计算,但是因为它们不加区别地对待视频的所有时空频率和亮度水平,所以结果经常和人眼视觉感觉不一致,近3 0 年来,人们一直在为寻找一种更好的方法而努力。近年来,评价视频质量的研究进入了一个崭新的阶段,出现了许多新方法和理论,其中有考虑人类视觉系统( h u m a nv i s u a ls y s t e mh v s ) 特性的方法,基于人眼基本视觉特性的视频质量评价模型也不断出现,但是h v s 非常复杂,对h v s 了解还不够深入,只能近似反映部分视觉特性,所以大多数基于h v s 算法都有较大的改进空间,w a n g n l 等提出了结构相似度( s t r u c t u r a ls i m i l a r i t y ,s s i m ) 的视频质量评价方法,方法简单且性能较好。根据失真视频与其相应的原始视频的比较程度,把视频质量客观评价方法分成三大类:全参考方法( f u l l 一r e f e r e n c e ) 、部分参考方法( r e d u c e d r e f e r e n c e ) 、无参考方法( n o n - r e f e r e n c e ) ,下面分别介绍其典型算法。h 2 6 4 编码算法研究与汇编优化1 2 1 全参考方法进行视频质量评价时可获得未失真的视频,通过原始视频和失真视频的对比得到视频质量,峰值信噪比( p s n r ) 和均方误差( m s e ) 就是全参考方法。w a n g 心3 等提出基于结构失真的全参考视频质量评价方法,基本思想是:人类视觉系统的主要功能是从视觉区域提取图像的结构性信息。该方法把原始图像和失真图像分为亮度、对比度和结构相似性三个部分,分别进行比较,然后把三部分比较结果综合考虑,具体如下:对于原始图像x x 。li = 1 ,2 ,n ) 和评价图像y y 。ii = l ,2 ,n 设l ( x ,y ) 为亮度比较函数,c ( x ,y ) 为对比度比较函数,s ( x ,y ) 为结构相似性比较函数。,1 ( x ,y ) = 黼c ( x ,y ) = 鞴s ( x ,y ) = ;o 丽。y + c 3 ( 1 1 )其中u x = ;= 专善t 和u ,= 歹= 专善只表示原始图像和评价图像的平均亮度,以= ( i 击芝( t 一为) i 和q = ( j 以一习) j 为原始图像xy 一注lv 一i = l和评价图像y 的标准差,= j ( 而- x k v ,一歹) 表示二者的协方差,c 。,c 2 ,c 。是为了避免分母为零而设的小常数,c 。= ( k l ) 2 ,c 2 = ( k 2 l ) 2 ,c 。= c 吃2 ,k 。,k 2 0 ,作用是分别对亮度、对比度和结构信息进行权值调整。先在8 x8 的局部窗口进行计算,然后在整幅图像中移动,整幅图像的质量评价用结构相似均值( m e a ns t r u c t u r a ls i m i l a r i t y ,m s s i m ) 来表示,m s s i m ( x ,y ) =z s s z m ( , , y j ) ,其中,x j 和y j 是第j个窗口的图像内容,m 是一幅图像中局部窗口的数量。硕士学位论文1 2 2 部分参考方法相对于全参考方法,部分参考方法只能从原始视频中提取若干特征信息,判断视频的失真程度,得到失真质量。最早提出部分参考方法的应该是w e b s t e r 晦1 ,通过从参考视频中提取出时空特征,把这些特征信息发送到接收端,以帮助对失真视频质量的评价,这里假定传输网络是准确无误的,实际上有可能丢失特征信息,影响质量评价,z h o uw a n g 随1 等提出了一种新的算法,不需要对特征信息进行网络传输,并提出了q u a li t y - a w a r ei m a g e 的概念。q u a l i t y - a w a r ei m a g e 的主要思想是从原始图像中提取特征信息,使用数字水印的技术将特征信息作为不可见的隐藏信息嵌入到此图像数据中,当此图像发生失真,用户可以从图像中提取特征信息以进行质量评价。q u a l i t y - a w a r ei m a g e 编、解码和质量评价系统的流程图如图l 所示。在提取特征信息的过程中,一方面为了提供有效的质量预测,r r质量评价系统希望知道尽量多的原始图像信息,这样,就必须嵌入大量的信息;另一方面,为了使隐藏信息看不见,且经过各种失真后,特征信息仍然存在,特征信息的量必须限制。最简单的方法是把原始图像的像素数和位置作为隐藏信息,但是信息量很大,所以必须考虑选择一种更为有效的视频特征。r 一“”“一气图1 1q u a l i t y - a w a r ei m a g e 编码、解码和质量分析系统1 0憨h 2 6 4 编码算法研究与汇编优化这里使用一种基于小波变换的自然图像的统计计算质量评价方法设p ( x ) 和q ( x ) 为二个图片相同子带的小波系数密度函数,x = x 1 一x 。) ,p ( x ) 和q ( x ) 的极大似然统计值( 1 0 9 - l i k e l i h o o d s ) 分别为:1 ( p ) = 专善l o g p ( x 一)l ( q ) = 专荟1 0 9 q ( x )( 1 3 )假设p ( x ) 为参考图像的系数密度分布,当n 值较大时,基于大数法则,p ( x ) 和q ( x ) 的k u l l b a c k - l e i b l e r 距离( k l d ) 为:l ( p ) 一l ( q ) - - * d ( pi q ) = f p ( x ) 1 0 9 9 p 了( x ) _ l 。( 1 4 )。g 工,用k l d 表示两个分布函数所包含信息的差异程度,可以利用k l d对图像进行比较、恢复,在视频压缩质量评价中也可以使用k l d 量化图像像素值分布。这里,我们使用k l d 来确定原始图像的小波系数分布p ( x ) 和失真图像的小波系数分布q ( x ) 的差异。嘲瞩嚼瞩囚:囚医:囚t a jo 扣,够萱日j图1 2 在应用可控锥形分解中的相同水平子带的小波系数直方图( 实线) 与高斯密度模型( 虚线) 计算比较( a ) 原始图像c o ) j p e g 2 0 0 0 压缩图像( c ) f l 高斯噪声污染的图像( d ) 高斯模糊图像为得到k l d 值,先要知道原始图像和失真图像的系数直方图,失真图像的系数直方图可以从收到的失真图像中计算得到,困难是要在接收端得到原始图像的系数直方图,如把原始图像的系数直方图作为隐藏信息,曲线步长小,曲线较光滑准确,但信息量大;步长小,曲线较粗糙,就使统计特征变差。图1 2 显示了在应用可控锥形分解中的一个小波子带的系数计算1 1硕士学位论文直方图,可以看出原始图像系数直方图( 实线) 与通用高斯密度模型( 虚线) 可以很好地匹配。所以我们可以使用二个参数的高斯密度模型很好地概括出原始图像的小波系数分布。高斯密度模型p i ( x ) = 2 a f 上( l 1 一f 1 ) e 一删7 d ,r ( 口) = f t 铲妒一f a r t ( a o )( 1 5 )公式1 5 提供一个非常有效的方法去模拟参考图像的系数直方图,而仅仅只需把二个参数( 筇) 作为隐藏信息传输到接收端,另外,还需要定义p 。( x ) 和p ( x ) 的k l d 值作为第三个参数,d ( p 1p ) =阮( 砷l o g 譬数。罗毒歹在接收端,我们希望计算原始图像和失真图像系数直方图的k l d值,但因为没有原始图像的系数直方图,我们用与其匹配的高斯密度模型p ( x ) 来代替d ( pllq ) = f p 。( z ) l o g 譬塾= d ( p ml iq ) - d ( p mlip ) ,d ( p ml q ) 已定义留弋x ,为参数,d ( p - lp ) 是原始图像和对应的高斯密度模型的k l d 值。总的失真值定义为。d = l 0 9 2 ( 1 + i d ( p i ig 聋) 1 ) ,其中k 是子带数,p t 和q k 分别为参考- v 0k = l图像和失真图像的第k 个子带的密度函数,d p l lg ) 是p k 和q k 之间的k l d 值,d o 是一个常数以控制失真值范围。1 。2 。3 无参考方法在很多实际的应用中,尤其是在网络视频通信领域,通常不能得到参考信息,这时候就只能选择无参考方法进行质量评价。因为没有参考信息,仅仅通过对失真视频空域和时域的处理分析来提取失真视频的特征,相比全参考方法和部分参考方法,无参考方法的实现难度更大。一种m p e g - 2 的无参考视频质量评价方法订1 被提出,主要利用从m p e g 视频流中量化范围参数来预测p s n r 。多年来人们的不断努力使得视频编码技术得到了很大的发展。作h 2 6 4 编码算法研究与汇编优化为对视频压缩的一些成熟方案的总结,人们通过实践检验,已形成了一系列标准且成为该领域的规范。国际标准化组织( i s o ) 和国际电信联盟标准化部( i t u t ) 为视频压缩领域相继颁布了一系列权威性的国际视频编码标准及建议,主要有m p e g 和m2 6 x 系列n 儿刭。1 3 视频编码标准简介1 3 1r p e g 系列标准m p e g - 1m p e g - 1 制定于1 9 9 2 年,为工业级标准而设计,它可针对s i f 标准分辨率( 对于n t s c 制为3 5 2 x 2 4 0 ;对于p a l 制为3 5 2 x 2 8 8 ) 的图像进行压缩,传输速率为1 5 m b i t s s e c ,每秒播放3 0 帧,具有c d ( 指激光唱盘) 音质,质量级别基本与v h s 相当。用于多媒体和v h s ( v i d e oh o m es y s t e m ) 质量级的广播电视,码率约为1 5 m b p s 的动态图像及其伴音的编码,目前流行的v c d 即采用此压缩标准。采用m p e g - - 1 标准可以把数字电视图像压缩到0 5 - - ,l b i t 像素。它可针对s i f 标准分辨率( 对于n t s c 制为3 5 2x2 4 0 ;p a l 制为3 5 22 8 8 ) 的图像进行压缩,传输速率为1 5 m b p s ,每秒播放3 0 帧,质量级别基本与v h s ( 广播级录像带) 相当。m p e g - 1 的编码速率最高可达4 - 5 m b p s ,但是解码后的图像质量有所下降。m p e g - 1 标准主要包括系统、视频编码、音频编码几个部分。m p e g - 1 采用运动补偿和二维o c t 变换,对量化后的d c t 系数进行变长编码,同时对每个数据块的直流分量d c 进行预测差分编码。m p e p l中的o c t 技术不仅用于帧内压缩,而且对于帧间预测误差也作了d c t变换,大大减少了空间域的冗余,达到了进一步压缩的目的。在m p e g - 1标准中,图像预测类型可以分为四种方式:帧内预测、前向帧间预测、双向帧间预测和直接预测。m p e g - i 与h 2 6 1 有很多相似之处,也采用混合编码框架,与h 2 6 1相比,有如下区别:1 不用环路滤波。1 3硬学位论文2 采用了半像素精度的运动矢量,运动矢量范围扩大到6 4 像素。3 提出了图像组( g o p :g r o u po fp i c t u r e ) 结构。每一个g o p 都以个i 帧开始,后跟一定数量的p 帧和b 帧,以实现视频的随机访问。4 。采用了王帧,p 帧,嚣帧三种帧类型,尤其提出了完善的b 帧理论。n p e g - 2m p e g - 2 的视频编码部分就是h 2 6 2 ,该标准面向常规数字电视、高清晰度数字电视、数字光盘和视频点播等应用,能在多种不同分辨率下提供速率范围为2 2 0 m b s 的视、音频编码方案。m p e g - 2 特别适用于广播级的数字电视的编码和传送,被认定为标准分辨率的数字电视和更高标准的高清晰度电视的编码标准,能够解决数字电视和高清晰度电视的隔行视频编码问题。m p e g - 2 作为一个得到广泛应翔的国际标准,主要在予提出了通用的压缩编码方法,定义了不同的“档次( p r o f i l e ) 和“级别 ( 1 e v e l ) ,可满足不同图像分辨率及相应的存储成本和处理速度的需要。“档次和“级别 的若干组合构成m p e g - 2 视频编码标准在某种特定应用下的子集:对某一输入格式的图像,采用特定集合的压缩编码工具,产生规定速率范围内的编码码流。m p e g - 2不是m p e g - 1 的简单升级,它在系统和传送方面作了更加详细的规定和进一步的完善。m p e g - 2 与m p e g - 1 相比主要区别如下:,1 。m p e g - 2 逐行编码的4 :2 :o 格式与m p e g - 1 相比,其色度采样点的位置水平移动0 5 个像素。2 m p e g - 2 支持4 :2 :0 格式的隔行编码。3 m p e g - 2 允许d c t 系数有其它的扫描格式( 如垂直交替扫描) ,并具有1 6 8 像素尺寸的块运动补偿。、4 m p e g - 2 定义了类( p r o f i l e ) 和级( 1 e v e l ) ,扩展了m p e g - 1 的受约束参数集概念,设计了更为广泛的特征子集和参数范围。5 。m p e g - 2 支持可分级性,如空间可分级性、时间可分级性和s n r可分级性。1 4h 2 6 4 编码算法研究与汇编优化6 允许更高的码率。m p e g - 4i s o 于1 9 9 8 年l o 月正式公布的一种具有交互性、通用可存取性以及高度可扩充性的视音频编码标准,可广泛应用于移动可视电话、基于内容的检索、交互式家庭购物、无线监视和监控等方面。与m p e g - i 、m p e g - 2 不同,m p e g - 4 不仅是针对一定比特率下的视频、音频编码,更加注重多媒体系统的交互性和灵活性。根据应用场合的不同,m p e g - 4采用分级编码:高码率范围为4 k b p s - - ,4 m b p s ,低码率范围为5 k b p s - - 一6 4 k b p s 。m p e g _ 4 标准的编码基于对象,便于操作和控制,并且具有很好的扩展性,可进行时域和空域的扩展。m p e g - 4 技术包含两个部分:音视频对象编码工具集和编码对象的句法语言。与传统编码标准最显著的不同是:接收者可以下载用于表示音视频信息的语法描述,并且具有很快被超大规模集成技术所支持的特性。总之,m p e g 标准从针对存储媒体的应用发展到适应传输媒体的应用,其核心视频编码的基本框架是和h 2 6 1 一致,其中引人注目的m p e g - 4 的基于对象的编码”部分由于尚有技术障碍,目前还难以普遍应用。因此,在此基础上发展起来的新的视频编码建议h 2 6 4 克服了前者的弱点,在混合编码的框架下引入了新的编码方式,提高了编码效率,在低码流下可达到优质图像质量。1 3 2h 2 6 x 系列冷h 2 6 1i t u t 公布的用于在综合业务数字网( i s d n ) 上以p 6 4 k b s( p = l 一3 0 ) 的速率开展视频会议和可视电话业务的视频压缩标准,是第一个成功用于实际的数字视频标准。p 值较低时,适用于较低品质的可视电话业务;p 值较高( p 6 ) 时,适于不同图像质量的视频会议业务。h 2 6 1 只对c i f 和q c i f 两种图像格式进行处理,每帧图像分成图像层、宏块组( c o b ) 层、宏块( m b ) 层、块( b l o c k ) 层来处理。h 2 6 1 详细制定了硕士学位论文视频编码的各个部分,包括运动补偿的帧间预测、d c t 变换、量化、熵编码,以及与固定速率的信道相匹配的速率控制等。h 2 6 1 要求输入图像的格式满足c i f 格式或是1 4 c i f ( q c i f ) 格式。h 2 6 1 标准将c i f 和q c i f 格式的数据结构划分为如下四个层次:图像层、块组层、宏块层和块层,图像层由图像头和块组数据组成,图像头包括一个2 0 比特的图像起始码和一些标志信息,如c i f q c i f 、帧数( 时间参数) 等。块组层由块组头( 1 6 比特块组起始码、块组编码号等)和宏块数据组成。宏块层由宏块头( 宏块地址、类型等) 和块数据组成。块层由变换系数和块结束符组成。夺h 2 6 31 9 9 6 年3 月,i t u - t 公布了甚低码率视频压缩的方案一h 2 6 3 建议( v i d e oc o d i n gf o rv e r yl o wb i t - r a t ec o m m u n i c a ti o n ) ,旨在利用p s t n 和移动通信网开展可

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论