数字视频原理 课件 第8章 视频压缩标准_第1页
数字视频原理 课件 第8章 视频压缩标准_第2页
数字视频原理 课件 第8章 视频压缩标准_第3页
数字视频原理 课件 第8章 视频压缩标准_第4页
数字视频原理 课件 第8章 视频压缩标准_第5页
已阅读5页,还剩106页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1数字视频原理PrinciplesofDigitalVideo授课教师第8章视频压缩标准28.1视频压缩编解码标准概述视频压缩标准在视音频系统中所处的位置3不同场景对视频编码器有不同的需求:VOD(VideoonDemand):反复观看,压缩一次,观看千万次甚至上亿次的内容来说,追求极致的压缩比,不在乎编码时间。RTC(Real-timeCommunications)

:编码延迟直接会影响双方沟通的效果,延迟是必须要考虑的一个因素。360全景:4K、8K分辨率的支持转码:直播需要保证实时的编码帧率,而离线则没有此约束。……实际的压缩效率取决于:视频内容编码器的选择编码器的设置48.2JPEG图像压缩编解码标准--8.2.1JPEG标准介绍JPEG(JointPhotographicExpertsGroup,联合图片专家组)是第一个广泛应用的数字图像压缩国际标准,由WG1委员会1986年制定、1992年获批,全称“连续色调静态图像的数字压缩和编码”,又称JPEG1,简称JPEG,专注连续色调静止图像编解码另有针对数字文档和数字扫描领域中的二值静止图像编码标准JBIG(JointBi-levelImageCodingExpertsGroup)JPEG1高效,除静态图像压缩,还常用于视频帧内压缩,“MotionJPEG”曾是数字视频传输、存储和编辑的事实“标准”JPEG规定了4种运行模式基于DPCM的无损(Lossless)编码模式基于DCT的有损顺序(Baseline)编码模式基于DCT的累进(Progressive)编码模式基于DCT的分级(Hierarchical)编码模式51)基于DPCM的无损(Lossless)编码模式

JPEG无损压缩原理框图编码像素和参考像素的位置关系模式预测0无预测1Px=Ra2Px=Rb3Px=Rc4Px=Ra+Rb-Rc5Px=Ra+(Rb-Rc)/26Px=Rb+(Ra-Rc)/27Px=(Ra+Rb)/2预测样值和参考样值的预测关系压缩比较低,一般可达2:11998年,WG1制定了新的无损压缩标准JPEG-LS,替代JPEG1中的无损编码模式,JPEGLS特别适合实现复杂度非常低或适中的硬件,同时提供最先进的图像无损压缩性能。62)基本(Baseline)编码模式提供了多分辨率或图像质量的分层编码能力,使得解码器可以根据需要选择解码全部或部分层次的数据,从而实现不同分辨率或质量的图像重建,适合图像数据库的浏览或多媒体应用中的场景切换。3)累进(Progressive)编码模式

基于DCT,允许图像按分辨率从模糊到清晰逐步加载,适合网络传输或资源受限的环境。顺序编码模式累进编码模式从左到右、从上到下扫描,一次扫描完成编码同顺序扫描,多次扫描完成编码72)级(Hierarchical)编码模式提供了多分辨率或图像质量的分层编码能力,使得解码器可以根据需要选择解码全部或部分层次的数据,从而实现不同分辨率或质量的图像重建,适合图像数据库的浏览或多媒体应用中的场景切换。多种空间分辨率的金字塔结构8在DCT系数的量化过程中,所必需的量化表和Huffman编码参数表应当依据待编码图像的具体特性而有所差异。因此,JPEG1标准并没有定义默认的相关数据表,但标准附录中确实提供了作为参考的量化表和霍夫曼编码的示例表,这些表都是经过大量图像实验得到,可以适用于大多数场景,但并不意味着适用于所有特定场合。实际应用中,众多JPEG1编解码程序简单直接地使用了标准附录中提供的示例表,而非根据图像的具体情况进行定制。已知信源及其概率分布时,Huffman编码最优,但信源统计特性常难精确预知或会随时间变化。对此有两种解决策略:一是周期性信源统计法,编码器周期估计信源特性构造优化Huffman编码并传码字给解码器,该法用于JPEG标准,码字在文件头传送;二是自适应Huffman编码法,编码器和解码器周期估计已编码信源输出特性构造相同编码,虽避免了传输码字开销,但估计效果不很理想,导致编码效率有所降低。9标准名称状态(最新版)标准号

目标JPEG1已发布(1994)ISO/IEC10918连续色调静止图像压缩编码JPEG2000已发布(2019)ISO/IEC15444比JPEG1更快、质量更高,消除块效应JPEGLS已发布(1998)ISO/IEC14495连续色调静止图像进行有效无损和近乎无损压缩JPEGXL已发布(2022)ISO/IEC18181满足Web上的图像交付和专业摄影的需求JPEGXR已发布(2019)ISO/IEC29199适用于各种应用的压缩格式规范,同时保持编解码器的实现简单,支持HDRJPEGXS已发布(2022)ISO/IEC21122支持系统提供更高的分辨率、帧率,并保持视觉无损的质量,应用于以前无压缩图像传输的应用JPEGXT已发布(2024)ISO/IEC18477扩展并完全向后兼容JPEG1,具有更高的位深、高动态范围成像、无损压缩和Alpha通道的表示。JPEGAI开发中(2024)ISO/IECCD6048基于学习的图像编码标准。在同等主观质量下,压缩效率比常用的图像编码标准有显著提高全部的JPEG系列图像压缩标准RGB->YUVLeveloffset8x8DCTDPCMInputImage4:4:44:2:24:2:0VLCZigzagscanRLEVLCDCHuffmanTableACHuffmanTable压缩码流压缩码流基本

(baseline)JPEG编码器UniformScalarQuantizatioQuantizationTableY通道亮度、色度各一个色度亮度DC通路AC通路下一页统一标量量化8.2JPEG图像压缩编解码标准--8.2.2JPEG1基本编码模式AmathematicalanalysisoftheDCTcoefficientdistributionsforimages[Lam,Goodman,2000]Testimage“Bridge”AC系数:Laplacian分布(相同尺度)DC系数分布类似于原图像直方图分布12JPEG编解码算法主要有以下几个重要步骤:1.格式转换:RGB格式图像数据转换为亮色分离的分量信号格式2.

亮度信号0偏置电平下移:降低亮度信号直流的系数,减少直流数据量3.DCT变换去除图像数据的相关性,便于量化过程去除图像数据的空间冗余。4.

量化(统一标量量化)利用人眼视觉特性设计而成的矩阵量化DCT系数,减少视觉冗余。5.熵编码对量化后的DC系数进行差分编码,AC系数进行之字形扫描和游程编码后,再分别进行VLC编码,减少数据(编码)冗余。亮度信号0偏置电平下移:灰度级2n的像素值,全部减去2n-1(一半),单极性无符号数据变为双极性有符号数数据。原因:将0电平下移,使得图像平均亮度降低,DCT变换的直流系数大大降低。13亮度量化矩阵161110162440516112121419265860551413162440576956141722295187806218223756681091037724355564811041139249647887103121120101729295981121001039917182447999999991821266699999999262656999999999947669999999999999999999999999999999999999999999999999999999999999999999999999999色度量化矩阵JPEG推荐了亮度信号和色度信号两种量化表

量化14139144149153155155155155144151153156159156156156150155160163158156156156159161162160160159159159159160161162162155155155161161161161160157157157162162161163162157157157162162161161163158158158DCT变换后的系数11162125272727271623252831282828222732353028282831333432323131313132333434272727333333333229292934343335342929293434333335303030实际编码举例:

原图像样值f(x,y)电平下移后的f(x,y)15DCT变换后的系数F(u,v)–量化前1611101624405161121214192658605514131624405769561417222951878062182237566810910377243555648110411392496478871031211201017292959811210010399亮度量化矩阵150-100000-2-1000000-1-10000000000000000000000000000000000000000000000

量化后的系数[F(u,v)]Q16

反量化后的系数[F’(u,v)]Q

与DCT变换后的原系数2400-1000000-24-12000000-14-130000000000000000000000000000000000000000000000[F’(u,v)]QF(u,v)亮度量化矩阵反量化量化前17反变换后的重建图像数据f’(x,y)与原图像数据比较144146149152154156156156148150152154156156156156155156157158158157156155160161161162161159157155163163164163162160158156163164164164162160158157160161162162162161159158158159161161162161159158139144149153155155155155144151153156159156156156150155160163158156156156159161162160160159159159159160161162162155155155161161161161160157157157162162161163162157157157162162161161163158158158f’(x,y)f(x,y)520-1-11114-1-1-2-300051-3-5010-110-12-10-2-44-331053123332310-2-11-10421-4-300-1310误差数据

恢复数据原始数据18f(x,y)f’(x,y)f(x,y)-f’(x,y)F(u,v)[F(u,v)]QDCTQQ’[F’(u,v)]QIDCT19DC系数的最大值在211-1以内,由于DC系数进行差分编码,且步长为1,DC系数差分数值的范围在-(211-1)~211-1以内,大概有212个的可能系数,同时AC系数大约有211个可能数值,对如此大规模的数值直接采用变长编码并不实用。JPEG1将DC系数差分值和AC系数值(统一用value表示)映射到所谓的“类别码”有序对(size,u)来解决这一问题。

u是value的二进制数(负值为反码)表示;size称为尺寸类别,表示u的位数。

20SSSS(size)Huffman编码(码长)DC差分值valueu000(2)0无1010(3)-1,10,12011(3)-3…-2,2…300,01,10,113100(3)-7…-4,4…7000,001,010,011,100,101,110,1114101(3)-15…-8,8…150000…0111,1000…11115110(3)-31…-16,16…3100000…01111,10000…1111161110(4)-63…-32,32…63000000…011111,100000…111111711110(5)-127…-64,64…1270000000…0111111,1000000…11111118111110(6)-255…-128,128…25500000000…01111111,10000000…1111111191111110(7)-511…-256,256…511000000000…011111111,100000000…1111111111011111110(8)-1023…-512,512…10230000000000…0111111111,1000000000…111111111111111111110(9)-2047…-1024,1024…204700000000000…01111111111,10000000000…11111111111PEG1标准中给出的亮度分量DC系数差分值Huffman编码示例

(size,u):仅对size进行Huffman编码21{4,-9,7,0,0,-2,0,0,0,-1,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,0,1,0,…}亮度分量DCT块系数经之字形扫描后为:{3;(0,-9);(0,7);(2,-2);(3,-1);(17,1);EOB}游程化(假设前一个块DC系数为1):游程Run约束在15以内(4bit表示):{3;(0,-9);(0,7);(2,-2);(3,-1);(15,0);(1,1);EOB}DC系数差分值->“(size,u)”,AC系数二元组“(Run,value)”->“(Run,size),u”“011,11;1011,0110;100,111;11111001,01;111010,0;11111111001;1100,1;1010”22JPEG1标准中针对亮度分量的AC系数部分提供的Huffman编码示例23由此可见,原图像为8×8=64个像素,如果每个像素用8bit编码,则压缩前的总比特位数为:8×8×8=512bit经过JPEG算法编码后,输出的总比特位数为:

56bit平均比特率:压缩比:248.3MPEG-2视频压缩编解码标准MPEG-1和MPEG-2标准均含三部分:系统:阐述音视频码流复用方式视频:阐述视频压缩码流格式音频,阐述音频压缩码流格式MPEG-2正式名称为“GenericCodingofMovingPicturesandAssociatedAudio”初为标清数字电视开发,设计编码速率10Mbps以下后涵盖原MPEG-3的关键规范(数字高清电视压缩),成通用编码标准MPEG-2在MPEG-1基础上扩展,与之高度兼容低比特率(低于1Mbit/s)未优化,3Mbit/s及以上性能超MPEG-1支持标清及高清分辨率半像素精度运动矢量4~8Mbps码率时质量满足消费类视频需求,在数字卫星电视等多个领域广泛应用。258.3MPEG-2视频压缩编解码标准--8.3.1编码结构层次MPEG对视频资料规定了层次结构,共分为六层:

1.视频序列(VideoSequence)(最高层);2.图像组(GroupofPictures);3.图像(Pictures);4.像条(Slice);5.宏块(Macroblock);6.像块(Block)(最低层).261.视频序列(VS)视频序列也称图像序列,它是随机选取节目的一个基本单元。从节目内容看,一个视频序列大致对应于一个镜头,切换一个镜头,即表示开始一个新的序列。图像大小、幅型比、帧率固定的图像序列。2.图像组(GOP)图像组是将一个图像序列中连续的几个图像组成一个小组,简称为GOP。它是对编码后的视频码流进行编辑的存取基本单元。3.图像(P)图像是一个独立的显示单元,也是图像编码的基本单元。可分为I、P、B三种编码图像,分别对应三种压缩编码模式,即帧内压缩编码(I帧编码)、前向预测编码(P帧编码)和双向预测编码(B帧编码)。274.像条/片(SLICE)

像条由一系列连续的宏块组成,前后独立。像条是发生误码后且不可纠正时,数据重新获得同步从而能正常译码的基本单元。285.宏块(MB)宏块是运动预测的基本单元。运动估计以宏块为单位得到最佳匹配宏块的运动向量。运动预测只对亮度数组进行,色差数组使用和亮度数组相同的运动向量。6.像块像块是DCT变换的基本单元,也是最小的处理单元。一幅图像以亮度数据数组为基准被分成为若干个8×8像素的数组,简称为块。可以是亮度块或色差信号块。298.3MPEG-2视频压缩编解码标准--8.3.2I、B、P帧编码原理图像组(GOP)I1I13B14B15P4B5B6B2B3P7P10P16B11B9B8B12前向预测后向预测“IBBPBBPBBPBB”12帧GOP结构30I图像帧的压缩算法:在空间方向上(内帧),采用类似JPEG压缩算法来去除冗余信息1.I帧(Intracodedpicture)帧内图,仅利用该帧图像本身信息进行编码,即直接进行DCT变换,量化和熵编码.属于中等压缩.可作为P/B帧的参考帧.压缩比(2-5):131P图像帧的压缩算法:对于P宏块,采用运动补偿帧间预测算法来去掉时间轴上的冗余信息。2.P帧(Predictive-codedpicture)

预测图,根据前面最靠近的I帧或者另一个P帧进行预测,属于前向预测.32双向预测示意图t1t3t2存在于前一帧图像(t1)存在于后一帧图像(t3)33B图像帧的压缩算法:3.B帧(Bidirectionallypredictive-codedpicture)双向预测图,它可以同时用过去的帧和未来的帧作参考帧,即前向和后向预测都有.压缩比(20-30):1B帧压缩最大,且不传播误码.34PSNRY(dB)U(dB)V(dB)I33.844.744.6I,P39.045.745.5I,B,P39.146.145.8某MPEG-2标准编码器对ITU-RBT.601标清视频序列编码结果从I帧到P帧再到B帧,压缩编码能力渐强,相同码率下对图像质量提升能力也依次增强。固定码率下,随P、B帧加入图像质量提升。B帧编码计算复杂、延时大,网络传输视频编码一般不用。说明:编码以最佳匹配预测为目标:I帧宏块仅帧内编码;P帧宏块可帧内或前向预测编码;B帧宏块支持所有编码宏块形式。第二,MPEG-2支持隔行逐格式,一帧分顶场和底场,不同色度格式有特定划分(详见标准),I、P、B帧概念同样适用于场。358.3MPEG-2视频压缩编解码标准--8.3.3MPEG-2编码过程361.帧重排由于B帧是双向预测帧(前向预测和后向预测),在后向预测时,需要用它将来的一个帧作为参考帧。因此需要把将来的帧先送入编码器,就要对原始图像重新排序。如,P4作为B2和B3的后向预测参考帧,应该排在B2和B3之前。按编码顺序重排后的图像序列:MPEG-2编码器框图——I帧编码帧重排运动补偿运动估计帧内/帧间模式判别DCT量化熵编码帧间帧内反量化反DCTK1K2运动矢量去复用器I帧存P帧存K4去复用器K3I、BPI、PBI帧存P帧存信源数据+++-A2A1IBP五、编码器工作原理

MPEG-2编码器框图——P帧编码帧重排运动补偿运动估计帧内/帧间模式判别DCT量化熵编码帧间帧内反量化反DCTK1K2运动矢量去复用器I帧存P帧存K4去复用器K3I、BPI、PBI帧存P帧存信源数据+++-A2A1IBP预测块预测块参考帧MVMPEG-2编码器框图——B帧编码帧重排运动补偿运动估计帧内/帧间模式判别DCT量化熵编码帧间帧内反量化反DCTK1K2运动矢量去复用器I帧存P帧存K4去复用器K3I、BPI、PBI帧存P帧存信源数据+++-A2A1IBP参考帧MV预测块B帧不作为参考帧使用!402.码率控制满足目标码率前提下高效稳定的视频编码:视频缓冲器、编码统计处理器和自适应量化器配合实现视频编码器码率控制。因I、P、B帧压缩特性不同致码率波动,熵编码后加视频缓冲器可平滑码率。为防缓冲器上溢或下溢,需控制熵编码码率,缓冲器接近上溢降码率,接近下溢增码率。编码统计处理器监测分析缓冲器,输出信息给自适应量化器,后者据此动态调整量化步长。418.3MPEG-2视频压缩编解码标准--8.3.4MPEG-2的型和级MPEG-2通过首次引入“类、级”概念,支持多等级压缩编码,解决编码器通用性与特殊性矛盾。规定四种级,以应对不同分辨率需求,为编码器提供灵活信源格式选择;

低级、主级、高1440级和高级引入不同压缩处理方法,即类或型

简单类、主类、信噪比可分级类、空间可分级类、高类4:2:2、多视角(Multi-view,MVP)类通过“类”“级”结合,MPEG-2编码器可提供灵活高效编码方案,提高通用性且满足特殊需求各种类有语法约束,限制参数范围,并非所有类和级组合都可用,标准给出可用组合及最大码率上限,用“类@级”表示。42

类(Profile)SimpleMainSNRSpatialHigh4:2:2Multi-view色度格式4:2:04:2:04:2:04:2:04:2:04:2:24:2:04:2:24:2:0GOP帧I,PI,P,BI,P,BI,P,BI,P,BI,P,BI,P,B可分级无无SNRSNR/空间SNR/空间无时间帧率3060,303060,3060,3060,3060,30帧内直流精度(bit)8,9,108,9,108,9,108,9,108,9,10,118,9,10,118,9,1043

级(Level)

类(Profile)SimpleMainSNRSpatialHigh4:2:2Multi-viewHigh1920×1080

MP@HL:80

HP@HL:所有层100中间+基本层80基本层254:2:2@HL:300MVP@HL:双层130基本层80High14401440×1080

MP@H-14:60

Spt@H-14:所有层60中间+基本层40基本层15HP@H-14:所有层80中间+基本层60基本层20

MVP@H-14:双层100基本层60Main720×480/576SP@ML:15MP@ML:15SNR@ML:双层15基本层10

HP@ML:所有层20中间+基本层15基本层44:2:2@ML:50MVP@ML:双层25基本层15Low352×240/288

MP@LL:4SNR@LL:双层15基本层3

MVP@LL:双层8基本层4MPEG-2类和级的最大码率上限(Mbps)44MP@ML是DVD及数字标清电视编码格式,体现MPEG-2在娱乐应用初期的重点需求;MP@HL是我国及美等国数字高清电视编码格式;4:2:2类面向影视制作、分发等应用需求,码率、色度分辨率和质量更高,质量高于MP@HL,可用于全I帧编码,适合多代压缩解压;MVP类适用于多视点视频,支持立体图像,提供多样分辨率与质量,基础层和增强层分别分配给左右视图。图像(830Kbytes)图像(830Kbytes)图像(830Kbytes)图像(830Kbytes)压缩的“I”帧图像100kbytes压缩的“B”帧图像12kbytes压缩的“B”帧图像12kbytes压缩的“P”帧图像33kbytes(Approximatesizes-dependsuponcomplexityofpicture)压缩到5Mbits/s的MPEG-2码流显示单元PresentationUnit存取单元AccessUnit无压缩(ITU-R601)数字视频45720x576x2六、视频基本码流(视频ES)8.3MPEG-2视频压缩编解码标准--8.3.5视频压缩基本码流46视频序列、GOP、图像、像条、宏块、像块6个层次:47序列起始码:StartCode起始码,每层不同,不允许出现在数据流中序列头:给出图像尺寸、帧型比、帧频和比特率,序列扩展,码:给出型/级,逐行/隔行以及色度格式GOP头:给出时间码,B帧的预测特性图像头:给出时间参考信息、图像编码类型IBP,VBV(视频缓存校验器)等信息;图像扩展码:给出运动图像、图像结构(顶场、底场或帧)、量化因子类型和VLC等信息。像条头:给出像条垂直位置,量化因子码等信息。宏块类型码(若干):给出宏块地址、方式、运动矢量等信息。像块层:给出DCT系数的VLC编码数据。488.4H.264/AVC视频压缩编解码标准--8.4.1H.264与MPEG-4标准诞生背景:1999年,ISO与IEC推出MPEG-4标准,旨在满足数字电视、交互式绘图、交互式多媒体等整合及压缩技术需求。MPEG-4标准特性:不仅是音视频编解码标准,更是以内容与交互性为核心的多媒体框架。引入基于对象的编码功能,增强用户与内容互动性,使编码对象融合及视频内容个性化定制成为可能。标准第2部分MPEG-4visual定义多种视觉信息编解码,支持自然和合成视觉对象编码,矩形视频编码与ITU-TH.263兼容。MPEG-4应用局限:基于对象的编码技术理论上潜力大,但因实现复杂度高、压缩优势不显著及专利许可协议问题,未在实际产品广泛应用。H.264标准诞生:1998年初,VCEG发布H.26L项目征求建议书,目标是提高编码效率一倍,1999年通过初稿设计。后H.263、MPEG-4visual和H.26L相互借鉴融合,于2003年统一为H.264/AVC高级视频编码标准,也是MPEG-4标准的第10部分。H.264地位影响:第二代视频编码标准,是视频压缩编解码的分水岭。它适应高清视频需求和网络环境变化,确保视频在各种设备流畅播放,是录制、压缩和分发视频内容的常用格式,在蓝光光盘、流媒体等领域广泛应用。498.4H.264/AVC视频压缩编解码标准--8.4.2H.264编码原理H.264视频编码标准灵活多样,提供多种工具满足不同比特率应用需求。与MPEG-2相比,它仅需其三分之一到一半比特率就能提供同等观看体验,这得益于一系列先进技术,虽增强了灵活性、提高了编码效率,但也使编码和解码复杂度大增。501.分层设计为适应新应用在不同网络灵活部署:视频编码层面(VideoCodingLayer,VCL):高效表示视频网络抽象层面(NetworkAbstractionLayer,NAL):格式化,以适配各种传输与存储实现码流与传输协议分离,增强可扩展性与兼容性。51MPEG-1/2分层结构中头部与数据强依赖,头部丢失数据难解码,序列层和图像层因传输限制,头部分组丢失会致其他分组无法解码而浪费资源。H.264将头部句法元素形成SPS和PPS,其余放入像条层。参数集独立,虽增加冗余、降低编码效率,但增强了通信鲁棒性,能限制丢包错误扩散,利于解码纠错。VCL层也就是视频编码器,编码器编码输出的数据流以SPS、PPS和像条Silce为单位进入NAL层,被封装为NALU单元,每个NALU单元由起始码、单元头、数据载荷构成。

H.264NALU基本结构522.小尺寸分块:

H.264/AVC在运动补偿块上更灵活,最小亮度块细化至4×4,且引入图像边界外推技术,提升预测准确性。3.帧内预测:

H.264引入真正意义上的空域帧内预测,利用相邻像素预测减少冗余,提高编码效率,不同于MPEG-1/2的频域DC系数预测。4.帧间预测:

采用高精度运动估计/补偿,支持1/4或1/8像素精度,多达16个参考帧,并引入加权预测,增强预测准确性和灵活性。535.整数DCT变换、Hadamard变换编码:

使用整数DCT和Hadamard变换,减少浮点运算,提高编码速度和稳定性,优化变换系数减少冗余。6.量化处理:

采用自适应量化技术,根据图像内容和目标码率动态调整量化步长,提高编码效率,适应不同场景。7.环路滤波器:

引入消块滤波器(环路滤波器),减少块状失真,提高预测能力和编码效率及图像质量。8.熵编码:

提供结合上下文信息的CAVLC和CABAC两种编码方法,CAVLC简单易实现,CABAC编码效率更高。548.4H.264/AVC视频压缩编解码标准--8.4.3H.264的其它新特性1.IDR帧

闭合GOP结构

开放GOP结构

闭合GOP和开放GOP结构示意图即时解码刷新(InstantaneousDecoderRefresh)帧MPEG-2中开放GOP结构编码灵活,可提升压缩效率,但码流切换时需丢弃无法解码的B帧,影响视频完整性,需合理设计码流和解码策略。闭合GOP结构首帧为IDR帧,分割前后GOP,实现无缝播放切换,确保视频独立完整,但压缩性能有损。二者各有优劣。应根据场景需求选择编码和解码策略,如同一场景用开放GOP,镜头切换时用闭合GOP,且需结合编码标准和解码器实现优化效率性能。552.新工具提供灵活分片大小,提升编码效率;引入灵活宏块排序(FlexibleMacroblockOrdering,FMO)的切片组技术,增强错误隐藏能力与数据丢失鲁棒性;支持任意切片排序(ArbitrarySliceOrdering,ASO)功能,改善实时应用端到端延迟;设计冗余分片(RedundantSlice,RS)工具,通过冗余信息保证视频连续清晰;提供数据分割(DataPartitioning,DP)功能,灵活分割切片语法以适应不同网络;引入SI(switchingIslice,切换帧内编码分片)/SP(switchingPslice,切换预测编码分片)同步/切换图像类型,实现速率切换与快速恢复,支持特技模式。

部分功能因技术复杂、成本或场景限制未广泛应用,但为H.264发展优化提供了潜力。568.4H.264/AVC视频压缩编解码标准--8.4.4H.264的档次与级别H.264/AVC规范众多编码工具,能应对广泛比特率、分辨率等应用场景。为平衡通用与特殊需求,依然按“档次”(Profile,即编码工具子集,利于复杂度受限时实现互操作性最大化)与“级别”(Level,定义解码图像分辨率、比特率等参数)划分工具,二者结合可满足特定功能需求。H.264档次应用

需求

基本档次视频会议编码效率,可靠性,低时延,低复杂度编/解码器基本档次移动视频编码效率,可靠性,低时延,低复杂度编/解码器,低功耗主档次广播电视编码效率,可靠性(经过噪声可控的信道),隔行视频,低复杂度解码器主档次视频存储与回放编码效率,隔行视频,低复杂度编码器和解码器扩展档次流视频编码效率,可靠性(经过不可控分组网络信道),可伸缩性主档次、高档次演播室制作无损或近无损,隔行视频,有效转码1.H.264的档次57三种档次既有公共编码部分又有特殊编码部分。所有档次的公共部分包括I分片、P分片和CAVLC熵编码。预测的单位不像MPEG-1/2是帧,而是细化到了片为单位。582.H.264的级别级别号典型图像尺寸

典型帧率最大压缩码率1QCIF1564kbit/s1bQCIF15128kbit/s1.1CF或QCIF7.5(CIF0)/30(QCIF)192kbit/s1.2CIF15384kbit/s1.3CIF30768kbit/s2CIF302Mbit/s2.1HHR(480i或576i)30/254Mbit/s2.2SD154Mbits3SD30/2510Mbivs3.11280×720p3014Mbit/s3.21280×720p6020Mbit/s4HD格式(720p或1080i)60p20Mbit/s4.1HD格式(720p或1080i)60p50Mbit/s4.21920×1080p60p50Mbit/s52k×1k72135Mbit/s5.12k×1k或4k×2k120/30240Mbit/s5.24k×2k或4096×216030/25240Mbit/s67680×432030240Mbit/s6.18192×409660480Mbit/s6.28192×4320120800Mbit/sH.264定义的级别H.264级别界定图像大小、帧率等影响编/解码处理与存储的关键参数H.264/AVC设20种级别(编号1.0-6.2),编号越高性能参数越高各级别对应特定分辨率、帧率、码率限制1b级别专为3G无线网络环境设计598.5H.265/HEVC视频压缩编解码标准视频应用向高清晰度、高帧率、高压缩率的方向发展,H.264编码技术面临的局限性:分辨率提高引起的问题:由于分块小,造成宏块数量成倍增长,计算量大。单个宏块内的图像内容信息量显著减少,同时相邻4×4或8×8块变换后的低频系数相似度大幅提高,进而产生了大量冗余。导致运动矢量幅值显著增加,这降低了对运动矢量残差进行编码的效率。一些核心算法,如CAVLC、CABAC以及Deblocking滤波等,均要求串行编码方式,从而限制了并行处理的能力,使得并行程度较低。

608.5H.265/HEVC视频压缩编解码标准--8.5.1H.265的新技术和特点611.灵活编码结构采用可变尺寸编码树单元(CTU),如16×16、32×32、64×64等,包含亮度、色度编码树块及语法元素。编码树块可再划分成更小编码块(CB),3个CB(Y、Cb、Cr)以及相应的语法元素进而组成1个编码单元(CU)。CB可细分预测块(PB)用于预测,再划分变换块(TB)用于变换,形成预测单元(PU)和变换单元(TU),各单元相对独立,处理更灵活。CU结构对应的四叉树结构622.优化预测技术帧内预测:沿用并扩展H.264模式,支持多种PU大小,亮度帧内预测模式增至35种,色度模式有5种,预测更精准。预测过程先获取相邻参考像素值并滤波,再按模式计算当前PU块像素值。632.优化预测技术帧间预测:灵活分块:CU尺寸16×16或更大时,允许非对称运动划分(AMP)。子像素插值算法:1/2像素用8抽头滤波器,1/4像素用7抽头滤波器,精度更高。新预测模式:有跳过(Skip)、合并(Merge)、普通帧间(Inter)三种模式Skip模式无需预测残差Merge模式运动参数由相邻块导出Inter模式需运动估计。自适应运动矢量预测技术(AMVP):通过相邻PU运动矢量信息构造候选列表,对差值编码,提高编码效率。643.并行化设计拼接块处理:将图像划分为含整数个最大编码单元(LCU)的矩形区域,实现并行处理,还可用于空间随机访问。错峰并行处理(WPP):分片slice分成若干CTU行,每行相对前一行有2个CTU延迟,压缩效率更好。4.改进熵编码

采用类似H.264的CABAC,但提高了并行处理能力和压缩性能,降低上下文存储需求。5.环路滤波

在分块滤波(DBF)基础上增加样点自适应补偿(SAO)滤波器,减少振铃效果,提升图像质量。6.残差四叉树变换(RQT)

基于四叉树结构的自适应变换技术,根据残差特性自适应选择变换块大小,在能量集中和细节保留间折中,提高编码效率。658.5H.265/HEVC视频压缩编解码标准--8.5.2H.265的档次、级别和层H.265在H.264基础上又定义了(Tier)的划分,档次、层和级别保障多应用兼容性。档次规定编码工具算法,技术指标含像素位深等;级别限制解码端关键参数,如最大采样频率等;层规定等级比特率高低,部分Level分主层(面向多数应用)和高层(用于苛刻应用)。

解码器向低级码流兼容,解码器须支持解码档次全部特性。1.档次H.265标准首版定义Main、MainStillPicture、Main10三个档次:只支持4:2:0采样;用Tiles则不能用错峰并行处理WPP,且每个Tile亮度分辨率至少256×64;Main和MainStillPicture支持8位像素深度,Main10支持10位,MainStillPicture不支持帧间预测。Main最常见,Main10的10bit位深可提高视频质量,多用于电子消费领域,支持该档次的解码器需能解码Main和Main10码流。MainStillPicture支持单静止图像,按Main编码。66H.265标准在后续版本中,又相继加入了多种档次:“主10静止图像(Main10StillPicture)”档次、21种格式范围扩展(Formatrangeextensions)档次4种高通量(Highthroughput)档次4种屏幕内容编码扩展(Screencontentcodingextensions)档次3种高通量屏幕内容编码扩展(Highthroughputscreencontentcodingextensions)档次1种多视角主(MultiviewMain)档次或称为3D主(3DMain)档次6种可伸缩扩展档次672.层和级别H.265定义MainTier和HighTier两层及17个级别(标准增补可能新增):级别4及以上支持高层能力,层按最高比特率处理应用。17个级别支持QCF到8K多种分辨率编码,图像宽高受MaxLumaPS限制(均≤其8倍再开方),还约束了图像中Tile最大拼接数及每秒最大Tile数。级别Luma图像最大样点数Luma图像最大采样率(样值/秒)最大码率(kbit/s)最小压缩率主层高层主层高层136864552960128-22212288036864001500-222.124576073728003000-223552960165888006000-223.19830403317760010000-2242228224668467201200030000444.122282241336934402000050000445891289626738688025000100000645.1891289653477376040000160000845.2891289610695475206000024000084635651584106954752060000240000846.1356515842139095040120000480000846.2356515844278190080240000800000646.3802160644812963840320000160000064714260633648129638403200001600000647.114260633685563801604800003200000647.214260633617112760320960000640000064H.265定义的层和级别682020年7月VCEG和MPEG发布首版H.266/VVC标准,其在相同视频质量下压缩效率比H.265提高一倍,以“通用性”为目标,覆盖多种视频类型、超高清及沉浸式视频,适用于多种移动设备。VVC编码算法在基于块的混合编码框架内改进各环节,新增近40种工具。VVC压缩码率仅为MPEG-2的1/8。8.6.1H.266的新技术和特点涵盖4:4:4、4:2:2、4:2:0色度格式及TU-RBT.2100宽色域标准,支持16bit位深起、10000尼特亮度的HDR视频,支持8~16bit位深视频编码,位深通常是10bit帧率0~120Hz可变,支持环绕或多角度视频编码对隔行扫描视频,将一帧视作两个独立场分别编码,简化编码器实现。1.图像格式69扩展CTU尺寸至128×128以适配更大图像引入砖形编码块(Brick)划分,采用多类型树MTT结构,支持二叉和三叉划分,取消CU、PU、TU概念区别,统一采用CU描述,提供更灵活的划分形状。除支持HEVC的光栅扫描Slice模式外,还支持矩形Slice模式。色度划分上,I帧采用色度分离树,P帧和B帧与亮度一致,但色度分离树划分中禁用2×2、4×2和2×4的小块以优化硬件实现。2.更加细致灵活的分块

扫描顺序slice模式

矩形slice模式

两种slice模式多类型树MTT结构70

编码标准图像划分H.264H.265H.266划分结构宏块和子宏块四叉树递归(CU/PU/TU结构)四叉树和嵌套多类型树递归亮度色度划分一致性一致一致I帧亮度色度可分离划分块组织方式扫描顺序slice扫描顺序slice、slice片段、tile扫描顺序slice、slice片段、矩形slice、tile、brick最大亮度编码块尺寸16×1664×64128×128最小亮度编码块尺寸4×48×84×4最大亮度预测块尺寸16×1664×64128×128最小亮度预测块尺寸4×44×44×4最大亮度变换块尺寸8×832×3264×64最小亮度变换块尺寸4×44×44×4顿内预测块划分形状方形方形方形+非方形顿间预测块划分形状对称对称+单层非对称对称+多层非对称H.264、H.265、H.266图像划分技术比较713.更多的帧内预测模式宽高比(W/H)被替换的方向预测模式1612,13,14,15812,1342,3,4,5,6,7,8,9,10,1122,3,4,5,6,71无1/261,62,63,64,65,661/457,58,59,60,61,62,63,64,65,661/855,561/1653,54,55,56宽角度预测模式中被替换的方向预测模式72多行参考方式734.帧内预测方面的改进扩展HEVC的Merge帧间预测,增候选列表长度、改进算法并引入运动残差MVD;运动估计改进含采用CU权重双向预测(BCW)、双向光流(BDOF)、增加仿射变换运动补偿预测(AMCP)及灵活几何划分模式(GPM);运动参数精细化改进包括引入子块时域运动矢量预测(SbTMVP)、自适应运动矢量精度(AMVD)、对称运动矢量残差(SMVD)及解码端运动矢量修正(DMVR),降低误差、减少数据传输且无需额外编码比特。5.联合预测联合帧间/帧内预测(CombinedInterandIntraPrediction,CIP)技术

对一个CU同时采用帧内与帧间预测生成两个预测块,并通过加权融合得出最终预测结果。746.环路滤波VVC改进HEVC去块效应滤波(DBF),滤波强度决策增依重建图像平均亮度,增加4×4边界处理,对大尺寸编码块亮度边界增强滤波,新增子块边界滤波;改进SAO技术逐像素滤波降振铃效应;新增基于块的自适应环路滤波(ALF)修正所有像素,降低失真。7.变换和量化

最大变换尺寸扩至64×64,采用多变换选择(MTS)技术,增DST-7和DCT-8为主变换候选;用基于归零的不可分离二次变换(NSST)技术二次变换主系数;仍用标量量化,最大QP扩至63,采用依赖性标量量化(DSQ)降误差;引入新变换系数扫描方式。8.熵编码HEVC和VVC以性能优越的上下文自适应二进制算术编码(CABAC)为唯一熵编码方法,VVC为其设计新灵活高效编码引擎,改进概率估计和码字匹配。758.6.2H.266的档次、级别和层VVC规定了4个主档次和2个多层主档次主档次:常规10bit位深的Main10档次支持静止图像的Main10StillPicture档次支持全采样的Main104:4:4档次支持全采样静止图像的Main104:4:4StillPicture档次多层主档次为MultilayerMain10和MultilayerMain104:4:4档次。等级包括一系列编码参数,如采样率、码率、压缩率、缓冲区容量等。

1.0、2.0、2.1、3.0、3.1、4.0、4.1、5.0、5.1、5.2、6.0、6.1、6.2共13个等级。两层(同HEVC一样)主层可用于大多数场合,要求码率较低高层可用于有特殊要求的场合,包括5.0到6.2的6个水平,允许码率较高。768.7AVS视频压缩编解码标准--8.7.1AVS/AVS+/AVS-M2006年3月1日,AVS视频部分成为国家标准,作为第一代AVS标准,又称为AVS1-P2,即AVS系列第二部分;2012年7月,国家广播电影电视总局发布《广播电视先进音视频编解码第1部分:视频》行业标准行业标准,简称AVS+,它是AVS视频标准的扩展改进版,面向广播电视,引入多项关键技术,编码性能与H.264/AVC相当且更贴合需求。AVS视频编码器结构与H.264/AVC相似,编码过程含多种工具,复杂度低于H.264。AVS-M是AVS系列第七部分,重点服务于计算能力和功耗有限的移动系统及设备的视频编码,广泛适用于多个领域,包括移动多媒体广播、IP多媒体系统、多媒体邮件服务、基于分组网络的多媒体业务、视频通话以及视频监控等。778.7AVS视频压缩编解码标准--8.7.2AVS22015年12月发布,面向4K超高清视频,编码效率较AVS提升超一倍,复杂度约2-3倍,性能优于同期H.265/HEVC,尤其场景视频编码优势显著,可省约40%码率。首次提出的场景视频编码的概念,主要面向监控、视频会议这类场景保持长时间不变的视频应用,并能使这类场景的视频压缩效率提高一倍。针对场景视频编码定义了G帧、GB帧和S帧三种新的编码图像类型。定义三种新编码图像类型及更新技术。与AVS1比,AVS2采用更灵活的块划分结构、更丰富的预测模式、去相关性更好的变换、更逼近信息熵的算术编码方法,按四叉树递归划分编码单元。整个编码过程同样分为预测、变换、量化、熵编码和环路滤波过程等五个模块。788.7AVS视频压缩编解码标准--8.7.3AVS3AVS3制定分两阶段:2018年3月-2019年6月第1阶段(基准档次)性能较AVS2提升30%;2019年6月-2021年12月第2阶段(增强档次)目标编码效率超AVS21倍且超同时代国际标准。2023年5月11日AVS3由国家广播电视总局正式发布,编号GY/T368-2023,还被纳入DVB核心规范等。AVS3面向超高清,沿用预测变换混合编码框架,较AVS2引入新编码工具,采用更优结构等,节省约30%码率,提升编码效率。7980AVS3引入四叉树(QT)、二叉树(BT)以及扩展四叉树(EQT)的划分方式,可以采用非方形编码单元。用局部分离树(LST)技术简化硬件实现,对小块实施模式限制提升处理效率。改进AVS2的三类帧间预测方式;帧内预测新技术:帧内预测模式扩展(EIPM)、预测像素滤波、跨分量预测等。EIPM扩展了帧内预测的角度,从33种扩展到66种,包括62种角度模式和4种特殊模式,提高了对方向性纹理的预测能力,可以适应纹理丰富的超高清视频内容。变换量化采用隐则变换(IST)和子块变换(SBT),并引入了新的变换核DST-7和DCT-8,能够聚集不均匀分布残差的能量。环路滤波用基于卷积神经网络的环路滤波(CNNLF)代替传统的去块滤波和SAO滤波方式。81由于H.265/HEVC在专利池和使用许可方面存在问题,对其推广应用造成了一定的困扰。因此,MPEG组织于2020年相继发布了MPEG-5第1部分基本视频编码(EssentialVideoCoding,EVC)和MPEG-5第2部分低复杂度增强视频编码(LowComplexityEnhancedVideoCoding,LCEVC)。EVC特别注重许可友好性,致力于为内容制作者提供免版税的选择。它通过削减一些高级特性和采用更为简化的技术,实现了更低的编码复杂度和更高的编码效率,旨在提供一个具有合理权衡的视频编码解决方案,从而促进其广泛的采用和推广。LCEVC旨在提高现有编解码器(如AVC、HEVC、VP9、AV1等)压缩效率的编解码器,同时保持较低的编码复杂性。LCEVC的输出是结合了现有视频编解码器生成的“基本比特流”以及一个可选的增强层,该增强层能够有条件地用于提升视频质量。8.8MPEG-5视频压缩编解码标准828.8MPEG-5视频压缩编解码标准--8.8.1EVCEVC分为基本档次和主档次基本档次基于公开技术,提供免版税基础工具集

适用于互联网服务器的视频点播或直播流媒体主档次在基础工具集上增加提升编码性能的工具,且可单独关闭,专利许可成本低且明确。

适用于8K超高清商业广播等多样化新服务领域1.基本档次编码结构:支持64×64到4×4块大小,引入四叉树编码结构。预测模式:帧内预测有五种方向预测模式,利用相邻像素空间相关性;帧间预测采用单向/双向基于块的运动补偿,运动矢量编码以相邻块运动矢量为候选。变换量化:数据块大小等于编码块大小时(64×64到4×4),用DCT变换,之后标量量化,QP范围0到51,缩放因子由查找表定义。环路滤波:采用H.263标准环路滤波器提升图像质量。熵编码:采用JPEG二进制算术编码方案,之字形扫描后二进制化处理游程/电平符号。832.主档次编码块分区工具支持灵活块划分,采用二元/三元树的混合方案。用分割单元编码顺序(SUCO)提高预测性能。编码基本单位是最大128×128的编码树单元(CTU),并可递归划分。为支持64×64流水线,大尺寸CU有特定划分规则,SUCO可实现灵活编码顺序。2.自适应运动矢量分辨率支持1/4到4像素多种MV分辨率,编码器依率失真优化(RDO)选择,传递分辨率索引。合并MVD(MMVD)提供新MV表示方法,可消除大量MVD传递。3.仿射帧间预测允许三种仿射运动模式,通过控制点MV描述CU仿射运动场,不同模式下控制点MV传递或推导方式不同,有CU级别仿射标志和合并候选索引传递机制。4.解码端运动矢量优化利用双预测MV双边匹配优化,在参考图像列表搜索优化MV,包括整数样本MV偏移搜索和分数样本MV优化,分数样本优化用参数误差表面方程推导。842.主档次5.自适应环路滤波器(ALF)

对解码样本滤波,参数在自适应参数集(APS)传输,有不同滤波模式和滤波器选择方式,采用多种滤波器系数预测技术,利用对称特性减少系数数量,重用先前传输系数。6.Hadamard变换域滤波器(HTDF)QP大于17时,HTDF应用于亮度重建块,核心是2×2哈达玛变换,参数从编码信息导出,滤波顺序为HTDF、去块效应处理和ALF。7.自适应变换选择除DCT-2外,可对残差应用DST-7和DCT-8,用标志指示是否应用,编码器依RDO决定,对帧间预测CU有特殊编码方式。8.高级系数编码对量化后变换系数扫描并熵编码,采用类似位平面编码方法,发出最后一个非零系数坐标信号,按逆之字形扫描顺序解析系数,以块为单位处理,采用两种编码方式。858.8MPEG-5视频压缩编解码标准--8.8.1LCEVCLCEVC借现有及未来编解码器,通过低分辨率处理视频、结合单层编解码器,并用一套简小专业的工具修正图像、提升画质、增加细节,以此提升性能、降低复杂度。86LCEVC关键技术

(1)稀疏残差处理:处理一至两层由参考帧与基础解码增强版对比产生的稀疏残差数据(含边缘等),用特制小型变换高效处理。

(2)高效利用现有编解码器:低分辨率下用基本编解码器,减少功耗,以更低QP更高效运行。

(3)弹性自适应编码:编码过程可抵御典型伪影,L-1残差纠正伪影,L-2残差增加细节锐度,基础重建质量影响两层作用。

(4)任意基础信息增强:在像素域增强任何基础编解码器(如MPEG-2等),无需了解其编解码具体信息。

(5)并行化处理:不用块间预测,用小独立变换核处理残差层,块与层解码均可并行。872.编码器结构基础编码器:

输入序列经两个下采样器按所选缩放模式(二维、仅水平一维或不缩放)处理,调用基础编解码器生成基础比特流并纳入LCEVC比特流。第一增强子层:

重建基础图像上采样后,与一阶下采样输入序列相减生成L-1残差,经变换、量化和熵编码得到第一层系数数据。第二增强子层

第一层系数经环路内解码器得重建图像,依缩放模式上采样后与输入序列相减计算残差,经编码工具处理,可对变换系数做时间预测去冗余,第二层量化变换系数及时间层信息纳入LCEVC比特流。883.编码工具上采样和下采样:用两个非规范性下采样器降输入序列分辨率,可垂直、水平、仅水平或不下采样;提供两个上采样器及四种指定上采样核恢复分辨率。变换:支持两种用2x2或4x4小核的变换,若仅水平上采样,变换核会微调。量化:用线性量化器量化变换系数。L-1滤波器:用4x4变换时,可对L-1残差用L-1滤波器,残差边界乘0到1间系数,边缘和角落可独立配置。时间预测:用零运动矢量预测,配时域缓冲区存前一帧残差,依变换块决定是否用,还能指示32x32残差块不用以减少信令开销。熵编码:封装前,两系数层和时域层由熵编码器独立处理,含游程长度和前缀编码器,系数组内数据也可只用游程长度编码器。898.9VP8/VP9/AV1视频压缩编解码标准--8.9.1VP8/VP91.VP82010年,谷歌收购以TrueMot

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论