(信号与信息处理专业论文)h264avc编码器的码率控制算法研究.pdf_第1页
(信号与信息处理专业论文)h264avc编码器的码率控制算法研究.pdf_第2页
(信号与信息处理专业论文)h264avc编码器的码率控制算法研究.pdf_第3页
(信号与信息处理专业论文)h264avc编码器的码率控制算法研究.pdf_第4页
(信号与信息处理专业论文)h264avc编码器的码率控制算法研究.pdf_第5页
已阅读5页,还剩58页未读, 继续免费阅读

(信号与信息处理专业论文)h264avc编码器的码率控制算法研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 i 论文摘要 论文摘要 itu-t和iso/iec两个国际标准化组织共同推出的新的视频编码 标准h.264/avc,不仅编码效率高,而且能支持从低带宽、高误 码率的无线移动视频通信到高码率、 低延迟的视频广播及在线流媒体 等多种应用,因此日益受到业界的关注。视频压缩编码的主要目标就 是在比特率受限条件下,尽量使编码失真最小。为了取得更高的压缩 效率,并在接收端获得最佳的视频质量,率失真优化和码率控制技术 在视频编码中占有重要地位。 本文对 h.264 中的码率控制算法进行了 深入的研究,针对其算法的不足提出了一些改进方法。 通过对大量 qcif 测试序列的编码结果进行分析,发现不论图像 类型是 i、p 帧,编码后的图像的 psnr 值和编码量化参数 qp 具有 线性关系。鉴于 i 帧占用了较多的比特数,而且其编码质量对整个 gop(图片组)的质量具有重要影响,本文利用这种线性关系来确定 i 帧的量化参数 qp, 以克服原 h.264 算法对于 i 帧的量化参数确定方 法过于简单、不够准确的缺点,提高重建视频的质量。 h.264/avc 码率控制算法中的一个重要手段是采用线性模型来 预测宏块的 mad 值。由于它只考虑时间相关性,预测精度较低。本 文综合利用视频序列中时间和空间两方面的相关性,提出了改进的 mad 预测模型,并根据前一个单元的预测误差对当前的 mad 预测 值进行修正,有效地减小了预测误差。 当视频序列进行场景切换时,其相邻帧间的时间相关性大大减 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 ii 弱,如果继续采用 mad 值预测模型进行预测,将严重地影响码率控 制的准确度及图像编码的质量。 本文根据场景切换将使相邻帧图像的 平均灰度差发生较大变化这个现象,快速检测是否发生场景切换,并 在场景切换时对切换帧的编码模式及 gop 结构进行调整,重新确定 新 gop 各帧的量化参数,提高了场景切换帧及同一 gop 中后续的 p 帧的质量。 实验表明, 本文提出的方法有效地提高了 h.264 的码率控制的性 能。 关键词:视频编码 h.264 码率控制 mad 场景切换 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 iii abstract h.264 is the newest video coding standard developed by itu-u and iso/iec. in addition to its high coding efficiency, h.264 also provides a solution to a broad range of applications, such as very low bit rate conversational services and entertainment quality broadcast, interactive video on demand services etc. therefore, h.264 has received highly attention from academic and industrial fields. it is known that the main goal of video coding is to minimize the coding distortion under the given bit rate. in order to achieve the optimal compression efficiency, and get the best video quality in the receivers, rate distortion optimization and rate control technology plays an important role in video coding. to improve the rate control performance of h.264, this dissertation first studies the rate control algorithm of h.264 in detail, and then proposes some improvement methods to compensate the defect of h.264. based on the analysis of extensive experiment results via various qcif video test sequences, the dissertation reveals the linear relation between psnr and quantization parameter (qp) of a coded picture in both intra frame (i frame) and inter frame (p frame). an i frame is usually allocated more bits than a p frame, and its coding quality has more important influence to the quality of entire group of picture. however, the method used to determine the qp of i frame in original algorithm is too simple and inaccurate. to improve the bit rate control capacity of h.264, the above linear relationship is introduced to determine the qp of i frame. in h.264, the original rate control algorithm employs a linear model to predict the mad value of a macroblock. because it exploits only the temporal correlation among frames, the prediction accuracy is not good enough. hence, an improved mad predicting model is proposed by combining the temporal and spatial correlation among frames in this dissertation. moreover, in this proposed algorithm, the predicted mad value is adaptively corrected based on the prediction errors of previous unit to increase the prediction accuracy. when the scene of a video sequence is switched, the temporal correlation 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 iv between current and previous framesis greatly diminished that the mad predicted model does not work. based on the investigation that when scene switching occurs, the average luminance difference between two continuous frames will be much larger, in this dissertation, the average luminance difference between two continuous frames is used to fast detect whether the scene has been switched. once scene switching occurs, the coding pattern of the frame and the gop structure are adjusted adaptively. consequently, the qp of each frame in the new gop is determined under the new condition. experimental results have shown that the proposed algorithm effectively improves the coding quality of the scene switching frame and its following p frames in the same gop. experimental results have proved the proposed algorithms effectively improve the bit rate control performance of h.264. key word: video coding, h.264, rate control, mean absolute difference (mad), scene switching 原创性声明 原创性声明 本人声明兹呈交的学位论文是本人在导师指导下完成的研究成 果。论文写作中不包含其他人已经发表或撰写过的研究内容,如参考 他人或集体的科研成果,均在论文中以明确的方式说明。本人依法享 有和承担由此论文所产生的权利和责任。 学位论文作者签名: 日期: 学位论文版权使用授权声明 学位论文版权使用授权声明 本人同意授权华侨大学有权保留并向国家机关或机构送交学 位论文和磁盘,允许学位论文被查阅和借阅。 论文作者签名: 指导教师签名: 签 名 日 期: 签 名 日 期: 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 1 第一章 绪论 第一章 绪论 1.1 引言 1.1 引言 视觉是人类获取信息最为重要的途径, 外部世界丰富多彩的信息大部分是通 过视觉感知的。据统计,人类通过视觉获取的信息占全部获取信息的 70% 1。随 着计算机、数字通信、多媒体和网络技术的发展,信息也在急剧地膨胀。图像和 视频作为信息最重要的载体之一,己经深入了人们的生活。人们不再满足于文字 及声音, 还希望看到生动的画面和场景。 个人用户对多媒体业务的需求不断增长, 使得多媒体不再局限于文本、语音和图片,视频图像将为用户提供功能更强大、 更完善的服务。 近年来,视频传输的应用前景日益为人们所认识,如通过 pstn 网络传输可 视电话、无线移动网上的各种视频业务,以及互联网上的多媒体电子邮件、电子 报纸、视频检索等。 与语音、图片等媒体形式不同,数字视频的数据量很大,对存储器、通信信 道以及处理器等都提出了相当高的要求。因此,对视频数据进行高效压缩意义重 大,是降低存储成本,缓解网络带宽,突破存储空间和处理器主频限制的关键技 术。 码率控制(rate control)是视频压缩编码过程中的重要环节。它贯穿整个视频 编码过程,其有效性不仅影响码流的码率稳定,还将影响到整个视频序列的图象 质量。 码率控制是否有效, 在很大程度上取决于率失真模型(rate-distortion model) 的准确性及码率控制算法的适应力。同以往的 mpeg-x 和 h.26x 编码标准一样, h.264 的率失真模型及码率控制算法也没有一个统一的模式。这是因为码率控制 与具体的应用需求紧密相关,不同的应用目标对码率控制的准确性、复杂性、实 时性、 控制灵活性、存储器资源占用量以及可控范围等方面有着迥然不同的限制 和要求。 通过以上的分析可以看出,视频编码有非常广阔的应用前景,而码率控制在 编码中有重要的作用, 并且针对不同应用其控制策略具有很强的灵活性和发挥余 地。因此,对视频编码的码率控制策略的研究具有重要意义。 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 2 1.2 视频编码技术发展历史和现状 1.2 视频编码技术发展历史和现状 1.2.1 图像压缩编码技术的发展历史1.2.1 图像压缩编码技术的发展历史 1948 年,shannon 等人 2联合发表了对电视信号进行脉冲编码调制(pcm: pulse code modulation)的论文,这标志着数字图像压缩编码技术的开端。 1952, 贝尔实验室的 c.culter 取得差分脉冲编码调制(dpcm)系统的专利 3, 奠定了真正实用的预测编码系统的基础。 1968 年 h.c andrews 等人 4基于大多数自然图像的高频分量相对幅度可能 较低, 可完全舍弃或只用少数码字编码而失真不大的观察,提出了不对图像本身 编码,而对其二维离散傅立叶变换(2d-dft)系数进行编码和传输。此后相继出 现了性能更佳的沃尔什哈达玛(walsh-hadamard)变换 5、k-l(karhunen-loeve) 变换、二维离散余弦变换(dct)等 3。其中 1974 年,n.ahmed 等人提出的 dct 奠定了当前视频标准变换编码的基础。 1969 年在美国召开的首届“图像编码会议”表明图像编码以独立的学科跻 身于学术界。接下来的时间里,对图像编码技术的研究进入了高峰,70 年代开 始了对帧间预测编码的研究:80 年代开始了对运动补偿(mc:motion compensation)所用的运动估计(me:motion estimation)算法进行研究等等。 1990 年正式通过了国际电话电报咨询委员会(ccitt,现并入国际电信联盟 itu)1988 年形成草案的 itu-t h.261 建议 6。 h.261 建议是运动图像编码技术 40 年研究的结晶,标志着图像编码技术开始走入实用。随后出现的 mpeg-1, mpeg-2,h.263,mpeg-4,h.264/avc 等视频标准都是在 h.261 的基础上发展 和改进的。 1.2.2 视频压缩编码技术1.2.2 视频压缩编码技术 视频除了在时域和空域上存在大量冗余外,还存在信息熵冗余(也称编码冗 余)、结构冗余、知识冗余和视觉冗余等 1。视频编码主要目的是在保证一定重构 质量的前提下,以尽可能少的比特数来表征视频信息。整个处理过程的核心思想 是去相关,即降低视频信息的冗余度,实现对视频的压缩。 视频压缩编码是以 shannon 信息论为基础的。一般而言,信源编码的方法按 照压缩数据能否被准确恢复分为两大类:无损压缩和有损压缩。其中,无损压缩 虽可以无失真地恢复原始数据,但是压缩效率十分有限。在实际应用中通常都是 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 3 将二者结合使用,视频压缩编码也不例外。 视频压缩主要的编码方法有以下几种: 1、预测编码 预测编码方法 7是较为实用且被广泛采用的一种压缩编码方法,其理论基础 主要是现代统计学和控制论。原理是从相邻像素之间的相关性特点考虑,不是对 一个像素直接编码,而是用同一帧(帧内预测编码)或相邻帧(帧间预测编码)中的 像素值来进行预测,然后对预测残差进行量化、编码、传输。预测编码实际是利 用了视频信息的时空域冗余。预测编码一般分为线性预测和非线性预测两种,其 中线性预测编码即 dpcm。 2、统计编码 数据压缩技术的理论基础是信息论。根据 shannon 信息论的原理,数据压缩 的理论极限是信息熵, 如果要求在编码过程中不丢失信息量, 则要求保存信息熵。 这种信息保持的编码就是熵编码。它是建立在随机过程的统计特性基础上的。图 像编码中应用最广的有基于概率分布特性的霍夫曼编码(huffman coding) 8和算 术编码 9,以及基于相关性的游程编码等三类。 3、变换编码 变换编码通常是将空域相关的像素点映射到另一个矢量空间, 使得图像的能 量集中在低频区域,表示图像中缓慢变化的内容,而图像的边缘、细节的纹理等 细节部分集中在变换域的高频区,然后对这些变换系数进行量化、编码处理。 k-l 变换是均方误差下的最佳正交变换,但难于用硬件实现。当图像相邻像素间 的相关系数接近 1 时,k-l 变换的基函数接近 dct 变换的基函数。而且 dct 存 在快速算法 10,11, 易于硬件实现, 因此被广泛应用于多种图像/视频编码国际标准 中。 变换编码除了采用正交变换编码外,还有子带编码 12和小波编码13。子带编 码则是将图像分裂成几个不同频段的子带(sub-band),对不同的子带设计不同的 编码参数,提高图像质量。小波变换编码充分的利用了小波分析在时域和频域同 时具有良好的局部化特征,与人眼视觉特性相符的多分辨率能力,分解系数分布 平稳,自然分级的金字塔式数据结构等优点,在视频压缩领域引起广泛的关注。 上述预测编码、统计编码、变换编码的组合可形成混合编码,是目前 mpeg 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 4 系列和 h.26x 系列视频标准的基础。 这些编码方法都是依照视频图像固有的特性 进行压缩的。伴随着感知生理心理学的发展,人们越来越清楚地认识到:人的 视觉感知特点和统计意义上的信息分布不一致。 统计上需要更多的信息量才能表 征的特征,对视觉感觉可能并不重要。从感知角度而言,无需详细表征这部分特 征,这时压缩技术的研究就突破了传统信息论的框架。 随着数学理论,如小波变换、分形几何理论、数学形态学等以及模式识别、 人工智能、生理心理学等学科的发展,高效的,新型的压缩编码方法相继产生, 如分形编码、基于模型的编码、基于对象的编码等 14。 1.3 视频编码标准的发展及简介 1.3 视频编码标准的发展及简介 图像和视频编码已经成为一个广泛研究的课题。现在它的应用遍及各行各 业, 已经从纯学术研究转变为高度的商业行为。不断增长的商业需求进一步推动 着标准的形成,而标准的制定又进一步加强商业的应用与需求。目前从事视频压 缩标准制定的国际组织主要有国际电信联盟 itu-t 的视频编码专家组 vceg(video coding expert group)和国际标准化组织 iso/iec 的运动图像专家 组 mpeg(motion picture expert group)。两个标准化组织基于不同的应用需求, 采用近似的压缩编码技术, 分别制定了 h.26x 和 mpeg-x 系列视频压缩标准。 其 中 itu-t 针对可视会议等应用分别制定了 h.261,h.262,h.263,h.263+, h.263+, h.26l, h.264/avc; iso/iec 相继制定了 mpeg-1, mpeg-2, mpeg-4。 以上国际压缩标准尽管应用领域不同, 但是均采用了预测编码结合变换量化的混 合编码模式。其中两大视频标准化组织于 1992 年联合提出的 mpeg-2/h.262 是 现有最成功的国际视频压缩标准, 继而又再次联手提出了h.264/avc, 即mpeg-4 第 10 部分。 1) h.261 itu,1993 h.261 6是最早出现的视频编码标准,是 itu-t 的前身 ccitt 针对可视电 话、 视频会议和窄带isdn等要求实时编解码和低延时应用提出的一个编码标准。 它是视频压缩编码的一个里程碑。 itu-t 和 iso 后面公布的基于波形的一系列视 频编码标准方法都是基于 h.261 中的混合编码方法。它的输出码率是 p 64kbit/s,其中 p 为 0 到 31 的整数,当 p 小于 6 时,只能传输清晰度不太高的图 像,可应用于电视电话;当 p 大于 6 时,可以传输清晰度较好的图像,适用于视 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 5 频会议等。h.261 采用的算法主要是帧间预测和二维 dct 变换的混合编码方法, 该标准同时支持帧间编码和帧内编码,当帧间预测效率较低的时候,则直接采用 dct 变换。 2) mpeg-1 iso,1991 mpeg-1 15标准制定的目标码率是 1.2m 比特/秒,对于 cif (352288)格式 图像可以达到实时播放,是为只读 cd-rom 光盘的视频存储和播放所制定的。 类似于 h.261 标准,mpeg-1 也采用运动补偿和二维 dct 变换,量化后的 dct 系数进行变长编码,同时每个数据块的直流分量 dc 进行预测差分编码。在 mpeg-1 标准中,图像预测类型可以分为四种情况:帧内预测、前向帧间预测、 双向帧间预测和直接预测。 3) mpeg-2/h.262 iso,1995 mpeg-2 16的视频编码部分就是 h.262,该标准主要针对数字视频广播 dvb( digital video broadcast)、高清晰度电视 hdtv ( high digital television)和 数字光盘 dvd (digital video discard)等 49m 比特/秒运动图像的编码。 mpeg-2 作为一个得到广泛应用的国际标准,成功之处在于提出了通用的压缩编码方法, 定义了不同的“档次”(profile)和“等级”(level)可满足不同图像分辨率及相应的 存储成本和处理速度的需要。mpeg-2 标准根据不同的档次形成了各个不同的 子集,每个“档次”的“等级”则是对编码参数所做出的进一步限制。这样以不 同“档次”和“等级”设计的解码器能够对相同或者较低档次的数据解码。其中 一个主要的档次和等级组合是 mpml (main profile & main level)。 与 h.261 视 频标准相比,mpeg-2/h.262 开始使用半像素精度的运动矢量搜索,引入了“帧” 和“场”的编码方法,支持可分级性技术,包括空间可分级性、时间可分级性和 信噪比可分级性等。 4) h.263 itu,1996 h.263 17是为低码率视频压缩提供的新标准,目的是支持码率小于 64kbit/s 的应用。在 h.261 建议的基础上,h.263 进行了重要改进,采用了半像索精度的 运动矢量搜索,增加了非限制运动矢量,提出了基于语法的算术编码、先进预测 模式和 pb 帧编码等多个高级选项,从而达到了进一步降低码率和提高编码质量 的目的。h.263+和 h.263+扩充了 h.263 的编码可选项,提高了编码效率,适用 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 6 范围更大,同时支持 sqcif 等多种图像格式。h.263 在增加编码效率的同时, 增强了抗误码的差错隐藏性能将信道传输性能问题在信源编码中加以综合考虑。 5) mpeg-4 iso,1998 mpeg-4 18标准既能够支持低码率的视频应用,也能够支持广播级的视频应 用。 与其他标准相比, mpeg-4 标准中引入了视听对象 avo (audio-visual object) 的概念,这种编码模式能有效提高视频通信的交互能力和编码效率。mpeg-4 还 采用了诸如形状编码和自适应 dct 技术以支持任意形状视频对象的编码,以及 基于内容的可分级性操作。其自然视频编码的基本框架和 h.263 标准是接近的, 但是于“基于对象的编码”尚有技术障碍,在技术专利保护问题上迟迟难以找到 有效的收费形式,因此该标准目前仍然没有得到普遍应用。 6) h.264/avc iso,2002 h.264/avc 19是 itu-t 和 iso/iec 共同成立的联合视频组 jvt (joint video team)共同制定的新标准。jvt 于 1998 年 2 月正式开始征集协议提案,1999 年 8 月完成了第一版草案和相应的测试模型,2001 年 12 月,在 jvt 的第 1 次会议 (pattaya,thailand)上形成 h.264/avc 的第二版工作草案(work draft 2),并推出测 试模型 jm-1 (joint model number 1),2002 年 7 月的 jvt 第 4 次会议 (klagenfurt,austria)上推出了 h.264/avc 的会员草案版(committee draft), 提出 了相应的校验模型 jm-4,在 2003 年 3 月召开的最后一次全体大会(pattaya, thailand)上,给出了最后的草案和相应的测试模型。两个月后该标准提交给 iso/iec,通过讨论成为 mpeg-4 第十部分,形成正式版 20。 h.264/avc 在整个编码框架上和先前的标准没有太大差别,都包含预测、变 换、量化和熵编码这几个功能单元。但在每个功能单元的细节上,h.264 做了很 大的变动。h.264 在运动估值时可采用不同大小的块,更高精度的亚象素搜索、 多参考帧选择。变换时使用 44 整数变换而不是传统 88dct,在熵编码时使 用统一变长码 uvlc(universal variable length codes)或基于内容自适应的二进制 算术编码 cabac (context-based adaptive binary arithmetic coding)。 h.264 是近年 来最为高效的一个视频压缩标准,它的压缩效率比 mpeg-4 和 h.263+提高了近 50%。 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 7 1.4 码率控制概述 1.4 码率控制概述 当我们对视频序列进行编码的时候,每一时间单位所产生的码流的比特数各 不相同,因此在通信信道上(无论其传输率是恒定还是可变),必须在编码器和信 道间放置一个先入先出的缓冲区以平滑输入, 同时还需有一个控制系统来进行必 要的控制,这个控制系统就是码率控制,它通过选择一些编码器的参数来对由于 图像变化而引起的码率变化进行调整,防止缓冲区的上溢或下溢,从而使得输出 码流在保证图像质量稳定的条件下,适应有限的信道容量。换句话说,码率控制 策略的目的是,通过对量化参数的自适应选择,使视频编码器在一定视频数据带 宽的限制下能够保证较稳定的码率、帧率以及较小的视频时延。 一个简单的码率控制框图如图 1.1 所示。在此模型中,编码缓冲区用于避免 比特率的波动。通过监视缓冲区 bf 的满溢度,码率控制通过调整影响编码器比 特率的量化参数 qs 来防止缓冲区上溢和下溢。换言之,在量化处理过程中使用 qs 来控制比特率。量化参数越大,编码同一帧所产生的比特数就越少,但解码 后的图象质量就越差。码率控制就是在比特率和图像质量间进行最优均衡。 编码器 码率控制器 缓冲区 输入视频压缩码流输出码流 图 1.1 码率控制框图 1.5 论文研究的主要内容 1.5 论文研究的主要内容 h.264/avc 编码标准是新的、高效的视频编码标准。本文在研究 h.264 编码 标准中的码率控制算法的基础上,针对 h.264 码率控制算法的不足,提出了改进 方法。首先通过 psnr-qp 线性关系确定 i 帧的 qp;其次,在采用二次 r-q 模 型来确定 p 帧的 qp 时, 采用时间线性预测模型和时空加权预测模型相结合的方 法取代原有的时间线性预测模型来预测 p 帧基本单元的 mad 值, 并根据前一单 元的预测误差对 mad 值进行修正。 另一方面, 视频序列中出现场景切换时会影响码率控制的效果及图像序列的 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 8 编码质量,而 h.264 码率控制算法没有对应的解决办法。本文首先采用相邻帧的 像素灰度绝对差来检测视频序列中是否出现场景切换;对于检测到的切换帧图 像,改变其编码模式并调整 gop 结构,对调整后的 gop 重新分配比特、确定各 帧的量化参数。 1.6 论文章节安排 1.6 论文章节安排 第一章 简要回顾了视频编码发展历史和背景, 介绍了视频图像压缩的原理、 主要方法和国际标准,并给出了本文的主要研究内容及文章结构安排。 第二章 对 h.264/avc 编码标准的原理及工作框架进行了阐述,并介绍了该 标准采用的几项关键技术。 第三章 论述了码率控制的基本原理,并简要介绍了一些经典的码率控制算 法。 第四章 详细介绍了 h.264 码率控制算法,在分析该算法不足之处的基础上 提出了改进算法,给出实验结果。 第五章 研究了场景切换对码率控制的影响,提出了场景切换下的码率控制 改进策略。 第六章 对本文的主要工作进行总结,说明下一步的研究工作,对未来的研 究工作进行展望。 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 9 第二章 第二章 h.264 编码技术 编码技术 h.264 视频编码标准是由 itu-t 和 iso/iec 两大组织联合开发出来的新的视 频压缩编码标准 20, 在吸收以往各种编码方案的优点的前提下, 采用了整数变换、 rdo 等多项新技术,使编码效率得到很大提高。 2.1 2.1 h.264/avc 的产生及应用前景 的产生及应用前景 1996 年在初步完成 h.263 的制定工作后, itu-t 确定了近期(near term)和长 期的(long term)两个工作目标。 近期目标是进一步扩展和增加 h.263 的特色, 增 强低比特率编码性能,并产生了 h.263 的增强版,即 h.263+, h.263+。长期目 标是制定一种新的视频编码标准,以更好的质量、更高的压缩比支持视频会议等 低比特率应用,由此产生了 h.26l 草案 21。与此同时,iso/iec 也在继续进行 mpeg-4 高级视频编码 avc(advanced video coding)的研究。 最近几年来,随着通信技术和电信市场的发展,基于 ip 的、融合互联网与 电信网络的全新下一代网络(ngn)逐渐浮出, 这为视频应用的发展创造优越的条 件。但是,如何进一步提高视频压缩编码效率,在同样带宽的信道中传输更多路 视频信号仍是一个亟待解决的技术难题。随着 internet 和移动通信的迅猛发展, 如何在ip和无线环境下提高抗误码能力, 保真压缩后视频信号的服务质量(qos), 成为视频通信发展的另一关键技术难题。 2001 年,mpeg 对 h.26l 草案进行了评估并认识到 h.26l 潜在的优越性, 于是 mpeg 和 vceg 组成了联合视频专家组(jvt:joint video team),进一步完 善 h.26l 模型,共同发展新的视频编码国际标准。新标准于 2003 年 3 月正式颁 布 22,官方名称分别为:itu-t rec.h.264 和 iso/iec mpeg-4 part10 avc(简称 为 h.264/avc)。 与以往视频标准相比,h.264/avc 虽未做出重大改进,但在多编码模式、编 码参数自适应选择、上下文自适应熵编码、多参考帧的灵活选择、高精度预测、 去方块滤波以及抗误码能力等方面进行了精雕细刻, 采取了一系列的切合实际的 技术措施,较好地实现了预定的两个主要目标:1)相对于 h.263 和 mpeg-4,视 频压缩比提高一倍,或节约 50%的码率,2)对网络特别是 ip 和无线网络具有良 好的抗误码能力。 itu-t 在发展和制定 h.264/avc 的前身 h.26l 时,主要是为甚低比特率编 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 10 码提供一种高性能的编码国际标准,但随着 mpeg 的加入以及更多新技术的采 纳,h.264/avc 以其卓越的压缩性能在电视、hdtv、卫星电视、存储媒体、无 线多媒体应用等方面显示出了巨大的应用潜力。 2.2 2.2 h.264/avc 的编解码框架 的编解码框架 和以往的视频标准相同,h.264/avc 也是基于块匹配的混合编码框架;通过 帧内、 帧间预测和运动补偿来消除视频序列中的时空域冗余,经过变换编码消除 频域冗余,因此,基本的功能模块,例如预测、变换、量化、熵编码都没有发生 根本的变化。图 2.1、2.2 分别是 h.264/avc 编码器、解码器结构框图。 当前 变换量化重排序熵编码 运动 估计 参考 帧内预测 选择 帧内预测 运动 补偿 重建 滤波反变换反量化 1f n fn + - f n dn + + nal x 帧间 帧内 dn 图 2.1 h.264 编码器框图 参考 1f n 重建 f n 运动 补偿 帧内预测 滤波反变换反量化重排序熵编码 nal x 帧间 帧内 + + p uf n 图 2.2 h.264 解码器框图 然而,为了在相同的编码框架下实现更高的视频压缩性能和更广泛的适应 性,h.264/avc 在各个模块中都引入了更先进的技术,使各功能模块的实现细节 发生了重要的改变,例如多方向的帧内预测、1/4 像素精度的运动估计、多种块 编码模式、多参考帧选择、去块效应环路滤波、自适应二进制算术编码等 23。 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 11 2.3 2.3 h.264/avc的关键技术 的关键技术 2.3.1 2.3.1 vcl与与nal的分层设置 的分层设置 h.2 64/avc为了达到上述两个预定的主要目标及应用多变性,从功能上分 为两层:视频编码层(vcl:video coding layer)和网络提取层(nal:network abstraction layer),如图2.3所示。 数据控制 vcl 数据分割 nal h.320mp4ffh.323/ipmpeg-2 编码片/分割数据 图2.3 h.264/avc的vcl和nal分层示意图 vcl主要负责对数字视频进行高效编解码,提供具有高质量、高压缩比、健 壮性、可分级等特性的视频编码码流。这一部分也是整个h.264/avc视频编码标 准的核心部分,同时也是本文研究的重点。但如同前面所提到的,编码视频比特 流对于不同的传输网络和传输协议并不是具有普遍的适应性。 为此h.264/avc在 视频编码层的外部定义了nal。 nal主要负责将vcl产生的数据正确地映射到不同的传输网络中去。 当vcl 产生的比特流将在某种特定网络中传输时, nal针对这种网络及其传输协议的特 性,对vcl的编码码流进行适合该网络及其传输协议的封装。 这样h.264/avc就可以在面向不同的传输网络时, 灵活地提供不同的封装方 式,增强了网络的适应性。nal的提出不但使h.264/avc对目前现存的各种不同 网络有很强的网络友好性,而且使它对未来的网络同样具有很强的适应性 24,25。 2.3.22.3.2 帧帧/场编码的自适应选择场编码的自适应选择 众所周知,采用隔行扫描方式时,每帧图像分为两场,一般帧中的邻近行空 间相关性较强,场中的邻近行时间相关性较强,因此,帧编码可用于运动性较小 或静止图像的编码,而场编码用于运动性较大的图像编码。h.264/avc可以根据 图像运动剧烈程度自适应地选择编码方式。如果一帧图像包含一些混合区域,即 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 12 有的区域是运动的,有的区域是相对静止或运动小的,则前一区域采用场模式编 码, 后一区域采用帧模式编码。帧/场编码的判决由同一帧的每一垂直宏块对(16 32亮度区)做出,这种编码称为宏块自适应帧/场编码。 2.3.3 帧内预测 2.3.3 帧内预测 帧内预测编码的基本原理是利用已解码重构的邻近块像素来实现对当前编 码块的预测,对预测块和实际块的残差进行变换,量化,熵编码。通常,视频序 列空间相邻像素之间具有强相关性,存在大量的空域冗余,特别是在变化平缓的 背景区域,如图 2.4 所示。 图 2.4 qcif 测试序列 claire 的第 232 帧图像 显然在变化相对平缓的背景区域,由于相邻像素值相近,利用帧内预测可 以大大提高帧内编码的效率。在以往的编码标准中,帧内编码只是直接对像素值 进行变换、量化和熵编码,编码输出的比特数很多(在 h.263+中,帧内预测只是 可选的编码工具之一,而且当时采用的预测方法非常简单 26)。为了消除空间冗 余,进一步提高压缩比,降低帧内编码的比特数,h.264/avc 将帧内预测作为必 须的编码工具固定下来,并且进行了大量改进。 然而,图像的不同区域空间变化是不相同的。尤其是不同物体交接的边界区 域, 通常是图像空间变化最复杂的地方。如果在这类区域采用的帧内预测方式与 背景区域相同,编码效果一定会更差。为了提高帧内预测的质量,h.264/avc 提 供三种帧内预测方式 22: 1) 44 亮度块帧内预测 2) 1616 亮度宏块帧内预测 3) 88 色度宏块帧内预测 并且为每一种预测方式提供多种预测模式。 一般,图像相对变化较大的区域,需要更细小的块分割和更多可选的预测模 式,以提供足够的预测精度,因此 44 亮度块帧内预测采用 9 种预测模式。 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 13 而 1616 亮度宏块帧内预测,更适合用在变化较平缓且面积较大的区域,预测 模式也相应有所减少,只有四种。另外,由于人类视觉系统(hvs:human visual system)对色度变化的敏感性低于亮度,因此 88 色度块帧内预测所需预测模式 少于 44 亮度块帧内预测,共有四种模式。 2.3.3.1 44 亮度块帧内预测 2.3.3.1 44 亮度块帧内预测 图 2.5 为 44 亮度块帧内预测的像素及预测方向图。 (a) (b) 图 2.5 44 亮度块帧内预测和预测方向示意图 图 2.5(a)中大写字母 a-q 表示相邻块已解码重构的像素(当这些像素在图像 外部或编码次序上滞后于被预测像素时称为不可得),小写字母 a-p 表示被预测 的 44 亮度块的 16 个亮度像素。 由于预测模式 2 为 dc 预测,不包括在预测方向图中,所以图 2.5(b)中所示 只是 44 亮度块其余 8 种预测模式的预测方向图。 九种预测模式分别为: 模式 0:垂直预测 模式 1:水平预测 模式 2:dc 预测,没有表明在图中 模式 3:下-左对角线预测,与模式 0 成 45 度角 模式 4:下-右对角线预测,与模式 1 成 45 度角 模式 5:垂直-右斜线预测,与模式 0 成 22.5 度角 模式 6:水平-下斜线预测,与模式 1 成 22.5 度角 模式 7:垂直-左斜线预测,与模式 0 成 22.5 度角 模式 8:水平-上斜线预测,与模式 1 成 22.5 度角 需要特别说明的是:上述各种预测模式的选择以相邻块的像素是否可得为前 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 14 提。不同预测模式下的像素 a-p 的预测值计算公式可参考文献22。 2.3.3.22.3.3.2 1616 亮度宏块帧内预测1616 亮度宏块帧内预测 1616 亮度宏块帧内预测共有 4 种预测模式,模式 0:垂直预测;模式 1: 水平预测;模式 2:dc 预测;模式 3:平面预测(plane),采用一个线性平面函数, 这在亮度变化平缓的区域预测效果非常好。预测模式的描述如图 2.6 所示。 模式 0(垂直预测) 模式 1(水平预测) 模式 2(dc 预测) 模式 3(平面预测) 图 2.6 1616 亮度宏块帧内预测模式示意图 2.3.3.3 88 色度块帧内预测 2.3.3.3 88 色度块帧内预测 与 1616 亮度宏块帧内预测的预测模式相比,除了 dc 预测有点细微区别 外,其他预测模式十分类似。预测模式分为模式 0:dc 预测,模式 1:水平预 测,模式 2:垂直预测,模式 3:平面预测。 色度宏块包含u、v两个色度分量宏块。在进行88色度宏块帧内预测时, 对两者采用相同的预测模式。预测值计算公式参考文献22。 2.3.4 先进的帧间预测技术 2.3.4.1 多种块模式的帧间预测 2.3.4 先进的帧间预测技术 2.3.4.1 多种块模式的帧间预测 与以往的视频编码标准类似, h.264/avc的帧间预测也是基于块的运动补偿 预测。过去的标准只定义了两种块的大小,分别为1616和88的正方形块(8 8的块是在h.263和mpeg-4中定义的)。但是由于视频图像的复杂性,在较大的块 中可能包含多个具有不同运动状态和不同形状的对象。 特别是在运动剧烈的局部 区域中,用一个宏块或4个(88)运动矢量并不能准确地描述一个宏块全部的运 动细节。 因此,为了更为准确地描述宏块的运动细节,h.264/avc定义了7种不同尺 寸和形状的宏块划分,如图2.7所示,一个1616亮度块可以按以下四种方式划 分:1616,168,816,88;一个88的图像块可以分为:88,84, 48,44。 华侨大学硕士论文: h.264/avc 编码器的码率控制算法研究 15 16x16 16x88x168x

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论