已阅读5页,还剩69页未读, 继续免费阅读
(信号与信息处理专业论文)dct域hdtv至sdtv视频转码器关键算法的研究与实现.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 摘要 d c t 域h d t v 至s d t v 视频转码,与传统的像素域转码相比,不仅避免了 d c t 、i d c t 运算,还通过利用输入h d t v 码流中宏块的运动矢量信息直接构造转 码后s d t v 相应宏块的运动矢量,避免了运算量极大的运动估计过程,有利于h d t v 至s d t v 实时转码的实现。 本文主要研究在d c t 域内基于宏块公共信息的运动补偿快速算法和利用d c t 系数进行码率控制算法。本文给出的运动补偿快速算法与传统的d c t 域运动补偿 算法相比,可以节省4 4 的运算量。给出的码率控制算法与传统的t m 5 算法相比, 不仅使编码生成的图像信噪比有所提高,而且解决了场景切换问题。 转码的关键算法由c 语言实现,并通过基于i n t e lp e n t i u m4c p u 具备s i m d 功 能的s s e 2 汇编指令集优化运算量大的转码程序,最终在p c 平台上实现了在d c t 域内h d t v 至s d t v 的快速视频转码。 关键词:视频转码,d c t 域运动补偿,码率控制,s s e 2 ,m p e g 2 a b s t r a c t a b s t r a c t c o m p a r e dw i t ht h et r a d i t i o n a lp i x e ld o m m nv i d e ot r a n s c o d i n g ,t h et r a n s c o d i n g f r o mh d t vt os d t vi nt h ed c td o m a i n ,n o to n l ya v o i d st h ed c ta n di d c t t r a n s f o r m s ,b u ta l s oa v o i d sm o t i o ne s t i m a t i o n ,t h em o s tc o m p u t a t i o nc o s t i n gp r o c e s s ,b y m a k i n gf u l lu s eo ft h em a c r o b l o c km o t i o nv e c t o ri n f o r m a t i o nf r o mt h ei n p u th d t v s t r e a mt oc o n s t r u c tt h em o t i o nv e c t o rf o rt h ea c c o r d i n gs d t vm a c r o b l o c k s i t sh e l p f u l t oa c h i e v et h eh d t vt os d t vv i d e ot r a n s c o d i n gi nt h er e a lt i m e t h i sd i s s e r t a t i o np r e s e n t st h er e s e a r c ho nt h ef a s tm o t i o nc o m p e n s a t i o na l g o r i t h m w i t ht h es h a r e dm a c r o b l o c ki n f o r m a t i o ni nt h ed c td o m a i na n dr a t ec o n t r o la l g o r i t h m w i t hd c tc o c m c i e n t s t h ef a s tm o t i o nc o m p e n s a t i o nc a ns a v e4 4 c o m p u t a t i o n c o m p a r e dt ot h et r a d i t i o n a lm o t i o nc o m p e n s a t i o ni nt h e d c td o m a i n c o m p a r e dw i m t h e t m 5m e t h o d ,t h er a t ec o n t r o la l g o r i t h mc a l ln o to n l yi n e a s et h ee n c o d i n gi m a m s p s n r ,b u ta l s os o l v et h es c e n ec h a n g ep r o b l e m t h ek e yt r a n s c o d i n ga l g o r i t h m sa r ea c h i e v e db yt h ec l a n g u a g e ,a n dw eo p t i m i z e t h em o s tc o m p u t a t i o nc o s t i n gt r a n s c o d i n gp r o g r a m sw i t ht h es s e 2a s s e m b l yl a n g u a g e , w h i c hi sb a s e do nt h ei u t e lp e n t i u m4c p ua n dh a st h es i m df u n c t i o n a tl a s t ,w e a c h i e v et h eq u i c kv i d e ot r a n s c o d i n gf r o mh d t vt os d t vi nt h e d c td o m m no nt h ep c k e y w o r d :v i d e ot r a n s c o d i n g ,m o t i o nc o m p e n s a t i o ni nt h ed c td o m a i n ,r a t ec o n t r o l , s s e 2 ,m p e g 2 i i 独创性声明 本人声明所呈交的学位论文是本人在导师指导下进行的研究工 作及取得的研究成果。据我所知,除了文中特别加以标注和致谢的地 方外,论文中不包含其他人已经发表或撰写过的研究成果,也不包含 为获得电子科技大学或其它教育机构的学位或证书而使用过的材料。 与我一同工作的同志对本研究所做的任何贡献均已在论文中作了明 确的说明并表示谢意。 签名:鬈筮日期:砂佴弓月旧 关于论文使用授权的说明 本学位论文作者完全了解电子科技大学有关保留、使用学位论文 的规定,有权保留并向国家有关部门或机构送交论文的复印件和磁 盘,允许论文被查阅和借阅。本人授权电子科技大学可以将学位论文 的全部或部分内容编入有关数据库进行检索,可以采用影印、缩印或 扫描等复制手段保存、汇编学位论文。 ( 保密的学位论文在解密后应遵守此规定) 签名: 称锨 导师签名: 日期:咿,年弓月日 第一章绪论 1 1 论文研究的目的和意义 第一章绪论 随着数字视频信源压缩技术、信道传输技术以及大规模集成电路技术的发展 与成熟,数字电视正走入人们的生活,人们不仅可以通过有线电视网络、高速互 联网在电视及p c 上收看高质量的数字电视节目,还可以通过手持移动设备,如手 机、掌上电脑等设备,无线移动地接收数字电视节目。不同的接收终端设备,在 数据处理速度、存储容量和显示能力上相差很大,因此在处理视频信息时,对不 同的接收终端使用同一格式的数据是不合适的,需要根据不同终端设备的处理能 力和接收带宽,进行视频转码,转换成不问的格式,再分别传输给不同的接收终 端。 数字视频转码技术就是对视频编码后的数据流进行端到端的处理,使其从一 种格式转变为另一种格式。所谓的格式包括编码标准、空间分辨率、帧速率、数 据传输率等等,其中任何一项特征发生改变都认为是发生了转码。实现转码功能 的设备称为转码器。转码器的输入、输出都是压缩视频数据流,转码后的视频数 据流要能够适应传输带宽以及接收端的某些特定要求。 本文高清晰度电视( h d t v ,简称高清电视) 至标准清晰度电视( s d t v ,简 称标清电视) d c t 域视频转码,是在m p e g 2 框架内,将视频编码码流由主框架高 级别( m p h l ) ,图像分辨率为1 9 2 0 x 1 0 8 0 ,宽高比为1 6 :9 的高清电视转换为主框架 主级;b t j ( m p m l ) ,分辨率为6 4 0 4 8 0 ,宽高比为4 :3 的标清电视,它不仅降低了 图像的分辨率,压缩了视频编码量,而且降低了对视频数据传输信道带宽的要求, 可以使那些具备实时解码并显示标清电视能力但图像显示能力、数据处理能力、 接收带宽等都无法满足高清电视接收、播放的终端设备,通过转码,接收并显示 标清电视节目。这样可以充分利用现有的终端设备,避免不必要的硬件升级,因 此高清电视到标清电视的转码,有着广泛的应用前景。 本文所涉及的d c t 域运动补偿和码率控制等算法,不仅是高清至标清电视 d c t 域视频转码的重要组成部分,而且对于其它不同视频压缩编码标准间的视频 转码同样有着借鉴意义。 电子科技大学硕士学位论文 1 2 转码的分类 视频转换编码主要有以下几种情况:码率转换、分辨率转换和语法间的转换。 其中码率转换、分辨率转换多用于按相同视频压缩编码标准生成的同类码流之间 的转码【”。 1 ) 码率转换 码率转换主要应用于电视广播和网络传输中,可以保证数字广播中特定级之间 的兼容性和网络传输中在保证有效传输的情况下,尽可能地节省带宽。码率转换 主要通过采用较粗的二次量化系数q ,实现,如图1 - 1 所示,对输入的码流经过可 变长解码( v l d ) 、反量化( 所1 ) 后,得到的d c t 系数直接作二次量化( q :) ,变长编 码( v l c ) ,输出所需要的码流。但这种方法前后两次量化误差的叠加会造成很大的 误码扩散。因此采用闭环结构来对漂移误差进行补偿,保证转码后的图像质量, 如图卜2 所示,其中m c 为运动补偿器,f r a m es t o r e 为帧存储器。 输坚叵 习互h 筘流 图1 - 1 码率转换开环框架示意图 图1 - 2 码率转换闭环框架示意图 流 第一章绪论 2 ) 分辨率转换 分辨率转换分为时间分辨率转码和空间分辨率转码。主要针对用户解码器的 一些限制,如实时处理能力、解码端处理能力及用户端显示器分辩率等。时间分 辨率转码是指帧率变换,可以通过丢弃不作为其它帧参考帧的双向预测b 帧来实 现。如果需要对帧内编码i 帧和前向预测p 帧进行丢帧操作,则会影响其它帧运动 矢量的指向,所以要考虑受影响运动矢量重新估计问题。 空间分辨率的转换,涉及的难点有:如何从原始压缩码流的运动矢量映射出降 低分辨率的图像宏块所对应的运动矢量:如何由原始压缩码流的宏块纹理数据在 压缩域中下采样获得新的纹理数据:以及考虑能够补偿误码扩散的转码结构以尽 可能地减少图像质量的下降。 3 ) 语法转码 语法转码指输入和转码输出的码流遵循不同的压缩标准,这部分研究主要集 中在不同标准在具体的语法、码流结构组织上的对应转换。 1 3 数字电视简介 数字电视,指从视音频信源开始,将图像画面的每一个像素、伴音的每一个 音节都用二进制数编码成多位比特数,再经过高效的信源压缩编码和前向纠错、 交织与调制等信道编码后,以非常高的比特率进行码流发射、传输和接收的系统 工程。全部过程都是数字化的。 数字电视根据其图像分辨率可以分为三类:h d t v ( h i g h d e f i n i t i o nt v ) 高清晰 度电视;s d t v ( s t a n d a r dd e f i n i t i o nt 标准清晰度电视;l d t v ( l o wd e f i n i t i o nt v ) 低清晰度电视。其中,h d t v 一般指水平隔行分辨率达到1 0 8 0 线或逐行分辨率达 到7 2 0 线,宽高比为1 6 :9 的数字电视节目;s d t v 一般指图像水平分辨率约为4 0 0 线的,相当于d v d 图像质量的,宽高比为4 :3 的数字电视节目;l d t v 一般指图 像水平分辨率低于4 0 0 线的相当于v c d 图像质量的数字电视节目。 数字电视按传输方式分为地面、卫星和有线三种。1 9 9 5 年,欧洲1 5 0 个组织 成立了d v b ( d i g i t a lv i d e ob r o a d c a s t i n g ,数字视频广播) 联盟,这个联盟现在已经 拥有近2 0 0 个成员。1 9 9 7 年,d v b 联盟发表了它的数据广播技术规范,包括卫星 数字电视传输标准d v b s 、有线电视传输系统标准d v b c 和地面传输标准d v b 。t , 为卫星、有线和地面电视频道传送高速数据铺平了道路。其中,d v b s 规定了卫 星数字广播调制标准,使原来传送一套p a l 制节目的频道可以传播四套数字电视 电子科技大学硕士学位论文 节目,大大提高了卫星的效率。d v b c 规定了在有线电视网中传播数字电视的调 制标准,使原来传送套p a l 制节目的频道可以传播四至六套数字电视节目。 d v b s 和d v b c 这两个全球化的卫星和有线传输方式标准,目前已作为世界统一 标准被大多数国家所接受( 包括中国) 。而对于地面数字电视广播标准,经国际电 讯联盟( i t u ) 批准的共有三个,分别为:欧盟的d v b t 标准、美国的 a t s c ( a d v a n c e d t e l e v i s i o ns y s t 6 l a c o m m i t t e e ,先进电视制式委员会) 标准和日本的 i s d b t ( i m e g r a t e ds e r v i c e sd i g i t a lb r o a d c a s t i n g ,综合业务数字广播) 标准,因此, 数字电视标准之争主要集中在地面数字广播系统。 1 4 论文选题依据和主要研究工作 最简单的视频转码方法是先将输入视频码流完全解码至像素域,在像素域内 进行图像的采样处理,然后再按相应视频压缩编码标准重新进行编码,这种转码 方法被称为级联像素域转码。此方法由于在二次编码时对宏块的运动矢量和编码 模式都重新做了计算,因此重建图像质量高、失真小、但是转码效率低,计算量 大、时问延迟大,难以达到安时转码的要求”1 。 另一种转码方法是压缩域( d c t 域) 转码,其基本思想是充分利用输入码流中的 编码信息,如视频序列头信息、宏块编码模式信息、运动矢量信息和量化后的d c t 系数等,直接生成转码后的码流。这种方法极大地降低了转码过程的运算量,而 且转码效率高,延迟小,适合于视频处理基本算法相同的压缩编码标准之间的视 频转码。 本文h d t v 至s d t v 转码是在d c t 域内实现高清到标清的转码,与传统的像素域 转码相比,在d c t 转码不需要对输入码流完全解码n 像素域,完全避免了d c t 、 i d c t 运算:通过解码输入码流中宏块运动矢量信息,可以直接在d c t 域内进行图 像的运动补偿;运动补偿后的图像,可以直接在d c t 域内进行图像空间分辨率的 下采样;利用解码的输入码流中宏块运动矢量可直接重构出转码后图像的相应运 动矢量,避免运算量极大的运动估计过程。因此在d c t 域内进行转码,可以获得 较高的计算效率,避免不必要的编解码延迟,有利于实时转码的实现。 本文的主要工作: 1 ) 视频压缩编码基本算法和m p e g 2 标准的学习与研究。 2 ) d c t 域运动补偿快速算法的研究及软件实现。 2 ) d c t 域运动补偿快速算法的研究及软件实现。 4 第一章绪论 3 ) 码率控制算法的研究及软件实现。 4 ) 利用s s e 2 汇编指令集对转码程序进行优化提速,以实现h d t v 至s d t v 的快速 转码。 1 5 论文的组织结构 论文共分七章来详细论述所作的研究工作。这七章分别为: 第一章:绪论 介绍论文研究课题的目的、意义和选题依据,给出论文的组织结构。 第二章:视频压缩编码及m p e g 2 标准简介 介绍视频压缩编码原理、主要压缩技术和m p e g 2 视频压缩标准基本语法知识 和视频编解码流程。 第三章:d c t 域转码框架2 乏d c t 域视频处理算法 给出本文d c t 域视频转码的转码框架和d c t 域视频处理的基本算法。 第四章:d c t 域转码关键模块算法 给d c t 域运动补偿、图像分辨率下采样、运动矢量重构和宏块编码模式重 构等转码关键算法。 第五章:码率控制 给出一种基于- t m 5 的d c t 域码率控制算法,可应用于转码后图像进行编码时的 码率控制,并解决了场景切换等问题。 第六章:视频转码的软件优化 介绍关于视频转码软件优化所采取的策略和基于i n t e lp e n t i u m4c p u 的单指 令多数据( s i m d ) ? e 编指令集s s e 2 的相关语法知识。 第七章:高清到标清电视d c t 域视频转码的软件实现 介绍实现高清到标清电视d c t 域视频转码的软件平台,并给出转码结果的测试 数据,最后对全文进行总结与展望。 电子科技大学硕士学位论文 第二章视频压缩编码及m p e g 2 标准简介 2 1 视频压缩编码的必要性 在多媒体信息处理中,最基本的需求是能动态实时地处理声音、动画、视频 信号,而图像的数据量是十分庞大的,若不对视频数据进行压缩处理,实时性很 难达到。例如,视频图像为中等分辨率6 4 0 4 8 0 ,帧率为2 5 帧秒,每采样点8 比 特量化,色差格式为4 :2 :2 ,它每秒的数据量为1 2 2 8 8 m b i t s ,如果直接在容量为 4 7 g b 的d v d 格式光盘中保存,则只能保存不到6 分钟的内容。而对于相同条件 分辨率为1 9 2 0 1 0 8 0 的高清晰度数宇电视图像来说,每秒的数据量将达到8 2 9 4 4 m b i t s ,则容量为4 7 g b 的d v d 格式光盘只能保存不到5 0 秒的内容。而数字电视 地面广播系统的传输带宽仅有6 m h z 到8 m h z 因此无论是存储还是传输,数字视频 都必须经过极大的压缩才能具有实际意义,这就使得视频压缩编码技术成为多媒 体技术的关键所在。 2 2 视频压缩编码原理和主要压缩技术 2 2 1 视频序列的冗余 视频压缩编码的目的是实现对视频的压缩,其核心思想是去相关,通过减少 视频序列间的相关性,降低视频内容的冗余,用较少的比特数来表示视频内容, 从而实现对视频的压缩。视频序列的冗余主要有以下几个方面【3 】 空间冗余 空间冗余是指在同一帧画面中,相邻的像素间存在的相关性,特别是当这些 相邻像素位于同一个视频对象中,相关性极强。例如在图像的背景区域。 时间冗余 通常对视频序列而言,除非发生场景切换,否则相继帧在时间上都是连续的。 在前后两帧中往往包含与当前帧相同的背景和对象。只是由于镜头的转动或对象 的移动使得空间位置发生变化。运动越缓慢,位置的变换越小。因此视频序列在 时域存在极强的相关性。 第二章视频压缩编码及m p e g 2 标准简介 编码冗余 对于视频编码符号,其平均码长高于所表示信息的信息熵,这个差值就形成 了编码冗余。编码冗余、空间冗余和时间冗余都依赖于图像数据的统计特性,可 以统称为统计冗余。 人眼视觉冗余 由于人眼视觉的非均匀性,使得人眼视觉对某些空间频率感觉迟钝。因此视 频中不同频率成分的内容对于人眼系统而言其重要性是不同的。也就是说存在频 域冗余。例如人眼视觉系统对亮度信号变化的敏感性高于色度信号变化。因此可 以对色度分量进行下采样,同时保持主观视觉质量不变。y u v 4 :2 :0 色差格式就 是对色度分量在水平和垂直两个方向进行2 :1 的下采样。另一方面对信号频域的 各个分量可以采取不同的量化系数,将人眼视觉不敏感的分量去除,丽不会引起 主观视频质量的下降。 结构冗余和知识冗余 图像的某些区域存在非常强的纹理结构,图像像素值有明显的分布模式,形 成结构冗余。或者图像中包含的信息与某些先验知识有关,例如人的五宫位置对 于人脸而言就是一种先验知识,这种冗余构成知识冗余。 2 2 2 视频压缩编码中的主要压缩技术 视频信源编码的方法按照压缩数据能否被准确恢复分为两大类:无损编码和 有损编码。虽然无损编码可以无失真的恢复原始数据,但其压缩效率十分有限。 因此在视频压缩中都是将无损编码和有损编码结合使用。视频编码中主要压缩技 术有以下几种。 预测编码 预测编码不是对一个像素直接编码,而是用同一帧( 帧内预测编码) 或相邻 帧( 帧间预测编码) 中的像素值来进行预测,然后对预测残差进行量化和编码。 显然预测编码实际是利用了图像数据中的空间和时间冗余。线性预测编码又称为 差分脉冲编码调制d p c m ( d i f f e r e n t i a lp u l s ec o d em o d u l a t i o n ) ,由于算法简单,易于 硬件实现,已被各种视频编码标准采纳。 帧间预测编码的主要方法有帧重复法、帧内插法和运动补偿法。其中运动补 偿法在视频编码中使用的最为广泛。运动补偿预测通常可以采用单向预测( 一个 参考帧) ,双向预测( 两个参考帧) 和捶值预测( 取两个参考帧预测值的平均) 来 7 电子科技大学硕士学位论文 实现。由于运动补偿预测可以有效地减少视频序列的时域冗余,因此成为构成当 前主要视频编码标准的最基本技术之一。 变换编码 变换编码是构成当前主要视频编码标准的另一项最基本技术,用来消除图像 的频域冗余。 正交变换编码通常是将空域相关的像素点映射到另一个正交矢量空间,使得 变换后的系数之间相关性降低。常见的正交变换有k - l ( k a r h u n e n l o e v e ) 变换、 离散傅立叶变换d f t ( d i s c r e t ef o u r i e rt r a n s f o r m ) 、离散余弦变换d c t ( d i s c r e t e c o s i n e t r a n s f o r m ) 等。k l 变换是均方误差准则下的最优变换,但实现困难,在现 行视频编码标准中几乎都采用了性能最为接近k l 变换的d c t 变换。d c t 变换是 1 9 7 4 年a h m e d 提出的【4 】,它具有一组固定的基函数,以及很好的能量压缩和去相 关特性。由于d c t 变换采用实数计算,加上有效的快速算法出现,使得硬件实现 成为可能,因此被广泛地采用。 变换编码除了采用正交变换编码外,还有子带编码和小波编码。由于正交变 换编码使得图像的能量集中在低频区域,表示图像中缓慢变化的内容,而图像的 边缘、细微的纹理等信息细节部分集中在变换域的高频区。为了实现压缩,通常 采用同一个量化器进行量化,这样就牺牲了图像的细节部分,造成解码图像模糊。 在高压缩比时,基于块的正交变换编码还会产生块效应和振铃效应,降低图像质 量。 而子带编码则是将图像分裂成几个不同阶段的子带,对不同的子带设计不同 的编码参数,提高图像质量。小波变换编码充分的利用了小波分析在时域和频域 同时具有良好的局部化特性,与人眼视觉特性相符的多分辨率能力,分解系数分 布平稳,自然分级的金字塔式数据结构等优点,在视频压缩领域引起广泛的关注。 它利用与正交分解完全不同的小波分解,以原始图像为初值,不断的将上一级图 像分解为4 个子带;上一级图像中的低频信息、垂直方向、水平方向和对角线方 向的边缘信息。从多分辨率分析出发,一般每次只对上一级的低频子图图像进行 分解。将整个图像而非其中的块作为整体进行传送,因此不会产生块效应。由于 小波变换的金字塔式数据结构的每一层都包含整个图像的信息,只是其中的分辨 率不同,因此可以选择传送部分或全部,非常简单,自然的实现可分级视频编码。 第二章视频压缩编码及m p e g 2 标准简介 统计编码 根据香农信息论的观点,信源冗余度来自信源本身的相关性和信源内部事件 概率分布的不均匀性。统计编码主要有基于概率分布特性的霍夫曼编码和算术编 码,以及基于相关性的游程长度编码三类。 霍夫曼编码( h u f f m a nc o d i n g ) 是一种变长变码v l c ( v a r i a b l el e n g t hc o d i n g ) , 霍夫曼编码将信源符号按概率大小重新排序,通过二叉树算法,依次将两个概率 最小的节点合并,直到根节点。完成树的构造后,给所有的树枝分配0 和1 ,这样 就可以给高概率符号分配短码,而概率小的符号则分配较长的码字,去除符号间 的统计冗余。在已知信源符号概率时,可以给出极好的编码性能。但霍夫曼编码 严重依赖信源的统计特性,编码前必须有信源概率分布的先验知识。对于复杂的 视频来说,只能用对大量数据统计后获得的近似分布来代替,因此实际应用时无 法达到最佳性能。另一方面v l c 提高了编码效率,但不利于硬件实现。 游程长度编码r l c ( r u n l e n g t hc o d i n g ) 是将符号值相同的连续符号串用一个 游程长度( 符号数) 和一个代表值描述。这样可以用更紧密地序列代替原有的相 同值符号串。在视频压缩中,量化后的数据常常出现大量的连零系数,利用游程 长度编码可以有效的降低表示零码的比特数。 算术编码( a r i t h m e t i cc o d i n g ) 是2 0 世纪8 0 年代发展起来的,理论上,算术编 码和霍夫曼编码都是最佳的,但在信源概率分布未知的情况下,算术编码优于霍 夫曼编码。算术编码的基本原理是用 0 ,1 之间的一个概率区间来表示数据序列。 将信源x 的一个给定状态x = k ,x 。 与 0 ,1 间的一个由大概率p 和小概率q 限 定的概率子区间相联系,区间的长度等于序列的概率p 0 ) 。编码器从n = i 开始,逐 位的处理输入的符号流。每输入一位,更新当前符号的条件概率,并以此调整p 和 q 限定的概率子空间。随着n 的增加,和输入符号序列相联系的概率子区间就变得 越来越小。最后,用这个表示概率子区间的小数给符号序列编码。 2 3 视频压缩编码标准 视频编码技术的标准化给不同的厂商和视频提供者奠定了一个共同工作的基 础,也为编码视频的交互和更为广泛的应用创造了必要的条件。开发一种国际标 准需要来自不同国家的许多同行合作,并需要一个能支持标准化过程和实施标准 的组织。视频编码国际标准的制定主要由i t u t ( i n t e r n a f i o n a lt e l e c o m m u n i c a t i o n u n i o n t e l e c o m m u n i c a t i o ns t a n d a r d i z a t i o n s e c t o r ) 和 i s o i e c ( i n t e m a t i o n a l 9 电子科技大学硕士学位论文 o r g a n i z a t i o nf o rs t a n d a r d i z a t i o n i n t e m a t i o n a le l e c t r o t e c h n i c a lc o m m i s s i o n ) 负责。 i t u - t 相继发布了h 2 6 x 系列标准,而i s o i e c 则推出了m p e g 系列标准。而这 些标准都是建立在基于块匹配的混合编码框架下的,并且有非常类似的结构。下 面对基于块匹配混合编码框架的基本结构,必要算法和相关视频编码标准作一个 简要介绍。 2 3 1 混和编码框架下的视频编码器 基于块匹配混合编码框架下的视频编码系统是将编码帧划分为n n 大小的 块,每一个块相对独立的进行处理。其核心思想是利用帧间预测编码消除图像序 列中的时域冗余,利用变换编码消除频域冗余。其编码器框图如图2 - 1 所示,其中, m c 是运动补偿器,m e 是运动矢量估计器,v l c 为变字长编码器,q 、i q 为量化 反量化器,d c t 、i d c t 为d c t 变换和反d c t 变换。 图2 1 块匹配混合编码器框图 d c t 变换和量化 除h 2 6 4 标准采用4 4 整型d c t 变换外,其他的标准都采用8 x 8 的d c t 变换, 其定义如下: 舷v ) = 丙2 ) 喇n 乞- i n 艺- i 舷加鼍笋c 。警公式( 2 - 1 x - - o ,- - a ) 川“v二fv 其中, “,v ,五y = 0 , 1 2 ,n l ;n = 8 ,x ,y 是像素域的空间坐标;“,v 是d c t 域的坐标。当 “:v = 0 时,c o ) = c ( v ) = l i ,当“,v 为其它值时,c ( “) = c ( v ) = 1 。 第二章视频压缩编码及m p e g 2 标准简介 i d c t 变换的定义如下: ,旺,y ) = 万2n 盖- i n 舌- 1 c ( “) c ( v ) ,( “,v ) c 。”( 2 x 2 + 1 ) u zc 。s ! ! 号亨翌 公式( 2 2 ) d c t 变换本身并不能实现数据压缩,6 4 个块系数变换后,还有6 4 个变换系 数。但d c t 变换具有良好的能量聚积能力,可以将能量以较大幅度集中在少数低 频系数上。图2 - 2 是d c t 变换能量聚积示意图 8 3 8 3 7 9 7 7 7 8 6 9 7 9 8 0 6 0 9 4 5 31 1 6 6 81 7 l 7 71 7 9 7 81 7 9 8 01 7 9 7 918 0 7 91 8 1 5 31 9 4 7 61 8 7 8 21 7 9 7 71 7 9 7 61 8 2 7 91 8 3 8 21 8 3 7 91 8 l 6 3 6 6 7 0 6 5 6 4 6 9 6 9 7 0 3 21 6 5 i 3 01 6 9 i i 3 11 6 7 l 3 11 6 1 l 3 01 7 1 l 3 21 6 9 l 2 91 7 3 l 3 01 6 9 i 块的像素系数矩阵 图2 - 2d c t 变换能量聚积示 3 1 35 6 2 71 87 8 6 02 7 l 一3 8 - 2 71 34 43 2 一l - 2 4 i - 2 0 - 1 71 03 32 1 - 6 - 1 6 | - 1 0 - 8 91 79 - 1 0 - 1 3 l 一6i64 3 7 5 230 3 7 40 4 4 一l 一2 9 02 3 10 4 2 - i3 块的d c t 系数矩阵 意图 2 7 1 0 - 9 通过随后的量化器量化,对人眼比较敏感的低频分量,高频附近能量幅度较 小的系数常常会出现连零串。在经过“之”扫描后,在后续的熵编码阶段实现有 效的压缩。 运动估计 块匹配运动估计b m m e ( b l o c k m a t c h i n gm o t i o ne s t i m a t i o n ) 因其性能良好,易于 硬件实现而被系列视频压缩标准所采纳。图2 3 为块匹配运动估计示意图。 当前编码帧被分割成mx n 的块,运动估计就是基于一定的匹配代价准则,在 参考帧中给定搜索窗口中寻找当前编码编码块的最佳匹配。常见的匹配代价准则 为s a d ( s u mo fa b s o l u t ed i f f e r e n c e s ) 、s s d ( s u mo fs q u a r e dd i f f e r e n c e s ) 、 c c f ( c r o s s c o r r e l a t i o nf u n c t i o n ) 和p d c ( p i x e ld i f f e r e n c ec l a s s i f i c a t i o n ) 。s a d 因其 计算简单常被选作运动估计的匹配代价准则。在获得最佳匹配后,就得到了相应 的运动矢量m v , 最后预测块和原始块的残差以及运动矢量被编码传送。 电子科技大学硕士学位论文 参考帧当前帧 奄蓦| ;| | | 誊i 囊誊:i 一鬻 垂萎删 蕤 编码块 黼 匹配块 徽 搜索窗口 m v :运动矢量 _ = 。“ 图2 - 3 块匹配运动估计示意图 获得最佳匹配块的过程叫运动搜索。最基本的运动搜索为全局搜索f s ( f u l l s e a r c h ) ,即在搜索窗口中逐点搜索当前块的最佳匹配块。对c i f 格式的图像( 图像 分辨率为3 5 2 x2 8 8 ) ,当m = n = 1 6 艘索半径为3 1 时,全搜索每秒钟需完成1 ,9 4 1 0 ” 次加法和9 7 4 1 0 ,次比较运算熨,因此运动搜索就成为基于块匹配混合系统计算瓶 颈所在。目前已有许多性能各不相同的快速算法。如三步搜索t s s ( t h r e e s t e ps e a r c h ) 等。 熵编码 熵编码的目的是去除编码符号间的冗余。在当前标准中,主要由游程长度编 码和变长编码组成。而算术编码在某些标准中也被采纳。算术编码的压缩效率高 于变长编码,计算的复杂度有所增加。 2 3 2 主要视频编码标准 2 3 2 1 h 2 6 1 标榭6 】 h 2 6 1 标准是第一个获得广泛应用的视频编码标准。它的全称为“v i d e oc o d e c f o ra u d i o v i s u a ls e r v i c e sa t p 。6 4 k b i t s ”。简称为p x6 4 。当p = 1 或2 时,码率最大 为1 2 8 k b p s 。由于码率太低,只能传输清晰度不太高的图像,所以只能适用于面对 面的电视电话。当p 大于或等于6 时,可传输清晰度较好的图像,适用于会议电视。 h 2 6 1 定义了一个完整的视频编码算法,采用了帧内图像编码、帧间误差预测、 运动补偿、d c t 、变长编码等技术,建立了取得巨大成功的基于块混合编码框架。 为后来的m p e g 1 、m p e g 2 等视频压缩标准提供了基础。 第二章视频压缩编码及m p e g 2 标准简介 2 3 2 2 m p e g 一1 标准e 7 】 1 9 9 1 年1 1 月活动图像专家组m p e g 制定了m p e g 一1 标准。m p e g 标准在h 2 6 1 视频编码算法的基础上改进、发展,m p e g 1 标准改进的主要内容是增加了b 图 像帧( 双向预测) 和图像组g o p 这些改进具有更高的压缩比,同时定义了编码算法 中个工具层的语法,使视频的可操作性更灵活。 m p e g 一1 标准是将数字视频信号和与之相伴的音频信号在个可以接受的质 量下,能被压缩到码率约为1 5 m b i v s 的一个m p e g 单一流,主要应用于存储应用。 m p e g 一1 标准只规定了码流语法和解码过程,用户可以很好地利用这个语法的灵活 性来设计非常高质量的编码器和非常低成本的解码器。编码器的设计中一些重要 参数,如运动估值、自适应量化和码率控制等可以由用户自由确定。 速率约为1 2 m b i v s 的用m p e g 1 算法压缩的视频图像的质量相当于v h s ( 家 用视频系统1 记录质量。空间分辨率限制为每视频帧扫描行3 6 0 个像素,并且在源 编码器端的视频信号为3 0 帧秒,非隔行扫描。对大多数原始图像内容,可得到无 人工痕迹的图像质量。m p e g 一1 标准是v c d 工业标准的核心,利用m p e g ,l 音频 的m p 3 音乐格式也倍受青睐。 2 32 3m p e g 一2 标准嗍: i s o i e c 于1 9 9 1 年开始研究新的标准,新标准着力于提高视频质量,提供不 亚于n t s c p a l 可达1 0 m b p s 左右的c c i r 6 0 1 质量。1 9 9 4 年公布了i s o i e c 1 3 8 1 8 ( m p e g 2 ) 草案,一年后成为国际标准。因此,m p e g 2 标准广泛地应用于卫 星广播业务、电缆电视、数字电视地面广播、点播电视、数字声音广播、多媒体 终端等众多领域。m p e g 2 标准是工业标准d v d 的核心标准。 m p e g 2 是m p e g 1 的一个超集,它兼容m p e g 1 。m p e g 一2 又对m p e g 一1 作 了重要的改进和扩充。针对隔行扫描的常规电视图像专门设置了“按帧编码”和 “按场编码”两种模式,并对运动补偿作了相应的扩充,使其编码效率显著提高。 档次和等级的划分是m p e g 2 为了适应不同应用而定义各个子集的结果。“档 次”是集成后的完整码流的一个子集,而每个“档次”的“等级”则是对编码参 数所作出的进一步限制。它是通过确定码流中相应的标题信息及附加信息中的有 关参数给定的,这样,为较高“档次”和“等级”码流设计的解码器能够对相同 或较低档次的数据解码。 电子科技大学硕士学位论文 2 3 2 4 h 2 6 3 标准【9 j 针对甚低码率“氐于6 4 k b p s ) 的视频会议和可视电话的应用,在1 9 9 5 年1 1 月 i t u t 推荐的低码率视频编码标准h 2 6 3 建议草案出台。h 2 6 3 标准的视频编码算 法与h 2 6 1 相似( 运动补偿和d c t 算法) ,但它在性能上有显著提高。实验表明: 在相同的主观质量下,h 2 6 3 编码码率仅为h ,2 6 1 的半。与h 2 6 1 相比,h 2 6 3 的主要区别如下: h 2 6 3 支持更多的图像格式、半像素精度运动估计、宏块( 1 6 1 6 ) 运动估计和 块( 8 8 ) 运动估计的自适应变换、3 一d ( l a s t - r u n - l e v e l ) 而不是2 一d ( r u n l e v e l ) 游程编码、可选的无限制运动矢量、可选的算术编码、可选的重叠运动补偿和可 选的双向预测。 在完成h 2 6 3 标准的制定工作后,为适应在现有的窄带网络环境上传输视频 信息,i t u t 在1 9 9 8 年1 月通过了h 2 6 3 标准的第二版h 2 6 3 + ,增加了十二个新的 高级模式。2 0 0 0 年1 1 月,又推出了第三版h 2 6 3 + + ,新增3 个高级模式。新增模式 包括:参考帧再采样模式、高级帧内编码模式、交替帧间v l c 选择模式、分片结 构模式、参考帧选择模式、数据分割模式可分级扩展编码等。 2 3 2 5 m p e g 一4 标准i j w 1 9 9 2 年,m p e g 决定开发新的适用于极低码率的a v 编码国际标准。但随着 i t u t 的h 2 6 3 及其第二版,第三版在低码率视频编码领域取得了巨大的成功, m p e g 工作组决定扩大m p e g 4 的研究目标。在深入分析了a v 领域中电视、计 算机、通信以及其交叉融合的发展趋势后,认为m p e g 4 应提供于通信的新方式。 其核心是: 基于内容的交互性。支持基于内容的操作和码流编辑,自然与合成数据的混 合编码,增强的时间域随即存取。 具有极高的压缩比。在可以比拟的速度下,主观视频质量好于现有的标准, 期望在迅速发展的移动通信网中获得应用。具有多个并发流编码能力,实现对景 物的多视角编码。 具有通用的存储性。提供一种抗误码的鲁棒性,可以实现基于内容的尺度可 变性。对重要的对象用较高的时间或空间分辨率表示,具有自适应使用可用资源 的能力。作为第一个面向对象的视频编码标准,m p e g 一4 的出现具有很强的历史意 义。 1 4 第二章视频压缩编码及m p e g 2 标准简介 2 3 2 6m p e g 7 标准 m p e g 7 标准是运动图像专家组与2 0 0 1 年9 月制定的。它的正式名称是多媒 体内容描述接口( m u l t i m e d i ac o n t e n td e s c r i p t i o ni n t e r f a c e ) 。目标是使用户快速、 有效地检索出所感兴趣的各种不同类型的多媒体资料。m p e g 7 的应用广泛,既可 以用于存储,也可以用于流式应用,它可以在实时或非实时的环境下应用,在教 育、新闻、地理信息系统等各方面具有健在的应用能力。 m p e g 7 将对各种不同类型的多媒体信息进行标准化的描述,该描述与所描述 的内容相联系,可以加到任何类型的多媒体资料上,不管多媒体资料的表达格式 或压缩格式如何,只要加上了这种标准化描述的多媒体数据就可以实现快速而有 效的搜索。该标准不包含对描述和特征的自动提取,它也没有规定利用描述进行 搜索的工具。m p e g 7 可以独立于其他m p e g 标准使用,也可以利用m p e g 7 标准 的描述来增强其他m e p g 标准的功能。 2 3 2 7 m p e g 2 1 标准 2 0 0 0 年3 月成立的m e p g 2 1 工作组在酝酿制定m p e g 2 1 标准,其核心目标是 使数字多媒体信息资源能够被大范围的网络和设备透明地、增值地使用。这一标 准需要完成以下任务是: 1 ) 解决框架的各成分之间如何关联、能够察觉不能实现联系的障碍在框架的什么 地方等问题。 2 ) 整合现有系统中的各种标准以支持多媒体管理的各种协调技术。 3 ) 开发新的规范使得能够通过网络存取和使用多媒体内容;实现多个交易模型保 证服务模型及收费;保障内容用户的隐私权。 2 3 2 8h 2 6 4 a v c 标准【1 2 】 h 2 6 4 标准是m p e g 和v c e g 的专家共同组成的联合视频小级t ,共同发 展的新的视频编码国际标准。官方名称分别为:i t u tr e e h 2 6 4 和i s o i e c m p e g - 4p a r t1 0 a v c 。它提供更高的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 重庆企业涉税法律服务税务约谈应对实操手册
- 八年级下册英语外研版单元测试卷含答案Module9
- 经济与管理学院研究生思想动态调研报告2026(3篇)
- 2026中国医疗人工智能应用场景及商业化路径研究报告
- 2026中国冷链物流智能化升级市场分析与投资决策报告
- 2026汽车改装市场潜力分析及政策法规与消费者需求研究报告
- 2026中国老年医疗行业市场现状供需分析及养老模式创新研究报告
- 2026中国真空热成型包装行业节能减排与绿色生产技术研究报告
- 2026中国数字孪生技术在智慧交通中应用案例报告
- 人教版四年级音乐下册(简谱)第三单元《甘洒热血写春秋》教学设计
- 2025年广投集团招聘笔试题目及答案
- 护理专业学生实习实习心理调适
- 中国听性脑干反应临床操作规范专家共识(2026版)
- 抬墓碑安全协议书
- 糖化终产物在口腔-全身损伤中的作用
- 儿科感染性疾病诊断与治疗
- 交通运输部南海救助局2025年下半年招考工作人员易考易错模拟试题(共500题)试卷后附参考答案
- 《简爱》核心内容解析
- 2026年软件定义汽车:SOA和中间件行业研究报告
- 川教版二年级上册生命生态安全全册教案教学设计
- 《0~3岁婴幼儿家庭教养指导》全套教学课件
评论
0/150
提交评论