(计算机应用技术专业论文)基于mpeg4的数字视频压缩技术.pdf_第1页
(计算机应用技术专业论文)基于mpeg4的数字视频压缩技术.pdf_第2页
(计算机应用技术专业论文)基于mpeg4的数字视频压缩技术.pdf_第3页
(计算机应用技术专业论文)基于mpeg4的数字视频压缩技术.pdf_第4页
(计算机应用技术专业论文)基于mpeg4的数字视频压缩技术.pdf_第5页
已阅读5页,还剩55页未读 继续免费阅读

(计算机应用技术专业论文)基于mpeg4的数字视频压缩技术.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

西北工业大学硕士学位论文 基于m p e g 4 的数字视频压缩技术 摘要 视频压缩技术是视频处理的基础,随着网络流媒体、无线视频等新的应用的出现, 人们不断对视频压缩编码技术提出新的更高的要求。同时,相关组织也相继推出了一些 视频编码标准,m p e g 一4 就是种应用广泛而且非常有前途的视频压缩编码标准。 本论文研究了m p e g 一4 视频编码标准中可以提高压缩比的各种特性,详细分析了 m p e g 4 中的运动估计算法,做出了详细的试验对比,改进了一种易于实现的新三步搜索 运动估计算法,用标准c 语言实现了一个符合m p e g 4a s p 语法标准的编码器和解码器,并 利用m i c r o s o f td i r e c t s h o w 工具将其集成到一个实时视频流传输系统中,该系统具有 扩展性和易移植性,为以后的基于网络的多媒体应用奠定了基础。本文还讨论了网络流 媒体的原理和应用,研究了一种适合网络视频流传输的视频编码模型,该系统可以广泛 应用于网络视频传输系统中。 关键宇:视频,压缩,运动估计,m p e g 一4 ,a s p ,编解码器, 传输 西北工业大学硕士学位论文 基于m p e g 4 的数字视频艋缩技术 a b s t r a c t i nt h i sp a p e r ,at h o r o u g h s t u d yi sc a r r i e do u to v e rt h ek e ya l g o r i t h m so f m p e ( 、- 4v i d e o c o d e c ,s e v e r a lo p t i m i z a t i o nm e t h o d sa r ep r o p o s e dt oe n h a n c et h ec o d i n gs p e e da n dp r o m o t e t h ea p p l i c a t i o n so fv i d e oc o d i n gi na c t u a lp r a c t i c e t h ed i s c u s s i o ni sm a i n l yf o c u s e do nh o w t o g e t t i n gh i 曲c o m p r e s s i o no fm p e g 一4a n dt h em o t i o ne s t i m a t i o na l g o r i t h m s a r ea l s o d i s c u s s e de s p e c i a l l y t h i sp a p e rd i s c u s s e st h en e c e s s a r yo f v i d e oe n c o d i n g ,r e v i e w st h em p e g 一4s e r i e sa n d s o m eb a s i cp o i n t ss u c ha st h ed a t as t r u c t r u e so fv i d e oc o d i n ga saw h o l e t h e nt h eu s eo f t r a d i t i o n a i c o m p r e s s i o nm e t h o d si n t ot h em p e g 4s t a n d a r di n d e t a i l f o re x a m p l ed c t t r a n s f o r m ,m o t i o ne s t i m a t i o na n dc o m p e n s a t i o n ,a n dv a r i a b l el e n g t hc o d i n g ,e t ca r ed i s c u s s e d a n dan e wm o t i o ne s t i o m a t i o na l g o r i t h mi sp r o p o s e d i na d d i t i o n ,t h ep a p e rd i s c u s st h ev i d e o d a t ao v e rs t r e a m m e d i aa n di l l u s t r a t e sh o wt h e 口e g - 4a s pv i d e oc o d e cd a t ai st r a n s f e r r e d o nt h el a n so ri n t e r n e ti nr e a l t i m em o d ea n dd e v e l o p m e n to faa p p l i c a t i o no f r e a l t i m ev i d e o d a t ac o m m u n i c a t i o n s y s y t e m k e y w o r d s : v i d e o ,c o m p r e s s i o n ,m p e g - 4 ,a s p ,m o t i o ne s t i m a t i o n ,c o d e c c o m m u n i c a t i o n 2 两北工业人学硕士学位论文 基于m p e g 4 的数字视频压缩技术 1 1 选题背景和意义 第一章绪论 随着信息技术的发展和社会的不断进步,人类对信息的需求越来越丰富。多媒体 信息已成为人类获取信息的最主要载体,人们希望无论何时何地都能够方便快捷地获得 语音、图像及视频等多媒体信息,而多媒体信息的计算、传输等技术也成为人们研究的 热点。 近3 0 年来,数字化的数据和语音通信问题一直被人们所关注,1 0 年前,全运动 数字视频用于桌面设备的技术就已经基本成熟。除了数字信号有更牢靠的形式之外,数 字表示和传输的主要优点在于它很容易在同一网络上提供各种各样的服务。现在数字视 频技术已经广泛地作用于个人计算机、高清晰度电视、可视电话和互联网视频信号流式 传输等各个方面。下一代的互连网应用、更加智能友好的用户接口等,都对多媒体技术 提出了新的要求,新一代多媒体视频技术是面向网络的,交互式的,高效组织、传输和 管理的,可以适应各种不同应用的需求。 目前,许多国家和地区都有大量的研究人员从事数字视频处理技术的研究。数字视 频处理涉及到数字视频比特流的产生,我们所了解的数字视频的应用均需要为数据压缩 而进行些数字处理。可以说,压缩是数字视频应用的基础。近几年来,关于视频编码 的研究取得了很大的进展,特别是国际标准化组织( i s 0 ) 和国际电信联盟( i t u ) 等国 际组织相继推出了h 2 6 x 及b l p e g 等视频压缩标准,极大地推动了视频压缩编码技术的发 展,促进了人们对视频编码技术的研究兴趣,推进了视频编码技术的应用。 本论文主要研究基于m p e g - 4 的视频编解码技术。在研究过程中,讨论了视频的压缩 编码的常用技术、运动估计方法、互联网上视频的传输等技术。 1 。2 视频编码技术的研究历史和现状 视频编码的一个主要目的是在保证一定重构质量的前提下,以尽量少的比特数来表 征视频信息。传统的压缩编码是以香农信息论为出发点,用统计概率模型来描述信源, 西北工业人学顿士学位论文 基于m p e g 4 的数字视频压缩技术 编码实体是象素或者象素块。这种基于数据统计的、以消除视频数据相关冗余为目的的 第一代视频编码技术获得了巨大的成功,这一阶段制定的m p e g 一1 ,m p e g 2 ,h 2 6 1 以及h 2 6 3 等视频压缩编码国际标准对计算机业产生了巨大的影响。 可以把视频编码方法划分为熵编码、源编码和混合编码等。熵指的是具体数据的平 均信息量,在编码中用墒值衡量是否为最佳编码。其定义为: 上 h ( x ) = 一e ( x j ) l o g 。p ( x s ) ( 1 1 ) ,= l 式中x 表示信源,h ( x ) 即为信源x 的熵。具体的熵编码方法有算术编码、霍夫曼编 码和游程编码等。熵编码方法是一种无损压缩的方法。源编码用于能够把原始数据中的 相关数据与不相关数据分开的场合。该方法要考虑原始数据的定义,通过消除不相关数 据以达到对原始数据流的压缩。与熵编码不同,源编码常常是有损编码。在有损编码方 法中,原始数据流与已经编码的数据流相似但是不相同。常用的离散余弦变换( d c t ) 编码和运动补偿等,都可以认为是源编码。混合编码方法是熵编码和源编码方法的结合。 通常是几种不同的熵编码和源编码方法组织在一起构成一种新的混合编码方法。通常, 由源编码过程产生的输出数据流用作熵编码过程的输入数据流。 第一代视频编码技术并未考虑信息接受者的主观特性、视频信息的具体含义和重要 程度等,只是力图去除数据冗余,这是一种低层次的编码技术。随后产生的第二代视频 编码技术是基于内容的编码,它所关心的是如何去除视频内容的冗余,它认为人眼是视 频信息的最终接受者,视频编码时应充分考虑人眼视觉特性的影响,这是目前视频编码 领域最为活跃的一个领域。 视频编码技术之所以得到迅速的发展,和相关视频编码标准的制定是密不可分的。 目前主要有两个制定视频编码标准的国际组织:r r u t 和i s o f l e c 。i t u - t 的标准称为建 议,以字母排序,视频会议电视编码的标准在h 的子集里,如h 2 6 1 ,h 2 6 2 和h 2 6 3 。i s o i e c 的标准按序号排列,如m p e g 1 f l j 对应的是1 1 1 7 2 ,m p e g 一2 相对应的是1 3 8 1 8 ,m p e g 一4 相对应的是1 4 4 9 6 等。i t u t 的建议标准主要用于实时视频通信,如视频电视会议、可视 电话等。i 丽m p e g 标准主要用于广播电视、d 、和视频流媒体等。大多数情况下,这两 个标准组织独立制定不同的标准,但在许多方面也有共同之处,例如 l 2 6 2 标准和 m p e g 一2 的视频编码标准基本上就是同一个标准。 自1 9 9 7 年以来,i t u t 的视频编码专家组v c e g - ( v i d e oc o d i n ge x p e r t sg r o u p ) 一直致力 6 两北工业大学硕士学位论文基于m p e g 4 的数字视频压缩技术 于研究一种新的视频编码标准h 2 6 l 。h 2 6 l 是一种高效的压缩方法,从核心技术 特征角度上讲,与h 2 6 3v 2 ( h 2 6 3 + ) 或m p e g - 4s i m p l e p r o f i l e 标准相比,h 2 6 l 具有如下特 性:在使用多数编码方法类似的最佳编码器时,可节省超过1 0 的码率;对包括 低比特率在内的所有比特率,h 2 6 l 都能持续提供较高的视频质量和基于不同的约束条 件来完成不同性质的任务,其中低延时模式包括实时通信的视频会议等,没有延时限制 的应用包括视频存储和以服务器为基础的视频流式应用等;强大的容错处理能力, h 2 6 l 不仅提供在包传输网中处理包丢失所需的工具,而且在易产生误码的无线网中处 理比特误码的工具:网络友好,它将网络层和编码层从概念上进行分离,便于对数据 进行打包处理和优先控制好的信息,实现所编码的视频流在当前所有的协议和复合结构 中能够无缝播放并容易组合。在2 0 0 1 年末,i s o 的运动图像编码组m p e g ( m o v i n gp i c t u r e e n c o d e r g r o u p ) 中的视频组和v c e g 决定在当前的h 2 6 l 编码草案基础上,联合制定一种 新的视频标准t ( j o i n t v i d e o t e a m ) 标准( 也可以写为j v t h :2 6 l ) 。j v t 是基于现有的 技术标准( 包括h 2 6 3 和m p e g 4 ) 之上的一个新标准,其主要特性包含了h 2 6 l 和m p e g _ 4 的 重要组成部分,对不同的视频应用程序而言这些特征可以转换成不同的优势。h 2 6 l 代 表着未来视频流技术发展的方向。 1 3 m p e g 系列视频编码标准介绍 m p e g ( 运动图像专家组) 成立于1 9 8 8 年,是专门为数字视音频制定压缩标准的专 家组,目前已拥有3 0 0 多名成员。m p e g 组织制定的各个标准都有不同的目标和应用, 目前已经提出了m p e ( 3 - 1 、m p e g 一2 、m p e g 4 、m p e g - 7 和m p e g - 2 1 等视频压缩标准。 m p e g 1 标准于1 9 9 3 年8 月公布,它是v c d 工业标准的核心。m p e g 一1 主要应 用于连续传输速率大约为1 5 m b i t s 的数字存储介质,例如c d 、数字音带( d a t ) 茅i 硬盘 等。m p e g 1 适用于分辨率约为3 5 2 2 8 8 像素线,画面速率大约在2 4 h z 到3 0 h z 的 非隔行的视频信号格式。由于使用的方法比较通用,因此能得到广泛的应用。但可以看 出,它所适用的视频信号的分辨率只有c c i r 提出的数字电视演播室建议的格式( 7 2 0 5 7 6 ) 的1 4 大小,很难满足人们e t 益增长的需求,虽然可以经过一些后处理的方法来提 高它的分辨率( 例如内插的方法1 ,但效果仍是差强人意的。 m p e g 组织于1 9 9 4 年推出m p e g 一2 压缩标准,以实现视音频服务与应用互操作的 可能性。m p e g 2 标准是针对标准数字电视和高清晰度电视在各种应用下的压缩方案和 7 两北工业大学硕士学位论文基于m p e g - 4 的数字视频压缩技术 系统层的详细规定,编码码率从每秒3 1 v l b p s 1 0 0 1 v l b p s 。m p e g 一2 不是m p e g 1 的简单 升级,它在系统层和传送层方面都做了更加详细的规定和进一步的完善。m p e g 一2 特别 适用于广播级的数字电视的编码和传送,被指定为s d t v 和h d t v 的编码标准。 m p e g 一4 是m p e g 组织( m o v i n g p i c t u r ee x p e r t sg r o u p ) 在成功地制定了m p e g 一1 和 m p e g 2 标准之后,所提出的新一代多媒体数据压缩标准。m p e g - 4 标准将众多的多媒 体应用集成于一个完整的框架内,旨在为多媒体通信及应用环境提供标准的算法及工 具,从而建立一种能被多媒体传输、存储、检索等应用领域普遍采用的统一数据格式。 它主要致力与为广泛的多媒体应用提供个通用的平台。标准的制定工作开始于1 9 9 3 年,并在1 9 9 8 年产生了第一版的国际标准。m p e g - 4 中一个重要的概念就是对象。一 个m p e g 4 场景包含一系列的视频和声音对象,他们通过场景描述文件组织起来。以 视频对象为例,它就包含了时空域上的形状、运动和纹理信息。这种基于对象的编解 码方法非常适合交互式的多媒体应用环境。m p e g 一4 的另一个特点是他同时支持对自然 的和合成的视觉、声音对象的编码,并可以将两者结合到同一个场景中去。m p e g 一4 有 着广泛的应用前景,例如数字电视、低比特率下的移动多媒体通信、视频电话、电视电 影制作、i n t e r n e t i n t r a n e t 上的视频流传输、基于面部表情模拟的虚拟会议室、交互 式多媒体应用等。 m p e g 一4 代表了基于模型对象的第二代压缩编码技术,它充分利用了人眼的视觉特 性,抓住了图像信息传输的本质,从轮廓、纹理思路出发,支持基于视觉内容的交互功 能,这适应了多媒体信息的应用由播放型转向基于内容的访问、检索及操作的发展趋势。 a v 对象( a v o ,a u d i ov i s u a lo b j e c t ) 是m p e g - 4 为支持基于内容编码而提出的重要概 念。对象是指在一个场景中能够访问和操纵的实体,对象可根据其独特的纹理、运动、 形状、模型和高层语义进行划分。m p e g 一4 中的视音频已不再是过去m p e g 一1 、m p e 6 - 2 中 图像帧的概念,而是一个个视听场景( a v 场景) ,这些不同的a v 场景由不同的a v 对象 组成。a v 对象是听觉、视觉、或者视听内容的表示单元,其基本单位是原始a v 对象, 它可以是自然的或合成的声音、图像。原始a v 对象具有高效编码、高效存储与传输以 及可交互操作的特性,它又可进一步组成复合a v 对象。因此m p e g 一4 标准的基本内容就 是对a v 对象进行高效编码、组织、存储与传输。a v 对象的提出,使多媒体通信具有高 度交互及高效编码的能力,a v 对象编码就是m p e g 一4 的核心编码技术。 m p e g 一4 不仅可提供高压缩率,同时也可实现更好的多媒体内容互动性及全方位的 两北工业大学坝士学位论文 基于m p e g - 4 的数字视频压缩技术 存取性,它采用开放的编码系统,可随时加入新的编码算法模块同时也可根据不同应 用需求现场配置解码器,以支持多种多媒体应用。 m p e g 7 标准被称为“多媒体内容描述接口”,为各类多媒体信息提供一种标准化 的描述,这种描述与内容本身有关,允许快速和有效地查询用户感兴趣的信息。它扩展 了现有的内容识别解决方案的能力,特别是它还包括了更多的数据类型。换而言之, m p e g 7 规定了一个用于描述各种不同类型多媒体信息的描述符的标准集合。该标准于 1 9 9 8 年1 0 月提出,于2 0 0 1 年最终完成并公布。m p e g 7 的目标是支持多种音频和视 觉的描述,包括自由文本、n 维时空结构、统计信息、客观属性、主观属性、生产属性 和组合信息。对于视觉信息的描述包括颜色、视觉对象、纹理、草图、形状、体积、空 问关系、运动及变形等。 正在制定的m p e g 2 1 则是一些关键技术的集成,通过这种集成环境就对全球数字 媒体资源进行透明的和增强的管理,实现内容描述、创建、发布、使用、识别、收费管 理、产权保护、用户隐私权保护、终端和网络资源抽取、事件报告等功能。 1 4 本文工作 本文蛉章节结构安排如下: “绪论”一章中回顾了视频编码技术的发展历史和研究现状,对m p e g 系列视频标 准进行了介绍,总结了本文的主要研究工作。 在第二犟中,简单介绍了视频编码技术的一些基本要点,如颜色空间、视频信号采 样格式等,介绍了m p e g 4 视频编码的一些相关数据结构等,例如v o p ( 视频对象层) 、 m a c r ob l o c k ( 宏块) 等,为下部分的论述奠定基础。 第三章详细描述了m p e g - 4 中的编码压缩方法。纹理编码是视频编码中菲常重要 的部分,本章详述了m p e g 4 中相关的纹理编码方法;运动估计”这一部分中,对 m p e g 4 编码标准中所使用的块匹配运动方法进行了详细描述,并对新三步搜索算法做 了一些改进,做出了详细的试验对比。 第四章实现了个符合m p e g 4a s p 语法标准的编解码器,对其进行了优化,测 试了编解码器的压缩效率,并将其用于一个网络实时流媒体传输系统中,讨论了一种用 于网络视频流传输的视频编码模型。 本文的主要工作如下: 西北工业大学硕士学位论文 基于m p e g 4 的数字视频压缩技术 1 详细讨论了m p e g 一4 视频压缩标准中消除帧内数据冗余的压缩编码方法,例如 d c t 变换、估计预测编码、均匀量化、行程编码和可变长编码等。 2 深入分析了一些运动估计的方法,并将这些方法应用到了编码器当中,作出了 实验对比,并提出了一种新的块运动估计算法。 3 利用标准c 语言实现了m p e g 一4a d v a n c e ds i m p l ep r o f il e ( a s p ) 编解码器, 并利用m m x 技术对其进行了优化,对其性能进行了测试。 4 将优化后的实时解码器应用到d i r e c t s h o w 系统中,实现了网络传送m p e g 一4 流、客户端实时解码播放的方案。 5 讨论了网络流媒体的原理和应用,研究了一种网络流媒体条件下的视频编码模 型。 1 0 西北工业大学硕士学位论文基于m p e g - 4 的数字视频压缩技术 第二章视频信号颜色空间及相关数据结构 2 1y c r c b 颜色空间 视频被描述为一组连续的画面,每幅画面称为一帧,即视频序列由帧组成,而每帧 画面可看作是二维的像素阵列。在静态图像处理技术中,一般使用r g b 空间矩阵表示图 像,即每一像素的彩色表示包含三个分量:红( r ) 、绿( g ) 、蓝( b ) ;但视频序列的大多 数压缩算法是在另一个彩色空间,即在y c r c b 空间中进行压缩处理。在y c r c b 空间中, 每一彩色像素是用另三个分量表示的:亮度分量( y ) 以及两个色差分量( c r 、c b ) 。我们 可以利用两个空间的联系进行空间转换,如下是两个空间相互转化的公式( 2 1 ) : y = 0 2 9 9r 十0 5 8 7 g + o 1 1 4 b r = y + 1 _ 1 4 c b c b = 一0 1 4 7 r 一0 2 8 9 g + 0 4 3 6 b = 0 4 9 2 ( b y )g = y 一0 3 9 4 c r - 0 5 8 c b c r :0 6 1 5 r 一0 5 1 5 g 一0 1 b = o 8 7 7 ( r y )b = y + 2 0 3 c r ( 2 1 ) 进行两个彩色空间的转换是基于人类视觉系统的特性:在r g b 空间中,r 、g 、b 三个信号有一个发生了变化,则总的图像的颜色就会发生变化,人眼是很容易察觉这种 变化的:然而人眼对y 、c r 、c b 三个信号的变化是有不同反应的,其中亮度信号的变 化比较敏感,而对色差信号的变化不是很敏感,这样就可以更多地考虑亮度信号,而对 色差信号采用一些处理方法以提高压缩比,比如即使经过亚采样或直接丢弃一部分数据 等处理,但人眼对恢复时转换到r g b 空间后的图像的变化仍然是不易察觉的。所以不 管在j p e g 标准,h 2 6 x 标准还是这里的m p e g 系列标准都要将视频源从r g b 空间变 换到y c r c b 空间中去,对亮度分量和色差分量采用不同的处理办法,以进行更进一步 的压缩处理。 经过从r g b 到y c r c b 的变换后,图像中比较重要的信息,也就是对人类视觉影响 比较大的信息都集中在y 矩阵中,而c r c b 矩阵中的图像信息比较小,因此,为了节约 比特数,我们可以不用对整个的c r c b 矩阵进行编码,可以对c r c b 矩阵首先进行一个 下采样,使得c r c b 图像的长度宽度都为原来的一半,这样就得到我们视频编码时常常 西北工业夫学硕士学位论文基于m p e g - - 4 的数字视额珏缩技术 看到的4 :2 :0 的y u v 图像格式。我们对标准的码流进行解码之后得到也是4 :2 :0 的 y u v 矩阵,当然显示时还需要对这个矩阵进行上采样,使得y c r c b 矩阵都为原始图像 大小,然后再变换到r g b 颜色空间进行进行显示。 2 2 m p e g - 4 的配置文件( p r o f i l e s & l e v e l s ) m p e g 一4 的语法定义是非常复杂的。完全实现m p e g - 4 语法需要非常艰巨的工作。 为了针对不同的应用进行不同配置不同层次的编码,m p e g 4 定义了很多的配置 ( p r o f i l e ) 来规定不同的语法子集。这样,m p e g 4 系统的实现就可以从简单配置发展 到复杂配置,相同配置的m p e g 一4 系统间也有着良好的兼容性。 所谓一种配置( p r o f i l e ) ,就是整个m p e g 4 码流语法定义的一个子集。而在一种配 置中,还可以有不同的级别( l e v e l ) 。因为即使有相同的码流语法,但是码流的各项参 数,如码流比特率,码流中所含的媒体对象个数等,却可以有很大的变化范围,这会对 编解码器的性能产生很大的影响。这就要在p r o f i l e 的基础上更细致地定义各种l e v e l 。 一个l e v e l 就是对码流中各种参数的限制条件的集合。 m p e g 4 定义了非常多的配置文件。从大的类别来说,音频流有音频配置( a u d i o p r o f i l e ) ,视频流有视频配置( v i s u a lp r o f i l e ) ,系统流有图形配置( g r a p h i c sp r o f i l e ) 、场景 描述配置( s c e n eg r a p hp r o f i l e ) 、对象描述符配置( o b j e c td e s c r i p t o rp r o f i l e ) 等。在本论文 中,主要涉及的是视频配置文件。视频配置文件分成三类:自然视频配置、合成视频配 置、自然合成视频混合的配置。在本论文,我们所说的a d v a n c e ds c a l a b l e p r o f i l e ( a s p ) 就 是自然视频配置中的一种。 2 3v o p 编码类型 m p e g - 4 除了在较低码率条件下提供高的压缩比以外,侧重于支持基于视觉内容的 交互功能,而提供实现基于内容交互功能的关键在于面向视频对象的编码。为此, m p e g 一4 引入了视频对象面( vop ) 的概念。在这一概念中,根据人眼感兴趣的一些特 性,如形状、运动、纹理等,将图像序列中每一帧中的场景,看成是由不同v0p 历组 成。而同一对象连续的v0p 称为视频对象( v0 ov0 可以是视频序列中的人物或 1 2 西北工业大学硕士学位论文 基于m p e g 4 的数字视频压缩技术 具体的景物,例如电视新闻中的播音员,或是电视剧中辆奔驰的汽车,也可以是计算 机图形技术生成的二维或三维图形。图2 1 为m p e g 一4 基于内容图像编码方法的简化 原理图。 - 4 d 。e 。o 。o 。b 。j e ,c t s 一b ,叫i d 。e 。o 。o 柏b j e ,c t k i 一 l 雯 叟 里 叫i 徽掣卜 l v i d e oo b j e c l l s 叫e o e r b e j e r d t , - e n c o d 罟 翌 1s e g m e n t e r r _ 弓 廿 e l ! ! 竺! 坚! i 芝 吨窭吨蛩 墨 o 翌 e 望 翌 + c ,)望 : - 图2 1 m p e g 4 基于内容图像编码简化原理图 在本文中,由于侧重于提高编码效率,适应因特网上流媒体的应用而采用了 m p e g 一4 a d v a n c e ds i m p l e p r o f i l e 。在这种配置下,没有用到根据图像的纹理、颜色等进 行的图像分割技术,所以这里的v o p 我们可以把它等同于上文提到的帧的概念( 在标 准里面实际不是同一个概念) 。v o p 编码类型有三种: 内部v o p ( i v o p ) ,只用到当前帧的信息编码; 单向预测v o p ( p v o p ) ,根据该v o p 前面的i - v o p 或者p v o p 信息,利用 运动估计和运动补偿技术来编码: 双向预测v o p ( b v o p ) ,根据该v o p 前面和后面的i - v o p 或者p v o p ,利 用运动估计和运动补偿技术来编码。 图2 2m p e g 4 中的三类v o p 西北工业大学硕士学位论文 基于m p e g - 4 的数字视频压缩技术 2 4 宏块 每个v o p 依次由若干个宏块( m b ) 组成,宏块是运动补偿和量化器标尺变化的基本 单位。同时在选择一种压缩模式时,宏块又是最小的数据单位,每一个宏块( m b ) 占 有1 6 1 6 像素的区域。图像在编码前都要被分割成若干个宏块( 图2 3 ) ,每个宏块 包含4 个8 8 的亮度块和两个8 x8 的色差块。宏块按照从左到右,自上而下的扫描 顺序排列。宏块由像素块组成。标准中规定了三种y c r c b 的格式。分别为4 ;4 :4 ,4 : 2 :2 和4 ;2 :0 。因为人类视觉系统对图像的亮度分量分辨率最敏感,所以y 空间的 像素以满分辨率编码。通过与一类平滑处理过程有机的结合,亚采样减少了像素的数量, 再利用其他一些技术,可以减少被压缩的信息量。在这里我们采用将每一组2x2 的 相邻亮度像素保留一对色度像素的办法进行亚采样。为了更进一步提高压缩比,我们采 用的是4 :2 :0 格式。它是由4 个8x8 的亮度( y ) 像素块和在空间位置上与之相应的 1 个8 8 色差( c r ) 和1 个8 8 色差( c b ) 像素块组成。相当于色差通道在x 、y 两 个方向被二次采样,因此对应于每四个亮度块只有个c r 块和一个c b 块。值得注意 的是由四个亮度块覆盖的区域与由每一个色度块覆盖的区域是相同的,这是因为对色度 信息进行了下采样。 图2 3 图像和宏块 同时,宏块也是最基本的解码单位,解码器输入的二进制码流是以宏块为单位进行 组织的,每个宏块包含着各亮度块和色差块的变换系数信息,运动矢量信息以及宏块的 量化信息。 1 4 西北工业火学硕士学位论义 基于m p e g 一4 的数字视频j 盂缩技术 2 5帧图、场图 m p e g 一4a s p 和m p e g 一2 区别于以前的m p e g 一1 的一个很重要的方面就在于它们 除了处理逐行视频外,还可以处理隔行视频。 对于隔行视频来说,编码器的输入是由一系列以场周期按时间分开的场组成。而对 于逐行视频,输入是由系列以帧周期按时间分开的帧组成。在逐行序列中,每个帧可 以看成为两个场而被作为场图编码。将一帧图分为两个场图时,这两个场应是互相交叉 的,位于上方的作为顶场,下方的作为底场。 图2 4 帧d c t 编码时亮度块组织 图2 5场d c t 编码时亮度块组织 所以,对场d c t 编码后的图像,对一个亮度块解码之后,要按照隔行的方式 去存放,才能恢复出原始的图像。在实际处理中,经常令顶场为0 ,底场为1 ,来 比较前后两幅图的场间的奇偶性。一般来说,相同奇偶性指的是两场均是顶场或均 是底场,不同奇偶性指的是两场一个是顶场,另一个是底场。 西北工业大学硕士学位论文 基于m p e g - 4 的数字视频压缩技术 2 6 本章总结 视频压缩是视频应用的基础,它在视频处理技术中占据着非常重要的位置。 视频信号数据量非常巨大,所以必须压缩,如果不进行压缩的话很多应用就无法实 现。视频图像的色度信号和色差信号在空域虽然属于一个随机场分布,但是它可以 看成为一个平稳的马尔可夫场,图像象素点在空域中的色度值和色差值除了边界轮 廓外,都是缓慢变化的,相邻象素的亮度值和色差值比较接近,具有很强的相关性, 直接用采样信号( p c m 码) 表示色度和色差,信息有较多的冗余性。这种空域的 冗余,为视频信号在空域的压缩提供了可能性。视频图像是沿时间轴方向变化的一 个帧序列,帧问图像的相关性也很强,通常用减少帧间的传送帧的数目即减少 帧率来减少时域的冗余信息。本章结合视频信息的特点,讨论了在视频压缩过程中 些基本的要点,例如颜色空间、帧图和场图等,介绍了m p e g - 4 视频编码标准的 配罱文件等概念,引入了m p e g 一4 编码中常用的数据类型。 两北工业大学硕上学位论文基于m p e g 4 的数字视频压缩技术 第三章视频序列编码的压缩方法 3 1概述 在过去的3 0 多年中,视频压缩技术获得了飞速的发展。视频数据之所以能进行高 倍率的压缩,是因为视频数据的空间域和时间域存在着大量的数据冗余,通过降低空域 冗余和时域冗余就可以对视频数据进行有效的压缩。为了获得更高的压缩编码效率,编 码技术也变得越来越精细和复杂。但是,最基本的d c t ( 离散余弦变换) 变换编码、 v l c ( 可变长编码) 统计编码、运动估计等技术仍然是最广泛使用的编码技术,人们在 这些编码方法的基础上不断提出了改进算法和新的编码方法。 我们利用一个简化的编码器模型进行了相关试验。该编码器采用整象素全搜索块匹 配运动估计方法、采用d c t i d c t 对宏块进行编码,用m i s sa m e r i c a 测试序列进行测 试。试验结果表明,运动估计占用的时间超过了整个执行时间的7 0 ,d c t d c t 处 理约占用1 5 的执行时间,数据量化占用了约5 的执行时间,其它开销占整个时间的 1 0 左右。这说明,采用高效的运动估计算法,减少时域数据冗余是提高压缩率的最重 要的手段,同时也必须减少空域数据冗余。 图3 1m i s sa m e r i c a 测试序列压缩执行时间分配 基于以上的分析,本论文的重点就是寻找高效的运动估计算法及如何改进一些量化方 法,设计一个性能良好的符合m p e g 4a s p 码流标准的编解码器。 1 7 两北工业大学硕士学位论文 基于m p e g - - 4 的数字视频压缩技术 3 2变换编码 变换编码不是直接对空域图像信号编码,而是首先将空域信号映射变换到另一个 正交矢量空间( 变换域或频域) ,产生批变换系数,然后对这些变换系数进行编码处理。 在实际应用中,我们是将一幅图像分割成n n 的许多子图像,每个子图像块送入 正交变换器作正交变换,变换器输出变换系数经滤波、量化、编码后送信道传输到 达接收端,接收端作解码、逆变换、综合拼按,恢复出空域图像。 以时域三角函数f ( t ) = a s i n 2 r t w t 为例,当 从( 一m ) ( ) 改变时,r 是一 个正弦波。假如将其变换到频域表示,只需幅值a 和频率,两个参数就足够了,可 见t - ( t ) 在时域描述时。数据之间的相关性极强,数据冗余度大;而转换到频域描 述时,数据相关性大大减少,数据冗余量减少,参数独立,数据量减少。对于数字 图像同样如此,图像信号变换到变换域后,其相关性下降,数据冗余度减少,对压 缩数据有显著效果。 变换编码技术迄今已有近3 0 年的历史,技术上比较成熟,理论也较完各,广 泛应用于各种图像数据压缩方法中,诸如黑白图像、静止图像、运动图像、以及多 媒体计算机技术中的电视帧内图像压缩和帧问图像压缩等。 正交变换的种类很多,如傅里叶( f o u r i e s ) 变换、沃尔什( w a l s h ) 变换、哈尔 ( h a a r ) 变换、斜( s l a n t ) 变换、余弦变换、正弦变换、k l 变换等等。其中k - l 变 换在最小均方误差的意义下是最优的。因为它的变换核矩阵不是固定不变的,而是 随原始输入图像而改变。余弦变换是傅里叶变换的一种特殊情况。因为当傅里叶级 数展开式中,如果被展开的函数是实偶函数,那么其傅里叶级数中只包含余弦项。 这样假如已知( x ) 0 o ) 并非实偶函数,可以通过对称延拓到o ( n 的像 素块。一般说来,大部分能量集中在低频系数上,即写在变换矩阵左上角的那些系 数。通过量化可以获得压缩。在块的( 0 ,0 ) 位置( 左上角) 的d c t 系数代表水平和 垂直频率都是0 ,也称为直流系数( d c ) 。 正比,且通过预测编码可以进一步压缩, d c 系数与8 8 的像素块的平均值成 因为相邻两个n 的像素块的平均值的 差相对很小,所以通过预测编码可以进一步压缩。其余的系数代表水平和垂直的空 间频率,也称为交流系数( a c ) 。通过选择合适的量化步长使系数的量化级别与空 域频率的高低相对应,将有助于产生零值a c 系数,这样做使得人类视觉系统不太 可能观察到特定空域频率信号的损失,除非系数值超过量化级别。对高阶系数连续 的零系数再进行行程编码、统计编码就可以获得更高的压缩比。 在m p e g 系列中,由于进行d c t 变换的基本单位是亮度块或色度块,大小为 8 8 ,所以可以在( 3 1 ) 中令n = 8 ,这样可得 1 9 西北工业大学硕士学位论文 基于m p e g - 4 的数字视频压缩技术 脚= 百1 脚州 萎7 善7m 川c o s ( 垦半岍) c o s ( 堡岩v 列( 3 4 ) j = 0v = 0 i ul u 实际应用中,考虑公式( 3 4 ) 可分离变量的特点,对( 3 4 ) 式的后一部分略加 改写,可以得到 萎7 丢7m 小o s ( 2 x ,6 + 1 ) u z c o s ( 2 y + 1 ) z = 扣堡岩( 砉m 川c o s 坚学v 万) ( 3 5 ) 这样我们设一个中间变量f ( v ) , f t ( 咖和c o s 里铲y 厅 ( 3 6 ) 这样变换系数就可以写为 脚,v ) = i 1 砸) 脚) 萎7 驰办c o s 垦学叫 ( 3 7 ) 叶 = 0 1 u 可以看出经过这样处理,2 维d c t 变换就分解成1 个行d c t 和1 个列d c t 变 换,这样就便于利用计算机实现。对于逆变换,仍然可以分离变量,以利于实现。 3 3自适应量化 3 3 1 均匀量化器 量化是指用规定范围内的一个值来表示值的一个范围。例如,把实数转换成 最接近的一个整数即是一种量化。量化范围可以被精确地表示成一整数码,该整数 码在解码过程中可用来恢复被量化的值。实际值与量化值之间的差值称为量化噪 声。在某些场合,人类视觉系统对量化噪声不敏感,量化噪声可以很大,因此,量 化可以提高编码效率。 量化在整个视频序列编码中占据着很重要的地位,因为我们是先将o c t 变换 后的系数矩阵进行量化,然后再对这个量化矩阵编码,如果量化后的非零系数越少, 则编码效果越好。而这是这个编码方案性能良好的主要原因之一。 我们采用一种均匀量化器对系数进行量化,这种量化器特征如图所示: 西北工业大学硕士学位论文基于m p e g 4 的数字视频压缩技术 索; 系数 图3 2均匀量化器的特征 将系数值除以量化器步长,再对结果四舍五入取整,即得到量化系数,半整 数值可以向上舍入也可以向下舍入,不影响画面质量,但如果能近似为零,则编码 尺寸最小,因而应优先考虑。例如,如果步长为1 6 ,系数值在2 5 4 0 之间,则量 化系数为2 。 由于均匀量化器的步长是固定的,所以在帧率经常变化的情况下它难以满足 需要,所以我们还采用了一种根据速率控制来自适应量化的算法。 3 3 2 自适应量化 m p e g 一4 语法中定义了一个变量:q u a n t _ t y p e ,这是一个占位l 比特的标志,当它设 置为l 时,使用m p e g 量化,当它为0 时则按照h 2 6 3 视频编码协议中的要求进行量 化因为m p e g 4 几乎兼容了以前的m p e g 协议和h 2 6 3 协议。如果使用m p e g 量 化,有两个缺省的量化矩阵,分别对应帧内宏块和帧间宏块。 内部宏块的缺省量化矩阵为: 2 1 塑j ! 三些查兰堡= ! j = 堂焦堡兰 苎坚呈里鱼:! 塑墼! 塑塑垦堕垫查 81 71 81 92 12 32 52 7 1 71 81 92 12 32 52 72 8 2 02 12 22 3 2 4 2 6 2 83 0 2 l2 22 32 4 2 62 83 0 3 2 2 22 3 2 42 62 8 3 0 3 23 5 2 32 42 6 2 83 03 2 3 53 8 2 52 6 2 8 3 03 23 53 84 l 2 72 83 03 23 53 84 14 5 ( 3 8 ) 这个量化矩阵是符合d c t 变换的特点的,即变换后在左上角的低频域集中了大 部分的能量,变换系数的值相对较大;雨在右下角的高频域交换系数几乎处处为零,能 量百分比很小。我们在低频域设计较小的量化阶距值,而把高频域的量化阶距值设计的 较大。这样在低频域可以细量化,不至于丢失太多的能量,不会产生很大的误差;而在 高频域进行粗量化,产生更多的零值,但不会有很大的影响,可以使得总体的编码效果 可以更好。 帧间宏块的缺省量化矩阵为: 1 61 71 8 1 92 02 12 22 3 1 71 81 9 2 02 12 22 32 4 1 8 1 92 02 12 22 32 42 5 1 92 02 12 2 2 3 2 42 62 7 2 02 12 22 32 5 2 6 2 7 2 8 2 12 2 2 32 42 6 2 7 2 83 0 2 22 32 42 62 7 2 83 03 1 2 32 4 2 5 2 7 2 83 03 13 3 ( 3 9 ) 西北工业大学硕士学位论文基于m p e g 4 的数字视频压缩技术 帧内和帧间的量化矩阵是不同的,因为它们所面对的经过上一步编码产生的数据的 特点是不同的。如上所述,帧内编码时要尽最使d c t 变化后的矩阵的系数的能量集中在 d c 段,与之相适应,采用了( 3 8 ) 所示的量化矩阵。而对p - v o p 或者b - v o p 来说,它 们由其前向帧或者后向帧重建而成,所以在空域是基本没意义的,所以各个系数的量化 步长基本相同。 3 4 可变长编码( v l c ) 虽然h u f f i n a n 码对于给定的消息概率集是最有效的最优编码,但是由于它的长度 变化很大,码字结构过于复杂,具体实现起来就比较困难。为了简化实现编码的复杂度, 可以牺牲一些压缩比,所以可以用可变长码( v l c ) 来代替h u f f m a n 编码。在可变长编 码( v l c ) 中,码表的设计是非常关键的步骤。m p e g

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论