(电力电子与电力传动专业论文)基于mpeg4的视频压缩编码的设计与实现.pdf_第1页
(电力电子与电力传动专业论文)基于mpeg4的视频压缩编码的设计与实现.pdf_第2页
(电力电子与电力传动专业论文)基于mpeg4的视频压缩编码的设计与实现.pdf_第3页
(电力电子与电力传动专业论文)基于mpeg4的视频压缩编码的设计与实现.pdf_第4页
(电力电子与电力传动专业论文)基于mpeg4的视频压缩编码的设计与实现.pdf_第5页
已阅读5页,还剩45页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

v i d e oc o m p r e s s i o ns y s t e m sd e s i g na n dr e a l i z a t i o nb a s eo n m p e g 一4 a bs t r a c t w i mt h ed e v e l o p m e n to fv i d e oc o m p r e s s i o nt e c h n o l o g y , v i d e o c o m p r e s s i o ns t a n d a r d sh a v e i m p r o v e di nt h ep a s tf e wy e a r s ,w h i c hn e e dt h eb e t t e rt r a d i t i o n a lv i d e oc o m p r e s s i o na l g o r i t h m a n ds o f t h a r dw a r e s i m p l ev i d e op r o f i l eo fv i d e op r o f i l eb a s e do nm p e g 一4s t a n d a r di sr e g a r d e d a st h er e a l i z a t i o ns t a n d a r d t e x t u r ec o d i n gi so fi m p o r t a n c e d c ta l g o r i t h mi so f t e nu s e di n v i d e oc o m p r e s s i o na l g o r i t h m ,w h i c hi so n l yu s e di nf r e q u e n c yd o m a i nb u tt i m ed o m a i n i tb r i n g s o nm o s a i cp h e n o m e n o n d w tp r o v i d e san e wl o c a la n a l y s i so fm u l t i f r e q u e n c yf i e l d m u l t i t i m e f i e l d ,a sag o o dt o o li nv i d e oc o m p r e s s i o n ,b e c a u s ei th a sc o m p l e x i t yo fe x p r e s si n c a l mi m a g e s i g n a la n dt h ea b i l i t yt oa d a p to fh u m a nv i s i o n ,m p e o 一4i ss t u d i e dd e e p l yb a s e do no b j e c to f v i d e oe n c o d i n gw i t ht h ed e v e l o p m e n to fv i d e os t a n d a r d t h eg r a m m a rs t r u c t u r eo fm p e g 一4 , e n c o d i n g d e c o d i n gf r a m e ,t h em e t h o do fv i d e oe n c o d i n ga r ei n t r o d u c e d t h ek e yt e c h n o l o g yo f s h a p ec o d i n g 、m o t i o ne s t i m a t i o na n dc o m p e n s a t i o n 、t e x t u r ec o d i n ga r er e s e a r c h e d t e x t u r e c o d i n g 、p m v f a s t 、c o d er a t ec o n t r o l 、i - d p c m 、p - d p c m 、d w t 、d c ta r es t u d i e di nd e t a i l i nm o t i o ne s t i m a t i o ns e a r c ha r i t h m e t i c ,p m v f a s ta l g o r i t h mi sp r o p o s e dt oc o m et u r ec o d i n g p r o j e c to fm p e g 一4b yu s i n gd w ti n s t e a do fd c t t h ew h o l es y s t e mc o m e st r u eo np cb y u s i n gs o f t w a r e t h ea c t u a ls y s t e mo fc o d i n gi sd e s i g no nd s ec o d i n ga r i t h m e t i ci so p t i m i z e dt o i m p r o v et h ee f f i c i e n c yo fp r o g r a mp e r f o r m ,w h i c hi sd e m a n d e db yt h er e a l - t i m eo fs y s t e m t h e r e s u l to f s ”t e mt e s f i n gi ss h o w e da tl a s t k e yw o r d s :v i d e oc o m p r e s s i o n ;m p e g 一4 ;d s p ;d w t e n c o d e r i i 大庆石油学院颂十学位论义 1 论文研究的背景和意义 绪论 随着网络的快速发展,多媒体通信技术在当今的网络时代获得了蓬勃的发展,但多媒 体信号所需的数据量非常大,因此在传输时所需的带宽也随着多媒体的应用而增加。由于 网络带宽的增加速度不及使用者增加的速度,造成了网络传输的堵塞。所以在当前有限的 带宽下,如何在现有的技术水平和硬件条件下实现合理、优化、实时的多媒体通信终端设 备和产品一直是近年来信号处理学术领域关注的方向。多媒体信号所包含信息种类相当的 多,如视频、图像、声音、文字等。而在这所有种类的信息罩面,以视频所占的数据是最 多的。因此,对视频数据压缩的技术的研究势在必行“。对视频数据而言,因为其中隐 含许多的冗余性( r e d u n d a n c y ) ”,因此视频数据压缩可将这些多余性去除,使得数据量 大量减少,得到很好压缩效果“。许多的视频标准是定义或采用了不同的数据压缩的算 法,压缩后所得到的数据量与其失真度也会不同。所以品质更好且压缩率更高的视频压缩 方法是研究的重点”1 。 2 视频压缩标准的现状 多媒体技术的广泛应用,促进视频压缩编码技术的发展,国际电信联盟( i t u ) 和国际 标准化组织( i s o ) 分别成立了专门的机构,制订了一系列视频编码的标准,致力于制订 运动图像压缩编码的国际标准。到目前为止,己经开发和正在开发的运动图像压缩标准有: m p e g 一1 、m p e g 一2 、m p e g 一4 、m p e g 一7 、m p e g 一2 1 、h 2 6 1 、i i 2 6 3 、h 2 6 3 + 、h 2 6 3 + + 、h 2 6 4 等8 。 这些视频压缩标准都是针对不同的功能与用途来设计,如m p e g 一2 主要用于d v d 电影压 缩、数字电视等应用,对于高画质高带宽的传输环境,m p e g 一2 提供了许多的优点,如编解 码架构较简单,编译码的速度较为快速,使得对于需要压缩大尺寸规格的视频需求下,无 论是软件或v l s i 的实现都较为容易且成本低廉,所以受使用者的欢迎。而h 2 6 3 的主要应 用于较窄带宽的网络环境及可视电话,它提供了小尺寸规格视频的传输,在较高压缩比的 条件下所能达到可接受的画面品质,其应用多为一般视频会议的头肩序列 ( h e a d a n d s h o u l d e r ) 的视频压缩,在静态的背景下能达到不错的压缩率”1 。 而m p e g 一4 标准是继m p e g - 2 的之后提出的新一代压缩标准,它之所以寄予厚望是因为它 的码速率为( 2 8 3 8 4 k b p s ) l e m p e g 一2 ( 3 1 0 m b p s ) 低,但是却能提供近似相同的画面品质, 而且在结构上m p e g 一4 所采用v o ( 视频对象概念) 更适合于人类视觉的感觉与认知水平,它将 视频分为背景与运动图像的部分,按照不同的对象提供了不同的压缩方式,不但会有较高 的压缩比而且能有更佳的视觉品质,提供使用者更人性化的视觉享受“”“。 绪论 视频压缩系统的实现方式 实现数字视频的压缩平台主要有两类:一类是基于p c 的,用软件算法来实现编解码功 能”;另一类是基于各种微处理器芯片,构成专用图像编解码电路。”2 。相比较而言,在 p c 上用软件实现如j p e g 、m p e g 一4 、h 2 6 4 等压缩算法,其特点是灵活性强、软件资源丰富、 开发周期短。但是,p c 设备体积较大,实时性差,使用场合有一定限制,而且p c 更多用 于后台处理,完成非实时性的分析和计算。在某些情况下,考虑到周围环境、速度要求, 特别是实时陛要求很高,或开发嵌入式系统时,需要采用由各类芯片设计的专用电路“。 随着信息技术的日益普及,以及超大规模集成电路技术和计算机技术的发展,各种快 速数字信号处理器件大量问世并得到广泛应用。目前,国际市场上涌现出多种多样的 d s p ( 数字信号处理器) 和数据处理系统,有专用的数字滤波器、数字频谱分析仪、实时图 像处理系统,有高速通用视频编解码芯片、高速通用数字处理芯片、高速多媒体信号处理 芯片等。 基于微处理器芯片的视频压缩系统开发方式主要有两种:一是采用专用芯片或可编程 器件实现视频图像的高速实时压缩( 如实现j p e g 的c l 5 5 0 、s t l l l 4 、l 6 4 7 0 2 ,实现m p e g 的 c l 9 5 0 、s t i 3 5 0 0 等芯片) ,其特点是实时性好、可靠性高,但灵活性差;二是使用高性能 通用d s p 并配置一些外围器件构成一个图像处理系统,通过编程实现视频图像的压缩,其 特点是灵活性强、实时性好、可靠性高i “1 ”。 采用通用型d s p 丌发实时视频压缩系统一直研究的重点。因为自从2 0 世纪7 0 年代末第一 片d s p 问世以来,d s p 就以数字电子器件特有的稳定性、可重复性、可大规模集成,特别是 可编程性高和易于实现自适应处理等特点,给数字信号处理的发展带来了巨大机遇1 。由 于各d s p 厂家的竞争及生产工艺的不断提高,使得d s p 芯片的价格不断下降,且性能不断提 高。同时,现场可编程门阵列( f p g a , f i e l dp r o g r a m m a b l eg a t ea r r a y ) 技术器件能够 以高速、实时、低成本、高灵活性的优点应用于数字信号处理领域,它可以很好的作为通 用d s p 的协处理器进行工作“”“。随着f p g a 和d s p 的发展,将通用处理器与f p g a 融合在一起, 把需要多个时钟周期的运算交给f p g a 完成,d s p 主要完成单时钟的运算和控制f p g a 的“可 再配置计算”功能,会更好地将二者的优势发挥出来。这两者的有效结合使得实现图像实 时传输和压缩变成了一种可能“。用d s p 实现视频压缩方法已成为数字视频压缩领域发展 的一大趋势,它的优点是研发的时程短,速度也在可以接受的范围,对压缩标准的架构演 变也可以很快的跟进,尤其是算法的改进,可以依照需要随时去更改,极大的提高了硬件 的升级效率“。 4 论文主要工作 1 基于d w t 在图像压缩方面的优良特性,尝试用d w t ( 离散小波变换) 取代离散d c t ( 离 散余弦变换) ,有效的消除了d c t 所产生的马赛克现象。 2 在运动估计搜索算法上,用p m v f a s t 替换最常用的d m 搜索方法,节省了搜索时间, 提高了p s n r ( 信噪比) 。 2 大庆_ i 油学院倾i :学位论文 3 4 5 剥m p e g 一4 编解码器在p c 下对进行了仿真。 t d s 3 2 0 d m 6 4 2e v m 进行了m p e g4 视频压缩编解码器的程序移植并优化程序代码。 最后对m p e g 一4 编码器进行了整体测试,测试结果证明系统设计的可行性。 第一章m p e g 4 标准的关键技术研究 第一章m p g e 4 标准的关键技术研究 m p e g 一4 视频压缩标准于1 9 9 9 年初正式成为国际标准,最初的目标是极低比特率的音 频视频编码压缩标准,是m p e g 一2 标准相比,m p e g 一4 标准不在规定具体的压缩算法,它更 多定义的是一种格式和框架,以支持各种各样新颖的和高效的功能。m p e g 一4 目的是寻求支 持数字音频视频数据通信、存取和管理的新途径,它为多媒体数据压缩提高了一个更为 r 1 阔的平台,它可以将各种各样的多媒体技术充分用于编码中,除包括压缩本身的一些工 具、算法、还包括图像分析和合成、计算机视觉、计算机图形、虚拟现实和语音合成技术 8 9 m p e g 一4 标准采用了基于对象的编码、基于模型的编码等第二代编码技术,m p e g 一4 最 显著的特点是基于内容的编码,所谓的对象是在一个场景中能够访问和操纵的实体,对象 的划分可以根据其独特的纹理、运动、形状、模型和高层语义为依据。这种编码是一种基 于内容的数据压缩方式,以前的压缩算法只是去掉帧内和帧间的冗余,而m p e g 一4 则要求 对图像和视频做更多的分析,甚至是理解,如将图像分割为运动物体对象和静止不动的背 景对象平面,并对这两个对象进行分别处理。背景对象采用压缩比较高、损失比较大的办 法进行编码,运动物体对象采用压缩比较低、损失较小的办法,这样就在压缩效率和解码 图像质量问得到较好的平衡。基于对象的编码除了能提高数据的压缩比,还能实现许多基 于内容的交互性功能。 1 1m p e g 4 数据结构 一个m p e g 一4 视频场景中可能包含多个视频对象。每个视频对象都用不同的数据结构来 划分。如图卜1 所示: 1 v s ( v i d e os e s s i o n ) :它位于数据结构层的最高层,是其它层数据的入口。一个完 整的视频包含多个v s 。 2 v o ( v i d e oo b j e c t ) :是场景中的某个物体,它是有生命期的,由时间上连续的许多 帧构成。大多数视频对象都是一个矩形帧,当然也可以是任意形状的对象或是场 景中的背景。 3 v o l ( v i d e oo b j e c tl a y e r ) :v o l 是v o 的时间或空间的伸缩性描述。v o 的描述可 以在不同时间分辨率和空间分辨率上进行。它可以只包括一个基本层,也可以包 括多个分辨率增强层。目标的伸缩性是通过v o l 来实现的。根据应用的具体要求, 每一个视频对象都可以用分级或不分级的方式进行编码,用视频对象层来表征。 v o l 提供了对分级编码的支持。一个视频对象可利用空间或时间可伸缩性进行编码 使分辨率从粗糙到精确。 4 o o v ( g r o u po fv i d e o ) :它是视频对象片面的组合,是可选成分。根据应用v o l 既可以由v o p 直接组合,也可由g o v 组合而成。可以提供码流中独立编码的视频 人庆石油学院硕士学位论文 对象平面参考点,因此可以支持对码流的随机访问点,是任选的。 5 v o p ( v j d e oo b j e c tp l a n e ) :一个v o p 是对一个视频对象的时间采样,包括视频对 象的运动参数、形状信息和纹理数据。v o p 可以是相互独立编码,也可以是通过 运动补偿依靠其它v o p 编码。对v o p 编码就是针对某一时刻该帧画面v o 的形状、 运动、纹理等信息进行编码。 v s v o v o l g o v v o p 图卜im p e g 一4 层次化的数据结构图 f i g 1 1t h el a y e r i n gd a t as t r u c t u r eb l o c kd i a g r a mo fm p e g 一4 1 2m p e g 4 视频编码和解码框架 m p e g 一4 编码和解码是针对v o p 进行的,在某一时刻,v o 以v o p 的形式出现,v 0 的构 成依赖与具体应用和实际系统,v o 可以是一个矩形帧,也可能是场景中的某一物体或某一 层面从而与原来的标准兼容:每个v 0 都由运动信息、形状信息和纹理信息组成。编码也 主要针对这个时刻的v o 的形状、运动、纹理这三类信息来进行。视频编码框架中主要包 括的三个关键模块,也即是形状、运动和纹理编码模块。视频对象编码首先从基于像素的 原始图像中分割出各个视觉对象v o p ,然后编码控制机制为不同的v o p 信息分配码率,之 后各个v o p 分别进行独立编码,最后将各个v o p 码流复合成一个码流。在编码控制和复 合阶段可以加入用户的交互控制或由智能化的算法进行控制。编码时首先由输入的视频序 列定义出v o p ,针对每一个v o p 分别进行编码,将所有的v o p 编码的结果合成在一起,形 成压缩视频数据流,解码时首先将压缩视频数据流分解,得到每一个v o p 的编码数据流, 针对它们分别进行v o p 解码,解码结果组合在一起形成输出视频。图1 2 、图卜3 给出了 m p e g 一4 编解码器的总体结构。 第一章m p e g - 4 标准的关键技术研究 v o p 0 l 1 编码p 编 码 码 4 v o p i l 1流 控 编码 复 制 合 翌卜 图卜2m p e g 一4 视频编码器结构 f i g 1 2t h es t r u c t u r eb l o c kd i a g r a mo fm p e g 一4e n c o d e r 码 一v o l l鳖塑l 码 吖哥1解码 一码流重组 流 复 合 v o p n 叫解码p 图卜3m p e g - 4 视频解码器结构 f i g 1 3t h es t r u c t u r eb l o c kd i a g r a mo fm p e g 一4d e c o d e r 1 3m p e g 4 的框架和级别 m p e g 一4 共有4 类框架:视频框架、音频框架、图形框架和场景描述框架。其中视频 框架又包含5 个级别,如下: ( 1 ) s i m p l ev i d e op r o f i l e :提供矩形视频对象高效有容错能力的编码功能,适合 应用于移动网络。 ( 2 ) s i m p l es c a l a b l ev i d e op r o f i l e :在s i m p l ep r o f i l e 基础上增加了对象时域 和空域扩展编码功能,应用于提供多级服务质量的应用,如i n t e r n e t 和软件解码。 ( 3 ) c o r ev i d e op r o f i l e :在s i m p l ep r o f i l e 基础上增加了任意形状对象编码和时 域扩展编码功能,适用于相对简单的内容交互应用,如i n t e r n e t 多媒体应用。 ( 4 ) m a i nv i d e op r o f i l e :在c o r ep r o f i l e 基础上增加了s p r i t e 对象编码功能, 适用于交互和娱乐质量广播和d v d 应用等。 ( 5 ) n - b i tv i d e op r o f i l e :在c o r ep r o f i l e 基础上增加了具有不同像素深度视频 6 人庆钉油学院颂叶。学位论义 对象编码功能,适用于监控应用。 1 4m p e g 4 的视频编码方法 m p e g 一4 是。个通用标准,这种通用性集中体现在它所支持的应用、比特率、分辨率、 质量和服务上。然而从标准的进展状况来看,m p e g 一4 把基于内容的应用的支持放在了非常 重要的地位,这种支持是多层面的。 m p e g 一4 视频部分是m p e g 一4 标准的核心内容之一。既提供传统的基于帧的编码方法又 提供基于视频对象( v o ) 的编码方法。在某时刻,视频对象以视频对象平面( v o p ) 的形式 出现,编码也主要针对该时刻视频对象的形状、运动和纹理这三类信息来进行。 1 4 1 形状编码 m p e g 一4 首次把形状描述引入运动图像的编码。v o p 的具体信息又称( a l p h a ) 平面, 它对各个零散的v o 合成整个场景非常重要。它是对场景分割各v o 的描述。一般的形状 是任意的,所以要对它进行专门的编码。形状信息的获得首先要对图像进行分析和分割。 把各个代表不同内容的对象分割后再用形状表示。v o 的形状信息有两类:一种是二值形 状信息;另一种是灰度级形状信息。二值形状信息用0 、l 来表示v o p 的形状,0 表示非 v o p 区域,1 表示v o p 区域。二值形状编码是基于1 6 x1 6 的b a b ( b i n a r ya l p h ab l o c k ) 块的。二值形状信息编码采用基于运动补偿块技术,可以是无损或有损编码。灰度形状信 息用0 2 5 5 之间的数值来表示v o p 的透明度,其中0 表示完全透明,2 5 5 表示完全不透明。 1 4 2 运动信息编码 m p e g 一4 采用运动预测和运动补偿技术来去除图像信息中的时间冗余成分,这些运动信 息的编码技术可视为由现有标准向任意形状的v o p 的延伸。在m p e g 一4 中运动预测和运动 补偿可以是基于1 6 1 6 宏块的,也可以是基于8 x 8 子块的。运动估计和补偿采用了“半 像素搜索”、“高级预测模式,和“重叠运动补偿”技术。了能适应任意形状的v o p ,m p e g 4 ;l 入了图像填充技术和多边形匹配技术。引入了“重复填充”和“多边形匹配”技术。对 于完全在v o p 外、但在边框内的宏块( 外部块) ,不做运动估计:对于完全在v o p 内的宏块( 内 部块) 作运动估计:对部分在v o p 内、部分在v o p 外的块( 边缘块) ,用“多边形匹配”技术 进行运动估计,匹配误差由块中属于v o p 内部的像素与参考块中相应位鸯像素的差的绝对 值的和( ( s a d ) 来度量。 14 3 纹理编码 纹理指的是i v o p 或p - v o p 、b - v o p 经运动补偿预测后残留下来的图像。纹理编码的对 象可以是帧内编码模式( i v o p ) ,也可以是帧间编码模式b - v o p 或p - v o p 运动补偿后的预 第一章m p e g 4 标准的关键技术研究 测误差。m p e g 一4 纹理编码使用了标准的基于8 8 块的d c t 变换。在帧内编码模式中,对 于完全位于v o p 内的像素块,则采用经典的d c t 方法;对于部分在v o p 内、部分在v o p 外 的像素块则首先采用图像填充技术来获得v o p 之外的像素值,之后再进行d c t 编码。帧 内编码模式中还将对d c t 变换的d c 及a c 系数进行有效的预测。在帧间编码模式中,为 了对b - v o p 和p - v o p 运动补偿后的预测误差进行编码,可将那些位于v o p 活跃区域之 外的像素值设为1 2 8 。变换之后的d c t 系数还需经过量化( 采用单一量化因子或量化矩 阵) 、z i g z a g 扫描及变长编码,这与现有标准基本相同。v o p 视频的纹理信息可以表示为 亮度成分y 和两个色度成分c r 和c b 。帧内编码情况下,纹理信息包含有亮度和色度成分; 运动补偿情况下,纹理信息表示经过运动补偿后的残差。v o p 纹理编码过程依次为d c t 变 换、系数量化、d c a c 系数预测、系数扫描和可变长编码处理后,最后形成比特流。 1 d c t 变换 d c t 变换是通过信号变换来消除数据空问相关性的一种有效方法。尽管变换本身不能 对数据进行压缩,但由于变换后系数之间的相关性明显降低,图像信息的大部分能量都集 中到少数几个变换系数上,采用适当的量化和嫡编码可以有效地压缩图像的数据量。而且 图像经变换后,系数的空间分布和频率特性能与人眼的视觉特性匹配,因此可以利用人类 视觉系统的生理和心理特点来得到较好的编码系统。帧内视频纹理宏块和填充宏块轮廓采 用基于8 8 块的d c t 变换进行编码。d c t 变换系数是以有损压缩的方式进行量化。 2 系数量化 量化有两种类型第一种方法根据系数的空间频率来修改量化步长的大小,第二种方法 采用的是对全部系数运用相同的量化步长。在m p e g - 4 标准中,允许对直流部分的变换系 数采用非线性量化的方法。 3 系数预测 量化系数的平均能量可以通过邻近宏块的预测得到进一步的降低。 方宏块丌始,可以是从左边的宏块开始,也可以是从左上的宏块开始。 应的,并且是基于周围宏块来选定的。 4 系数扫描和游程编码 在游程编码之前,系数通过扫描过程从二维数据转换成一维数据。 种方法:水平交替扫描、竖直交替方式、z i g z a g 扫描。 1 5m p e g 4 视频编码算法研究 预测可以是先从上 预测的方向是自适 通常用的扫描有三 视频图像压缩编码的方法有许多种,按照不同的标准以及根据研究问题的出发点不同 可以分成不同的类。按信息是否有损失可以分为两大类:无损压缩编码和有损压缩编码。 如果全部数据在编码时都保留,则解码端就能完全无损地重建原图像,这种编码称为 无损压缩。无损压缩编码符合理想要求,但压缩比都不大,如哈夫曼编码、算术编码、游 程编码等。 在视频压缩编码中,有时为了实现高倍数的压缩是通过减少视频序列间的相关性,降 大庆石油学院坝士学位论文 低视频内容中的冗余。解码端重建的图像就与原图像有所差异,这种编码就是有损压缩。 有损压缩编码后图像信息有损失,且压缩比越高,图像失真越明显。常用的编码方法有: 预测编码、变换编码( d c t 编码、小波变换编码) 、分形编码、矢量编码、神经网络编码等。 1 _ 5 1 d c t 与d w t 比较 m p e g 一4 采用是将视频图像分成宏块的方式以d c t 结合差分调制的方法来进行压缩。d c t 计算复杂度适中,又具有可分离特性,还有快速算法等特点使其成为视频压缩常采用的一 种算法。但随着应用和研究的不断深入,d c t 变换的缺点逐步暴露出来,主要有: 1 易出现马赛克效应和飞蚊噪声 在低比特率环境下,易出现了马赛克效应和飞蚊噪声,因为一般情况下图像信号是高 度非平稳的,很难用g a u s s 过程来刻画,并且图像中的一些突变结构,用余弦基作图像信 号的非线性逼近,其结果不是最优的。 2 d c t 只能在频域对信号进行分解,不能提供时域的信息。 3 耗费硬件资源 d c t 要用到三角函数来计算,通常会将三角函数和角度的对应值先算好储存在r o m 里, 在计算时直接查表即可快速得到所需要的值。这样需要更多的存储器。 所以研究人员试图找到一种更适合第二代视频压缩编码技术的压缩算法。 d w t ( 离散小波变换) 为时间和频率的局部化提供了信号的一个多分辨率多频率表示, 其具有良好的去相关性和能量压缩特性以及存在着快速算法和在表示非平稳图像信号方 面的灵活性和适应人类视觉特征的能力,已经成为图像压缩方面的有力工具”。 小波分析的本质是多分辨分析信号,多分辨率变换特性便于与人眼的视觉特性相结合, 它的后续编码方法可以针对图像特性、视觉特性,对不同的频率区域分别处理,而且支持 多分辨率、多码率传输方案删。与d c t 不同的是它在时域和频域同时具有良好的局部化性 质,对高频成分采用逐渐精细的时域或空间域步长,可以聚焦到分析对象的任意细节。小 波变换就是一种将图像分解戒与人类视觉特性相匹配的不同分辨率、不同方向特性的予带 并使能量集中在某些子带的变换,因此为图像的压缩提供了巨大的可能性。s m a l f a t 将多 分辨分析思想与离散小波变换巧妙结合起来,由于小波变换的优良特性与m a l f a t 算法的 简便易行,使得小波变换图像编码压缩算法成为目前图像压缩领域的一个主要研究方向 ( 5 i 1 5 2m p e g 4 编解码算法选择 基于本论文需要出发,在这里将提升离散小波变换与差分调制结合起来构建视频压缩 的编解码器。使用s p i h t 算法来进行量化。“。 箱一章m p e g 4 标准的关键技术研究 1 5 3 提升离散小波变换 提升离散小波变换由分裂( s p l i t ) 、提升( 1 i f tj n g ) 和正规化( n o r m a l i z a t i o n ) 三个步骤 所构成”。 ( 1 ) 分裂:将输入信号f ( i 1 分成奇数( o d d ) 及偶数( e v e n ) 两个序列。奇数序列用符号 钟表示;偶数序列用符号s ? 表示。其过程用公式( 卜1 ) 表式。 s ? = f ( 2 i )刃= f ( 2 i + 1 ) ( 2 ) 提升:将s ? 一1 输入到估测函数以估测出卵和。1 之间的误差值,然后将冒。减 估测出来的误差值可得到掣。再来将得到的卵输入到更新函数虬,然后和s ,n 。相加得 到s ? 。其过程如公式( 卜2 ) 、公式( 卜3 ) 和图卜4 所示。 d ? 一 彬= 卵一p 。( s ? 。1 ) j ? = s ? 。1 + u ( 卵一) 图1 - 4 提升阶段示意图 f i g 1 4t h eg r a p ho fl i f t i n gp e r i o d ( 卜2 ) ( 卜3 ) ( 3 ) 正规化:在这个最后的步骤中只要将得到的s :和分别和常数k o 和k 。相乘可得 到缸妇和d f 】。札踞和d i 即是最后我们所要的低频和高频的数据。 s i = 墨s ? d i _ k ,卵 9 7 提升式离散小波转换转换如下列公式及图卜5 所示。 研= d o a o ( s o l + 5 7 ) ( 1 - 4 ) ( 卜5 ) ( 卜5 ) 人庆百油学院硕士学位论文 f i 】 s s ? 一a 0 ( 吐+ d ? ) d ? = 砰一a 2 ( s i 。+ s j ) s ;= s ;一码( d :,+ d ? ) s i - k o s ? d f = k l 彰 a 0 = 1 5 8 6 1 3 4 3 4 2 ,a l = 0 0 5 2 9 8 0 11 8 5 4 ,a 2 = 0 8 8 2 9 11 0 7 6 2 驴o 4 4 3 5 0 6 8 5 2 2k o - 1 1 4 9 6 0 4 3 9 8 ,k 1 ( 1 6 ) ( 1 7 ) ( 卜8 ) ( 卜9 ) ( 1 1 0 ) 分裂提升 规范化 图卜59 7 提升离散小波变换 f i g 1 59 71 i f t i n gd w t 反提升离散小波变换的过程序只要将执行程序反向运作就可以把低频信号和高频信号 组合还原。如图卜6 所示。 f d f p 陟一 陟姐 t + e 卜斗 图1 - 69 7 提升反离散小波变换 f i g 1 - 6 9 7l i f t i n gi d w t 第一章m p e g 4 标准的关键技术研究 1 5 4s p i h t 算法 s p i h t ( 分层树的集划分,s e tp a r t i t i o n i n gi nh i e r a r c h i c a lt r e e ) 是一种以阶层树 分割数据成为独立区块的编码算法,是对e z w 算法的扩展,它继承了零树的许多思想,其 目的也是通过方向树最有效地表示重要系数,并通过对树的划分,将尽可能多的非重要系 数集中在一起。因此衍生了四元树、扫描顺序、门坎值等辅助的方法来帮助编码“。 1 四元树 四元树是较高阶的某一数值在低一阶频域有四个数值与的对应,在低二阶频域有十六 个数值与的对应。 _ j到 a 1 1 1 a 1 2 l l l lh l l掏 剑 a 3 l h l 0 l h lh h l l f l h 0h h 0 图卜7 四元树频域关系图 f i g 1 7t h eg r a p ho fq u a d r u p l et r e e f r e q u e n c yd o m a i nr e l a t i o n 由图卜7 可了解不同阶之间如何联结成一由上而下的树状结构。在l l i 频域中的系数 a 和l h i ,h l l ,h h i 频域中的系数a 1 ,a 2 ,a 3 是同一空间位置的数据被分成四个不同 频域系数。而a 1 代表的空间位置和h l o 频域中系数a 1 1 , a 1 2 ,a 1 3 , a 1 4 是一样的。 同理h l l 中的任一系数所代表的空间域在h l o 一定有四个系数与的对应。可以看出这些 系数在树中的大略模样。系数a 是树的根有三个子树a l ,a 2 ,a 3 。系数a 1 有四个子树 a 1 1 ,a 1 2 ,a 1 3 ,a 1 4 ,系数a 2 有四个子树a 2 1 ,a 2 2 ,a 2 3 ,a 2 4 ,系数a 3 有四个子树 a 3 1 ,a 3 2 ,a 3 3 ,a 3 4 。整个以a 为根的系数共有1 6 个。图卜8 更能说明它们之间的关系。 大庆石油学院硕l 学位论文 f i g 图卜8 四元树树状表示法 3 扫描顺序: s p i h t 编译码时用来作为确认位置的方法就是扫描顺序,编译码算法事先有一份数据 说明此离散小波转换后转换的阶数,垂直像素数量,水平像素数量。并以此数据作为编译 码顺序的依据,这样的话就不需要将相对位置信息编入码中。因此定义扫描j i 啜序为,先搜 索低频区域再搜索高频区域,同一频域则由左而右,由上而下依序扫描。如图卜9 所示。 ii2彳,2 th 2 h w 7 。 l h ih h l l h 。 r h h 0 图1 - 9 扫描顺序频域表示法 4 门坎值 作为决定系数值是否是重要系数的基准。当系数的绝对值大于门坎值时就被判定为重 要系数,反的则被判定为非重要系数。门坎值的求法是先求n ,n 的求法如公式( 卜1 1 ) 是 将全部的系数扫描过一遍求得最大系数,再将最大系数以2 为基底求l o g 的最大整数结果。 而门坎值t k 的求法如公式2 ,门坎值瓦中k 为自n 递减的数值。 n 。l 0 9 2 ( m a x ( c j ) ) = 2 瓦一l = 2 肛1 ( 卜1 1 ) ( 1 1 2 ) ( 1 1 3 ) 第一章m p e g - 4 标准的关键技术研究 1 6 运动估计算法分析 互= 2 ( 1 1 4 ) 运动搜索是按搜索算法指定的搜索路径寻找最佳匹配块以及最匹配的运动矢量。各种 搜索算法的主要区别就在于如何选择指定窗口内的搜索路径和搜索点数,也就是尽量提高 匹配精度和减少搜索次数。下面介绍几种常用的搜索算法: 1 6 1f s ( 全搜索算法) 全搜索即在搜索范围内逐点搜索,每搜索一次计算一次s a d ,当s a d 达到最小值时, 求得最佳匹配宏块。全搜索算法搜索到的结果是全局最优。全搜索算法的算法性能很好且 硬件实现简单,但是计算量很庞大,需要很多处理单元,是以牺牲性能来换取处理速度的 提高”“。 1 6 2t s s ( 三步搜索法) t s s 为了减小f s 算法的运动搜索复杂度和数据读取复杂度而出现的一种改进的运动估 计算法。它具有简单、健壮、性能良好的特点。t s s 算法的基本思想是采用一种由粗到细 的搜索模式,从原点开始,以最大搜索长度的一半为步长检测中心及周围8 个邻点的s a d 值,找到s a d 值最小点,下一步以该最小点为中心,步长减半,并在缩小的方形的中心 及周围9 个点找s a d 最小点,依此类推,直到步长为1 。t s s 算法在搜索区域为( 7 , 7 ) 时初始搜索步长为4 ,对慢速运动块的估计来说太大,t s s 很早就确定了搜索方向, 容易陷入局部最小点,损失搜索精度。“。 1 6 3d s ( 钻石搜索法) 钻石搜索法d s ( d i a m o n ds e a r c h ) 的核心思想是减少进行块匹配的搜索点。钻石搜索 法采用了两种搜索模式,第一种模式称为大钻石型搜索模式( l d s p ) 。该模式包括围绕中 心点的8 个点,总计9 个点,从而形成一个大钻石形。第二种模式称为小钻石型搜索模 式( s d s p ) 。这种模式包含了5 个点,形成个较小规模的钻石形。d s 算法采用l d s p 和 s d s p 两种形状的搜索块,先用l d s p 搜索,由于步长大、搜索范围广,可以进行粗定位, 使搜索过程不会陷于局部最小。当粗定位结束后,可以认为最优点就在l d s p 周围8 个 点所围的菱形区域中,这时再用s d s p 来准确定位,使搜索不至于有大的起伏,所以它的 性能优于其它快速算法。但是,d s 算法有其自己的不足之处,对于运动剧烈的图像取7 个像素点的搜索范围,速度就比不上t s s ;对于静止的图像序列必须要依次计算l d s p 和 s d s p 两个模板的1 3 个点,而理想情况是只需计算s d s p 的5 个点;由于过早选定方向, 容易陷入局部极小。 1 4 大庆石油学院硕十学位论文 1 6 4p m v f a s t ( 可预测的运动向量场自适应搜索法) p m v f a s t 在运动向量的预测上除了参考空间相关性的区块a 、b 、d 和( 0 ,0 ) 的位置,也 参考了时间相关性的区块g 和中间值( m e d i a n ) 的运动向量预测如公式( 卜1 5 ,1 1 6 ) ,当 前的区块与g 之间也存在明显的相关性,因为目前的区块与g 有可能是属于同一个对象。 至于中间值预测( m e d i a np r e d i e t o r ) 与f l 前区块运动向量的关系,由于中州值预测( m e d i a n p r e d i e t o r ) 与运动向量存在着相当明显的关系,因此p i v f a s t 并不定以( 0 ,0 ) 的位置为 优先搜索的对象,而是先以空间相关性为依据所求的中间值为优先的搜索对象“”1 。 x = m e d i a n ( m v a x ,姗 柳d j ( 1 1 5 ) m k ,= m e d i a n ( m v a v m v b pm 、) ( 1 1 6 ) 除了预测值的选择之外,p m v f a s t 还针对门坎值( t h r e s h o l d ) 做改进。它不像m v f a s t 采取固定的门坎值( l 1 、l 2 ) 来决定该使用s d s p 或l d s p 搜索样板,因为固定的门坎值对于 不同运动变化量的视频串行而言未必是合适的,所以p m v f a s t 是依据画框( f r a m e ) 的内容 动态的决定门坎值大小,以判断该使用何者搜索样板。p m v f a s t 的流程图如图卜1 2 所示 p m v f a s t 算法叙述如下: 步骤1 :依据a 、b 、d 运动向量,先预测中间值的运动向量。 步骤2 :依据中间值大小或门坎值大小决定使用哪种搜索样板( s d s p 、l d s p ) ,如果中 间值或门坎值符合d e c i s i o n # l 的判断条件,则使用s d s p ,否则跳到步骤6 。 步骤3 :计算目前处理的区块与中间值运动向量所指到的位置之间的差异值,如果结 果符合d e c i s i o n # 2 的判断条件则停止,否则继续下一个步骤。 步骤4 :计算a 、b 、d 、g 运动向量所指到的位置和( 0 ,0 ) 的位置与目前处理的区块的 差异值,如果最小的差异值符合d e c i s i o n # 3 的判断条件则停止,否则继续下一个步骤。 步骤5 :以最小差异值的运动向量所指到的位置为中心点做s d s p 搜索( 同菱形搜索算 法) ,最小差异值的运动向量就为目前处理区块的运动向量。 步骤6 :以( 0 ,0 ) 的位置为中心点做l d s p 搜索( 同菱形搜索算法) ,最小差异值的运动 向量就为目前处理区块的运动向量。 p m v f a s t 的流程图的判断条件,分别定义如下:d e c i s i o n # l 中其参数d i s t a n c e 表示中 间值预测所得运动向量( d i s t a n c e = jm e d i a nm v xi + m e d i a nm v y ) ,p r e d e q 表示当空间上三 个区块运动相量相同时设为1 否则为0 ,t h r e s a 和t h r e s h 表示依据区块内容所采取适当 的门坎值。d e c i s i o n # 2 中s a d p m v 表示所预测运动向量的s a d 值,s a d p f m v 表示与目前处 理的区块相同位置的前一张画面区块。在d e c i s i o n # 3 中m i n s a d 表示在空间相关上a 、b 、 d 三个区块、时间相关上g 和( 0 ,0 ) 的位置上共5 个运动向量的最小s a d 值。 综上所述,p m v f a s t 从空域相关性出发,由相邻块预测出当前块的搜索起点,较大限 度地克服搜索陷入局部最小的情况,并且能较快

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论