已阅读5页,还剩78页未读, 继续免费阅读
(计算机应用技术专业论文)全局运动估计及其在视频编码中的应用.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
全局运动估计及其在视频编码中的应用中文摘要中文摘要随着可视电话电视会议、数字电视、v c d d v d 等应用的发展,视频压缩编码技术已经成为学术界和产业界普遍关注的热点。本文对视频压缩编码中的关键技术运动估计和补偿方法进行了研究,内容包括:夺对视频运动模型进行分析,推导了三维刚体经摄像机正交投影n - 维空间后的运动场参数模型。夺结合二维运动场参数模型,在分析现有的全局运动估计算法基础上,提出了改进算法,与传统算法相比,改进算法在计算速度和精确性上都要优于现有算法。夺在分析现有的视频编码国际标准所采用的视频编码框架的基础上,提出了基于全局运动补偿编码的视频编码框架。夺结合视频压缩编码标准h 2 6 3 ,设计并实现了基于全局运动补偿编码的h 2 6 3 编码器。与现有编码器相比,全局运动补偿编码可以平均节约5 0 的码流,同时重建图像的质量平均提高2 - 4 d b 。夺结合我国自主开发的先进的视频压缩编码标准a v s ,设计并实现了基于全局运动补偿编码的a v s 编码器,与现有的编码器相比,全局运动补偿编码可以使重建图像的质量提高0 1 d b 以上。关键词:全局运动估计,全局运动补偿,视频编码,h 2 6 3 ,a v s作者:郭丽指导老师:龚声蓉本文的研究工作受江苏省自然科学基金资助项目“基于内容的视频分层编码传输体系与算法研究”( 编号:b k 2 0 0 3 0 2 9 ) 和铁路信息科学与工程部级开放实验室基金“基于内容的数字水印算法研究”( 编号:t d x x 0 5 0 1 ) 的资助。楚坚篓墅! ! 型鹜篓缝堕! 翌墼塑竺! 鹜墅! 壁黧垫兰塑! 曼塑歉a b s t r a c tw i t ht h ed e v e l o p m e n to fv i d e o p h o n e v i d e oc o n f e r e n c e ,d i 西t a lt v , v c d d v d ,a n de t c ,t h ev i d e oc o d i n gh a sg r a d u a l l yb e c o m et h ec o n l l n o nr e s e a r c hf i e l do fa c a d e m i ca n di n d u s t r i a lg r o u p s i nt h i st h e w s ,m o t i o ne s t i m a t i o na n dc o m p e n s a t i o n ,t h ek e yt e c h n o l o g yo f v i d e oc o d i n g ,a r ei n v e s t i g a t e d i t ss p e c i f i cw o r ki n c l u d e s :夺m a k i n ga n a l y s i so nt h ev i d e om o t i o nm o d e l s ,d e d u c i n gt h ep a r a m e t r i cm o d e lw h i c hd e s c r i b e st h eo r t h o g r a p h i cp r o j e c t i o no f3 - dr i g i dm o t i o no fas u r f a c et ot h e2 - di m a g ep l a n e 。夺c o m b i n i n gw i t ht h ep a r a m e t r i cm o d e l ,p r o p o s i n ga l li m p r o v e dg l o b a lm o t i o ne s t i m a t i o na l g o r i t h mb a s e do nt h ea n a l y s i so nt r a d i t i o n a la l g o r i t h m ,c o m p a r i n g 谢爨t h et r a d i t i o n a la l g o r i t h m ,t h ee x p e r i m e n t a lr e s u l t ss h o wt h a tt h en e wa l g o r i t h mi ss u p e r i o ri nc o m p u t a t i o na n da c c u r a c y ,夺p r o p o s i n gt h ef r a m ec h a r to fv i d e oc o d i n gw i t hg l o b a lm o t i o nc o m p e n s a t i o no nt h eb a s i so ff r a m ec h a r to ft h ec o n v e n t i o n a lc o d i n gm e t h o dw i t hb l o c km o t i o nc o m p e n s a t i o na n a l y s i s 。m a k i n ga n a l y s i so nt h ei t u - r e c o m m e n d a t i o nh 2 6 3 d e s i g n i n ga n di n l p l e m e n t i n gt h e 娃。2 6 3v i d e oc o d i n gb a s e do ng l o b a lm o t i o nc o m p e n s a t i o n 。c o m p a r i n gw i t ht h et r a d i t i o n a lc o d i n g ,t h ee x p e r i m e n t a lr e s u l t ss h o wt h a tt h eg l o b a lm o t i o nc o m p e n s a t i o nc o d i n gc a l ls a v eu pt oa v e r a g e5 0 i nt o t a lb i t - r a t ea n di m p r o v et h ep s n rb y2 - 4 d b 夺m a k i n ga n a l y s i so nt h ea u d i oa n dv i d e oc o d i n gs t a n d a r dw o r k g r o u po fc h i n ar e c o m m e n d a t i o na v s 。d e s i g n i n ga n di m p l e m e n t i n gt h ea v sv i d e oc o d i n gb a s e do ng l o b a lm o t i o nc o m p e n s a t i o n c o m p a r i n gw i t ht h et r a d i t i o n a lc o d i n 舀t h ee x p e r i m e n t a lr e s u l t ss h o wt h a tt h eg l o b a lm o t i o nc o m p e n s a t i o nc o d i n gc a ni m p r o v et h ep s n rb ym o r et h a n0 。l d b 。k e y w o r d s :g l o b a lm o t i o ne s t i m a t i o n ,g l o b a lm o t i o nc o m p e n s a t i o n ,v i d e oc o d i n g ,h 。2 6 3 ,a v sw r i t t e nb yg n ol is u p e r v i s e db yg o n gs h e n g r o n gl l鱼塑曼型竺2 1 塑! 里壁! 竺苎! ! 翌竺璺! 堕垒! ! ! 苎! ! 翌虫堕! ! 兰! 璺垫墨兰皇! ! 竺竺t h er e s e a r c ho ft h i st h e s i sh a ss p o n s o r e db yt h en a t u r a ls c i e n c ef o u n d a t i o no fj i a n g s up r o v i n c eu n d e rg r a n tb k 2 0 0 3 0 2 9a n db yt h ef u n do fs c i e n t i f i cr e s e a r c ho ft h eo p e n k e yl a b o r a t o r yo nr a i l w a yi n f o r m a t i o ns c i e n c ea n dt e c h n o l o g yo fr a i l w a ym i n i s t r yu n d e rg r a n tt d x x 0 5 0 1 1 1 1苏州大学学位论文独创性声明及使用授权声明学位论文独创性声明本人郑震声明:艇提交的学位论文是本人在导! j l i 的指导下,独立进行研究王作所取得的成果。除文中已经注明引用的内容外,本论文不含其他个人或集体已经发表或撰写过的研究成果,也不含为获得苏州大学或其它教育机构的学位证书而使用过的材料。对本文的研究作出重要贡献的个人和集体,均已在文中以明确方式标明。本人承掇本声明的法律责任。研究生签名;二阻日期:垫奠迸学位论文使用授权声明苏州大学、中国科学技术信息研究所、国家鄹书馆、清华大学论文合作部、中国社科院文献信息情报中心有权保留本人所送交学位论文的复印件和电子文档,可以采用影印、缩印或其他复制手段保存论文。本人电予文档的内容和纸质论文的内容相一致。除在保密期内的保密论文外,允许论文被查阅和借阅,可以公布( 包括刊登) 论文的全部或部分肉容。论文的公布( 包括刊登) 授权苏娜大学学位办办理。磋究生签名:j 阻日期:埘导师签名:日期勰乏立狴全局运动估计及其在视频编码中的应用第一章绪论第一章绪论1 1 研究的背景与意义随着现代电子与计算机技术的发展,数字视频技术得到了飞速的发展,目前已经渗透到了商业、教育以及娱乐等各个方面。对于大多数的存储和传输系统而言,视频信号的数字化所产生的数据量是非常巨大的,因而,视频压缩编码在大多数数字视频的应用中具有非常重要的意义近年来,数字视频压缩编码技术得到了迅速的发展和广泛的应用,并且日臻成熟,其标志就是一系列数字视频压缩编码国际标准的制定【lj 从1 9 8 4 年c c i t t 公布了第一个视频压缩编码国际标准以来,删t 等国际标准化组织陆续颁布了接近十个视频压缩编码国际标准,大大推动了视频通信和数字电视广播的发展【l 捌根据统计显示【3 1 ,在上述这些国际编码标准的编码过程中,约8 0 的运算时间耗费在运动估计、运动补偿模块中,因此,运动估计、运动补偿模块的运算速度直接影响整个编码系统的实时实现。同时,由信息论的知识可知,通过预测,差值图像的信息熵低于原图像,可用较少的码字进行编码,实现压缩,所以运动估计和补偿算法的优劣对最终产生的码率和图像质量有直接影响。视频序列的运动是非常复杂的,最基本的运动是指摄像机固定,运动物体相对于背景移动,由于摄像机是固定的,这些背景相对于相邻帧序列而言是静止不变的,这些运动物体所表现出来的运动称之为局部运动然而在图像处理中,通常是通过摄像机获得原始的视频序列图像,很多情况下摄像机安装在运动平台上,为了更好地捕捉图像,摄像机本身也要在全空间范围内做扫描运动,如缩放、水平运动、竖直运动、旋转运动等,这样一来,固定的背景物体会在图像平面上显示出一种全局的二维运动,称之为全局运动。全局运动估计的目的就是要从视频序列中找出背景的运动规律。全局运动估计广泛应用于基于对象分割侧、图像拼接1 7 , 明、视频检索限埘、视频编码【d 4 1 等领域在基于运动的图像分割中,首先进行全局运动估计,得到背景的运动i 然后根据背景运动进行运动补偿,就可以得到前景物体的运动,根据运动的不同将前景和背景物体分开,从而完成比较理想的图像分割;在进行图像拼接时需要知道相邻帧的运动参数,进行全局运动估计就可以得到这些运动参数,根据运动参数可以第一章绪论伞局运动估计及其有视频编码中的应用将相邻帧连接上;在大多数视频序列中,摄像机的运动总是跟踪着视频中重要人物和事件的运动,因此可以认为全局运动信息在一定程度上反映了视频中的语义内容,这样就可以利用从视频中提取的全局运动信息进行检索,该技术可以在特定的应用领域,如体育类视频中起到较好的检索作用,提供其他视觉特征所无法实现的检索功能;全局运动估计可以用于实现全局运动补偿编码。在基于块匹配的运动估计和补偿中,对每一个宏块是单独做运动估计的,但是,在同一个视频帧图像中的宏块可能会经历相似的运动,即全局运动,因此使用全局运动补偿,使编码器传输小数量的运动参数来描述整个图像的缺省的全局运动,而不是每个宏块使用各自的运动矢量,这样能够改善压缩的效率,提高视频编码器的性能,此外全局运动估计用于计算摄像机运动的参数模型,这些参数模型不仅可以表示平移运动,还可以描述旋转、缩放等更复杂的运动,使用这些参数模型对视频的运动进行估计而得到的预测帧与当前帧之间的残差将明显减少,从而显著提高视频编码的压缩比,减少码流。41 2 视频编码简介1 2 1 视频编码的必要性和可能性。数字化了的视频信号的数据量是非常巨大的,一个未经压缩的高清晰度电视( h d ) 序列,格式为1 9 2 0 x 1 0 8 0 ,彩色,4 :4 :4 采样,每帧数据量为6 2 2 0 8 0 0 字节,每秒3 0 帧,则每秒的数据量就达到了1 4 9 g b i t s 。巨大的数据量给存储和传输都造成了巨大障碍。一张6 5 0 m 的c d r o m 只能存放1 0 4 帧图像,可存的节目时间仅为3 5秒,h d t v 信号必须在4 m h z 的信道( 该信道能够支持大约2 0 m b p s 的速率) 上播出,如果要在这些设备和现有的信道上存储和传输视频数据,必须进行压缩因此,视频压缩编码是十分必要的。数字视频压缩的基础是原始视频数据当中存在大量的冗余。原始视频数据中的冗余主要表现在以下几个方面【”j :( 1 ) 空间冗余:是指视频序列中每帧图像内部相邻像素之间存在的相关性。( 2 ) 时间冗余:是指视频图像序列中的不同帧之间存在的相关性。( 3 ) 视觉冗余:是指人眼不能感知或不敏感的那部分视频图像信息( 4 ) 信息熵冗余:也称编码冗余,如果图像中平均每个像素使用的比特数大于该图像的信息熵,则图像中存在冗余,这种冗余称为信息熵冗余。2全局运动估计及其在视频编码中的应用第一中绪论( 5 ) 结构冗余:是指图像中存在很强的纹理结构或自相似性。( 6 ) 知识冗余:是指有些图像中包含的与某些先验知识有关的信息。数字视频压缩的目的就是要通过去除数据中的这些冗余从而减少需要的比特数。1 2 2 视频压缩编码标准上个世纪八十年代以来,随着传真技术、电视会议,可视电话、高清晰度电视、图像检索、可视图文、多媒体及计算机网络等技术的兴起与发展,视频业务的数据量越来越大,这就对视频压缩编码提出了更高的要求,同时也促进了视频编码技术的发展。由于一系列国际标准的制订和专用数字处理芯片的推出,高质量的数字编码方法也正从理论研究走向实用化。n u t 与i s o i e c 是制定视频编码标准的两大组织【j 1 ,n u t 制定的标准包括h 2 6 1 、h 2 6 3 、h 2 6 4 ,主要应用于实时视频通信领域,如会议电视;m p e g 系列标准是由i s o i e c 制定的,主要应用于视频存储( 3 v d ) 、广播电,视、因特网或无线网上的流媒体等。两个组织也共同制定了一些标准,h 2 6 2 标准等同于m p e g - 2 的视频编码标准,而最新的h 2 6 4 标准则被纳入m p e g - 4 的第l o 部分此外,我国也自主制定了音,视频编码技术标准a v s t 旧,主要面向高清晰度电视、高“密度光存储媒体等应用。这些标准有的已经完成并在多媒体产业中得到了广泛应用,有的正在进一步完善中。、m p e g 标准最初针对c d r o m 上约1 2 m b p s 传输率进行视频压缩,后来发展到于1 9 9 0 年成为高质量音频和视频压缩的标准草案。它在许多商业领域得到了广泛应用,包括光盘存储媒体的播放,音频、视频通过不同通道广播,点对点交换数字音频,视频数据,高清晰度电视,网络多媒体,另外还有许多特殊商业和非商业上的应用。m p e g - 1 和m p e g - 2 主要用于高中比特率,m p e 0 1 应用最广泛的是v c d ,m p e g - 2主要用于高清晰度电视( h d t v ) 、数字视盘( d v d ) 和数字视频( d v b ) 广播。m p e g - 4则主要针对低比特率,特别是6 4 k b p s 下的音频视频压缩,在标准电话线上传输可视电话,该标准适合于计算机网络尤其是i n t e r n e t 上的多媒体表示,允许在灵活的终端上对敏感数据进行高效压缩,包括从非常低的比特率到中速比特率的各种选择来适应网络能力m p e g 7 用来为不同类型的多媒体信息描述定义一个标准,通过数据如静止图画,图形、三维模型,音频、视频来定位,或远程地用该数据描述的双向指针来定位。第一章绪论伞局运动估计及其曲视频编码中的应用与m p e g 标准不同,l t u t 的h 2 6 x 视频压缩标准主要应用于双向实时通信。h 2 6 1 是最早的窄带视频会议系统压缩算法,适用于i s d n 网络。h 2 6 3 在h 2 6 1 基础上做了许多改进使视频质量有了很大提高,最初适用于公用电话交换网络( p s t n )和无线网络,目前在所有应用中已基本上代替了h 2 6 1 。h 2 6 3 + 和h 2 6 3 + + 分别是h 2 6 3 的第二版和第三版,它们分别增加了许多新技术,目的在于扩大建议的应用范围、增强其抗误码的顽健性、提高重建图像的主观质量以及加强对编码比特率的控制2 0 0 3 年3 月,u t i s o 正式公布了h 2 6 4 视频压缩标准,由于其具有比以往标准更出色的性能,被人们称为新一代视频编码标准,它优异的压缩性能也将在数字电视广播、视频实时通信、网络视频流媒体传递以及多媒体短信等各个方面发挥重要作用数字电视、网络电视、移动电视、高清激光视盘等新应用正在兴起,它们将支撑起一个崭新而巨大的市场,而这些应用所依赖的编解码标准却正在被国外技术m p e g - 4 和h 2 6 4 所占领,面对这种情况,国家信息产业部科学技术司于2 0 0 2 年6月批准成立了a v s 工作组,制定了a v s 标准a v s 标准是信息技术先进音视频编码系列标准的简称,它是数字电视、网络电视及移动电视等音视频系统的基础性标准f 1 6 1 。a v s 标准以当前国际上最先进的m p e g - 4a v c h 2 6 4 框架为基础,强调自主知识产权,同时充分考虑了实现的复杂度。它是我国具备自主知识产权的第二代信源编码标准a v s 最大的应用价值是利用面向标清的数字电视传输系统能够直接提供高清业务、利用当前的光盘技术制造出新一代高清晰度激光视盘机,从而为我国数字音视频产业的跨越发展提供难得契机a v s 将在标准工作组的基础上,联合家电、i t 、广电、电信、音响等领域的芯片、软件、整机、媒体运营方面的强势企业,共同打造中国数字音视频产业的光辉未来。1 3 国内外研究现状全局运动估计被广泛应用的前提是对全局运动估计算法的研究,本文首先重点研究了全局运动估计算法,然后在此基础上研究了全局运动估计在视频编码中的应用一全局运动补偿编码。1 3 - 1 全局运动估计技术如何快速准确地估计出全局运动。关键在于估计图像中各像素点的运动矢量【1 7 i 4全局运动估计及其在视频编码中的应用第一章绪论最直接的想法就是对应于图像背景上的每一个像素,计算出它的运动场矢量。可以通过常用的块匹配算法或光流场技术进行运动场矢量的估计。但是逐像素的运动矢量运算将引入两个问题:( 1 ) 逐个估计图像中每个像素点的运动速度,计算量大;( 2 ) 无论采用块匹配算法或光流场技术估计单个像素点的运动矢量,都不能保证该像素一定是在“静止”的背景上,这样就有可能会出现一些异常的估计值,这些异常估计值对全局运动的正常估计将产生较为严重的影响。对于同一帧的数字图像而言,不同区域的全局运动矢量很可能不相等。例如,相对于摄像机的旋转运动,处于图像中心的像素点的运动矢量要比图像边缘的像素点运动矢量大然而,相对于某种摄像机运动模型而言,图像上各像素点的运动具有相同的规律,它们做的是共模运动。如果能找到这个共同的运动模型,就能够用它来方便地描述图像相对于摄像机的全局运动,显然这个模型能够很好地描述图像的平移、旋_转、缩放等多种运动。用于表征这个模型的参数就被定义为全局运动参数。假定求得了全局运动参数,那么图像上各个像素点的运动矢量都可以根据此参数求得这么一来,全局运动的估计问题就被归结为全局运动参数的估计如何计算全局运动参数?首先得选用一种适当的摄像机运动模型,如旋转平移的四参数模型、平行投影的六参数模型、透视投影的八参数模型等;其次估计选定模型的参数,如何估计选定模型的参数? 目前大部分全局运动估计方法都是基于密度估计的,一般采用迭代优化方法0 4 , 1 。2 4 1 这些方法可以分成两类:基于像素梯度的方法和基于运动矢量的方法,其中以基于像素梯度的方法最为成熟和适用,其计算结果也更为准确。文献【i ,1 ”玎采用了基于像素梯度的方法;文献 2 2 - 2 4 采用了基于运动矢量的方法。此外,一些新型的全局运动估计算法也在不断涌现,例如文献彤0 6 1 采用了多直线全局运动估计方法;文献口刀将进化规划算法引入到全局运动估计算法中。1 3 2 全局运动补偿编码全局运动补偿编码是一种基于模型的编码方法,基于模型的编码方法是下一代编码方法的发展方向,它不但可以提高编码效率,同时可以改善解码后图像的质量【瑚。全局运动估计在m p e ( 3 - 4 的s p r i t e 编码【1 9 】以及h 2 6 3 + 中提出的增强可选模式:参考图像重采样模式 2 9 1 中得到了应用,但全局运动补偿编码在现有的视频编码标准中一直第一章绪论全局运动估计及其在视频编码中的廊用没有得到应用,例如:h 2 6 3 标准【3 0 l 、最新的h 2 6 4 标准1 3 3 1 ,3 2 l 和a v s 标准1 3 3 1 等。因此研究全局运动补偿编码是很有意义的。近年来,这一课题吸引了越来越多的学者,其中以国外学者研究居多“4 t 3 7 l ,国内学者涉及得较2 8 , 3 8 1 。全局运动补偿编码方法主要分为两类:单全局运动模型法以及多全局运动模型法。单全局运动模型法对当前帧建立统一的全局运动模型,通过全局运动估计算法求解模型参数,根据模型参数对参考帧进行全局运动补偿形成新的参考帧,在原参考帧和新参考帧中选择最佳匹配的块进行编码,例如文献t 3 4 , 3 9 1 ;多全局运动模型法首先将当前帧分成一定大小的块,对每个块建立一个全局运动模型,通过全局运动估计算法求解每个块的模型参数,根据每个块的模型参数对参考图像进行全局运动补偿,形成多个新的参考帧,在原参考帧和多个新参考帧中选择最佳匹配的块进行编码,例如文献【4 0 4 1 1 多全局运动模型法虽然能更精确地描述全局运动,但是由于全局运动估计算法一般采用迭代优化方法,计算量大,而多个模型参数的计算将进一步增加计算量,因此不能适用于实时的编码中1 4 本文的主要研究内容及创新本文重点围绕数字视频运动模型分析、全局运动估计算法研究以及全局运动估计技术在视频编码中的应用开展研究,具体研究内容包括:( 1 ) 视频运动模型分析全局运动一般是由摄像机的运动引起的,局部运动是独立的运动物体相对于摄像机的运动。无论是由摄像机或者是物体运动所产生的运动,通常都可以由运动模型来描述,为了更好地研究全局运动,本文首先对数字视频的运动模型进行分析,推导出摄像机的运动模型。( 2 ) 全局运动估计算法研究。全局运动估计的核心问题是如何估计选定的摄像机运动模型的参数。本文针对目前全局运动估计中计算量大和噪声点多这两个难点,在分析全局运动估计的原理和现有的全局运动估计算法的基础上,提出了改进的全局运动估计算法,并给出了与现有算法的实验比较结果。( 3 ) 全局运动估计在视频编码中的应用本文在对传统的基于块的视频编码方法研究的基础上,重点研究了全局运动估计在视频编码中的应用,提出了基于全局运动补偿编码的视频编码框架,同时结合现有的视频编码标准,在v c 什平台上分别实现了基于全局运动补偿编码的h 2 6 3 编码器和基于全局运动补偿编码的a v s 编码器。6全局运动估计及其在视频编码中的应用第一章绪论1 5 论文安排第一章:主要介绍课题的研究任务和国内外研究动态等。第二章:对数字视频的运动模型进行分析,推导出用于描述摄像机运动的运动模型。第三章:分析全局运动估计的原理,讨论目前主要的全局运动估计算法,提出改进算法,并给出与现有算法的实验比较结果。第四章:在分析现有的视频编码体系结构基础上,提出了基于全局运动补偿编码的视频编码体系结构。第五章:分析由国际电信联盟制定的h 2 6 3 标准,并结合该标准,实现了基于全局运动补偿编码的h 2 6 3 编码器,并给出与现有编码器的性能比较结果。第六章:分析由我国数字音视频编解码技术标准工作组( 简称a v s 工作组) 制定的a v s 标准,并在该标准的基础上实现了基于全局运动补偿编码的a v s 编码器,并给出与现有编码器的性能比较结果。第七章:结论主要总结了本文的研究成果,并对进一步的工作进行了展望。+7第二章数字视频的运动模型分析伞局运动估计及具在视频编码中的府用第二章数字视频的运动模型分析要计算图像的全局运动参数,首先要找到正确表征全局运动的摄像机的共模运动模型由于z - 维的时变视频图像反映的是随时间变化的现实世界中的三维空域场景,因此有必要研究时变的三维空域场景以及它与投影到二维视频图像平面上形成的时交视频图像之间的映射关系本章首先讨论了表达三维空域场景及其中实体的结构和运动变化的数学模型,然后研究时交的三维空域场景和二维视频图像平面的几种投影模型:透视投影,正交投影( 平移投影) 模型,并重点分析了在正交投影下三维空域场景和它的二维投影之间映射关系的数学表示,最后建立摄像机的六参数模型本章是数字视频处理的建模基础2 1 观察空间中三维物体的运动模型数字视频表达了三维场景和运动物体在二维图像平面上的投影信息随时间的变化过程【4 2 l ,这种变化过程反映了摄像机与物体及场景之间的相对三维运动根据运动学原理,三维运动分为刚体运动和非刚体运动在刚体运动情况下,物体上一组三维点之间的相对距离关系不随时间变化,即运动物体的三维结构和形状可用一个不变形表面如:平面、分段平面或多项式曲面等来建模。如果整个观察空间中只有一个刚体,则可用一组运动和结构参数来建立描述模型。在相互独立运动的多刚体的情况下,则需要多组不同的参数来描述各个刚体的运动。在非刚体运动情况下,可用变形体模型来建模由于非刚体运动非常复杂,同时课题的研究时问比较有限,因此,本文仅对刚体运动做研究。2 1 1 刚体的三维运动模型刚体的三维运动模型用于描述刚体上各点在不同时刻之间的三维空间位置对应关系m 记x = 防,y ,z 】r ,= 防,y ,z r 分别表示刚体上一点在,和,时刻的坐标位置,由于刚体运动只涉及平移和旋转,所以其三维运动模型方程为:z = r x + t( 2 - 1 )其中r 表示3 x 3 的旋转矩阵,t = i 五,耳,疋】r 表示平移矢量。在直角坐标系中三维旋转可用相对于三个坐标轴x ,y ,z 的旋转角度以。研易来表示,相对于各个坐全旦堡垫堡芝墨茎垄塑丝塑坚! 塑窒旦墨三! 墼王塑塑圣垫壁型塑标轴做顺时针旋转的矩阵如下:r j00 c o s b陋,】= 0c o s 六一s i n o xl k ,】= 10【0s i n 以c o s o xjl s i n g将上面的式子代入( 2 - 1 ) 式并展开:日忸 茎 + r = 【r j i r ,i r : 喜 + 蔓s i n g c o s g0j k hs i n gc o s b j【0其中球。i r ,i r ;】= c o s o rc o s o zs i n 8 xs i n o rc o s 0 2 - - c o s # xs i n o zc o s 8 xs i n gc o s o z + s i n o xs i n 8 zc o s o rs i n o zs i n 8 xs i n gs i n 8 z + c , o s 8 x s 8 zc o s 8 xs i n o rs i n o z s i n 8 xc o s gi s i n 岛s i n 以c o s 岛c o s 以c o s b当口角很小的时候,c o s 8 * j ,s i n o * 0 ,上式可以化简成:刚三一色e x珊圈2 1 2 刚体的三维运动场( 2 - 2 )( 2 3 )由于运动可以采用位移和速度参数来描述,所以三维运动场又可以分为三维运动位移场和三维运动速度场。将( 2 3 ) 式进一步化简:日雌乏针瞄10 孵豳q 川匡:朝* 曼乏e + 匮,于是可得刚体上点x 的三维运动位移矢量d 如下:d ;慝1【d :j怔h 三珊圈( 2 呦刚体上各点的三维运动位移矢量的集合便构成了刚体的三维运动位移场。上式两9们爿警d-o包d 以第二章数字视频的运动模型分析拿局运动估计及其存视频编码中的摩用 蔓 * 三,乏弓, 茎 + 篷q 一乃 毫 = 速度矢量 囊 = 速度矢量的各个轴方向组成部分 圣 = 角速度f :r 。呻r 。即( 丘y ,z ,) 寸伍弘f ) ,其中,y z ) 为三维空间坐标,g ,力表示二维图像平面z】,l纯- x7 g ,襄陬f旺,zy ,z )( a )图2 - 1 透视投影模型示意图透视投影又称为中心投影,使用基于几何光学原理的理想小孔摄像机来反映图像的形成过程。所有从物体发出的光线均通过对应于透镜中心的投影中心。透视投影模型示意图如图2 1 ( a ) 所示,图像平面与三维空间中x 轴和】,轴所形成i n全局运动估计及其在视频编码中的麻用第二章数字视频的运动模型分析的平面是完全重合的。三维空间中一点似,l z ) 经过透镜中心向图像平面上进行投影,从而获得对应的投影点坐标为:g ,y ) ,图中的厂表示透镜中心到图像平面的距离,即摄像机的焦距。由相应的几何关系可得:x :卫( 2 8 )x 2 f - 一zt z 。劲- ,- = 芑为了运算方便,可以对上述模型进行简化,把图像平面沿z 轴平移到透镜中心的前面,仍然保持图像平面到透镜中心的距离为,从而得到简化的透视投影模型如图2 - 1 c o ) 所示,相应的几何关系可由下式来表达:z :墨( 2 1 0 )7) ,;娑( 2 - u ) 一2 2 2 正交投影模型正交投影又称为平行投影,假设所有从三维实体所发出的到图像平面的光线相互平行,摄像机到实体的距离并不影响正交投影中图像平面上的强度分布当实体与摄像机之间的距离远远超过实体上的点相对于实体自身的坐标系深度时,正交投影可以作为透视投影的很好的近似。正交投影模型的示意图如图2 - 2 所示。ly 。xz一r,似,y ,z )一巨图2 - 2 正交投影模型示意图图像平面与三维空自j 中x 轴和r 轴所形成的平面相互平行,并且这两个平面的原点之间的连线与z 轴重合由图示关系可知摄像机的焦距,对正交投影不产生任何影响。在直角坐标系中,其投影几何关系为:第二章数字视频的运动模型分析全局运动估计及其在税频编码中的府用x 2 爿( 2 1 2 )y = l ,( 2 - 1 3 )由上式可知无论物体距离摄像机有多远,物体总是产生相同的图像。由于芷交投影是一个线性关系式,所以在计算精度允许的范围内它可以简化计算。2 3 成像空间中= 维运动场模型三维运动可由物体上各点的三维位移矢量和三维速度矢量来描述,将其按照上面的透视投影模型或正交投影模型向图像平面进行投影,便可以得到相应的二维位移矢量和二维速度矢量。于是在图像平面上二维位移矢量的集合便形成y - - 维位移场,二维速度矢量的集合便形成了二维速度场。在对运动属性缺乏附加假设的情况下,仅仅用两帧图像来进行对应矢量和光流矢量( 速度矢量) 的计算会出现解的存在性问题、解的唯一性问题和解的连续性问题,所以运动估算需要附加有关的二维运动场结构的假设条件,根据假设条件的不同,可将其划分为参数模型和非参数模型两大类。非参数模型需要为每一个像素或像素区域求解一个运动矢量;而参数模型是对场景中的每一个物体求解一组运动参数,由这一组运动参数来表征这个物体的运动。上述两种模型都具有其各自的特点,适用于不同的应用场合。参数模型适用于刚体的运动描述,主要是描述曲面的三维运动( 位移和速度) 在图像平面上的透视或正交投影。一般来说三维曲面的表达式决定了带参数的二维运动场模型。非参数模型把均匀( 平滑度) 约束条件强加于二维运动场上,从而消除了=维运动估算中的孔径问题由于本文主要研究的是刚体的运动,所以下面就对成像空问中运动场的参数模型进行详细的论述2 3 1 三维刚体在成像空间中的位移场与速度场的参数模型由于正交投影最适合本文研究的视频图像中场景的情况,因此本文以正交投影为基础来讨论三维刚体在成像空间中的位移场与速度场。正交位移场是指三维位移矢量正交投影到图像平面上所形成的矢量场,根据前面的刚体三维运动模型( 2 6 ) 式和正交投影模型的( 2 - 1 2 ) 式、( 2 - 1 3 ) 式,可以推导出t 时刻到,时刻点g ,y ) 的正交位移矢量怛。,d , l 如t :全局运动估计及其存视频编码中的应用第一二帝数宁视频的运功模型分析t = ,一x = - - o z y 4 - b z + 乃( 2 一1 4 )d y = y - y = 易x 一以z 十乃( 2 - 1 5 )正交速度场可以根据前面的刚体运动的三维速度场( 2 7 ) 式和正交投影模型的( 2 1 2 ) 式、( 2 - 1 3 ) 式推导得出,也可以用上面的正交位移场模型的等式两端同时除以f ,并令f 的极限趋近于零得到:叱= 吨y 十巧r z + y k ( 2 1 6 ),= 刃2 x t g x z + y k ( 2 - 1 7 )上式中的以,o ) 是f 时刻点g ,y ) 的正交速度矢量。2 3 2 三维平面区域在成像空间中的位移场与速度场参数模型在二维运动场的参数模型分析中,平面是一个十分重要的特例,因为现实世界中各种物体的表面大多可以用许多平面区域来进行近似,从而引出了由平面块所构成的任意面的表达式。下面就针对三维平面推导其在正交投影条件下的二维位移场模型和“二维速度场模型。一般情况下三维平面可以用下面的一次方程来描述:z = a + b x + c y( 2 - i s )将平面方程( 2 1 8 ) 式代入( 2 1 4 ) 式、( 2 - i s ) 式化简,可得在正交投影条件下的三维平面的二维位移场模型为:吒= 工- - x = 6 巩工+ ( c b 一吃砂+ ( 口印+ )( 2 1 9 )j ,= y - y = 0 l 一6 以h c 以y + 仉一口以) ( 2 2 0 )由此可以看出:在芷交投影条件下的三维平面的二维位移场模型是由6 个参数:6 岛,( c b 一吃) 、q 唧+ 巧) 、( o z 一6 以) ,一c 以和纯一口以) 所决定的一个变换模型。下面对三维平面的二维速度场进行分析。将平面方程( 2 1 8 ) 式代a 1 目t j 体运动的三维速度场( 2 - 7 ) 式,利用正交投影模型( 2 一1 2 ) 式、( 2 1 3 ) 式,可以推导出如下关系式:v i = b t 矿r x + ( c w r 一) y + ( 口嘶+ j( 2 2 1 )o = g 一b t 矿x ) x - c t u x y + 舻i 一口刃- ) ( 2 - 2 2 )由此可以看出;在正交投影条件下的三维平面的二维速度场模型也是由6 个参数:6 研,( c w r 一留。) 、【口玎,+ ) 、瓴一6 ) ,一c 巧。和魄一口听) 所决定的一个变换模型。第二章数宁视额的运动模型分析全局运动估计及其在视频编码中的戍用( 2 - 2 1 ) 式和( 2 2 2 ) 式可以简单表示成:匕= a l x + 啦y + b lb2 a j i + f t i 4 y + b z其中:( 2 - 2 3 )( 2 - 2 4 )a 1 2 b m ra 2 2 c 毋y 一癣zb | = o 口r + y ka l = 钌z b r a xa = 一c 岔xb z2 y h n 巧y至此,本章已经推导出了运动物体的二维运动参数模型,物体的运动可能是由于自身运动引起的,也可能是由于摄像机的运动引起的,因此推导出的二维位移场和速度场参数模型适用于摄像机的运动2 4 本章小结本章对观察空间中三维物体的运动模型与运动场,摄像机的二维成像模型以及成像空间中的运动场模型进行了详细的论述,并建立了正交投影情况下的摄像机二维成像参数模型。本章是后续全局运动估计算法的理论基础。全局运动估计及其在视频编码中的应用第三章伞局运动估计的原理和算法研究第三章全局运动估计的原理和算法研究在视频图像序列中,帧与帧之间总是存在差别的,引起这种帧问差的原因很多,如各种噪声的干扰摄像机位置或参数的变化以及场景中运动目标的独立运动等,在数字图像处理中,把这种帧阔变化都看作是运动根据影响范围和产生原因的不同,帧问运动可以分为由视频采集系统镜头平移,旋转缩放引起的整帧内容一致变化的全局运动和由自主实体独立运动引起的只有部分图像变化的局部运动两种形式全局运动估计就是对图像中整帧内容一致变化的全局运动进行运动矢量参数估算本章首先阐述全局运动估计的原理,然后在对现有的全局运动估计算法分析的基础上,提出一种改进的全局运动估计算法,最后给出与现有算法的实验比较结果3 1 全局运动估计的原理假设图像,g ,j ,) 和,g ,) ,) 是相关联的两幅图像,即图像j ,g ,y ) 可以经过运动变:换到图像l k y ) 由第二章可以知道,视频运动可以用参数模型来表示,假设“,只)和似,) 分别为图像,和l 中相对应的位置,这两幅图像之间的运动可以表示为:爿= 力扫,而,门)( 3 1 )一= 兀仂,y j( 3 - 2 )其o e p 是运动模型的参数集,正和正是定义的函数,即参数模型表达式,f 为对应位置的下标通过最小化两幅图像的强度残差来求得参数集p ,用公式表达如下;p = a r g r a i n “传,只) 一l g :,) ) 2。v,i1(3-3)其中:l b ,只) 和l 似,) 分别代表图像和l 中对应位置的强度3 2 全局运动估计算法研究3 2 1 基于像素梯度的全局运动估计算法基本思想假设一个点0 ,j ,) 经过,的时间运动到了g + 缸,y + , y ) f i q 位置,可以知道,沿着运动轨迹,物体的亮度保持不变,因此:i b + 缸,y + y 。t + f ) = j b ,y ,n由光流方程【4 3 j( 3 4 )第兰章全局运动估计的原理和算法研究全局运动估计及其在视频编码中的府用其中:,g ,y ,f ) 表示物体在g ,y ) 位置的亮度值。将g + 缸,) ,+ 缈,t + 缸) 在,g ,y ,f ) 处用泰勒展开式展开:,g + a r , y + a y ,+ f ) = i ( x ,y ,f ) + l 材+ j ,v + + 高次项( 3 5 )其中:i x = 面d l = 石d l = 瓦d l ”= 鲁v = 等0 ,力代表瞬时的像素运动速度矢量,也被称为光流矢量;l 、分别代表x 方向和y 方向的梯度,l 代表时间偏导由于二维运动矢量估计问题具有的“不适定”特性,要进行运动估计还需要根据二维运动场模型结构附加约束条件。由第二章中的分析可知,二维运动场模型根据其对应的三维运动场数学模型的不同而不同,一个由三维刚性物体运动产生的运动场,在正交投影下生成的二维运动场,可以用仿射运动模型描述;也可以用非线性透视运动模型描述。此外,还有更复杂的二次曲面映射模型等。在这些模型中,由于正交投影的仿射模型是较简单的线性模型,采用仿射模型可以减少图像背景各像素点运动速度场的估计计算量,同时,仿射模型可以描述平移、旋转和缩放等运动,最适合本文研究的视频图像中场景的情况,因此在后面的研究中都采用式( 2 - 2 3 ) 和式( 2 2 4 ) 的二维投影速度模型来进行二维运动矢量估计假设运动为小运动,高次项可以忽略。将第二章推导的正交投影的6 参数仿射运动模型代入式( 3 5 ) :l l x n l + l l - y 0 2 + l l * b t + lr x 口3 + 1 ,y 口。ly b 2 = 一i |g 书由于只有一个方程,但有六个未知数,无法求解,考虑到对于图像中的每一个像素点都满足( 3 6 ) 式,因此对每一个像素点列出( 3 - 6 ) 式,假设有i 个像素点,于是得到:f 口= b( 3 7 )其中:f =| l | x li i l y ll i ll x ll ,i y lly il 吐x ki 畦y ti 吐i x kl y kl 江1 6( 3 8 )全局运动估计及其在视频编码中的府用第三幸全局运动估计的原理和算法研究a =b =至此,全局运动的估计问题已经归结为全局运动参数的估计。如何求解全局运动参数? 由以上的推导,得到了如下的表达式:f a = bk 6 6 jk ,对于一幅图像,k 往往大于6 ,因此所列出的方程式将远远大于未知数的个数,应用最小二乘原理来解决这个问题,也就是最小化公式:护a - b h 3( 3 - l o )迸一步化简:p 7 f ) 4 = ( ,7 b )6 66 1 6 1简单表示成:a a = b其中:a = f 7 fb = f 7 b由于矩阵f ,b 可以根据已知条件求得,得到全局运动参数集a 0 - 1 2 )因此矩阵a 、b 可以求出,最终就可以在上面的公式推导过程中。对于公式:,b + 缸,y
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 人名-布局B-精简
- 2026年汽车行业知识产权保护现状与维权案例
- 公司财务年终述职报告(范文3篇)
- 个人银行员工述职报告(17篇)
- 医院感染知识考试试题及答案
- 林业系统事业单位招聘考试《林业知识》真题库及答案
- 施工进度管理方案
- 林业基础知识试题(附答案)
- 财务人员思想报告(3篇)
- 长期合作合同范本(2026版)
- 2026下半年四川省达州市事业单位招聘考试笔试易考易错模拟试题(共500题)试卷后附参考答案
- 2026年宿州萧县人民医院公开招聘卫生专业技术人员61名(编外)考试参考题库及答案详解
- 2026年华侨、港澳、台联考高考数学试卷(含解析)
- 2025-2026学年人教版PEP五年级英语下册全册单词表(带音标)
- 2025江苏无锡市江阴市人才发展集团有限公司招聘2人笔试历年参考题库附带答案详解
- 2026-2030中国全球板球和曲棍球行业市场发展趋势与前景展望战略分析研究报告
- 儿童肾病综合征诊疗专家共识(2026版)
- LY/T 1188-2025便携式链锯导板
- 2026年医疗机构放射工作人员放射防护培训考试试题(附答案)
- 儿外科工作制度
- 餐厅社交媒体运营方案
评论
0/150
提交评论