(通信与信息系统专业论文)基于视觉几何的多视点视频编码研究.pdf_第1页
(通信与信息系统专业论文)基于视觉几何的多视点视频编码研究.pdf_第2页
(通信与信息系统专业论文)基于视觉几何的多视点视频编码研究.pdf_第3页
(通信与信息系统专业论文)基于视觉几何的多视点视频编码研究.pdf_第4页
(通信与信息系统专业论文)基于视觉几何的多视点视频编码研究.pdf_第5页
已阅读5页,还剩65页未读 继续免费阅读

(通信与信息系统专业论文)基于视觉几何的多视点视频编码研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 摘要 h 2 6 4 a v c 是目前最新、最有前途的视频压缩标准。它在追求编码效率的同 时也提供了非常好的视频质量,是非常高效的视频压缩编码方法。多视点视频是 由摄像机阵列从不同角度拍摄同一场景得到的一组视频信号,包含了丰富的3 d 场景信息,它满足了人们对视频场景自然和真实再现的需求,越来越受到学术和 工业界的重视,成为近年来视频领域的研究热点之一,h 2 6 4 标准也针对其提出 了专门的多视点视频编码的增修案。多视点视频的数据量随着摄像机的数目增加 而线性增加,各个视点间存在着巨大的视点间冗余。多视点视频编码技术主要致 力于如何提高多视点视频的压缩编码效率,如何消除视点间冗余就成了提高多视 点视频压缩效率的关键。目前的方法都是使用视差矢量来消除视点间冗余,它是 两视点间图像对应编码块的位置偏差。但是由于视差矢量范围通常比运动矢量更 大,视差矢量估计的搜索过程需要大量的时间。 对极几何是计算机视觉中描述来自同一景物的两幅非定标图像进行分析的基 本工具。多视点视频中任意两视点的视频图像均服从对极几何的关系,这个关系 就可以用来限制视差搜索的范围,达到提高编码效率的效果。 本文针对多视点视频的视点间冗余,利用多视点视频各个视点间的对极几何 约束关系,提出了一种基于对极线校正的视差估计快速搜索算法。首先分析了视 点间图像基础矩阵的算法,然后提出了一种针对多视点视频的图像校正算法,并 建立视点间对应的对极线校正索引表。将其应用到视差估计中来缩小两视点间的 视差搜索范围,将原有的视差搜索从二维降到了一维,大大提高了编码效率。本 文方法在t 的m v c 编码测试平台j m v c 上实现,数据结果表明,本文提出方 法在仅提高视差估计的搜索时间的前提下,将编码时间平均提高了3 0 。另外该 方法不需在编码码流中加入任何附加信息。 关键词:h 2 6 4 a v c 多视点视频编码基础矩阵视觉几何对极线校正 a b s t r a c t a b s t r a c t h 2 6 4 a v ci st h el a t e s ta n dm o s tp r o m i s i n gv i d e oc o d i n gs t a n d a r d i ti sav e r y e f f i c i e n tv i d e oc o m p r e s s i o nc o d i n gm e t h o dw h i c hp u r s u i t so fc o d i n ge f f i c i e n c ya n d o f f e r sav e r yg o o dv i d e oq u a l i t ya tt h es a m et i m e m u l t i v i e wv i d e oc a p t u r e db y s y n c h r o n i z e dc a m e r a sf r o md i f f e r e n tv i e w p o i n t s i tc o m p r i s e sr i c h3 一di n f o r m a t i o n a n dm e e t sp e o p l e sn e e d so fa d d e dr e a l i s ma n dn a t u r a l l yr e p r o d u c t i o no fv i d e os c e n e s oi ta t t r a c t sm o r ea n dm o r ea t t e n t i o n si na c a d e m i ca n di n d u s t r i a lc i r c l e ,a n db e c a m e t h eh o t s p o to ft h ev i d e oa r e a t h em a j o ra d d i t i o nt oh 2 6 4 a v cc o n t a i n i n gt h e a m e n d m e n tf o rm u l t i v i e wv i d e oc o d i n g ( m v c ) e x t e n s i o n , i n c l u d i n gt h em u l t i - v i e w h i g hp r o f i l eh a sb e e np r o p o s e db y ti nm a r c h2 0 0 9 h o w e v e r , m u l t i - v i e wv i d e o r e s u l t si nat r e m e n d o u sa m o u n to fd a t ad e p e n d i n go nt h en u m b e ro fc a m e r a sa n dt h e r e a r eal a r g en u m b e ro fi n t e r - v i e w p o i n tr e d u n d a n c yb e t w e e nd i f f e r e n tv i e w p o i n t s m u l t i - v i e wv i d e oc o d i n gf o c u s e do nc o m p r e s s i o nf o re f f i c i e n ts t o r a g ea n dt r a n s m i s s i o n o fm u l t i v i e wv i d e od a t aa n dh o wt oe l i m i n a t et h ei n t e r - v i e w p o i n tr e d u n d a n c yb e c a m e t h ek e yt oi m p r o v et h ee f f i c i e n c yo f m u l t i v i e wv i d e oc o d i n g e p i p o l a rg e o m e t r y r e f e r st ot h eg e o m e t r yo fc o m p u t e rv i s i o n w h e nt w oc a m e r a s v i e wa3 ds c e n ef r o mt w od i s t i n c tp o s i t i o n s ,i td e s c r i b e san u m b e ro fg e o m e t r i c r e l a t i o n sb e t w e e nt h e3 dp o i n t sa n dt h e i rp r o j e c t i o n so n t ot h e2 di m a g e st h a tl e a dt o c o n s t r a i n t sb e t w e e nt h ei m a g ep o i n t s a n yt w oi m a g e so fv i e w p o i n t so fm u l t i v i e w v i d e oa r es u b j e c tt ot h ee p i p o l a rg e o m e t r yr e l a t i o n s h i p t oe f f i c i e n t l ye n c o d ed a t a - i n t e n s i v em u l t i - v i e wi m a g i n gc o n t e n t ,af a s td i s p a r i t y e s t i m a t i o ns e a r c hm e t h o di sp r o p o s e di nt h i sp a p e rb a s e do nt h er e c t i f i e d 印i p o l a rl i n e s f i r s t l y , as e to fm a t c h i n gp o i n t si so b t a i n e db yad o gd e t e c t i o na l g o r i t h ma n d m a t c h i n go fd a i s yd e s c r i p t o r t h e nar o b u s ta l g o r i t h mi su s e dt oe s t i m a t et h e f u n d a m e n t a lm a t r i x a n das p e c i f i ca l g o r i t h mf o ri m a g er e c t i f i c a t i o ni sp r o p o s e di nt h i s p a p e rb a s e do nt h er e l a t i o n s h i po ft h ei m a g e so fd i f f e r e n tv i e w p o i n t so fm u l t i v i e w v i d e o ar e c t i f y - t a b l ew h i c hc o n t a i n si n f o r m a t i o no fr e l a t i o n s h i pb e t w e e nt h eo r i g i n a l i m a g ea n dt h er e c t i f i e di m a g ei sc o m p u t e da n du s e di nt h ed i s p a r i t ye s t i m a t i o n s e a r c h i n gt oc o n f i n et h es e a r c hr a n g ef r o m2 - dt o1 一d t h i sa l g o r i t h mc a l lr e c o n s t r u c t i m a g e s 、析廿ls i m i l a rq u a l i t yc o m p a r e d 谢t 1 1t h ef u l ls e a r c ha n dt h et zf a s ts e a r c h m e t h o d si nj m v c ( j o i n tm u l t i v i e wv i d e oc o d i n g ) ,b u tt h et o t a le n c o d i n gt i m ei s r e d u c e db y3 0 a v e r a g e l y 基于视觉几何的多视点视频编码研究 k e y w o r d s :h 2 6 4 a v c m u l t i - v i e wv i d e oc o d i n gf u n d a m e n t a lm a t r i x e p i p o l a rr e c t i f i c a t i o n 西安电子科技大学 学位论文独创性( 或创新性) 声明 秉承学校严谨的学风和优良的科学道德,本人声明所呈交的论文是我个人在 导师指导下进行的研究工作及取得的研究成果。尽我所知,除了文中特别加以标 注和致谢中所罗列的内容以外,论文中不包含其他人已经发表或撰写过的研究成 果;也不包含为获得西安电子科技大学或其它教育机构的学位或证书而使用过的 材料。与我一同工作的同志对本研究所做的任何贡献均已在论文中做了明确的说 明并表示了谢意。 申请学位论文与资料若有不实之处,本人承担一切的法律责任。 本人签名:爿堑趁日期型! :厶醴 西安电子科技大学 关于论文使用授权的说明 本人完全了解西安电子科技大学有关保留和使用学位论文的规定,即:研究 生在校攻读学位期间论文工作的知识产权单位属西安电子科技大学。学校有权保 留送交论文的复印件,允许查阅和借阅论文;学校可以公布论文的全部或部分内 容,可以允许采用影印、缩印或其它复制手段保存论文。同时本人保证,毕业后 结合学位论文研究课题再撰写的文章一律署名单位为西安电子科技大学。 ( 保密的论文在解密后遵守此规定) 本人签名: 导师签名:日期型上芝,幻 第一章绪论 第一章绪论 1 1 引言 当今社会已经进入了数字信息时代,数字信息化几乎涉及到世界的每个角落, 渗透到并极大地改变了人们的工作和生活的方式。随着社会的进步,人们对信息 的需求也越来越丰富,这也推动了信息技术的不断发展。人们希望可以随时随地、 方便快捷地通过语音、数据、图像与视频等多种方式进行通信。而人类获得的外 界信息有8 0 以上是通过视觉系统得到的,视觉信息能给人们直观生动的形象, 因此图像视频受到了人们的广泛关注。在过去的时间里,视频技术得到了飞速的 发展,使得可视电话、视频会议、高清晰度电视( 瑚) t v ) 、视频点播( v o d ) 以 及视频广播等应用成为现实并且得到普及【1 1 。 由于视频信息庞大的数据量给视频的传输带来极大的不便,视频编码技术应 运而生。自1 9 4 8 年图像压缩编码从电视信号数字化提出以来,短短几十年间,视 频编解码技术迅速发展,至今已有多个国际视频编解码标准制定并产业化应用。 在视频技术领域中,主要的发展趋势是追求对自然景物更加真实和清晰的表征。 而传统的二维平面的视频在表现场景深度信息方面的局限性已经不能满足人们的 需求,能够提供3 d 视觉的立体多视点视频技术越来越受到学术界和工业界的重 视,并且已经成为当前视频研究的热点之一。多视点视频系统增加了图像中景物 的深度信息,在自然场景的表征上个具有真实感,具有广泛的应用场景。例如3 d 电视、自由视点电视、远程医疗及虚拟现实等。多视点视频会带来视频数据的急 剧增加,使得视频的储存和传输变得十分困难,必须对其进行高效的压缩。多视 点视频的编码与传输是多视点视频发展的关键技术,也是近几年的研究热点。 1 2 图像视频编码的发展 图像编码是从2 0 世纪4 0 年代末开始进行系统研究的,至今已有6 0 年的历史, 不仅在理论研究上取得了巨大进步,而且在实际中也获得了广泛应用。近十多年 来,视频编解码技术迅速发展,并且日臻成熟,其标志是多个国际视频编解码标 准的制定及其产业化应用1 2 d 引。 1 9 8 4 年c c i t t 第1 5 研究组发布了数字基群电视会议编码标准h 1 2 0 建议。 1 9 8 8 年c c i t t 通过了“p 6 4 k b p s ( p - - 1 3 0 ) 视像编码标准h 2 6 1 建议,被称 为视频压缩编码的一个里程碑。从此,国际电信联盟( i t ut e l e c o m m u n i c a t i o n 基于视觉几何的多视点视频编码研究 s t a n d a r d i z a t i o ns e c t o r ,i t u t ) 、国际标准化组织( i n t e r n a t i o n a lo r g a n i z a t i o nf o r s t a n d a r d i z a t i o n ,i s o ) 等公布的基于波形的一系列视频编码标准的编码方法都是 基于h 2 6 1 中的混合编码方法。 19 8 6 年,i s o 和c c i t t 成立了联合图像专家组( j p e g ,j o i n tp h o t o g r a p h i c e x p e r t sg r o u p ) ,研究连续色调静止图像压缩算法国际标准,1 9 9 2 年7 月通过了 j p e g 标准。 1 9 8 8 年i s o i e c 信息技术联合委员会成立了活动图像专家组( m p e g ,m o v i n g p i c t u r ee x p e r tg n o u p ) 。1 9 9 1 年公布了m p e g 1 视频编码标准,m p e g 1 分为图 像编码、声音编码和系统( 同步和复用) 3 个部分,主要用于在各种数字存储介 质上存储同步和彩色运动视频信号。m p e g - 1 标准采用了运动估计运动补偿、 变换编码等技术,并规定了编码位流的表示语法和具体解码方法。m p e g - 1 标准 是v c d 工业标准的核心,作为m p e g 制定的第一个标准,其在多媒体存储领域 获得了巨大成功,极大的推动了以v c d 为代表的多媒体业务的发展。 1 9 9 4 年1 1 月,又公布了m p e g - 2 标准,用于数字视频广播( d v b ) 、家用 d v d 的视频压缩及高清晰度电视( h d ,) 。其设计目标是高级工业标准的图象 质量以及更高的传输率。其所能提供的传输率在3 1 0 m b p s 之间。m p e g - 2 在设计 时的巧妙处理,使得大多数m p e g - 2 解码器也可播放m p e g 1 格式的数据,如 v c d 等。由于m p e g 2 的出色性能表现,已能适用于h d t v ,使得原打算为h d t v 设计的m p e g 3 ,还没出世就被抛弃了。 1 9 9 5 年,i t u t 推出h 2 6 3 标准,用于低于6 4k b p s 的低码率视频传输,如 p s t n 信道中可视会议、多媒体通信等。它以h 2 6 1 为基础,同时吸收了m p e g 等其他一些国际标准中有效合理的部分并做出改进,如半像素精度的运动估计、 不受限运动矢量、高级预测模式等,使其性能优于h 2 6 1 。1 9 8 4 年和2 0 0 0 年又分 别公布了h 2 6 3 + 、h 2 6 3 + + 等标准,是h 2 6 3 标准的扩充并与之兼容。 1 9 9 9 年1 2 月份,i s o i e c 通过了“视听对象的编码标准,_ 心但e g 4 ,m p e g - 4 与m p e g 1 和m p e g 2 有很大的不同。m p e g - 4 不只是具体压缩算法,它是针对 数字电视、交互式绘图应用( 影音合成内容) 、交互式多媒体等整合压缩技术的需 求而制定的国际标准。m p e g - 4 标准将众多的多媒体应用集成于一个完整的框架 内,旨在为多媒体通信及应用环境提供标准的算法及工具,从而建立起一种能被 多媒体传输、存储、检索等应用领域普遍采用的统一数据格式。 2 0 0 3 年3 月,由i t u t 和i s o i e c 共同组成的联合视频小组( j o i n t v i d e ot e a m , n 完成了新的视频编码标准h 2 6 4 a v c 的制定,h 2 6 4 仍是基于经典混合编码 算法的基本结构,在变换编码、熵编码和运动估计等方面采用了一系列先进技术、 新研究成果,该标准不仅显著提高了压缩比,而且具有良好的网络亲和性,加强 了对m 网、移动网的误码和丢包的处理,可获得比以往各种编码标准更为优越的 第一章绪论3 性能。 继h 2 6 4 a v c 之后,t 又相继公布了h 2 6 4 a v c 的四个增修案 ( a m e n d m e n t ) ,分别为扩展高保真压缩( f i d e l i t yr a n g ee x t e n s i o n s ,f r e x t ) 1 1 0 、 支持4 :4 :4 颜色格式档次( h i g h4 :4 :4p r o f i l e ) n j 和- 1 分级视频编码( s c a l a b l ev i d e o c o d i n g ,s v c ) t 1 2 1 ,而第四个增修案就是多视点视频编码( m u l t i v i e w v i d e oc o d i n g , m v c ) 。 1 3 1 多视点视频 1 3 多视点视频及其应用 多视点视频【1 3 】【1 4 】是由排成阵列的多个摄像机从不同角度拍摄同一场景得到 的一组视频信号,与单视点视频相比,多视点视频增加了场景的深度信息,能够 更加生动地再现现实场景,给人以身临其境的感觉。在显示的时候,可以根据观 看者所处的位置显示相应角度的图像,当观看者的头部移动是,看到的内容也会 出现相应的变化,从而得到了“运动视差和“环视 的效果。由于人眼对场景 画面变化的辨别能力非常强,为了得到自然而又平滑的运动视差效果,双眼距离 内需要超过1 0 幅的画面,这样,就需要非常稠密的摄像机阵列来或得多视点视频 序列。但是,这样的系统太过复杂也难以实现,所以实际应用中都是使用较稀疏 的摄像机阵列来拍摄,然后利用视差信息和相邻两个相机的视频来合成中间视点 的图像。目前采集多视点视频的摄像机阵列一般采用如图1 1 所示的这两种配置。 ( a ) 平行摄像机阵列 ( b ) 汇聚摄像机阵列 图1 1 多视点视频摄像机配置 基于视觉几何的多视点视频编码研究 1 3 2 多视点视频的应用 多视点视频可阻广泛应用于自由视点视柳自由视点电视、3 d 视频3 d 电视、 交互式会议电视、3 d 远程通信、远程医学诊疗、虚拟现实以及视频监视系统等多 种正在兴起的多媒体业务。欧洲的d i s t i m a 项目组指出:在未来的1 0 一1 5 年,目 前在网络、通信系统以及电视系统中使用的传统图像将被淘汰,作为新的媒体的 数据,立体视频图像在以上方面有很大的应用前景。 1 ” 本节介绍多视点视频的两个重要应用【l “,分别是自由视点视频,自由视点电视 ( f r e ev i e w p o i n tv i d e o f r e ev i e w p o i n tt v ,f 、w t v ) 和3 d 视频门d 电视 ( 3 d v j d e o 3 d t v ,3 d v 胆d t v ) 。 1自由视点视频自由视点电视( f v v f t v ) 图12 自由视点电视方案 在自由视点电视应用中,用户可以在摄像机阵列的拍摄范围内自由改变观看 电视的角度。所以它的主要特点是可交互性,例如,在体育比赛中,有多个摄像 机从不同角度对比赛场景进行同步拍摄,使用计算机对采集到的多视点视频信号 进行合成,可供用户在一定范围内从任意一个角度观看比赛。并可以根据自己的 喜好随时改变观看的视点。日本n 兀公司c y t l e rs p a c e 实验室提出了一种自由视 点电视的解决方案mj 。如图12 所示,自由视点电视系统的主要模块有:多视点 视频采集、视频预处理、多视点视频编码、码流传输、多视点视频解码和视图合 成。摄像机阵列果集到的多视点视频经过视频预处理模块后送入m v c 编码器进 第一章绪论 行编码。解码器恢复出多视点视频信号,根据用户所选择的视点进行视点合成, 最后将合成的信号送到播放设备进行显示。视频预处理和视点合成是该系统中的 两个重要模块。预处理的作用主要是完成视点之间的补偿处理。通过补偿处理不 仅能够进一步提高视点间的相关性,提高m v c 的编码效率,而且可以使视点合 成模块中生成的虚拟视点更加接近自然场景。在自由视点电视系统中,用户只需 要部分的视点图像来合成当前虚拟视点的图像,因此,解码端只需要解码部分视 点图像,这就需要多视点视频码流具有一定的“部分视点解码的功能。视点合 成模块则是从解码端得到视频数据和摄像机的参数信息,根据用户选择观看的位 置,通过该位置附近的两个实际拍摄视点的视频信号合成出用户观看的虚拟视点。 如果用户选择观看的是实际摄像机拍摄的位置,则不需要经过视点合成。 2 3 d 视频3 d 电视( 3 d v 3 d t v ) 3 d 电视主要是指提供具有强烈立体感和深度感的立体多视点视频业务,可以 认为是目前已有的立体电影的扩展。在立体电影中,观众看到的是同样的立体画 面,而在3 d 电视中,不同的位置的观看者看到的画面内容是不一样的,每个观 众看到的都是对应于其自身位置的立体画面。3 d 电视的主要特征就是具有强烈的 视觉立体感,能够为观看者提供3 d 的场景体验和感受,使其仿佛置身于真实场 景之中,具有逼真的效果。3 d t v 主要应用于广播业务,这种应用环境一般不要 求支持交互性。 i 视点1l i 视点2i多视点视频 编码器 ( m v c e n c o d e r ) 圆 n 路视点视频 多视点视频 解码器 ( m 、c d e c o d e r ) 传统2 d 终端 图1 33 d t v 系统框图 图1 3 给出一个3 d 电视系统的基本方案。使用m v c 编码器对多视点视频信 号进行编码,将码流以广播方式发送。根据用户显示需求的不同,解码端可以选 择解码一个或多个视点送至显示终端。该系统可向下兼容,可同时支持多种显示 终端。对于传统的2 d 显示终端,接收到一个视点的视频数据后可以直接进行显 示。而对于立体视频终端,需要获得两个视点的视频数据用于立体显示。多视点 视频终端则需要获得多个视点的视频数据用于3 d 视频显示。 零一 6基于视觉几何的多视点视频编码研究 1 4 多视点视频编码 1 4 1 多视点视频编码( m v c ) 从前面两个多视点视频的典型应用系统可以看出,系统的核心模块就是多视 点的编码、储存传输。多视点视频的数据量随着摄像机的数目增加而线性增加, 巨大的数据量已经成为制约其广泛应用的瓶颈。因此,多视点视频编码技术是未 来视频通信领域中的一项关键技术,主要致力于如何对多视点视频进行高效地压 缩编码。图1 4 是一个多视点视频编码系统的框图 1 8 1 ,由摄像机阵列拍摄的n 路 视点视频并行输入到m v c 编码器,经过编码后生成一个码流进行传输或存储, 解码端根据接收到的码流恢复出多视点视频,并且可以根据用户的不同需求支持 只恢复一个或几个视点的视频信号。 生呵j p 优点蛹缒m 玄练,l n ,r 、肌y o i 视点1 il 视点ll l 视点2l多视点视频 。槲 多视点视频 扒 r 、 i 视点2 l 、编码器 解码器 l , , ( m v c( 删c ; e n c o d e r )d e c o d e r ) i 视点nli 视点n tl n 路原始视点n 路恢复视点 图1 4 多视点视频编码系统框图 多视点视频编码技术主要致力于如何利用视点间相关性和视点内部的相关性 ( 时间相关性和空间相关性) 提高多视点视频的压缩效率。国际视频标准化组织 将现阶段的m v c 定位于h 2 6 4 a v c 的重要补充和扩展,所以,本论文的研究内 容是基于h 2 6 4 a v c 的m v c 编码框架开展的。 1 4 2m v c 的标准化进程 m p e g 早在2 0 0 1 年就充分认识到3 d 音频和3 d 视频( 3 da u d i oa n d v i d e o ,3 d a v ) 的重要性及其广阔的应用前景,于2 0 0 1 年1 2 月第5 8 次m p e g 会议 上成立3 d a v 特别小组( 3 d a u d i ov i s u a la dh o eg r o u p ) ,对3 d a v 进行需求分析、 典型应用场景定义等研究。 在2 0 0 5 年1 月第7 1 次m p e g 会议上,3 d a v 特别小组正式开始接收多视点 视频编码的相关提案,标志着m v c 标准化制订工作的正式开始。多视点视频编 码的标准化工作主要有两个方面,一是在h 2 6 4 a v c 的框架下定义一些扩展的语 第一章绪论 法语义,用于多个视点的联合编码;二是研究一些新的技术,用来提高多视点视 频的编码效率。截止到第7 5 次m p e g 会议( 2 0 0 6 年1 月) 为止,国际上知名的i t 行业公司、研究机构和大学,例如微软、摩托罗拉、t h o m s o n 、h h i 、n t t 、k d d i 、 三菱、三星、l g 、s e j o n g 大学和清华大学等都参与到了m v c 的标准制订工作中, 积极提交技术提案。会议针对m v c 建立了五个核心实验( c o r ee x p e r i m e n t ,c e ) , 分别为预测结构( p r e d i c t i o ns t r u c t u r e s ) 、亮度补偿( i l l u m i n a t i o nc o m p e n s a t i o n ) 、视图 合成预澳l j ( v i e wi n t e r p o l a t i o np r e d i c t i o n ) 、视差矢量估计( d i s p a r i t yv e c t o rp r e d i c t i o n ) 和非对称宏块划分( a s y m m e t r i cm bp a r t i t i o n i n g ) 。考虑现有的m v c 是定位于 h 2 6 4 a v c 的扩展,第7 5 次m p e g 会议还做出了一个重要决定,m v c 将作为 h 2 6 4 a v c 的第四个增修案,其标准化限制在h 2 6 4 a v c 的编码框架内。 由于h 2 6 4 a v c 的标准化工作一直由t 负责,因此,在2 0 0 6 年7 月的第 7 7 次m p e g 会议上,m v c 的标准化工作正式移交给t ,这标志着m v c 的标 准化工作进入实质性阶段。视频标准并不明确规定编码器如何实现,而是规定一 个已编码视频比特流的语法语义和该比特流的解码方法。另外,第7 7 次m p e g 会议上正式发布了m v c 、s v c 的软件参考模型j m v m ( j o i n tm u l t i v i e wv i d e o m o d e l ,j m v m ) n 9 1 ,并将该模型作为后续技术提案的公共测试平台来衡量各技术 提案的编码增益。在j m v m 经过数次版本升级后,2 0 0 8 年5 月,t 发布了新 的m v c 的公共测试平台j m v c ( j o i n tm u l t i v i e wv i d e oc o d i n g ) 2 0 1 ,该平台剔除了 与j m v c 无关的算法和工具,专用于m v c ,本文中所做实验便是基于该平台。 2 0 0 6 年1 0 月第7 8 次m p e g 会议在杭州举行,本次会议上t 向m p e g 组 织提交了m v c 联合草案( m v cj o i n td r 锄【2 l 】,m v c 的标准化程序正式启动。之 后m v c 的标准化制订工作正在紧张的进行中,在每三个月召开一次的标准化会 议上,国内外研究机构纷纷提交自己的提案,争取所提技术能成为m v c 的一个 基本组成部分。 2 0 0 9 年3 月,t 正式公布了h 2 6 4 a v c 的第四个增修案多视点视频编 码方案。之后又发布了关于的m v c 的相关档次定义、附加补充增强信息( s e i ) 等, m v c 的研究进程还在如火如荼的进行中。 1 5 本文的主要研究内容和成果 多视点视频m v c 是h 2 6 4 a v c 编码标准的第四个增修案,m v c 也是当前 的热点研究内容,由于多视点视频不同视点间存在很大的相关性,利用视点间相 关性消除冗余提高m v c 编码效率是m v c 研究的主要方向之一。目前,m v c 利 用h 2 6 4 a v c 的多参考图像预测技术,利用邻近视点中已编码图像作为当前编码 图像的视点间参考图像来提高编码效率。由h h i 提出的基于分层b 帧的视点间 8基于视觉几何的多视点视频编码研究 时间混合预测结构因其出色的编码效率被t 选为m v c 的参考预测结构。该结 构虽然充分利用了视点间的相关性,但是视差估计搜索也带来了编码复杂度,降 低了编码效率。本文这一点,提出了一种基于视觉几何中对极线校正的快速视差 估计搜索方法。通过提取多视点视频的第一帧,检测特征点,然后做特征点匹配, 使用匹配点集计算出视点图像间的基础矩阵来对图像进行校正。本文提出了一种 适于多视点编码的对极线校正算法,用建立校正索引表的方式将视差估计的二维 搜索变为一维,缩小搜索范围,加快视差估计的搜索速度。最后本文该方法在t ( 联合图像专家组) 的多视点视频编码的参考模型j m v c 上实现。在几乎不引入 编码损失的前提下,降低了编码复杂度,提高了m v c 系统的效率,将编码速度 在原模型基础上提高了3 0 4 0 。 本文共分五章,各章主要内容安排如下: 第一章:绪论 首先简单介绍视频压缩编码的发展历史,接着介绍了多视点视频及其应用, 以及多视点视频编码的发展历史和m v c 的标准化历程,最后介绍了本文的主要 内容和研究成果。 第二章:h 2 6 4 视频编码标准 本章主要介绍了h 2 6 4 视频编码标准,分析了其编解码器的框架,并且极少 了其与m v c 有关的一些内容和算法。 第三章:基于h 2 6 4 的多视点视频编码 本章介绍了h 2 6 4 标准下的m v c ,主要是视差矢量的定义和其预测编码, m v c 的预测结构,最后给出了多视点视频编码的评价指标。 第四章:与m v c 相关的视觉几何 本章首先介绍了视觉几何的基本知识,然后主要介绍了基础矩阵及其求法, 主要是图像特征点的检测,特征点的描述和匹配,以及基础矩阵的鲁棒性算法。 最后介绍了对极几何中图像校正的原理,给出了对极线校正的基本算法。 第五章:一种基于对极线校正的多视点视频编码 在本章中,提出了一种快速的视差估计搜索算法,对该算法作了详细阐述, 并给出了算法的测试平台和测试结果,最后对结果进行了分析。 第六章:总结与展望 本章为全文的总结,并指出了以后的研究方向。 第二章h 2 6 4 视频编码标准 9 第二章h 2 6 4 视频编码标准 2 1h 2 6 4 视频标准概述 m p e g 和v c e g 经联合开发了一个比早期研发的m p e g 和h 2 6 3 性能更好的 视频压缩编码标准,这就是被命名为a v c ( a d v a n c e dv i d e oc o d i n g ) 的,也被称 为i t u th 2 6 4 建议和m p e g 一4 的第1 0 部分的标准,简称为h 2 6 4 a v c 冽阱】 或h 2 6 4 。这个国际标准于2 0 0 3 3 正式被i t u t 所通过并在国际上正式颁布。 h 2 6 4 的颁布是视频压缩编码学科发展中的一件大事,它不仅有优异的压缩 性能,而且具有良好的网络亲和性,也将在数字电视广播、视频实时通信、网络 视频流媒体传递以及多媒体短信等各个方面发挥重要作用。测试表明,相对于 m p e g - 4 、h 2 6 3 和m p e g 2 ,在获得相同视频质量的前提下,h 2 6 4 的平均编码 比特比m p e g - 4a s p 要少4 1 ,比h 2 6 3h l p 要少5 2 ,比m p e g 2 要少6 7 。 在无线带宽资源和传输能力有限,以提高压缩编码效率为主要研究目标的无线视 频和多媒体应用中,h 2 6 4 以其卓越的性能,具有广阔的应用前景。h 2 6 4 可应用 于视频通信领域,如实时视频会议系统、h d t v 、网络广播、视频流媒体服务、 移动多媒体及远程视频监控等等,其编码技术先进实用,网络适应性强,必将成 为最具影响的视频编码标准之一。 2 2 1h 2 6 4 编码器 2 2h 2 6 4 编码器和解码器 h 2 6 4 没有明确地规定一个编解码器t 2 3 】如何实现,只是规定了一个编了码的 视频比特流的句法和该比特流的解码方法,各个厂商的编码器和解码器在此框架 下应能够互通,在实现上具有较大灵活性,而且有利于相互竞争。 h 2 6 4 编码器功能组成如图2 1 所示,输入的帧或场f n 以宏块为单位被编码 器处理。首先,按帧内或帧间预测编码的方法进行处理。如果采用帧间预测编码, 其预测值p 是根据前面已编码的参考图像经运动补偿( m c ) 后得出,其中参考 图像用f n 1 表示。为了提高预测精度,从而提高压缩比,实际的参考图像可在 过去或未来( 指显示次序上) 已编码解码重建和滤波的帧中进行选择。 预测值p 和当前块相减后,产生一个残差块d n ,经变换、量化后产生一组 量化后的变换系数x ,再经熵编码,与解码所需的一些附加信息( 如预测模式、 1 0 基于视觉几何的多视点视频编码研究 量化参数、运动矢量等) 一起组成一个压缩后的码流,经n a l ( 网络自适应层) 供传输和存储用。 为了提供进一步预测用的参考图像,编码器必须有重建图像的功能。因此必 须使残差图像经反量化、反变换后得到的d n 与预测值p 相加,得到u f n ( 未经 滤波的帧) 。为了去除解码环路中产生的噪声,提高参考帧的图像质量,设置了一 个环路滤波器,滤波后的输出f n ,即为重建图像,可用作后面编码时的参考图像。 图2 1h 2 6 4 编码器 h 2 6 4 的解码器如图2 2 所示。编码器的n a l 输出一个压缩后的h 2 6 4 压缩 比特流,经熵解码得到量化后的一组变换系数x ,再经反量化、反变换,得到残 差d n ,利用从该比特流中解码出的头信息,解码器就产生一个预测块p ,它和编 码器中的原始p 是相同的。当该解码器产生的p 与残差d n 相加后,就产生u f n , 再经滤波后,最后就得到滤波后的f n ,这个f 1 1 就是最后的解码输出图像。 图2 2h 2 6 4 解码器 h 2 6 4 内容简介 h 2 6 4 a v c 采用传统的基于块的运动补偿和变换编码,使用一些先进的编码 技术极大地提高了压缩效率,例如:1 4 像素精度运动补偿预测、可变块大小运 动补偿预测、多参考图像运动补偿预测、精细的帧内预测、自适应环路滤波等。 第二章h 2 6 4 视频编码标准 本节仅就研究m v c 所需要的h 2 6 4 的相关内容作简要介绍。 2 3 1h 2 6 4 的图像划分 视频的一场或一帧可用来产生一个编码图像。通常,视频的帧可分成两种类 型:连续或隔行视频帧。在电视中,为减少大面积闪烁现象,把一帧分成两个隔 行的场。显然,这时场内邻行之间的空间相关性较强,而帧内邻近行空间相关性 强,因此活动量较小或静止的图像宜采用帧编码方式,对活动量较大的运动图像 则宜采用场编码方式。一幅视频图像( 帧) 可划分成一个或多个片( s l i c e ) 。根据 预测关系片可以分为以下五类: i 片:片内的所有宏块都使用帧内预测进行编码。 p 片:除i 片的编码方式外,p 片中的一些宏块可以使用前向帧间预测进行 编码,但不能使用后向帧间预测。 b 片:除p 片可使用的编码方式外,b 片中的一些宏块可以使用前向帧间预 测和后向帧间预测。 h 2 6 4 a v c 中的这三种片编码模式与先前标准中给出的图像编码模式十分相 似,但对参考图像的使用有所不同。此外,h 2 6 4 a :v c 添加了两种新的片的编码 模式,s p 片和s i 片。这两种片可用于码流切换,实现快进快退,并具有抗误码 能力。 当前编码图像的各个片相互独立,不存在预测关系,因此可以有效地限制误 码扩散。每个片中包含若干个宏块( m a e r o b l o c k ,m b ) 。一个m b 由一个1 6 x 1 6 亮度分量( y 分量) 及其相应的两个色度分量( c b 、c r 分量) 组成。i 片只包含 i 宏块,p 片可包含p 和i 宏块,而b 片可包含b 和i 宏块。i 宏块利用从当前片 中已解码的像素作为参考进行帧内预测( 不能取其它片中的已解码像素作为参考 进行帧内预测) ,p 宏块利用前面已编码图象作为参考图象进行帧内预测,b 宏块 则利用双向的参考图象进行预测。根据不同的图像内容,在帧间预测编码过程中 可将m b 进一步划分为分区( p a r t i t i o n ) 。 o1 o 1 图2 3 ( a ) 1 6 1 6 宏块分区 0 j 耋 2 3 1 2 基于视觉几何的多视点视频编码研究 01 o 1 01 23 图2 3 ( b ) 8 x 8 子宏块分区 h 2 6 4 a v c 中给出的m b 分区有:一个1 6 x 1 6 的宏块分区,两个1 6 x 8 的宏 块分区,两个8 x 1 6 的宏块分区或四个8 x 8 的亚宏块。一个亚宏块由一个8 x 8 y 分 量和相应的c b 、c r 分量组成。与m b 分区类似,在帧间预测编码过程中,可以 对亚宏块进一步分区。h 2 6 4 a v c 中规定的亚宏块分区有:一个8 x 8 的亚宏块分 区,两个4 x 8 的亚宏块分区,两个8 x 4 的亚宏块分区或四个4 x 4 的亚宏块分区。 在h 2 6 4 a v c 中还给出块( b l o c k ) 的定义,块是指一个m x n 的采样点集合,m 和n 可以任选1 6 、8 和4 中的一个值,也就是说块可以指m b ,也可以指分区。 2 3 2 帧内预测 在帧内预测模式中,预测块p 是基于已编码重建块和当前块的数据形成的。 对亮度像素而言,可对4 x 4 子块或者1 6 x 1 6 宏块进行帧内预测。对每一个4 x 4 亮度子块进行独立预测,适用于带有大量细节的图像压缩编码,4 x 4 亮度子块有 9 种可选的帧内预测模式;对整个1 6 x 1 6 宏块进行亮度预测,适用于平坦区域图 像的压缩编码,1 6 x 1 6 亮度块有4 种预测模式;色度块也有4 种帧内预测模式, 类似于1 6 x 1 6 亮度块预测模式。此外,还有一种帧内编码模式称为ip c m 编码 模式。该模式下,编码器直接传输图像像素值,而不经过预测和变换。在一些特 殊的情况下,特别是图像内容不规则或者量化参数非常低时该模式比“常规操作” ( 帧内预测变

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论