(通信与信息系统专业论文)internet上基于mpeg4自适应视频编码及控制的研究.pdf_第1页
(通信与信息系统专业论文)internet上基于mpeg4自适应视频编码及控制的研究.pdf_第2页
(通信与信息系统专业论文)internet上基于mpeg4自适应视频编码及控制的研究.pdf_第3页
(通信与信息系统专业论文)internet上基于mpeg4自适应视频编码及控制的研究.pdf_第4页
(通信与信息系统专业论文)internet上基于mpeg4自适应视频编码及控制的研究.pdf_第5页
已阅读5页,还剩70页未读 继续免费阅读

(通信与信息系统专业论文)internet上基于mpeg4自适应视频编码及控制的研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

华中科技大学硕士学位论文 州l l 摘要 随着i n t e m e t 和多媒体技术的发展,视频流的编码和传输技术口益成为人们 关注的焦点和应用的瓶颈。本文从编码和传输相结合的角度对这一问题进行了深 入研究。 首先对目前的视频编码技术作了全面的回顾,分析了i n t e m e t 传输业务的特 点和技术指标,然后阐述了较新的i n t e m e t 上连续媒体流的传输框架,并以此为 基础,分别从m p e g 一4 视频流的特点和i n t e m e t 传输特性两方面对现行的面向对 象编码和打包传输机制进行了改进。 ( m p e g 一4 视频编码是面向对象的,不同的视频对象独自编码,但它们却共享 网络资源。因此如何科学地在这些对象间分配资源历来是研究热点,对此本文从 三方面做了探讨。其一,提出形状运动匹配因子并以此为参考改变v o 的编码帧 率,并设计了不同帧率编码的速率控制方案,相比于统一帧率编码方法对象问比 特分配更合理。其二,提出了根据宏块运动剧烈程度改变其量化因子的方法让 v o p 内的比特更多用于人眼更敏感的运动细节。其三,用多线程预测法处理p 帧, 并在帧率控制中通过停止某个预测线程实现成组跳帧,在低运动复杂度的远程教 学视频流处理中有效地减少了接收端回放图象的停顿和跳跃现象。尹厂 丢包是i n t e m e t 上较常见的传输错误,本文提出了一种根据v o p 类型莺要程 度提供不同保护的前向纠错方法,既降低了保护的冗余度又能使保护效果不出现 明显下降,还使编码器和保护单元之间的接口简洁明了。 通过以上工作,对前面的i n t e m e t 上的视频流传输框架进行了改进,使之具 有更强的适应性。还提出了一个自适应编码控制方案,将控制模块从编码器中分 离出来,通过接口参数与编码器交互,让编码器具有白适应能力。另外还给出了 软件控制模块的设计思路。 最后回顾了远程教学的特点和实现手段以及易学远程教学系统中的相关技 术,并给出了视频编码的改进方案。 关键词:自适应编码,速率控制,多线程预测,健壮性编码,远程教学系统 华中科技大学硕士学位论文 a b s t r a c t w i t ht h ed e v e l o p m e n to fi n t e r a c ta n dm u l t i m e d i a ,v i d e oc o d i n ga n dt r a n s m i s s i o n b e c o m em o r ea n dm o r ea t t r a c t a b l e t o p e o p l e a n dh a v e b e e nab o t t l e n e c kf o r m u l t i m e d i a a p p l i c a t i o n s o m ed e e p r e s e a r c ho nt h e mh a sb e e nc o n d u c t e df r o m c o m b i n a t i o nc o d i n gw i t ht r a n s m i s s i o ni nt h i st h e s i s f i r s t l y , aw h o l e r e v i e wa b o u t c o d i n gt e c h n i q u e b vf a ra r et a k e n ,a n dt h e c h a r a c t e r i s t i co fi n t e m e ts e r v i c ef o r t r a n s p o r t a t i o n a n do o sa r ea n a l y z e d t h e na f r a m e w o r ko ft r a n s p o r t i n gc o n t i n u o u sm e d i as t r e a mi si l l u s t r a t e d b a s e d o nt h i s f r a m e w o r k ,t h ei m p r o v e m e n to no b j e c t o r i e n t e dc o d i n ga n dp a c k e t i z a t i o na r eg i v e n f r o mt h ec h a r a c t e r i s t i co ft h em p e g - 4v i d e os t r e a ma n dt r a i to ft r a n s m i s s i o no v e r i n t e m e t m p e g 4v i d e oc o d i n gi sb a s e do nv i d e oo b j e c t s e a c ho ft h e mi s e n c o d e d i n d e p e n d a n t l y b u tt h e ys h a r en e t w o r kr e s o u r c e s oi t h a v eb e e naf o c h so fr e s e a r c h t h a th o wt oa s s i g nr e s o u r c eb e t w e e nt h e s eo b i e c t ss i n c et h e ni nt h e s et h e s i s ,t h r e e w a y s h a v eb e e ns t u d i e do nt h i st o p i c f i r s t ,p r o p o s es h a p ec h a n g ea n dd i s t o r t i o nt ob ea r e f e r e n c ea s a d a p t i n gf l a m er a t e o fv i d e oo b j e c tc o d i n g ,a n dd e s i g n er a t ec o n t r o l s c h e m ef o rd i 腩r e n tf r a m er a t ec o d i n ga m o n gd i f i e r e n to b j e c t s e x p e r i m e n tr e s u l t s s h o wt h a tb i ta l l o c a t i o nf o rv i d e oo b j e c t si sm o r es c i e n t i f i ct h a nu n i q u ef r a m er a t e c o d i n g s e c o n d ,as o l u t i o nt oc h a n g eq u a n t i z a t i o np a r a m e t e ro fm a c r ob l o c kw i t hi t s m o t i o nc o m p l e x i t yi s g i v e ns o t h a tm o r eb i t sc a ns e r v e df o rm o t i o nd e t a i l st h a ta r e m o r es e n s i t i v et oh u m a ne y e s t h i r d ,m u l t i p l ep r e d i c t i o nt h r e a d sa r ep r e s e n t e dt od e a l w i t hpf r a m e s ,a n dan o v e lf l a m es k i p p i n gs c h e m ea r eg i v e nw h i c hc a ns k i pag r o u po f f r a m e sb ys t o p p i n gap r e d i c t i o nt h r e a d i ti sp r o v e dt h a tt h o s ep h e n o m e n ao f f r e e z i n g a n di u m p i n go ft h ed e c o d e dv i d e ow h i c ho f t e np r e s e n ti nt r a d i t o n a lm e t h o dw e r e r e d u c e di np r o c e s s i n go f d i s t a n c el e a r n i n gv i d e ow i t hl o wc o m p l e x i t y p a c k e tl o s sa f ec o m d 】o ne l f o rd u r i n gt r a n s m i s s i o n ) v e r i n t e r n e tan e wf o r w a r d e r r o rc o r r e c t i o nm e t h o di sp r o p o s e dw h i c ha nu n e q u a l p r o t e c t i o nt ov i d e oo b j e c tp l a n e s b yt h e i rt y p ei m p o r t a n c ea r et a k e n t h e s em e t h o dc a nr e d u c et h er e d u n d a n c yo f a d d i t i o n a ld a t aa n dm a i n t a i nt h ee f f e c tw i t hl i t t l e1 0 s s a n dm a k et h ei n t e r f a c eb e t w e e n e n c o d e ra n dp r o t e c t i o nu n i tm o r e s i m p l ea n d c l e a r t h r o u g ha b o v ew o r k ,a ni m p r o v e m e n tt op r e v i o u sf r a m w o r ko fv i d e os t r e a m t r a n s p o r t a t i o n i s p r e s e n t e ds ot h a t i ti sm o r ea d a p t i v e as c h e m eo fa d a p t i v ev i d e o e n c o d i n gc o n t r 0 1i sa l s og i v e nw h i c hs e p e r a t i n gt h ec o n t r o lm o d e lf r o me n c o d e r s ot h a t l a t c rb e c o m e a d a p t i v ee n c o d e rb yi n t e r a c t i o nw i t hf o r m c rt h r o u g hi n t e r f a c ep a r a m e t e r s i na d d i t i o n ad e s i g ng u i d e l i n et os o f t w a r ec o n t r o lm o d e l i sa l s oi l l u s t r a t e d 1 i 华中科技大学硕士学位论文 f i n a l l y ,t h e c h a r a c t e r i s t i co fd i s t a n c el e a m i n ga n di m p l e m e n t a t i o n o fi ta r e s u m m a r i z e dt h er e l a t i v et e c h n i q u e si ne a s yl e a r n i n gd i s t a n c el e a r n i n gs y s t e ma r e i n t r o d e c e d ,a n dm o r ei m p o r t a n t ,ai m p r o v i n gs c h e m eo f v i d e oc o d i n gf o rt h es y s t e m a r ep r o p o s e d k e y w o r d s :a d a p t i v ec o d i n g ,r a t ec o n t r o l ,m u l t i p l e p r e d i c t i o nt h r e a d s ,e r r o r r e s i l i e n c ec o d i n g ,d i s t a n c el e a f i n gs y s t e m i i i 华中科技大学硕士学位论文 1 绪论 1 1 图像与视频编码技术的发展 随着数字化通信、计算机网络以及多媒体技术的飞速发展,符合人类信息交 换方式的多媒体通信已经成为一种不可避免的趋势。据统计,人类感觉器官接收 的各类信息中,视觉类占了近7 0 。这些视觉信息经过数字化后,如果不进行压 缩,其数据量是巨大的。因此,视觉图像数据的压缩成为解决多媒体通信和存储 问题的一个关键环节。 图像压缩技术自从1 9 4 8 年o l i v e r 提出p c m 编码理论1 1 1 开始,迄今已有5 0 多 年的历史。它已经发展成为一个独立的研究领域。图像数据压缩技术的基本思想 就是去除视觉图像数据因存在各种形式的相关性所带来的数据冗余。各种图像编 码方法的提出都是与视觉数据冗余类型有关的,一般视觉数据中主要存在以下几 种数据冗余:空间冗余、时间冗余、信息熵冗余、结构冗余、知识冗余及视觉冗 余等。根据编码方法所采用的冗余度的信息,t o n e s 和k u n t 等人在他们的著作p 】 中把图像编码分为了两个阶段:第一代编码技术和第二代编码技术。第一代的编 码技术仅考虑了图像及图像序列中的空间冗余、时间冗余和信息熵的冗余。其编 码方法主要以象素或象素块作为编码的基本实体,而没有或较少考虑人类视觉系 统。第一代编码方法主要有:脉冲编码调制、预测编码、变换编码、矢量量化以 及子带和小波编码等方法。在八十年代初,第一代编码技术发展遇到了阻碍。主 要在于其不能提供高的压缩比,不能在低比特率编码中提供良好的视觉质量。而 第二代编码技术在第一代编码技术的基础上,进一步考虑了视觉数据中的结构知 识和视觉等冗余,以获取更高效的压缩效果。代表性的第二代编码方法有:基于 分割的编码方法、基于模型的编码方法和分形编码等。基于分割的编码方法是把 图像或视频分割成多个实体对象,对每个实体单独进行编码,例如分裂合并编码 方法、基于内容的编码方法等。基于模型的图像编码主要分为语义基编码和物理 基编码两种。根据所建立的模型编码器,通过图像分析,从场景提取参数,如形 状参数等,并对这些参数进行编码和传输而解码器只要利用这些参数,根据模 华中科技大学硕士学位论文 型合成例像。分形图像编码方法则基于分形几何理论利用图像的自相似性来编 码。从这些方法可以看出,第二代图像编码方法是建立在图像分析和合成、计算 机图形学、虚拟现实和计算机视觉等基础上,其中许多新的编码技术还有待于进 一步研究和探索。 1 2 图像与视频编码标准 随着编码技术的广泛应用和各国高度的重视,为适应全球工业与经济的飞跃 发展,国际标准化组织加快将图像和视频编码的研究成果制定为相应的标准。本 节简要介绍几种主要的图像和视频编码标准:i t u th 2 6 1 、i t u th 2 6 3 、 t u t h2 6 3 + 、i t uh 2 6 3 + + 、i t uh 2 6 l 、i s oj p e g 、i s oj p e g l s 、i s oj p e g 2 0 0 0 、 i s oj b i g 、i s oj b i g 2 、i s 0m p e g i 、i s om p e g 一2 、i s 0m p e g 4 、i s om p e g 一7 、 【s om p e g 2 i 。 1 2 1i t u - 1 h 2 6 1 、h 2 6 3 、h 2 6 3 + 、h 2 6 3 + + 和h 2 6 l h 2 6 1 p 1 是用于p 6 4 k b i t s ( p = 1 ,2 ,3 0 ) 速率下音频视频业务的视 频编解码标准。它采用的主要视频编码技术有d c t 编码、帧问预测、运动补偿 等方法,支持c i f ( 3 5 2 2 8 8 ) 和q c i f ( 1 7 6 1 4 4 ) 两种图像格式。 h 2 6 3 4 - 5 是面向低比特率通信的视频编码标准。它是在h2 6 l 的基础上发展 起来的。主要采用的编码技术与 l 2 6 i 相同,增加了s u b q c i f ( 1 2 8 9 6 ) 、4 c i f ( 7 0 4 5 7 6 ) 、1 6 c i f ( 1 4 0 8 1 15 2 ) 三种图像格式,同时增加了无限制运动矢量、基于语 法的算术编码、先进的预测,p b 帧四种可选模式。在低比特率小于6 4 k b w s 环境 下h 2 6 3 的编码图像质量要优于h 2 6 l 。 h 2 6 3 + p “是h 2 6 3 的第二:版,后向兼容h 2 6 3 ,与h2 6 3 相比它增加了1 2 个可选的编码模式:先进的帧内编码、除块滤波、片( s l i c e ) 结构、附加增强信息、 改进的p b 帧、参考图像选择、时空及s n r 可伸缩( s c a l a b i l i t y l 、参考图像再抽样、 减少分辨率更新、独立分段解码、可替换的帧内v l c 、修改的量化模式。h 2 6 3 + 中的无限制运动矢量模式与h 2 6 3 中的无限制运动矢量模式也有所不同。 h 2 6 3 + + 瞪。】是i t u 刚刚制定的h 2 6 3 进一步改进的标准,它的标准已在 华中科技大学硕士学位论文 2 0 0 1 年颁布。h2 6 3 + + 将在h2 6 3 + 标准的基础上再加上若干个可选编码模式:增 强参考帧选择模式、误码恢复的数据划分模式、i d c t 谍匹配减少模式,另外仿 射运动补偿、选择系数扫描、误码控制编码及头信息重复等方法也是标准所考虑 采纳的技术。 h 2 6 l 【”是i t u 正在制定的新的视频编码标准,预计在2 0 0 2 年颁布。它 将采用与h 2 6 3 不同的编码技术以期获得比h 2 6 3 最佳版本还要高的编码性能 增益。所采用的技术有:在预测编码方法中采用自适应运动精度方法【i o j 平口仿射模 型来提高运动估计的精度,对于预测误差编码采用矢量量化和小波进行编码 【”l ,为了增强帧间编码的性能,标准采用了小波编码的方法,同时采用高效的变 长码表的索引来提高熵编码的效率。h 2 6 l 主要的特点将是: 1 高性能压缩比,与h 2 6 3 + 标准相比, l 2 6 l 编码比特数将节省5 0 以上。 2 编码方法的简单化,如采用基本的基于块的编码方法。 3 不同的时延性来满足不同业务的需求,如对实时的通信业务的低时延( 没 有b 帧) 和基于服务器的视频流的中等时延特性。 4 算法健壮性,能够有效进行包丢失的恢复和移动信道中的误码恢复。 5 编解码复杂度的灵活性,用来满足不同应用对编码质量的要求。 6 同样适合高质量的业务应用,在高比特条件下有高的编码质量,可以应用 于娱乐业务中。 7 适合网络上的传输,比特流结构易于打成数据包,同时提供信息优先权控 制等措施。 1 2 2i s oj p e g 、j p e g l s 和j p e g 2 0 0 0 j p e g ( j o i n t p h o t o g r a p h i ce x p e l sg r o u p ) 目的是制订连续色调的静止图像编 码标准。它的第一个图像编码标准即人们常说的j p e g 标准,即i s1 0 9 1 8 1f i t u t t 8 1 ) 1 2 1 o j p e g 标准采用了d c t 变换和变长熵编码等技术。 j p e g l s 是即将出现的连续色调静止图像的无损近无损压缩标准,它的会 议草案可以从网页剐上获得。草案的更新版本将做为标准i s l 4 4 9 5 或t8 4 公布 0 4 1 , 它采用的算法是基于h e w l e t t p a c k a r d 实验室研究的l o c o i ( l o wc o m d l e x i t v l o s s l e s sc o m p r e s s i o nf o ri m a g e s ) 算法i | “,l o c o i 算法可详见文献。 华中科技大学硕士学位论文 j p e g 一2 0 0 0 是在2 0 0 0 年底发布的新图像压缩标准【sl5 4 4 4m 】。它提供许多 新的特征性能f ”】:有损或无损的单分量灰度和多分量彩色数据压缩:感兴趣区域 编码;图像的任何不同区域可以编码为不同的逼真度:图像逼真度或分辨率的逐 渐浮现:随机访问一幅图像的特定区域;尤其在高压缩比下的超级压缩性能,好 的容错性能等。j p e g 一2 0 0 0 标准将可以直接处理超过6 4 6 4 k 的大图像。为了避 免运用几个算法时可能发生的模式不兼容,可以运用一个算法来处理儿乎所有的 图像。新的算法可以用来在噪声环境中传输图像,并能高效地处理由计算机合成 的图像,可以根据有损或无损格式处理由连续色调的二值图像和灰度图像构成的 混合类型的图像文件。j p e g 一2 0 0 0 也支持逐渐浮现的传输模式,可以在窄带信道 和存储容量有限的环境中实时传送图像,除此之外j p e g 2 0 0 0 还提供诸如水印标 签加密等的附加功能。总之j p e g 2 0 0 0 的功能将是十分先进和强大的,它的潜在 应用领域有w e b 浏览、文档成像、数字照相、医疗成像、遥感等。 1 2 3i s oj b i g 和j b i g 2 j b i g 是制定二值图像编码标准的专家组。它于1 9 9 3 年制定了第一个值图 像编码标准( j b i g l ) i s o i e ci1 5 4 4 ,即i t u tt8 2 。它是二值图像无损压 缩标准。 j b i g 2 【2 0 j 是联合二值图像专家组制订的一个新的二值图像编码标准。它是第 一个二值图像有损压缩的国际标准。它具有以下一些显著的优点【2 1 】:压缩性能的 提高;提供对文本、半色调和其它的二值图像内容的特定压缩方法;提供有损和 无损压缩:多页文档的压缩:灵活的格式( 容易嵌入到其它的图像文件格式,如 t t i f f ) ;高效地解压( 应用某些编码模式,图像可以用软件每秒解压2 5 亿个像 素) 。此外,j b i g 2 允许质量逐渐加强编码和内容逐渐浮现编码( 例如首先文本, 然后半色调图像) 。一个典型的j b i g 2 编码器可以把输入的二:值图像分解为几个 区域或图像碎片( 通常是基于内容的) ,每个图像碎片分别应用不同的方法编码, 在交互多媒体应用中,这种基于内容的分解是十分必需的。 4 华中科技大学硕士学位论文 1 2 41 s om p e g 。1 、m p e g 2 、m p e g 4 、m p e g 7 和m p e g 一2 1 m p e g 是运动图像专家组( m o t i o n p i c t u r ee x p e a sg r o u p ) 的简称,它仓i j 立于 1 9 8 8 年,其最初使命是制订运动图像及其伴音的编码标准。关于m p e g 的历史 及标准的介绍可见文献。“j 。 m p e g 11 2 5 1 是第一个m p e g 标准。它可把运动图像和伴音以1 4 m b i t s 的比 特率压缩存储在c d 上,图像质量与盒式v h s 相当,己在v c d 中获得了广泛的 应用。 m p e g 2 是m p e g 制订的第二个多媒体标准。其大体框架与m p e g 一1 一 致,但m p e g - 2 的应用领域相比之下要更加广泛。m p e g 一2 采用了工具集( t o o l k i t ) 的方法来满足不同应用的要求。m p e g 一2 主要在数字电视d v d 和h d t v 等多媒 体产品中获得应用。 m p e g 4 2 7 - 3 3 是于1 9 9 9 年出台的一个新的多媒体标准。较之m p e g 前两个 图像编码标准而言,m p e g 一4 为多媒体数据压缩提供了一个更为广阔的平台。它 更多的是定义一种格式和框架,而不是具体的算法。它将各种多媒体技术充分应 用于编码,其中除压缩本身一些工具外,还包括图像分析和合成、计算机视觉、 计算机图形学、虚拟现实和语音合成等技术。m p e g 一4 提供了许多新的性能:提 供了基于内容的交互性,定义了音视频对象,可以对任意形状的视频对象编码: 可以高效地对自然或合成的多媒体数据编码;高效的压缩性,具有更高的编码效 率,同已存在或即将形成的其它标准相比,在相同比特率下具有更高的视觉听觉 质量:提供了易出错环境中的稳健性,来保证其在许多无线和有线网络以及存储 介质中的应用等等。 m p e g 7 【m 3 8 1 是m p e g 从1 9 9 6 年1 0 月开始制订的一个新标准,在2 0 0 1 年 成为正式的标准。它的目的是为了高效地描述和搜索多媒体内容。随着多媒体数 据信息与日剧增,从中获得感兴趣的材料变得日益困难,因为无法对多媒体视听 内容进行标识和描述。m p e g 7 就是用来解决上述问题的m p e g 家族新成员。它 是多媒体内容描述接口标准,它将扩展已存在的内容标识方法,主要是加入更多 的数据类型。换句话说,m p e g 7 将规定一个能用来描述不同类型的多媒体信息 的标准捌i 述子r d e s c r i p t o r ) 集合。它将标准化一些方法,来定义其它描述了、描 述子结构、描述方法以及描述子之间的关系。描述( 即描述子的组合和描述方法j 华中科技大学硕士学位论文 应该伴随内容本身,允许进行快速和高效地搜索用户感兴趣的材料。m p e g 一7 还 将标准化一种规定描述方法的语言( 即描述定义语言d d l ) 。带有m p e g 7 数据 的视听材料可以被索引和查找,这些材料包括:静止图像、图形、3 d 模型、音 频、语音、视频,以及这些元素如何组合成一个多媒体表现的有关信息。这些一 般数据类型的特例可以包括面部表情和人的特征。 m p e g 一2 1 【j 圳是1 9 9 9 年底才开始的一个有关多媒体框架的标准活动,这个活 动的目的是为了达到对支持电子内容传送的多媒体框架的共同理解,以期制订 s c 2 9 能力范围内的新标准。它将是一个与多媒体内容传送有关的标准,严格说 来m p e g 一7 和m p e g 2 l 已不属于编码标准而应称为多媒体标准。 1 3 视频编码现状和趋势 当前视频编码研究的热点及视频发展的趋势主要集中在三个方面:健壮的视 频编码、基于对象的自适应视频编码和合成自然混合数据编码。 1 3 1 健壮的视频编码 视频编码的目的是压缩视频信息。但是随着视频信扈、冗余度的减少,视频抗 误码能力也降低。由于目前通信传输信道不是理想信道( 如i n t e m e t 网络不提供 质量保证及无线网络的极低带宽、高误码等特性) ,为了能够有效的进行视频通 信,需要健壮的视频编码技术。健壮视频编码需要联合考虑信源和信道两个方面, 在不影响编码效率的情况下,适当增加些冗余来提高比特流抗误码能力。h 2 6 3 善 和m p e o 一4 标准是首先考虑编码健壮性的编码标准。它们采用了一些健壮编码方 法,如h 2 6 3 + 中的参考帧选择模式【8 1 ,m p e g 一4 标准中采用的可逆变长码 2 8 1 等 技术。由于视频编码健壮性能的提高需要考虑编码的各个环节及之间的配合,高 效的健壮编码算法还有待进一步的研究。 1 3 2 基于对象的自适应视频编码 螭f 对象的视频编码是为了给多媒体提供更强的交互性而产生的视频编码 华中科技大学硕士学位论文 新技术。由于信息和网络等技术的迅猛发展以及人们物质文化生活水平的提高, 人们对高交互多媒体业务和i n t e r n e t 业务【4 “1 1 ( 如远程会议、远程教学、购物点 播、视频v o d 、电子商务等) 的需求曰益增加,迫切需要出现新的编码技术来提 供较强的交互性。基于对象、基于内容的视频编码技术就是顺应这种需求而产生 的,它也是m p e g 一4 标准的重要特性之一,它的发展在很大程度上受m p e g - 4 标 准活动的驱使。基于对象的编码可以对任意形状的视频对象进行编码、传输、解 码,但也由此而带来一些新的难题。当前基于对象的视频编码的研究集中在视频 对象分割、基于对象的编码技术( 包括对象纹理、形状及运动估计等方法) 以及 基于对象的速率控制等方面。网络多媒体的应用对基于对象的编码技术提出了更 高的要求,编码器必须要考虑网络的时变性和不可预知性,考虑终端用户在带宽 和处理能力上的差异性,编码输出的内容应该具有极强的适应性。 1 3 3 合成一自然混合数据编码 合成一自然混合数据编码( s y h c ) 【2 84 “5 】是用来表示和传输合成一自然的混 合数据的技术,是当前图像视频编码领域的又一个新的研究热点,同时也是 m p e g 4 支持的特性之一。现在越来越多的实时交互应用需要对听觉、视觉信息 和2 d 、3 d 计算机图形进行混合编码。音频、视频和2 d 、3 d 的合成内容要求以 不同的格式,在不同的计算和显示平台上集成为数字媒体。在办公室、工厂、公 共场合和私人场所等工作和娱乐时所进行的实时或交互应用,要求出现新的能进 行公共计算、资源、工具、算法及原始数据集成的硬软件环境来传送媒体内容。 同时随着w w w 的出现,视觉听觉数据可用全新的自由度进行交互,然而却存在 着许多问题。首先视听数据的形式是如此的众多( 如视频游戏、机械c a d 、建筑 c a d 和医学图像等) ,但却没有统一的方法来改变和集成这些数据集,使之成为 一个综合的场景。其次这些视听数据的数据量是如此的巨大,即使在宽带网络、 非实时的数据下载应用中也需要进行数据压缩。再次在一个真正灵活的环境中, 场景的一部分可能是实时的数据流( 如传统的视频) ,而另一部分可能由当地的 用户控制传送,因此要求有更细精度的事件同步。s n h c 就是为了满足这些需求 而兴起的一个新的研究领域。 总之当前视频编码技术的发展有两大趋势,从视频通信整体系统角度上看, 7 华中科技大学硕士学位论文 发腥复杂度低、时延小、效率高、自适应能力强及健壮r 土强的视频编鹃技术:另 一种主要是从多媒体应用角度上看,综合采用计算机图形学、计算机视觉和图像 处理等技术的视频编码技术。这两大发展趋势不是独立的而是相辅相成的。 1 4 本文研究的内容和意义 1 4 1 本课题研究背景及意义 本课题是国家教育部重点科学技术项目( n o2 0 0 0 1 7 5 ) “现代远程教育 关键技术:交互式实时教学工具软件”和国家科技部技术创新基金项目( n o 0 0 c 2 6 2 2 4 2 1 0 6 4 1 ) “远程教学协同群件产品”的核心技术之一,这两个项目 的重点是连续媒体流的实时传输,如何对多媒体流高效地编码并结合网络的情况 进行实时传输将是至关重要的技术难关。由于我国幅员辽阔,教育机构遍布,只 有i n t e m e t 才能将它们“一网打尽”,因此我们将研究的重点放在i n t e m e t 上,这 样远程教学系统才具有普适性。在编码方式的选择上,因为i s o i e c 颁布的 m p e g 一4 标准先进高效,我们将只作基于m p e g 一4 的多媒体流编码和传输的研究。 考虑到实时教学的需要,整套系统的实时性将是必不可少的。但连续媒体( 如视 频和音频) 具有隐含的时间维,需要在一段特定的时间内按特定的速度播放h , 如果播放速度得不到满足,q o s ( q u a l i t yo fs e r v i c e ) 就不能保证。连续媒体的 另一个特点是数据量大,对于连续媒体数据的录制、传送、播放和访问,以“b e s t e f f o r t ”为基础的i n t e r n e t 平台与存储机制难以满足其实时性、等时性和高吞吐量的 要求。凶此,i n t e r n e t 环境下连续媒体实时传输就成为了一个极具挑战性的课题, 而其中首当其冲的就是源端的编码。由于网络环境的复杂性和终端用户的多样 陀,研究信源编码器必须要考虑诸多凶素,才有可能使研究出来的系统具有较强 的适应性。其一,编码器应该考虑到网络带宽的变化,使输出的比特流得到及时 而高效的传输,就要研究速率控制问题。速率控制模块在编码器中起着控制调节 作用,使得在编码因素( 如编码比特率、帧率等) 限制条件下尽可能地提高编码 视 ! 的质显,而基! 】二对象的速牢控制需充分利用基于对象的特性来尽可能获得r 质量的基于内容的视频流。针对这些问题,许多学者已提出了不少算法和工具, 华中科技大学硕士学位论文 但这个崭新的研究领域仍然留有许多极富挑战性的工作。其? ,与所有视频通信 一样,传输m p e g 一4 视频流必须经过信道。但是由于现有信道是非理想信道,信 道对视频流造成误码和大的延时,使其不能正确有效的传输。m p e g 一4 考虑这点 提出了健壮的视频编码方法来提高比特流的抗误码能力,但仅这一点还是不够 的。m p e g - 4 的视频流传输还需要考虑网络信道问题,及采用误码控制技术来进一 步减少误码的可能。这就需要对健壮编码方法和误码控制技术进行研究,同时配 合研究采用恰当的网络技术,这些也是m p e g - 4 视频通信的研究重点。其三,由 于硬件技术的飞速发展,硬件实现的编码器在处理速度上一直优于软件编码器, 而且硬件板卡不容易被仿制,配备硬件板卡的多媒体系统c p u 的负荷也会减轻, 因此本文试验所采用的软件编码器最终会由硬件取代。但与之接口的传输和控制 部分仍将由软件完成,这就要求合理地设计硬件编码器接口,使之能与有关软件 正常挂接并具有软件编码器系统的一切功能,比如自适应能力等。本文的研究将 对硬件编码器的接口设计提供重要参考。 1 4 2 作者的主要工作和本文的主要内容 作者从2 0 0 0 年下半年开始进入课题研究,查阅了大量的文献,对m p e g 4 标准的研究进展、国内外应用m p e g - - 4 的情况有着全面的了解。本课题是国家教 育部重点科学技术项目( n o 2 0 0 0 1 7 5 ) “现代远程教育关键技术:交互式实 时教学工具软件”的核心技术之一,该项目的一个重要阶段性成果“易学” 多媒体远程教学系统已经研制成功并于2 0 0 2 年三月通过验收,有关详情请参见 第五章。作者根据远程教学中视频内容的特点,提出了一种自适应视频编码框架, 使得编码形成的码流能适应各种带宽传输。尤其是在带宽较窄,丢包率较大的环 境中具有较强的鲁棒性。为使硬件编码器也具有类似适应能力,作者提出了一种 编码器的设计方案,在设计编码器与传输协议的接口时保留若干可调参数,以方 便软件控制程序调控编码器的工作使之具有自适应能力。作者还研究了在多个视 频对象问如何根据对象整体运动程度决定其编码帧率并进行编解码、在运动剧烈 环境中如何调整宏块的比特分配从而让运动的细节得到更丰富的体现以及帧、日j 编码与帧率控制等问题,作者还针对在i n t e m e t 上传输视频流的特点研究了编解 码的健壮性问题。 华中科技大学硕士学位论文 在第一章绪论之后,本文第二章介绍了i n t e r n e t 上连续媒体流的传输框架, 回顾了基于m p e g 4 的自适应编码技术的研究概况和应用。接着在第三章中重点 介绍编码速率控制技术,包括多个视频对象问速率控制、按运动复杂度进行速率 控制 【帧率控制策略。接下来的一章作者介绍了i n t e r n e t 上的健壮性编码技术, 并结合第二章中的相关内容提出了一个自适应编码框架。作为上述研究成果的应 用,在第五章中介绍了作者作为主要研发人员之一研制的易学多媒体远程教学系 统,讲述了己采用和拟在改进版中采用的自适应编码技术。最后是全文总结。 华中科技大学硕士学位论文 2i n t e r n e t 上m p e g 一4 视频流编码传输概述 2 1i n t e r n e t 上连续媒体流传输特点 2 1 1 连续媒体流通信特点 多媒体按其时间特性可分为离散媒体和连续媒体两类。离散媒体是指那些信 息值与时间无关的媒体,如文本、图形和图像等:而连续媒体则是指那些信息值 与时间有关,并随时间变化的媒体,如语音和视频等,表现为一个连续的媒体流。 连续媒体可非正式地定义为一个有关信息单元的时间序列( 例如,一个视频流是一 个视频帧的时间序列) ,每个信息单元都有其在连续媒体中的时间坐标和时段( 也 就是表现时间长度) ,信息单元之间也具有严格的时间联系,并在语义上相关。因 而连续媒体具有实时同步要求,连续媒体通信除了需要网络的高通信速率以外, 还要求保持连续媒体的实时同步特性,从而保证连续媒体的连续性和语义完整性 ( 部分连续媒体的通信服务质量要求如表2 1 所示) 。实时同步性是连续媒体的一个 主要特征,也是多媒体通信区别于传统数据通信的一个重要标志。 表2 1连续媒体的通信服务质量要求 平均吞吐量最大延迟最大抖动允许的比特允许的分组 ( b p s )( m s )( m s ) 差错率差错率 视频( t v )l o o m 2 5 0l ol o 2l o 3 压缩视频2 l o m2 5 0ll o 6l o 9 语音音频6 4 k2 5 0l o l o 1 ( 1 一占) 占5 r = r 扪,。一b c + 国si f8 c r d + t ( 裙s ( 3 7 l瓦 o t h e r w i s g 由于在比特率较低时,形状和运动部分将占据较大部分编码比特,为防止纹 理编码占用比特过多,就限制了量化系数的取值范围,下限为,上限为3 i 。 如果仅仅非纹理部分也会导致缓冲区上溢,还需要计算跳帧数。方法如下: s = t 一瓦女 w h i l e ( s r t o t a l + o 2 + m b 2 ( m b l + m b 2 ) ,则令r v 0 2 = o ;若超过,则不对背景宏块进行编 码,而只是以前一帧对应位置的宏块代替。- r v 0 2 计算出来后,r v o t 立即由( 1 ) 式可得。对于m b l 类型的宏块量化步长的 计算采用下面速率控制模型,该模型是对t m n 5 控制模型的改进。 3 3 1 改进的速率控制模型 在t m n 5 速率控制模型中,通过改变量化步长和跳帧来实现输出比特率的控 制。速率控制过程主要分为两步。第一步,在完成前一帧的编码后根据缓冲区的 占用情况计算是否需要跳帧,跳几帧。第二步,计算当前帧各宏块的量化步长。 为方便阅读,先将各变量的含义列表( 表3 3 ) 说明: 该模型先由( 2 ) 式计算出当前帧m b l 宏块所用的总比特数。 p b ,。= - - r v 0 2 ( 3 1 1 ) 缓冲区大小按下式设定 ( 3 t 2 ) 旦瞅 | 圭 | :黜胼 削 ”o融 华中科技大学硕士学位论文 b :! ! + t b f ( 3 1 3 ) “”厶。, g o p 的第一帧( 帧序号n = o ) 用默认的量化步长1 1 进行帧内编码。以下全 部为p 帧,用所述的方法进行速率控制。 置k 。初值为0 ,开始编码。每编完一帧,将该帧编码比特数累计到b “r 中。 如对第n 帧编码后,按下式更新b 。 b 。= 6 。+ b 。 ( 31 4 ) 然n n ( 3 1 5 ) 式确定跳帧数正帅。 b 。一六女。+ r ,t b f 一3 + r v 0 2 以。一( 工女p 1 ) + 只, ( 3l5 ) 当丘。确定后,下一个编码帧的序号是n 十丘矿l ,这也是新的n 值。 再按下列式子分别计算宏块量化系数的全局和局部调节因子。 g 。:生型! 堕 ( 3 1 6 ) u a 42 万f 一 。 2 1 2 + ( 占“一意b l argel)7r(317) 量化因子的调节范围不超过2 。因此最后的量化步长要作如下调整。 q p = q 只f l + s g n ( 织 一q p n l ) 。m a x ( 2 ,| q 只,。一q p n ,1 ) ( 31 8 ) t m n 5 速率控制模型的一个主要问题是它将比特均匀分配给帧内各宏块,如 ( 3 1 7 ) 式所示。也就是说运动剧烈的宏块和运动较慢的宏块所分配的比特数相同。 但是人眼对活动的物体更敏感,运动剧烈的宏块即活动级( a c t i v i t yl e v e l ) 高的宏块 更影响视觉效果,而且运动较慢宏块一般所需的比特数也少一些。这种平均分配 比特的算法显然不能达到最优的视觉效果。 为解决上面提到的问题,我们提出了一种根据宏块运动剧烈程度分配比特的 方案。运动剧烈的宏块可以分得更多的比特。先定义一个反映宏块运动剧烈程度 的量活动级,由该宏块运动补偿残差的平方和表示。同时定义一帧内v 0 1 所有宏块的活动级为该v o 的活动级。按下列式子分别重新计算宏块量化系数的 全局利局部调节凶子。 36 华中科技

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论