(计算机应用技术专业论文)基于内容的视频分析技术的研究.pdf_第1页
(计算机应用技术专业论文)基于内容的视频分析技术的研究.pdf_第2页
(计算机应用技术专业论文)基于内容的视频分析技术的研究.pdf_第3页
(计算机应用技术专业论文)基于内容的视频分析技术的研究.pdf_第4页
(计算机应用技术专业论文)基于内容的视频分析技术的研究.pdf_第5页
已阅读5页,还剩50页未读, 继续免费阅读

(计算机应用技术专业论文)基于内容的视频分析技术的研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

, 望里查兰堡主堂焦笙塞 摘要 f 数字视频是新媒体时代的一种重要信息类型。数字视频的信息量是巨大的,但是它缺 乏结构化的组织,不容易被计算机完全理解。随着视频信息量的急剧增长,用户需要操纵、 组织和检索视频数据的新工具,然而,阻碍数字视频的有效组织、访问和操纵的技术障碍 仍然存在。卜r 一一 本论文讨论高效的视频访问和管理所需的自动视频内容分析技术。本论文发展的技术 包括利用视觉特征的量塾蝴j 型,把具有相似内容的视频片段聚类成为语义上有意义的 单元,一种反映视频事件的故事发展的简洁视频表示,以及一种支持对动态视频事件的有 效访问的层次浏览界面。 本论文提出了一种塑塑坌堑框架,包括基于视觉内容的视频分割,关键帧提取和视频 片段快速聚类算法。我们把视频类用有向边连接,以简洁的图表示显示出视频内容,这使 用户可以对视频进行非线性的高效访问。此外,针对动态的复杂视频事件,我们提供了层 次化的访问方式,这提供了一种灵活的访问机制。本论文提出的方法取得了有效的视频分 割和视频故事表示的效果 并且为视频的组织和浏览提供了新的方式。 塑婆盔兰堡主兰焦笙茎 a b s t r a c t d i g i t hv i d e o h a sb e c o m em i m p o r t a n tt y p eo f i n f o r m a t i o ni nt h en e wm e d i ae r ai n f o r m a t i o n i nd i g i t a lv i d e o si sm a s s i v eb u tt h eo r g a n i z a t i o ni s 、l e r ) ru n s t r u c t u r e da n dc a n n o tb en o te a s i l y u n d e r s t a n d a b l et oc o m p u t e r ss i n c et h ea m o u n to fd i g i t a lv i d e od a t ai s i n c r e a s i n gt r e m e n d o u s l y , u s e r sn o wr e q u i r en e wt o o l sf o rm a n i p u l a t i n g ,o r g a n i z i n ga n dr e m e v i n gt h ev i d e od a t a b u t t e c h n i c a lb a r r i e r ss t i l le x i s tt h a tp r e v e n te f f i c i e ma c c e s sa n dm a n i p u l a t i o no fd i g i t a lv i d e of r o m l a r g e ,d i s t r i b u t e ds o m c e s t h et h e s i sa d d r e s s e sa u t o m a t i cv i d e oc o g e n ta n a l y s i st e c h n i q u e sn e e d e df o re f f i c i e n ta c c e s s a n dm a n a g e m e n td i g i t a lv i d e ot h e t e c h n i q u e sd e v e l o p e di nt h et h e s i si n c l u d ea u t o m a t i cv i d e o s e g m e n t a t i o nu s i n gv i s u a lf e a t u r e s ,c l u s t e r i n go fi n d i v i d u a lv i d e os e g m e n t sw i t hs i m i l a rc o n t e n t i n t os e m a n t i c a l l ym e a n i n g f u lu n i t s ,ac o m p a c tv i d e o r e p r e s e n t a t i o nt h a tr e f l e c ts t o r yf l o wo fv i d e o e v e n t s ,a n dah i e r a r c h i c a lb r o w s m g i n t e r f a c et h a ts u p p o r te f f i c i e n ta c c e s st od y n a m i cv i d e oe v e n t s t h et h e s i sp r o p o s e sav i d e oa n a l y s i sf r a m e w o r k ,w h i c hi n c l u d e sv i d e os e g m e n t a t i o n ,k e y f r a m es e l e c t i o na n df a s tc l u s t e r i n go fv i d e os e g m e n t sb a s e do nv i s u a lc o n t e n tv i d e oc l u s t e r sa r e t h e nc o n n e c t e dw i t hd f f e c t e de d g e s ,t h u sw ec a n p r e s e n tv i d e oc o n t e n tw i t hc o m p a c tg r a p h st h e s e c o l l s t l q o sa l l o wh s e r st 0a c c e s sv i d e oe f f e c t i v e l yi nan o n l i n e a rw a y w ea l s op r e s e n tc o m p l e x d y n a n l l ce v e n t si nah i e r a r c h i c a lw a y , t h u se n a b l eaf l e x i b l ea c c e s sm e c h a n i s m t h e p r o p o s e dt e c h n i q u e s a c h i e v ee f f i c i e n tv i d e o s e g m e n t a t i o n a n d r e p r e s e n t a t i o n o f u n d e r l y i n gv i d e os t o n e s ,a n do f f e rn e wm e a n sf o rv i d e oo r g a n i z a t i o na n db r o w s i n g 一一 塑婆奎兰堡主兰垒堡苎 第一章概述 在我们所处的时代,数字图像、视频、文字、音频和图形大量涌现,通信和网络技术 改变了人们通讯,管理和使用信息的方式。人们现在可以访问到大大超过以前的信息量。 作为多种媒体类型的信息源的i n t e m e t 的快速发展和数字图书馆的迅速增加,都是这方面 的例子。数字媒体在性质和容量方面和传统媒体有很大的不同,所以提供新的数字媒体管 理服务是个挑战性的工作。在创新性和实用化的应用方面,媒体内容的制作和获取,存储 和传输,搜索和查询,传播和产权保护等等都是重要的问题。 1 。1 研究背景 数字信息包括许多种不同性质的数据:文字、音频、图形、图像和视频等。其中,视 频是最难处理的,因为它的容量巨大,而且缺乏方便的操纵和高效的访问工具,所以带来 了很多技术上的困难。视频在娱乐,通信,教育和研究,制造方面广泛使用。和传统的文 字文档不同的是,视频内容的很多方面是不能用文字描述的,而且也不能用文字方法完全 地索引和标记出来。现在的数据库依赖于关键字来索引,组织和搜索大量的数据。因此, 在数字视频系统中需要有管理视频数据以及扩充传统的基于关键字访问模型的新的方法和 技术。 要有效地访问、理解和检索视频信息,能够自动分析视频内容的工具是必不可少的。 视频分析的一个基本任务是从视频中提取出显著的信息和视频结构,达到对视频内容的计 算机化理解。视频分析的目标是提供对视频中有关内容的快速而有意义的非线性访问。基 于内容的视频分析能让用户快速地理解视频节目的内容,可以方便用户对视频的浏览和检 索等操作。 对于浏览和视频数据库检索等应用来说,自动分析视频内容和建立起方便视频的层次 组织和语义理解的结构的方法是相当重要的。视频内容的分解和基本视频事件的检测是视 频分析的两个主要工作。这一般意味着,把整个视频分割成有意义的视频片段,并且把它 们归入预先定义好的事件类型中。视频事件可以在不同的层次上定义,比如高层次上的新 闻或广告,以及低层次上的视觉特征。视频事件可以用文字描述来建立索引,也可以用声 音和视觉等低级特征来建立索引。这样,用户可以利用内容相似性进行视频片段的检索。 浙江大学硕士学位论文 1 2 论文的主要内容 本论文讨论基于视觉内容的视频分析方面的工作。在第二章中,我们对视频分析和检 索的相关技术作了回顾,重点考察了视频分割、表示,和多特征的视频分析方面的技术和 方法。在第三章中,我们提出了基于视觉内容的视频分割和有效表示视频片段的动态特点 的关键帧集提取方法,在此基础上可以进行视频片段的匹配。提取出的关键帧集可以减少 视频片段匹配所需要的计算量,并保留匹配算法的准确性。 我们还提出了改进的视频片段快速聚类算法,该方法考虑了视频片段在时序上的特点, 把内容上相似并且时间上相近的视频片段聚类成一个视频片段组,即视频类。通过实验发 现,这种视频分析方法在识别有意义的片段方面取得良好的效果,而且为第四章的视频表 示方法提供了基础。 在第四章中,我们提出了基于故事线的视频表示方案。通过重建视频的结构和提出视 频的时序结构图表示,我们设计了对动态视频事件的分层浏览框架,使用户能够灵活地以 非线性方式访问视频内容,理解视频的故事发展。 2 - 浙江大学硕士学位论文 第二章视频分析和检索技术的回顾 随着数字信号处理技术、通信技术及超大规模集成电路技术的飞速发展,多媒体计算 技术与多媒体网络通信的融合有了重大的突破,使得数字视频的处理和系统技术成为研究 和开发的热点。但是,妨碍大规模、分布式数字视频资源的有效访问和操纵的技术障碍仍 然存在。现有的m p e g - 1 和m p e g 2 等视频压缩算法在减小带宽要求方面取得了好的结果, 但在数字视频的分析和操纵方面带来了挑战性的问题。目前,需要有处理视频分析、表示、 编辑和索引等问题的新算法和技术。 2 _ 1 数字视频管理系统 对现有的大型视频数据库,需要有快速和方便的访问机制。视频数据库有多种数据类 型,而且声音和视觉数据的处理是有难度的,并有大的复杂度。传统的视频数据检索依赖 于人工的注解。人工注解的工作是枯燥的,而且难以充分地描述声音和视觉数据。为实现 更高效的视频检索,需要有能够解决这个传统问题的方法。基于内容的多媒体数据检索提 供了高效视频检索的可能,它基于内容地访问文字、声音、图像和视频数据。 针对搜索和检索过程而进行的数字视频的高效存储和组织,称为视频的内容管理。数 字视频管理系统是管理视频中内在的多种媒体数据和提供视频访问的系统。通用的系统框 架如图2 1 所示。 _ :二二二二:二:二季露二二二:二二二二二鼍 园图图圈 羿雨i 嘲:l 蟛字挂颛世壤承继的姐峭瞧耀 3 浙江大学硕士学位论文 高效的内容管理要求具有传统数据库所不具备的新功能,视频、声音、文字、图像、 动画等信息类型的集成出现要求具有高效的维护和检索信息的方法。在数字视频数据库中 的搜索将依赖于文字、声音、和视觉的索引。使用户能方便地浏览并找到感兴趣的片段, 也需要有智能的过滤和选择机制。【i o 讨论了关于媒体管理系统的一些热门话题。数字视 频管理系统通常要具有视频数据的建模、组织、索引、检索等功能。 在数字视频中,图像数据是空间数据,音频数据是时序数据,而连续图像和动画则是 时间一空间域的数据,这些类型的媒体数据有各自的特点。此外,不同类型的视频节目有 明显的内容差异,视频的大量信息的特点又使它难以有效地管理。当集成并协调多种媒体 内容来表示视频信息时,视频访问会更有效。因此,设计视频内容的有效表示是视频数据 建模中的重要问题。在有效表示视频内容的情况下,现有的数据库系统结构也能支持视频 数据的检索。 在数字视频管理系统中,视频检索指基于特定的标准搜索视频数据库,提取和返回与 查询输入最匹配的相关视频数据。视频检索必须考虑查询界面的设计和如何处理用户的查 询。数字视频管理还必须考虑视频数据的插入、删除、修改等编辑工作。它包括向视频集 合中引入新的视频数据,从视频集合中删除已有的一些视频数据,修改视频内容和重新组 织视频数据的集合。利用自动的视频操作可以极大地减小数字视频操作消耗的时间,必须 使多种媒体类型的不同操作都能高效地实现。 在数字视频管理系统中,视频分割方法是设计自动视频索引和视频的建模、组织与检 索方法的第一步。下一节介绍视频的自动分割。 2 2 自动视频分割 视频是由称为镜头的不同视频片段编辑形成的。镜头是在段连续时间内的摄影操作 生成的连续的帧序列。视频节目中的结构就是从这个实际情况中产生出来的。一个镜头通 常表示场景中时间和空间上连贯的动作,它由几个连续记录的帧组成。每个镜头往往包含 了不同于相邻镜头的可视内容。所以,镜头是第一级的视频分割,即把视频节目分解成具 有紧密相关联内容的片段的照好概念。 因为视频是连续的基于时间的媒体,所以把视频流分割成镜头片段,就可以提供比帧 更高级的视频访问层次。镜头可以用作支持很多类型操作的基本单元。例如,在视频建模 中,镜头结构表示了视频中要提取的的低级语义。视频的理解往往要求理解镜头之间的关 - 正- 浙江大学硕士学位论文 系。在涉及到视频存储和视频检索的应用中,镜头的索引应该是一个必要的步骤。因此 数字视频好的时序分割算法对许多视频应用是有帮助的。 2 2 1 镜头边界检测 镜头可以是猷剪辑方式连接在一起的,这时相邻的镜头之间的边界是容易区分的,或 者镜头也可以通过消隐,淡入淡出,和擦拭等许多编辑模式中的某一种而连接在一起,这 样形成的是镜头之间的渐变。 由于摄影机操作( 如平移,倾斜,平移缩放) 和其他比较难以检测的因素( 如摄影机 抖动,噪声) ,一个镜头中也包含摄影机和目标的运动等可视特征。检测由摄影机引起的镜 头视频内容的变化是基于内容的视频分割的又一步。把镜头边界检测和同一个摄影机引起 的视频内容变化的检测结合起来,就可以产生执行视频分割的有效方法。 如果视频节目只由“静止镜头”组成,其中的摄影机保持固定位置、方向和放大倍率, 则可以假定帧内容在镜头中是不发生剧烈变化的。在这种情况下,一个镜头包含的可视信 息可以被个具有代表性的图象充分地表示出来。然而,视频节目既包括静止镜头,也包 括“运动镜头”,此时的摄影机经受着平移、倾斜、平移缩放、跟踪等操作。通过处理图象 序列,可以计算出摄影机操作对图象施加的效果。在具有突出的目标和摄影机运动的视频 镜头里,单个代表帧不足以精确地分析它所代表的图像集合。基于这个信息,可以对运动 镜头进一步地进行特征提取,从而可以检测出镜头中的摄影机运动和目标运动等可视特征, 并且可以选取出多于一幅的关键帧。 视频镜头是根据视频转换边界定义的,所以有必要研究视频转换的制作。视频转换是 在视频编辑制作阶段产生的。在编辑中,视频镜头是根据某些编辑决定而汇集在一起,所 以产生视频转换。根据视频编辑技术,视频转换一般有两种主要类型。如果视频编辑者不 做编辑工作,而只是把两个镜头连接在一起,这种连接被称为突然的转换,又称为镜头的 突变。另外,如果视频编辑者使用了某些特殊技术,使得镜头的连接看起来在视觉上是光 滑的,那么这样的连接是逐渐的转换,即渐变。 为了执行视频分解,每种时序视频分割方法都需要检测视频流中的两个镜头之间的转 换,把基本的转换类型进行分类,并确定镜头转换边界。一个常常做出的假定是:镜头中 的一些特征,如目标运动、颜色分布和光照,在一个镜头的相邻两帧之间不会剧烈变化, 而且不同的镜头有不同的内容特征。基于这个假设,已经提出一些利用颜色分布和运动等 一5 - 浙江大学硕士学位论文 低级视觉特征的镜头边界检测算法。 因为有消隐,淡入淡出,和擦拭等多种渐变类型,它们可能有变化的时间长度,针对 不同的视频转换类型,大多数现有的算法提出不同的解决方法。检测剪辑的视频分割算法 往往计算相邻帧间的差异并研究这个值的变化。但是目前还没有种在通用框架中处理剪 辑和各种类型的渐变的一般方法。 现有的时序视频分割方法一般是从视频帧中提取出各种低级特征,利用这些特征推导 出帧间的差异值,在这个值表现出某些非典型的行为时,标记出一处镜头转换。以下是一 些经常用到的特征 ( 1 ) 像素强度匹配 这个方法比较的是两个相邻帧的像素强度。例如,要检测第m 帧和第( m + 1 ) 帧之间的 镜头转换,就在l k 空间中计算两帧之间的距离。如果这个距离大于某个预先设置的阈值, 就确定在第m 帧发生了镜头转换。对于彩色视频序列来说,要计算三个颜色通道上的距离。 如果总的变化大于一个阈值,就确定有镜头转换发生。在像素强度匹配方法中,较难区分 出小区域中的大变化和大区域中的小变化。因此,这个方法对运动和摄像机操作敏感,可 能造成假的检测,但是它能较好地指示出镜头的转换。 此外,模板匹配方法【7 7 】比较两幅图像在同一位置的象素或区域。a r d i z z o n e 和l a c a s c i a 2 使用了多层感知器来处理两帧之间的像素差异,以决定它们是否属于同一个镜头。 ( 2 ) 颜色直方图比较 在这个方法中,两个相邻帧是根据它们的直方图进行比较。这种方法有两个变种,一 种是在p 空间中比较两帧的直方图差异的方法,称为直方图差异法( d o h ) :另一种是差异 直方图法,b 口利用两帧中一对一的像素差异构造出的直方图( h o d ) 。在差异直方图法中, 如果有较多的像素与原来的分布不同,则两帧之间的变化程度也较大。直方图差异法( d o h ) 对局部目标运动不敏感,但是它对镜头转换和全局的摄像机操作敏感。与直方图差异法( d o h ) 相比,差异直方图法( h o d ) 对局部目标运动更敏感。当属于不同镜头的直方图相似,或者 光照条件的变化使得相同镜头中的直方图有差异时,基于直方图的方法会出错。 颜色直方图在视频分割中用得最广泛【5 1 ,7 0 ,7 7 】。f e r m a n 和t e k a l p 1 3 】使用y ,u ,v 成分 的直方图差异之和。s e t h i 和p a t e l 4 6 采用了统计方法,研究差异直方图的分布,并根据不 同的分布标记出不同的转换类型。但是,只利用一个阚值难以检测突变和渐变两种镜头转 换类型。如果闽值小,会检测出过多的突变剪辑,如果阈值大,又检测不出渐变的镜头转 换。z h a n g 等人 7 7 】提出了一种两步的双阈值方法来处理单个阈值带来的问题。在第一步中, 6 , 浙江大学硕士学位论文 计算相邻帧间的颜色直方图差异,并用一个较高的阈值( 1 d 来检测突变剪辑。当帧间的差 异大于较高的阈值时,就确定有突变剪辑发生。在第二步中,他们使用了个较低的阈值( t 1 ) 来处理渐变。当相邻帧间的差异大于较低的阈值时,就计算连续帧的差异之和,当差异之 和的值大于较高的阈值( t 。) 时,就确定在当前帧发生了渐变的镜头转换。 ( 3 ) d c t 系数 m p e g 、h 2 6 1 、h2 6 3 等视频压缩的国际标准是基于d c t 变换的。频域的d c t 变换 系数是和像素域相关的。因此,d c t 系数可以用于压缩视频序列中的镜头变换检测。 z h a n g 等a 7 8 1 提出了一种匹配两个i 帧工和工中对应的d c t 系数的成对比较方法。 这类似于未压缩域中的像素强度匹配方法。这里,厶和工的i 宏块的成对的归一化绝对差 异是由下式决定的: 姒= 击善怒嚣畿揣 其中c 阮t 纠是工中块,的第k 个系数。如果d z ,大于阈值,就认为块,发生了变 化。如果发生变化的块数目大于某个闽值,就确定在帧工和工之间的视频序列发生了镜头 转换。 但是,在m p e g 视频中,只有i 帧是用d c t 系数编码的,所以上述算法不能直接用 于b 帧和p 帧。为了克服这个问题,y e o 和l i u 6 5 ,6 6 1 提出了m p e g 视频中的镜头转换检 测方法。这个算法只利用d c 系数,首先,视频序列中的每个帧都构造一个d c 帧( ,:d c ) 。 在m p e g 视频中,可以从1 帧的每个块中直接获得d c 系数。对于m p e g 视频中的p 帧和 b 帧,就需要预测各个d c 系数。两个d c 帧厶。和产的差异大小之和可以作为两个视频 帧的相似性度量,即 d ( r 。,”) = fr 。( i ,) 一z ”( f ,) f 其中帧厶。p 是块p 的d c 系数。如果d ( f f 。,9 是对称滑动窗口中的最大值,或 者d 钟i 9 是窗口中第二个最大值的2 - 3 倍,就确定厶和工之间发生了镜头转换。这个 方法的执行速度快,但在具有的相似像素值和不同的密度分布的两帧之间,可能会发生剪 辑的错误检测。【6 6 】中也提出一种基于时序子采样的渐变检测方法,在每二十帧中只测试 一帧,不需要测试连续帧。这种方法对在镜头转换之前经常出现的摄像机闪光和镜头内部 变化是敏感的。 此外,k o b l a 和d o e r m a n 【2 4 】在他们的v i d e o t r a i l 系统中,从每帧的d c 系数中构成了 浙江大学硕士学位论文 一个特征矢量,并减小了矢量的维数。h a n 和t e w f i k 【1 6 在未压缩域中使用了类似的方法, 其中,从一个时间窗口内的帧中子采样得到的多组像素值用作特征矢量。p a t e l 和s e t h i 3 9 使用从m p e g 序列的d c 帧中推导出来的强度直方图。k s h e n 和d e l p 4 9 , 喟d c 系数和运 动矢量来估计颜色直方图,并处理m p e g 压缩格式的视频序列。 ( 4 ) 运动矢量特征 运动分析是视频处理的一个重要步骤。视频流是由受到视觉标志的时空分段连续性约 束的视频单元组成的。在镜头转换或新活动等事件中,连贯的视觉运动变得突然不连续。 所以运动的不连续性可以用于标记镜头的转换,和新活动的开始。 s h a h r a r a y 4 7 提出了一种检测镜头的突变和渐变的方法,它是基于对连续帧间的差异 进行运动控制的时序滤波。对第一个图像中的每个块都执行块匹配算法,找出在第二个图 像中与它匹配得“最好”的区域。用非线性统计滤波器产生全局匹配值。通过识别匹配值中 连续的低级增长,可以检测镜头的渐变。 z h a n g 等人【7 8 】提出了一种利用i v p e g 中的运动矢量的剪辑检测方法,它基于运动矢 量的数目m 。在p 帧中,m 是运动矢量的数目。在b 帧中,肘是前向和后向的非零运动数 目中的较小值。设r 是一个接近于零的闽值,则m t 有效地指示b 帧和p 帧之前或之后 存在着镜头边界。但是,这个方法在没有运动时产生错误检测。通过对发生镜头转换的b 帧两侧的两个i 帧进行归一化内积,可以改进这个方法。 m e n g 等人【3 7 基于运动信息和亮度成分的d c 系数,提出了一个视频分割算法。这个 方法首先重建p 帧的d c 系数。然后计算出i 帧和p 帧的d c 系数的方差i 盯2l 。计算三 个比值:( 1 ) k ,即p 帧中内编码块和运动补偿块的比值;( 2 ) 氏,即前向和后向运动矢量数 的比值;( 3 ) r f ,即k 的倒数。然后执行一个两步的算法。在第一步中标记可能的镜头转换 帧。如果p 帧的k 或b 帧的民值较大,就把相应帧标记为可能帧。如果i 帧的l 盯2 i 达 到极大值,而且它前面的b 帧的r f 也达到极大值,就把i 帧标记为可能帧。在第二步中, 取消淡入淡出区域中所有可能帧的标记,并检查所有带标记的帧。如果当前带标记的帧和 上一个镜头转换之间的差异大于阈值,则当前带标记的帧是真正的镜头转换帧。 k o b l a ,d o e r m a n 和l i n 2 5 使用利用压缩帧中的每种类型宏块的数目而推导得到的一个 特征值来执行剪辑的检测。 ( 5 ) 其它特征 8 - 浙江大学硕士学位论文 z a b i h ,m i l l e r 和m a i 7 5 使用帧中进入和退出的边像素数目改变的比例来进行剪辑检 测。s h e n ,l i 和s e t l l i 【4 8 利用多层h a u s d o r f f 距离直方图把这个技术用于m p e g 序列。 还有一些视频分割方法。h a m p a p u r 等人【1 5 通过研究视频制作技术,提出了一种基于 模型的方法,它针对不同编辑效果而描述不同的模型。y u 等人 7 4 1 币l j 用小波把每个帧在空 域上分解成低分辨率和高分辨率的成分,他们提取出高分辨率成分中的边谱平均特征来检 测消隐,并在低分辨率成分中利用双色差来识别淡入淡出的转换。 由于数字视频往往是以m p e g 等压缩格式存储的,而解码算法中计算量最大的部分是 反d c t ( i d c t ) 操作。如果可以在执行d c t 之前处理视频序列,就可以减少计算时间。 因此,直接处理压缩格式的视频序列的多种方法【2 5 ,3 7 ,4 9 ,6 6 已经提出来。 可以用许多策略来处理这些特征。在许多情况下,使用一个全局阈值的简单闽值方法 被用作显著性测试,而基于模型的方法是通过对镜头特性的建模来检测镜头转换 1 ,5 8 。 以上方法中的大多数需要仔细地选择阈值,并受噪声影响 2 1 】。在剪辑检测中,可以 通过把噪声建模成高斯分布来选取阈值 7 7 】,它可以设置成范围,并用于考虑帧间差异是 否足够显著。然而,渐变的闽值只能利用经验来选取。对某种视频有效的阈值不一定对某 种别的视频有效。而且,利用颜色特征时,目标运动和摄像机闪光可能会导致错误检测, 因此需要特殊处理【6 6 。 2 2 2 镜头的关键帧选取 视频镜头指的是描述时间和空间上连续事件的几个相邻视频帧的记录。关键帧是用于 描述一个镜头的具有代表性的图象帧,它反映一个镜头的主要内容。一种通常的做法是用 一个关键帧( 镜头的第一帧) 表示一个视频镜头。一般来说,在具有显著的目标或摄像机 运动和视觉效果的镜头中,一个关键帧不足以表示视频镜头的全部内容。但是用镜头中的 全部帧来表示镜头的视觉内容又会引起太大的计算量。 关键帧选取过程可以看成是在必要时把视频镜头分割成较小的单元,并且为镜头的每 个片段选取一幅代表图像。现有的关键帧选取方法可以广泛地分成三类: 均匀采样的方法。 m i n i v i d e o 系统【5 3 提供了数字视频的高效访问界面,它使用在视频镜头中用相同的 时间间隔选取的关键帧。这个方法不考虑视频镜头的内容,总是产生多个关键帧。然而, 当镜头是静态的,除了第一个关键帧,其它的关键帧都是冗余的。而且,利用均匀采样方 - 9 浙江大学硕士学位论文 法,当镜头中有大量的运动或颜色变化时,观察者对镜头的内容可能产生混淆。因此需要 利用非均匀采样的方法克服上述问题,即在颜色变化和运动剧烈时选取较多的关键帧,而 在镜头内容变化较小时选取较少的关键帧。 基于颜色的方法 基于颜色的关键帧选取方法使用直方图 6 8 ,7 9 】或小波分析【6 4 找出视频镜头中的帧间 相似性。z h a n g 等人 7 9 依据帧间的显著变化来选择多个关键帧。选取镜头中的第一帧为 关键帧,计算镜头中的剩余帧与前一个关键帧之差,如果差值大于某一个阈值,即有显著 差异,则把相应的帧也标记为关键帧。这种方法可以根据镜头内容的变化程度选择相应数 目的代表帧, 基于颜色的方法使用多种统计尺度来计算图像的差异。这些方法依赖于阚值选取。然 而,因为这些阈值只是用于比较统计量,并不和视频中的事件有语义联系,所以很难选取 出对每种视频都合适的阈值。而且,每一领域中都有大量的视频资源,视频制作技术也在 随时间而变化,所以特定领域的阈值选取方法仅可以处理某些特定类型的视频资源。此外, 基于颜色的相似性度量不能对视频镜头中由摄像机或目标运动导致的动态信息进行量化。 基于运动的方法 基于运动的关键帧选取方法更适合于基于镜头内容的时序变化来控制关键帧的数目。 一般地,基于运动的关键帧选取方法利用基于像素的图像差异【2 7 或光流计算 4 7 ,6 4 。一 种特定领域的关键帧选取方法 2 3 n 用于概括录像带视频内容。这种复杂的方法使用了 全局运动和手势分析,但把这种方法推广到别的领域比较困难。 w o l f f 6 4 j 置过光流分析( o 砸c a lf l o wa n a l y s i s ) 来计算镜头中的运动量,在运动量局部最 小处选取代表帧,它反映了视频数据中的静止,往往表示一种强调的实际情况这种方法首 先用h o r n s c h t m c k 法计算光流,对每个象素光流分量的模求和,作为第k 帧的运动量m ( k ) , 即: ( t ) = i o ,( ,j ,) o , 0 ,女) l j 其中q ( u 动是帧k 中象素( 巧) 光流的x 分量,0 “u n 是帧中象素( ) 光流的y 分量。 然后该方法寻找m ( k ) 的局部最小值。从k = o 开始,扫描m 0 ( ) k 曲线,找到两个局部最大 值m ( k 。) 和m ( k :) ,m ( k 2 ) 的值与m ( k 。) 的值至少相差p ( 由经验设定) 。如果 m ( k ,) - - m i v t ( m ) ,( k , k k ) ,则把k 3 选为代表帧。然后把k :作为当前的k 1 ,继续寻找下 一个k :。w o l f 的这种基于运动的方法可以根据镜头的结构选择相应数目的代表帧。如果先 - 1 0 - 塑翌查兰堡主兰焦笙三 把图象中的运动目标从背景中取出,再计算目标所在位置的光流,可以取得更好的效果 总的来说,关键帧选取方法需要满足以下标准:( 1 ) 利用视频中由视觉效果和摄像机 或目标运动导致的动态信息,必须能够尽可能准确完全地反映镜头中的主要事件;( 2 ) 达 到一个好的平衡,即保留镜头中尽可能多的视觉内容和时序变化,并且尽量减少高效地表 示视觉内容所需的关键帧数目。 2 3 视频内容的组织和表示 要快速查找视频的内容,应向用户提供视频内容具有代表性的层次表示。如一部半小 时的影片分别有一个文字标题、一段文字简介、一篇全文脚本、一些代表性的图像和一段 几分钟长的略览视频片段。所有这些代表性的表示构成视频内容的层信息。用户在检索时 可以先方便地查阅某一层的视频表示,再决定是否调看更丰富的视频表示。 视频内容组织和表示的第一步是把视频表现出的可视信息浓缩起来。视频内容分析首 先利用镜头边界检测把视频流分割成连续的镜头片段,并把这些片段浓缩成一个或几个关 键帧 6 8 ,7 8 ,并且根据声音和视觉特性决定镜头之间的关系,即视频内容的结构。 2 3 1 镜头级的视频组织和表示 把视频分割成镜头,用一个或几个关键帧表示视频镜头,把关键帧的集合显示成时序 序列,可以产生镜头级的视频表示。用户可以通过浏览关键帧图像的集合,而不必再象从 前那样观看整个视频节目。 目前已经有几种表示视频的商业方案 5 7 1 ,它使每个镜头的关键帧和文字描述并存, 还提供空间组合图面i ( m o s a i c ) 的界面,作为多个镜头的概括。然而,在许多视频节目中, 会有很多镜头( 例如,5 0 0 个镜头的情况是常见的) 。这种情况下,把镜头序列表示成一维 的图像数组并不能给用户高效地浏览及搜索特定视频片段的方法。如果用户从来没有看过 视频,而且不知道从哪里开始搜索图像数组,那么这种视频表示方法就带来了问题。 另一种视频内容的表示方法是根据预先定义的影片背景,区分出视频中不同的帧呈现 的内容,并为了视频表示和浏览的目的而提取出更“重要”的帧。这可以通过提取体育事件 中的重点【7 3 】,检测说明文字 6 7 】,以及识别关键字来实现。这些重要事件的检测允许浏览 长视频序列,并显著地减小浏览整个视频序列的时间。 基于关键帧的视频表示方法没有考虑视频中重要的目标( 例如,篮球节目中移动的篮 一 一一 塑垩查堂堡主堂垡笙塞 球运动员) 。基于目标的视频分割与表示方法用重要目标来表示视频镜头【5 ,8 0 ,8 4 1 。但是提 取重要目标本身是一个非常困难的问题,所以基于目标的视频表示目前仍局限于提取目标 相对比较容易的特定视频节目中。例如在新闻节目中,主持人是个重要的目标。而在网球 等特殊的体育节目中,运动员的目标分割比较简单。 2 3 2 节目级的视频组织和表示 通过确定视频节目中的场景成分之间的结构关系,也可以生成节目级的视频表示。例 如,视频镜头的时序排列和动态特点反映出视频的故事结构。考虑到这样基本的结构信息, 有必要自动地识别视频中的视觉和时序关系,并提取出视频内容的简洁表示,这在视频浏 览等应用中是有用的。目前的大多数方法利用关键帧视觉内容的相似性对镜头聚类,产生 视频的结构。 和静态图像相似的是,视频的内容常常以颜色直方图、目标形状、纹理等形式表示。 3 3 ,6 9 ,8 5 中的方法显示了基于镜头的分层的视频组织结构( 如镜头聚类树) ,其中,每个 镜头被看成视频的基本检索单元。除了关键帧以外,也可以使用镜头时序内容的变化。【7 0 中的场景转换图通过连接时间上相邻的镜头类,模仿出视频的故事流。此外,对话和m t v 等可计算的场景的表示也是一个有意义的研究问题。在静态的视频表示技术中,观察者不 能体验或观察每个场景具有的动态结构。 在节目级的视频表示中,基于文字方法的主题检测和跟踪是十分有用的。,而且在处理 大量的视频资源时,概括表示出多个视频的主题是重要的【6 0 】。目前,也提出了些集成 地利用视频、音频、文字等多种媒体来表示视频的方法【6 1 。虽然用多种媒体来表示和理 解视频是合理的,但在理解和分析各种媒体方面还要做大量的研究工作。 此外,在特定领域中的视频内容表示应用中,新闻广播节目的基于模型的视频序列分 析已经提了出来 5 2 ,7 6 】。它是基于新闻广播节目的特定模型,提取出视频序列中的特殊语 义元素。又如,在会议视频中,参与者的概括表示是很有用的。用户可以快速地观察事件 中的所有参与者,可以随意地访问每个参与者的发言。通过分析视频( 即脸 6 2 的检测与 跟踪) 、语音和文字( 包括记录文字和嵌入文字) 可以实现人的检测与识别。但是,针对不 同节目形式的视频序列的一般模型是很难建立的。这可能会把这种应用局限于某些视频节 目类型。 - 1 2 一塑里奎堂堡主兰笪笙苎 2 4 视频特征提取 镜头是视频组织和检索的最小单位。视频分割成镜头后,就要对各个镜头进行特征提 取,得到一个尽可能充分反映镜头内容的特征空间,这个特征空间将作为视频索引和检索 的依据。视频数据的特征分为静态特征和动态特征。 2 4 1 静态特征提取 静态特征的提取主要针对关键帧,可以采用通常的图象处理方法,如提取颜色特征、 纹理特征、形状和边缘特征等。 颜色特征提取颜色是用于图象相似性比较的最常用的一个特征。近年来提出了多 种基于颜色的视频索引技术【3 ,7 ,3 8 。在q b i c 3 8 、j a c o b 3 等许多系统中,都采用了颜 色直方图方法。颜色直方图是给定一个离散的颜色空间,把它分成n 个区域,每个区域取 它的中心色作为代表,计算落入每个区域内象素的个数,就得到了颜色直方图。颜色直方 图是一个n 维的特征空间。在计算颜色直方图之前,往往需要把r g b 空间通过非线性变 换,形成其它的颜色空间( 如h s v ,m n n s d l 空间) ,因为在这些空间里,颜色三元组之间 的距离更符合人眼的视觉差异。z h a n g 等人 8 1 除了采用与上述方法相似的颜色直方图方法 外,还增加了关键帧的主要颜色和平均亮度两种特征 纹理特征提取纹理是图象分类和识别的另一个主要特征,例如,森林和草地具有 不同的纹理特征。纹理分析方法可以大致分为统计型和结构型两类 3 6 ,5 4 】。其中统计方法 是找出图象的数值特征,例如傅里叶频谱特性、共生矩阵、m a r k o v 随机场模型等;结构方 法则是首先假定纹理模式由纹理基元按一定的规则排列组成,因而纹理分析就变为确定这 些基元,并定量分析它们的空间排列。单纯的结构方法仅仅适用于非常规则的图案,而实 际上图象很少具有这种规则性,因此把统计方法和结构方法结合使用,往往能取得较好的 效果。在各种纹理分析方法中,z h a n g 7 9 ,8 1 选择了t a m u r a 特征( 对比度,方向性和粗糙 度) 和同步自退化模型( s a rm o d e l ) :而j a c o b 系统 3 6 采用了边缘密度( e d g ed e n s i t y ) 的 方法,即边缘象素与总象素之比。这种方法首先把关键帧分割成四个相等的区域,然后对 每个区域分别沿0 。、4 5 。、9 0 。和1 3 5 。4 个方向计算边缘密度,从而得到一个1 6 x l 的基于 纹理的特征向量。 形状特征提取关键帧中的主要目标往往反映了视频的重要内容,这些目标可以通 过其形状来表示。形状分析首先要把目标从背景中分割出来,再使用圆形度、矩形度、矩 1 3 浙江大学硕士学位论文 等各种方法进行形状的相似性比较e 由于形状的相似性比较仍是一个很困难的问题【7 9 ,8 1 因而目前在视频处理中使用得较少。 2 4 2 运动特征提取 视频数据除了具有静态特征外,还具有运动特征。它反映了视频数据的时域变化,而 且往往是用户检索时所能给出的主要内容,例如用户可能要求检索某个目标从画面上消失 的视频片段。因此对视频数据进行特征提取时,必须研究其运动特征。 摄像机的运动往往会给视频图象带来全局的影响,例如水平移动摄像机将使所有的象 素点发生水平移动,焦距拉长会使象素点从中心向四周发散,焦距缩短会使象素点从四周 向中心会聚。在只有目标运动的视频片段中,大部分背景象素保持不变,而仅是运动目标 和被摭挡的部分会发生变化 由于运动特征无法从一幅静止的图象中获得,所以必须对视频序列进行分析。运动分 析的方法有基于光流方程的方法、基于块的方法、象素递归方法和贝叶斯方法 5 4 1 等,但 这些方法计算量都非常大。一种可以避免耗时的光流和块匹配计算方法是利用m p e g 视频 流中b 帧和p 帧的运动向量 3 9 ,7 9 】。镜头平移时,大多数的运动向量方向相同,且大小相 似:镜头推拉时,运动向量会由中心指向四周( 或由四周指向中心) 对于目标运动,大部 分运动向量为零或值很小,仅是对应于目标运动的那部分运动向量的值较大( 如图22 所示) 卜 : ,a - r , 1 4 p - ij i * 扯舡曲堍轧 :- 、:, 、 i + 图2 2 镜头操作时的运动向量 p a t e l 和s e t h i 3 9 计算b 帧和p 帧的宏块运动向量在8 个方6 3 的分布,即: 1k f j2 去印 其中f j 表示第j 个方向的运动向量所占的比例;k 是帧中宏块的总数;而印,j ) 取值 为0 或l ,指示第i 个运动向量是否在方向j 上。加上没有运动向量的块所占的比例,就得 到一个具有9 个分量的特征向量。利用这个特征向量可以将镜头分为静止、对象运动、镜 头摇动、跟踪、变焦和综合运动6 类。 z h a n g 等a 7 9 ,8 1 】计算镜头内各帧平均亮度和主要颜色的均值和方差,作为镜头运动 - 1 4 , x r k 一 浙江大学硕士学位论文 量大小的度量。他们用这种方法把新闻节目视频段分为主持人和新闻内容,并取得了良好 的效果。 视频运动特征的研究,多年来一直得到广泛的重视,己取得了不少研究成果,但到目 前为止,还有许多问题没有解决,例如大目标( 占据图像的大部分空间) 的运动与镜头的 运动难以区分,显露的被遮挡背景与运动目标难以区别,特别在光照条件发生变化时,大 多数的运动分析方法都会失效。 2 5 基于语音和多特征的视频分析 基于语音的视频分析已经提出多年。传统的方法是语音和说话者识别,即解决“谁” 说了“什么”的问题。在这个领域的多种方法中,基于h i d d e nm a r k o v 模型的框架在语音 识别和依赖于文字的说话者识别方面取得了成功,高斯混合模型适合于文字无关的说话者 识别【4 0 】。最近,更多类型的音频内容,包括不同的音乐类型,背景噪声,以及水和动物 等的一般声音,也在研究之中。s a u n d e r s 4 4 提出了一种在电台广播中区分语言和音乐的方 法。s a r a o e n o 和l e o n a r d i 4 2 把音频分成四种类型:寂静、语言、音乐和嗓音。w o l d 等人【6 3 提出了种更详细的音频内容分类方法,把音频内容分成1 0 组:动物、铃声、笑声、机器、 乐器、男声、女声、电话和水声,其中乐器声又进一步地分成几类。z h a n g 和k u o 8 2 】以层 次方式对音频内容避行分类。在较粗糙的层次上,音频数据分成语言,音乐,环境声音和 寂静。在更精细的层次上,环境声音又进一步地分成掌声、雨声、鸟鸣等类型。这些研究 也发展了模拟人类听觉和反映音频内容的特点的音频特征集合。 在视频内容分析中结合多特征的方法是最近提出来

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论