(计算机应用技术专业论文)基于关键帧的视频信息检索系统的设计与实现.pdf_第1页
(计算机应用技术专业论文)基于关键帧的视频信息检索系统的设计与实现.pdf_第2页
(计算机应用技术专业论文)基于关键帧的视频信息检索系统的设计与实现.pdf_第3页
(计算机应用技术专业论文)基于关键帧的视频信息检索系统的设计与实现.pdf_第4页
(计算机应用技术专业论文)基于关键帧的视频信息检索系统的设计与实现.pdf_第5页
已阅读5页,还剩55页未读 继续免费阅读

(计算机应用技术专业论文)基于关键帧的视频信息检索系统的设计与实现.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

中文摘要摘要:随着通信和多媒体技术的迅速发展,检索和浏览海量的多媒体数据成为日益迫切的问题。由于视频数据具有丰富的信息,难以用精确的语言来表示它的特征,因此采用传统的人工描述方法存在很大的弊端。在此背景下,可由计算机自动运算的视频信息内容特征提取和检索技术成为当前急需解决的课题。基于内容的视频检索技术( c b 乙c o n 自t - b a s e d d r e 砸e v a l ) 是其中一项可以满足上述需要的可行技术方案,也是近年来的研究热点,它主要指通过镜头检测、关键帧提取、特征提取、目标检索等步骤,获得特定的检索目标,检索结果不受个人对视频不同理解的影响。本文研究了基于内容的视频信息检索的的若干关键技术。要完成对特定视频片段的检索,视频镜头检测和镜头特征提取是两个首要问题。本文第三章对镜头检测算法进行了研究,首先介绍了传统的突变镜头检测算法和渐变镜头检测算法,并通过试验以及结果分析,总结了各种方法的优点和不足:同时介绍了传统的关键帧提取方法以及在本系统中采用的方法。第四章对检索过程中的相关反馈进行了研究,介绍了常用的相关反馈算法,并对其权重调整算法进行了改进。在以上算法研究基础之上,我们建立了一个基于关键帧的视频检索实验平台,讨论了系统的组成模块和功能,介绍了系统提供的各种检索手段,给出了一些检索实例。在检索过程中,引入相关反馈的检索方式,通过用户的参与和帮助,经过反复的迭代检索使检索结果更好的满足用户的需求关键词;基于内容的视频检索;镜头检测;关键帧提取;特征提取;相关反馈分类号:t p 3 1 1 5 2a b s l l 队c r - w i m 也e 瑚| p i da d v a n c 嚣i n m 呲“c a 虹o na l l dm l l l 岫e d i ac o m p 嘶n gt t l n o i o g i e s ,a c c 船s i l l gm a 鲳a m o u n 忸o fm l l l 缸c d i ad a 协缸b 啪i l l gar e a l i 够h o 、例e f ,t h e 珊番d sf o r 咖p n 叮捌n t 舶td 班阳c t 日i z a 虹o no fv i 鲫a li n 向吼撕o nh a 代b 湖s 由o n g l y 哪e di n 坤my e a 塔b a u o fs c 、嘲霜l 面【l i 枷o n so fm em 雏m a l锄。洲。鸺a n dt h ca i l l _ b i g 璐n a t u o fv i s u a li n :o 也1 1 h ec 白e n t b 勰。d d r 曲话v a l ( c b r :v ) 协c h n o l o g y 嘲懿剃ym t 也en d sm t i e da b o v e 觚di sah o tr e s e 疵ht o p i ci n 地n ty 侣,i tm a i l l l y 坤f b 塔t o 群艏n gt h e 删丘co b j c c t i v er e 硒v a l觚o o r d i n gt os h o td e t c c t i o n 锄dk e 舛 锄ec ) c 打a c t i ,f i t i l 坤a 【臼出o n 趾do b j e c tr e 啊v a lo c t 缸dn 地m s u l to fn 圮蟛啊v a li ln o ti n f l u e n c 。db yt h cp e f s 伽m sd i 任醯e n td 耐锄d i i l 擎t o w 棚st l l ev i d e o h lt l l i st h 鹤i s s a v e r a lk e yt e i t m o l o g i 豁f b rc b 己h a v eb e 融i 删韶t i g 曲e d f 0 rt l l ep l l r p o o fv i d d i p sr e 缸e 词,a u t o m 撕c 锄ds e m i - 棚m m a t i cm e i l l o d sf o rv i d e os h o tl o 训o n 龇l ds h o tc o n t c n tc h 觚a c t e r i z a t i 咖a m et w op r i o rs t e p s ma h a p t 盯3 ,6 r s n yw ed i s c u s ss 锄cc 0 伽0 ns h o ts e 舯a l 乜i t i o nm e t l l o d s 越l ds t i l d yt h e i ra d v a t a n g 鼯a n ds h ,t c m n i n g st l l r o u g ht l l ee x p 幽饥t s 锄dm e 缸a l y s i so ft l 】【e 删协m 锄w h i l ew ei i l 昀d u c et l l e 砌i t i o n a lk 妒劬m e 既劬c t i m e t h o d s 锄dl l l em 舭u s e di l ln l i ss y s t 锄h ic l l 印t 盯4 ,w e 蚰j d yt h er c l 洲觚a c ka l g o r i t l l l mu s e di nm em 晒v a lp r o c 鹤s ,趾dm a k eal i t n ti m p r o v 锄锄ti l lt c r m so f i 协w c i g h t a d j u s t i n ga 1 9 0 矗m m b 硒e do nm ea l 鲥血m sm 训o i l 。da b o v ei nt l i i st l l 鼯i sw cb 1 1 i l dak t 可f 池幽a s c dv i d c or e 砸e v a ls y g t 锄锄dd i s c u 站t l l ec 0 喧i l p o s i d o nm l df u n 砸o n so f t l l es y s t 锄m o d l l l e s ,i n 仃o d u c em eq l 嘲硒n gm e a mw i l i c ht l l i ss y s t 锄s u p p o n s an 啪b 盯o fq 眦f y i l l g 雏dr e 雠e v a le x p e r i m 伽【忸w i t l l 硎i m a g 铭a 坞p e r f o 衄e dt dv a l i d a t et h f i e sa b o v ca n ds o m ef e g u l 协a p r 髓m t e d ht l l es 蜘r c hp r o c e 蚪,w ca d o p tt b er e l e v a n c ef e e d b a c kr 矧e v a im e t h o d s ,锄d 也r o u g ht h ep a m c i p a t i o no fu s e 埽,a f t 盯r 印e a t e di t c r a l t i v es 俄呐w e 萨t b e t t 盯s e a r c hr e 鲫l 协t om c e tt h en e e d so f u s e 格1 ( e y w o r d s :c o n t 曲t b 船c d d r e 啊“a l ;s h o ts e 鲫e n t a t i o nm e t h o d s ;k e y 舶m ee x 仃枷o n ;f b a t l l r ce x 仃a c t i o n ;r e l e v 锄1 c ef e e d j b a c kc l a s s n o :t p 3 11 5 2致谢本论文的工作是在我的导师须德教授的悉心指导下完成的,须德教授严谨的治学态度和科学的工作方法给了我极大的帮助和影响在此衷心感谢三年来须老师对我的关心和指导宋泽海老师在学习上和生活上给予了我很大的关心和帮助,在此向宋老师表示衷心的谢意在实验室工作及撰写论文期间,李兵、冯松鹤等同学对我论文中的视频检索部分的研究工作给予了热情帮助,在此向他们表达我的感激之情。另外也感谢我的家人,他们的理解和支持使我能够在学校专心完成我的学业。l 引言1 1 研究的目的及意义由于视频的数据量巨大,需要用更大的存储空间和传输带宽,因此,在过去的很长一段时间内,基于内容的视频传输没有得到广泛的应用。随着数字技术和互联网的发展,数字视频的产生和传播变得越来越容易,视频信息己经开始逐步走入人们的日常生活中,视频数据在以前所未有的速度增长。对于网上公共社区、网上广告和网上电子商务等应用领域,视频信息极大地增强了网上站点的吸引力,其作用尤为明显。此外,数字电视、多媒体广播、可视电话、视频会议系统的出现,使数字视频的存储和传输也不再是一件困难的事,它使人们越来越感受到视频技术发展所带来的无穷魅力在视频传输和存储问题得到发展的同时,人们所面临的问题己不再是视频内容的匮乏。对于大多数用户来说,那种仅仅在站点上放置几个归e g 视频文件供下载的方式也已经远远不能满足需要了,面对浩如烟海的视频信息,用户希望能像查询文字信息那样方便快捷地对视频信息进行检索和查询,最终找出自己感兴趣的视频内容进行播放和浏览。基于内容的视频检索( 简称c b v r ) 技术正是基于这方面的迫切需求而迅速发展起来的所谓视频检索是指从大量的视频数据中找到所需要的视频片断。它是视频数据库必须具备的基本功能如果不对视频数据库内的视频数据进行自动及有效的描述,那么大量的信息将会淹没在视频数据库中,这样会造成资源的巨大浪费。因此,针对视频检索技术的研究是十分必要的我们知道,传统的c b v r 方法主要是借用基于文本数据库的检索方法,即给视频数据编号,然后对信息按设计好的格式进行严格统一的加工( 包括分类、标记关键词或索引词等人工标注工作) ,这些工作完成之后才能进行有效的检索。这种方法虽然简单,但在实际应用中却遇到了巨大的难题:一是互联网的普及导致信息量急剧增加:二是人工标注工作量大且成本太高,不可能对所有视频数据都进行这样的处理:三是视频内容丰富,很难用文字进行全面的恰当描述:四是人工标注分散进行,导致不同人对信息的主观感知不同,人的主观性、随意性和误差性对标注结果影响较大:五是传统数据库是以精确匹配为基础,对于大量非结构化的视频数据无法进行相似性检索。以上诸多因素导致传统方法在寻找多媒体信息时显得越来越难为了克服传统方法带来的问题,必须采用一种基于自身内容的能全面、客观地提取视频内容的新方法。计算机技术发展恰恰提供了人们实现这一方法的可能。利用计算机,人们可以方便的对视频数据进行处理以产生适当的摘要,从而灵活地组织视频数据,进行相应的视频查询。这种方式完全不同于传统的基于关键词的处理方法,它融合了图像理解和模式识别等新技术通过采用这种方式,人们能够更加全面地表示、处理、组织和获取视频数据。c b v r 的研究正是从这种方法出发,充分利用视频中的各种信息( 包括颜色、纹理、形状、运动矢量、亮度等等) ,实现自动或半自动的视频检索1 2 目前的研究现状视频检索研究从上世纪9 0 年代中期才成为多媒体技术研究的热点之一,至今已研究出一些基本模型和算法,也有一些视频检索数据库原型系统闯世,但系统中很多问题尚未找到公认的成熟解决方案,目前主要是处于研究阶段。国外方面,由于该领域的研究工作开展得早,因此,提出的新方法和开发出的实用检索系统较多。研究项目包括c a r n e g i em e l l o n 大学的i n f o 瑚e d i a 数字视频图书馆项目、i 蹦a l i i l a d e n 研究中心研究开发的q b i c 、美国堪萨斯大学的数字视频图书馆系统( d v l s ) 、微软研究中心等。c a r n e g i em e l l o n 大学的i n f o 瑚e d i a 数字图书馆项目由n s f ,d a r p a ,n a s a 等资助,i n f o 瑚e d i a 项目致力于研究新的方法进行自动的视频和音频的检索、浏览、检索和内容提取,并集成在一个系统中,用于教育、信息和娱乐等行业i n f o 瑚e d i a项目发展智能、自动的视频内容分析机制以普及数字视频图书馆的应用,在语音识别、图像认知、自然语言处理等领域的研究为基于内容和知识的自动检索和内容提取提供了支持i n f o r 腿d i a 项目已经研究开发的项目包括i n f o 硼e d i a i ( n s f资助的数字图书馆项目,结合了语音识别、图书认知、自然语言处理等技术,实现视频的分割和索引) ,跏1 t i l i n g u a li n f o 瑚e d i a ( 多语言i n f o r m e d i a 项目开发了自动的系统和工具,用于实现多语言和多媒体信息的捕捉、检索、提取等) 。i 叫a 1 衄d e n 研究中心研究开发的q b i c ( q u e r yb yi 唿g ec o n t e n t ) ,是基于内容检索系统的典型代表。q b i c 系统允许使用例子图像、用户构建的草图和图画、选择的颜色和纹理模式、镜头和目标运动和其他图形信息等,对大型图像和视频数据库进行查询。美国哥伦比亚大学开发的基于内容检索原型系统v i s u a i s e e k 图像查询系统和2w e b s e e k 图像及视频搜索引擎系统该系统的主要特点是用到了图像区域的空间关系查询和直接从压缩数据中提取视觉特征所用到的视觉特征有颜色集、纹理特征的小波变换为了加快检索过程,还开发了基于二叉数的索引算法美国堪萨斯大学的数字视频图书馆系统( d v l s ) 的目标是存储,索引及检索视频信息并通过因特网及国家信息基础设施实现视频共享的技术,己建立了一个称为v i s l 0 n 的原型系统及一个视频数据库,数据库中包含了有1 0 0 0 多小时的由多个广播通讯公司提供的视频信息。国内方面,由于在该领域的研究起步较晚,技术水平相对滞后,所以,大规模的、用于相关领域的应用系统还不多,难以满足视频点播、医疗、军事等领域对视频处理的要求,但这种情况己经引起了国内研究人员的广泛关注,研究氛围十分浓厚,也取得了一些不错的研究成果例如,国防科技大学多媒体研究中心和系统工程系研究开发出了新闻节目浏览检索系统( n e w v e d i oc a r ) 和多媒体信息查询和检索系( m i r c ) 。此外,为提高自身的研究水平,促进相互间学术交流,达到优势互补,实现共同提高,国内的研究机构还纷纷同国外同行开展了一系列成功的合作。例如,清华大学计算机系和新南威尔士大学计算机系在图像和视频检索方面进行了合作:浙江大学计算机系和美国伊利诺其大学合作进行的基于语义联想支撑的视频检索研究等,其研究的前沿很多都己经转移到接近人的行为识别分析、视频语义和情感特征提取等方面目前,视频检索在低级的语法分析上已经发展得十分成熟,低级的语法分析包括镜头分割,代表帧选取、视频聚类等基于内容的视频检索慢慢开始从低级的语法分析转向高级的语义分析。m p e g 7 标准其目标就是实现集高层语义特征和低层视觉特征的基于内容的多特征综合检索,今后研究的热点之一将是高层的基于语义内容的视频检索从以上国内外的研究现状和一些产品来看,有一些问题还有待解决:( 1 ) 算法有待改进由于视频的数据量大,处理时间长,算法处理的速度很重要因此提高视频检索算法和特征提取算法就成了研究的方向之一( 2 ) 检索效果的评价尚没有标准视频检索效果评价主要使用的是查全率和查准率两个指标用户在评价算法的时候,可以预先选定含有特定目标的视频作为一组相关的视频,然后根据返回的结果计算查全率和查准率。查全率和查准率越高,说明该检索算法的效果越好。( 3 ) 视频的检索反馈。基于内容的视频检索系统中,最常用的检索方式是例子视频查询,即用户提交一段视频,系统返回相似的一系列视频,但怎样定义两段视频是相似的仍然是困难的问题,这限制了检索系统的应用范围。而且由于视频内容的复杂性,不同用户在检索过程中,即使对同一段视频,其注重的角度3也有可能不同,因此接受用户的反馈意见,当用户对查询结果不满意时可以优化查询结果,突出用户的需要,这仍需要进一步深入研究( 4 ) 视频多特征的综合检索方法基于内容视频检索还要解决多种检索手段相结合的问题,以提高检索的效率对于单一特征检索手段,由于其约束信息不足,在返回目标视频的同时往往会返回大量其他也满足此检索要求的视频。采用多个检索手段相结合的方法无疑可提供更多的约束而使得返回视频中目标视频的比率得到提高,但检索手段间的融合是所要解决的问题1 3 本文的研究内容本文以研究c b v r 中基于关键帧的分析与检索为主要内容,从视频处理的层次化结构最底层的分析入手,通过利用d i r e c t s h o w 技术对原始视频进行镜头检测、关键帧选取并保存入视频数据库,首先通过镜头检测将视频帧序列分解为单个镜头,对每个镜头根据其内容提取一定数量的关键帧,存入数据库中然后对关键帧进行特征提取,保存在特征数据库中用户通过给出预查询的示例图像,系统在关键帧库中比较与示例图像的相似度,根据一定的相似匹配方式,输出最相似匹配结果。在检索过程中,引入相关反馈的检索方式,通过用户的参与和帮助,经过反复的迭代检索使检索结果更好的满足用户的需求。如图卜l 所示为研究内容的基本流程框架。图卜l 基于关键帧的视频检索的基本流程f i g u r el lt h eb a s i cp r o c e s so fv i d e or e t r i e v a lb a s e do nk e y f r a m e41 4 本文的组织本文的内容按如下方式组织:第二章先是介绍了视频数据的特点、视频数据的层次化结构、基于内容的视频检索的特点以及视频检索中的关键技术等基本知识第三章对镜头变换检测算法进行了研究,本文第三章对镜头检测算法进行了研究,首先介绍了传统的突变镜头检测算法和渐变镜头检测算法,并通过试验以及结果分析,总结了各种方法的优点和不足;同时介绍了传统的关键帧提取方法以及在本系统中采用的方法。在本章最后一节给出了结合d i 根:t s h o w 技术直接对视频而不是图像帧序列进行镜头检测的方法第四章对检索过程中的交互反馈进行了研究,介绍了相关反馈在图像检索中的两种主要策略。在详细介绍了r u i 的权重调整算法后,通过对此算法的仔细研究,本文提出了其中的不足之处,并在第三节中给出了其改进方法第五章介绍了作者实现的基于关键帧的视频检索系统体系结构、实现方式以及功能模块,并且在其中验证了以上几章节中的算法第六章对本文的研究工作做了一下总结,并对未来的基于内容视频检索领域作了一下前景展望,提出了下一步的工作方向52 视频检索技术综述基于内容的视频检索指根据视频的语义特征进行检索,以提取出与特征相符或相似的视频数据。涉及到数据库、图像处理、视频格式、检索技术等多方面的技术,有着广泛的应用前景。2 1 视频数据的层次化结构视频数据是视频数据库存储的对象。为了从视频数据库中方便的检索视频对象,视频数据均应以一定的结构存储。我们常把送入计算机中的一段视频数据称为原始视频流( r 矗wv i d e os h 瑚m ) 在组织视频数据时一般可以使用不同的视频单元,如可通过帧、镜头、场景等概念来描述。视频帧( f r 锄e ) 是一幅静态图像,是组成视频的最小视觉单位,将时间上连续的帧序列合并到一起便形成了动态视频。视频镜头( s h o t ) 由一系列帧组成的一段视频,它描绘一个故事或一组摄像机的连续动作。视频场景( s c e n e ) 可能包含多个镜头,针对的是同一个环境下的一批对象,但拍摄的角度和手法可能不同,通过组织形成一个故事情节,表达了一定的语义内容任何视频都是由一个个经过编辑的镜头衔接而成的,被编辑过的镜头是视频中基本的动态表达单位,往下就是镜头中的静态视频帧序列,往上就是表达一定内容及意义的场景片段其层次结构如图2 - l 所示不素巨( x y ,t )图2 一l 视频数据的层次化结构f i g m 它2 lt h eh i e r a r c h i c a ls t r u c t u r eo fv i d e od a t a2 2 基于内容的视频检索的特点基于内容的视频检索从检索过程上讲与传统数据库中的检索方法是一样的,也包括查询说明、查询处理、结果返回,但是基于内容的视频检索所面对的是视频6数据,其处理过程更为复杂传统数值字符型数据的查询则是直接针对具体数据,因此可直接通过对数值的说明来进行查询处理。而基于内容的视频处理必须对视频数据进行处理才能用于检索传统数据的检索由于面对的是单纯的数值字符型数据,查询也是针对这种字符数值数据进行的,对于这种数据的检索不需要进行预处理,而视频数据是长媒体数据,要能够对视频进行基于内容的检索即是对视频进行视频特征匹配由于视频特征并不直接存在于视频数据中,因此必须先对视频进行一系列特定的预处理来获得所需的视频特征,因此视频数据的预处理过程是视频数据检索不同于传统数据检索的基本点,也是视频检索的基础用户在对视频进行基于内容的检索时,由于用户无法知道这些特征的数值,因此对视频特征的匹配不再是纯字符的匹配算法,而是能够满足检索要求的模糊检索算法由于视频信息检索是一种模糊检索问题,因此其结果不是单一的,经过模糊查询处理后,返回的是一系列与用户查询要求相关的对象,这些对象必须以相似度的大小排序,让用户知道哪些是与他查询要求最相近的结果。如果结果不符合用户的要求,用户可以重新调整查询要求,或者缩小查寻范围,以逐步得到更精确的结果由于基于内容的视频检索的模糊性,因此其查询说明不再局限于传统的查询语言,它可以是多种多样的,既可以是精确的( 如查询格式化数据) ,也可以是模糊的( 如用户给出某个特征一定相似度的查询) ,但最多的是q b e ( q u e r yb 嬲c de x 锄p l e ) 示例查询。用户可以选择某个例子,这个例子往往是从可视化的列表中选择的,同时用户还可以给它赋以一定的权重。当然由于视频内容并不是可以简单描述的,所以视频检索的查询说明还可以是多种方式的组合2 3 基于内容的视频检索的关键技术视频检索系统是一个复杂的综合的系统,涉及到数据库、图像处理、视频格式、检索技术等多方面的内容,对于一个视频检索系统,决定其性能的主要关键技术如下“1 :( 1 ) 镜头检测技术在视频检索系统中,视频进入数据库之前,需要将非结构化的视频数据进行结构化处理,才能对其进行检索、查询等操作,对应于该步骤的技术就是视频的镜头检测技术,因此镜头检测在整个视频检索中起到至关重要的作用。成为结构化的镜头之后,所涉及的主要技术是关键帧的提取。如果关键帧提取不好,就不能有效代表一个镜头的内容,既使特征提取非常正确,用户也无法正确检索到需7要的目标视频。关键帧提取技术也是建立基于内容的视频检索系统的一项重要计未。( 2 ) 镜头聚类技术镜头检测主要是基于视觉特征进行的,所得到的结果与视频的语义描述还有一定的距离。为了描述视频中的有语义意义的事件或者活动需要构建更高层次的与内容相关的镜头聚类这既要考虑各种视频单元( 如场景、情节、故事单元) ,也要考虑不同的聚类方法,还要考虑具体的应用( 3 ) 视频数据库的组织和索引技术多媒体信息常是非结构化的,对这些非结构化的数据要结构化才能有效的进行利用在镜头检测和聚类的基础上,进一步提取有意义的视频对象和其他感兴趣的信息,使视频数据从线性的无组织的状态转化成容易进行高层处理的有组织的数据对实现基于内容的视频检索至关重要因此要借助数据库技术,利用高效的特征数据库索引机制,为用户提供快速的特征查询。其中,索引根据特定属性对数据库中数据进行排序,从而可提高对数据库中数据访问的效率与传统的字符型数据库系统相比,视频数据库索引要困难和复杂的多。首先,在传统的数据库管理系统中,通常选择一个或多个能够识别数据的关键域( 或属性) ,但在视频数据库中,按照什么索引是不清楚也不容易确定的,例如可以按视听特征索引,也可按注释索弓l ,还可按视频所包含的其他信息索引此外,不像文本数据,基于内容的视频数据索引很难自动生成对于视频来说,有很多难以用字符和数字符号描述的内容线索,如视频中的运动、帧图像中某一对象的形状、颜色和纹理等当用户要利用这些线索对数据进行检索时,就不得不首先将其人工转化为文本或关键词形式,但这种转换带有一定的主观性,且极其费时。现在,网络和数据库中的视频数据量非常庞大,人们在应用中不仅要求数据库及其他信息系统能对视频进行存储以及进行基于关键字的检索,而且要求对视频数据进行自动语义分析、表达和检索所谓基于内容的检索就是指根据媒体和媒体对象的内容语义以及上下文联系进行检索。然而,虽然视频数据包含极其丰富的语义内容,但在物理层次上,视频是二维象素阵列的时间序列,与语义内容并不直接相关。因此,要实现基于内容的检索,必须突破传统的基于一个或多个关键域( 或属性) 建立索引和基于表达式索引的局限,直接对视频内容进行分析,抽取特征和语义,并利用这些内容特征建立索引。( 4 ) 面向查询检索的特征提取和匹配技术如何提取与人们对视频数据内容主观理解相符合的视觉特征,如何使特征之间的相似度与实际人们的视觉感受相吻合,是对视频进行查询所必须解决的问题。另外,针对不同应用选择合适的特征和灵活的视频查询手段也是十分重要的。在基于内容的视频检索系统中,特征提取主要是针对关键帧进行,最常用的特征就是关键帧的底层特征,包括颜色特征、纹理特征、形状特征等( 5 ) 相关反馈视频检索系统的最终用户是人,由于视频内容的复杂性,及不同用户对于视频的不同理解,根据用户提供的视频特征检索到的结果或者部分结果有可能不是用户需要的为了提高检索的精度,人们认识到,在视频检索过程中需要用户的参与和帮助,经过反复的迭代检索才能使检索结果更好的满足用户的需求为了把用户模型嵌入到视频检索系统中,近年来出现了相关反馈( r e l e v a n c ef b 础b a c k )检索方法相关反馈是指根据用户对结果的一个评价,系统自动更新检索结果群,使其更符合用户的要求,达到逐步求精的目的。目前,相关反馈技术在文本检索、图像检索、视频检索中都有广泛应用。( 6 ) 用户接口的支持我们在检索字符数据时,接口常常十分简单,只需输入一个字符串或几个字符串,这是因为对字符数值类型数据查询时,查询条件的输入及结果的表达都是十分明确的,一般都可以用关系表格的形式描述。但是在视频数据检索中,对视频内容、时闻及空间的描述、查找以及结果的浏览及表现均要求采取新的方法,使用户可以很方便地描述查询需求并得到相应的数据,此时检索系统不是简单地接受用户的描述,而要协助用户描述其查询的思路及内容,并在用户接口上表达出来;查询结果也不是简单的表格,而是要把视频数据直观地表达出来,给出结果的叙事表达因此,基于内容的视频信息检索系统是一个互动的过程,要能够为用户提供友好的交互界面、多样化的查询手段、方便快速的浏览和导航能力。2 4 本章小结第二章主要介绍了视频数据的特点及其层次化结构,在此基础上分析了基于内容的视频检索的特点,研究了建立一个高效的基于内容的视频检索系统所要涉及到的若干关键技术。93 镜头检测及关键帧提取在视频检索系统中,视频进入数据库之前需要将非结构化的视频数据进行结构化处理,才能对其进行检索、查询等操作,对应于该步骤的技术就是视频的镜头检测技术,因此镜头检测在整个视频检索中起到至关重要的作用成为结构化的镜头之后,所涉及的主要技术是关键帧的提取,如果关键帧提取不好,就不能有效代表一个镜头的内容,即使特征提取非常正确,用户也无法正确检索到需要的目标视频,因此关键帧提取技术也是建立基于内容的视频检索系统的一项重要技术。3 1 镜头检测技术概述对视频进行有效的组织,需要将视频分解为若干有意义的单元。一般认为视频的基本物理单元是镜头( s h o t ) 。所谓镜头,是指摄像机的一次操作所摄制的视频图像。任何一段视频数据流都是由许多镜头组成的,镜头是视频数据的基本单元大部分视频是通过编辑一个个镜头连接而成的,所以基于内容检索的视频处理首先要把视频自动地分割为一个个镜头作为基本的索引单元,这个过程就称为镜头边界的检测它是基于内容视频检索的第一步,直接影响到视频检索的成败。镜头边界的类型一般可以分为突变型和渐变型两种。两个镜头间的突变是将两个镜头直接连接在一起得到的,中间没有使用任何摄影编辑效果。突变一般对应在两帧图像问某种模式( 由于场景亮度或者颜色的改变,目标或背景的运动,边缘轮廓的变化等产生造成) 的突变。在同一场景下,亮度的突然变化主要有两个原因,一是照明的变化( 如开灯闪光) ,一是景物的( 快速) 移动。在不同的场景下,亮度的突然变化则主要是由场景自身的变化产生的。不过在实际中,一般很难知道亮度的变化具体是由于上述哪一个原因( 包括照明变化、景物运动、场景变化) 产生的。渐变又可分为许多种,主要包括溶解( d i s s o l v e ) 、淡入( f a d ei n ) 、淡出( f a d e o u t ) 和扫换( w i p e ) 等。淡入对应将一个镜头不断变亮,直至最后一帧变得完全白色( 实际中到达正常显示就停止了) 的光学过程。淡出对应将一个镜头不断变暗( 一般也持续l o 多帧) ,直至最后一帧变得完全黑色的过程。叠化可看作一个淡入镜头和淡出镜头的叠加。目前的镜头检测方法可以分为三大类叫啪,即基于解压的全图像序列的识别方法、直接基于压缩视频的识别方法和基于确定变换模型的识别方法。第一类方法是完全基于图像处理技术的,其基本思想是对全解压缩的帧图像序列通过帧间比较的方法来识别镜头的突变和渐变。这一类方法是视频分段技术中重要和基础的方法之l o一其它类型的方法往往需要用到它的一些基本技术;第二类方法则是直接利用压缩数据中的某些信息,如d c t 系数和运动矢量等进行分段,可以大大减少视频分析和处理的计算量;第三类它通过建立镜头变换的精确数学模型来帮助提高镜头变换识别率和识别速度,其优点是可以建立一套基于数学模型的系统的方法,而且对于特定领域( 如新闻) 的视频图像可以通过在数学模型上加上一定的限制条件来提高方法的有效性,这一类方法的表现主要取决于所基于的数学模型,我们这里主要研究的是非压缩域的视频镜头检测方法。3 2 突变镜头检测算法对镜头突变的检测目前都采用类似图像分割中基于边界的方法,即利用镜头间的不连续性基本思路是寻找视频中相邻两个镜头之间明显的特征差别,这里的关键是选取合适的图象特征,计算特征值并利用特征值的不同将镜头分开具体可依次计算相邻两帧间的差别,当差别超过预定的阙值时,判定得到镜头边界,并将视频切断。下面主要介绍几种常见的突变镜头检测算法“1 3 2 1 模板匹配算法模板匹配是指对相邻两帧相同位置的象素灰度值或颜色值进行比较,并计算两帧图象灰度差或颜色差的密度例如:若两帧图象和,。,当这两幅图象大小均为m n ,对应象素点坐标( x ,y ) 的象素个数分别为为只o ,y ) 和( 而力时,模板匹配的公式如下:5 了,j q ,k 1 ) = 垒静3 1 其中厂。 1 孵伉j ,) 一最t “州 t 1t l 是给定的一个阈值。【oo l h e n i 当d ( l ,k ) 的值超过预先给定的阙值t ( 0 t 1 ) 时,就断定有突变镜头出现这类方法是基于颜色的图象匹配的最简单的方法,但是模板匹配的计算方法与图象象素的位置密切相关。因此用这种方法进行镜头变换检测容易对噪声和物体运动十分敏感,会产生误判断,所以我们通常不会采用单纯模板匹配的方法3 2 2 颜色直方图匹配算法颜色直方图匹配是把两幅图象的颜色直方图进行比较,若相邻两帧和j 。的颜色直方图为何。和羁。,图象大小均为m n ,假设图象的颜色( 或灰度) 由n 级组成,则颜色直方图匹配的计算方法如下:上i e ( 的一珥+ t ( 七) id 弛,) = 址西赢矿一( 3 2 )对于r g b 图象,由于图象颜色是由r ( 红色) 、g ( 绿色) 、b ( 蓝色) 三基色组成,因此公式( 3 - 2 ) 可以改写成公式( 3 3 ) :( i 研一巩( 七) | + f 群一峨( 七) i + l 研( d 一硪( 七) i )弛,o - ) = 掣磊五夏面一( 3 3 )当d ( ,o 。) 或d 。( ,k 。) 的值超过预先给定的阈值t ( o t 1 ) 时,就断定有突变镜头出现。基于颜色直方图匹配算法有如下优点:首先,对噪声和小物体运动不敏感,比模板匹配优越;其次,对于颜色分布明显不同的两幅图象,能够达到较好的检测效果。尽管如此,由于颜色直方图丢失了图象颜色的位置信息,因此两幅图象可能内容完全不同但直方图相似因此,单纯用图象颜色直方图匹配也可能会造成误判断有一种改进的方法,即把图象划分成若干子块,分别对各子块进行颜色直方图匹配,舍弃差别最大的一对子块比较值,其余的比较结果参与最后的识别由于各子块的位置固定,因此各子块的颜色直方图在一定程度上反映的图象颜色的位置特征另外,舍弃了最大的一对子块比较值,其目的是为了忽略大物体运动对比较结果产生的影响所以予块划分与颜色直方图匹配结合可以对物体运动、摄像机运动、镜头缩放等有着更好的适应性公式如下:厂,1i d 烈j 赢,的l m a x ( d _ 烈,o 。,动)d ( ,) = 地l l _ 一( 3 4 )r j瞄,。u ) 一日。u ) |( ,七) = 盟1 万一( 3 5 )其中r 是将图象分成的总块数,日。( d 是图象的第k 块的颜色直方图,n为直方图的颜色等级,t 是图象的第k 块包含的象素个数。很明显d ( ,k ) 在o和l 之间。3 2 3 2 直方图匹配算法x 2 直方图匹配的公式如下,各参数与颜色直方图匹配相同:1 2撕= 喜蒜总慧c s 咱,当d ( ,。l ) 或的值超过预先给定的阈值t ( o t k 宰d 2 ,k 为正系数该方法由于利用了在突变位置附近的局部信息,检测效果比全局阙值法有相当大的提高。3 3 渐变镜头检测算法对渐变的检测可参照前面对突交的检测进行事实上,有许多突变检测算法也可用来检测渐变。但另一方面渐变也有自身的特点,所以也有许多专门用于渐变检测的方法,下面简单介绍几种渐变检测的算法。3 3 1 双阈值法双阈值法嘲是一种经典的通用镜头检测方法,可以检测出突变镜头和渐变镜头。根据前面突变镜头检测的介绍,当前后两帧的帧问差超过阈值时,则认为此处有一个突变,可将此方法推广到渐变检测中。帧间差在渐变处要比在镜头内部高,但比在突变处要低很多为此,需要设置高低两个阈值正和石顺序考察帧问差,如果超过了瓦,就认为是检测到一个突变。如果没有超过瓦,但超过了石,就认为检测到了一个可能的渐变起始帧,并继续向后检测,如果仍超过z ,则将帧间差累加,直至帧间差低于乃若此时累计的帧间差超过了瓦,则认为是检测到渐变的结束帧,否则认为刚才那些超过z 的帧间差是由于其他原因( 如光照变化和运动等) 造成的,不是渐变这个过程如图3 一l 所示图3 一l 双阈值方法f i g u r e3 1d u a l t h r e s h 0 1 dm e t h o d虽然双阈值法可以同时检测突变和渐变,而且具体实现也比较简单,但仍然存在以下几个问题:( 1 ) 在帧间差累积过程中,未必能找到递增序列的终止点。可能出现的情况是:即使渐变过程已经结束,帧间差可能还是超过z ,则有可能造成漏检;( 2 ) 没有考虑在渐变内部也存在帧问距离小于z 的情形,此时,容易在渐变未结束却满足累计的帧问差超过了墨时判定渐变结束可以设定一个容忍值0 ,如果渐变检测中累计出现这样情况的帧数不大于州“,仍然对其继续进行渐变检测:( 3 ) 不能确定渐变的起始点,因为渐变时的帧间差和非渐变时相差并不是很大,使得低阈值z 不容易确定,因此难以确定相应的渐变起始点。3 3 2 基于边缘的方法这种方法的基本思想是基于一个简单的现象:在镜头切换、淡入淡出或者叠化对,总有新边缘出现或者旧边缘消失可以把消失的旧边缘称为“出边缘把新出现的边缘称为。入边缘”定义连续两帧图像中后一帧图像相对于前一帧图像新进入的边缘象素数“,刚消失的边缘象素数为“一如果n i 或n o 的值有孤立的峰表明该处有切变,如果没有孤立峰,但有连续的较大值,则有可能是渐变,检测窗口中的局部最大值就提供了渐变的线索。通过比较n i 和n o 的相对值可以进一步区分淡入( n i n o ) ,淡出( n i n o ,n i o p t i o n s ”,在弹出的哪i s 对话框中选择d i r e c t o r i 懿选项卡,看看h l d u d e f i l 髂和l i b 删r y 丘1 嚣中是否包含有d i r e c t xs d k的i n c l u d e 路径和l i b 路径,如果没有,将这两个路径添加上去即可。( 2 ) 在实现获取视频帧序列的过程中,我们通过m e d i a d e t e c t o r 对象提供的接口i d i a d e t 来实现的,这个接口包含了一些方法能够从媒体源文件中提取一些重要信息,比如媒体类型、帧速率甚至是视频流的单个帧要正确使用i m e d i a d e t 接口,工程中需要包含下列文件:头文件;d s h o w h ,q e d i t h库文件:s t 彻i i d s 1 i b因为使用c c o m p t r 模板来声明接口实例,所以还要在工程中包a t l b a s e h头文件下面我们将一步步利用i m e d i a d e t 接口实现获取视频中单个帧图像以及整个帧序列的函数功能。b o o lg e t i m a g e f r o m m e d i a a s d i b a r r a y ( c s t r i n gs t r m e d i a f 订e n 锄e ,d i b a r r a y & p d i b a r r a y i n t m h e i g h t ,i n t m w i d t h ,b y t e & m p b u f 蕾e r ,i n t & m b u f 诧r l e n ,d o u b l er e f t i m e ) ;第一步:在函数体内创建i h e d i a d e t 接口实例,创建实例需要调用c o c r e a t e i n s t a n c e 函数,并给函数的第一个参数传入c l s i d m e d i a d e t 类标识符,从视频文件中读取相应时间的帧图片象素数组信息:第二步:选择要进行镜头检测的视频文件,调用i m e d i a d e t :p u t f i l e n a m c方法为接口指定一个媒体文件,该方法只有一个参数,这个参数描述了媒体文件的路径,注意参数类型为b s t r ;第三步:调用l m e d i a d e t :p u ic u r r e n t s t r e a m 方法定位影片文件输出的视频流;第四步:调用i m e d i a d e t :g e t - s t r e 锄m e d i a t y p c 方法得到一个v i d e o i n f o r h e a d e r 结构,这个结构与当前指定的视频流关联v i d e o i n f o r h e a d e r 结构中包含有一个b i t m a p i n f o r h e a d e r 结构类型的成员,它描述了视频影像对应位图的尺寸、颜色等有用的信息。第五步:调用i m e d i a d e t :g e t b i t m a p b i t s 方法,只需要给第一个参数传递一个合适的时问托f i i m e 即可获得相应的帧图像的象素信息从内存缓冲区中读取象素r g b 值存入到d b a r r a y 结构体中,即可以在后续工作中对此图像进行一系列的操作【们。3 6 3 基于d i r e c t s h o w 的视频镜头检测方法上节我们介绍了利用d i c t s h o w 直接从原始视频中获取帧图像的方法,本节我们结合此方法介绍利用d i r e c t s h o w 直接在原始视频的基础上进行镜头检测的方法,图3 6 给出了其程序的流程图。图3 6 基于d i r e c t s h 册的视频镜头检测的流程图f i g u r e3 6f l o w c h a r to fv i d e od e t e c t i o nb a s e do nd i r e c t s h o w3 7 本章小结本章对镜头变换检测算法进行了研究,首先介绍了传统的突变镜头检测算法和渐变镜头检测算法,并通过试验以及结果分析,总结了各种方法的优点和不足:同时介绍了传统的关键帧提取方法以及在本系统中采用的方法。在最后一节中对d i r e c t s h 钾做了介绍,这是系统对于视频文件进行控制( 如播放、暂停、停止、快进) 的支撑平台,文中特别介绍了如何用d i r e c t s h 删获取视频流中的单帧图像,并给出了在此基础上进行镜头检测的流程图4 视频检索中的相关反馈在基于内容的视频检索系统中,反馈是调整技术以适应用户需求和提高检索精度的常用手段特别是在借助语义概念进行的检索中,反馈是实现人机交互,从而将用户知识结合进查询中去的重要方法。目前检索系统多数采用的描述方法还主要是基于低层视觉特征的方法,这些方法主要有两个主要的问题“”:( 1 ) 对同一种特征人们提出了许多种表达,以纹理特征为例,表达此特征的方法包括灰度直方图的矩、灰度共生矩阵、t 锄u r a 纹理特征等,但很难说哪种表达最好。为全面描述图像特征,综合利用多种描述特征是必要的,但要对不同的特征进行有效的加权,也需要用户具有许多低层特征的全面知识,这在实际中是不现实的。( 2 ) 高层概念和低层特征问的缺口使用低层特征的检索方法认为从高层概念到低层特征的映射很容易由用户完成,即认为用低层的特征可以很方便的建立起到高层的概念这种假设在有些情况下是成立的,如提到“十五的月亮”,人们容易想到它的颜色和形状。但这些假设在许多情况下并不成立,如提到“漂亮的衣服”,人们很难猜测它的颜色、长短或尺寸。反过来,也很难仅指定一些颜色、纹理或形状的数值来构建一件“漂亮的衣服”考虑到基于低层特征进行检索存在的问题,在视频检索过程中,期望通过一次搜索就找到需要的视频信息通常是不现实的,需要用户的参与和帮助,经过反复的迭代检索才能使检索结果更好的满足用户的需求。为了把用户模型嵌入到检索系统中,近年来出现了相关反馈( r e l e v a n c ef e e d b a c k ) 检索方法。相关反馈方法的基

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论