(通信与信息系统专业论文)基于内容新闻视频解析关键技术研究.pdf_第1页
(通信与信息系统专业论文)基于内容新闻视频解析关键技术研究.pdf_第2页
(通信与信息系统专业论文)基于内容新闻视频解析关键技术研究.pdf_第3页
(通信与信息系统专业论文)基于内容新闻视频解析关键技术研究.pdf_第4页
(通信与信息系统专业论文)基于内容新闻视频解析关键技术研究.pdf_第5页
已阅读5页,还剩140页未读 继续免费阅读

(通信与信息系统专业论文)基于内容新闻视频解析关键技术研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要近些年来,随着计算机技术、宽带网络、视频压缩技术、视频点播、网络电视等技术的推广和普及,数字视频已经广泛地应用于广播、教育、娱乐、医疗服以及监控等领域。与传统的文本信息相比,视频具有生动、表现力强和信息量大等特点。但视频的数据结构复杂、数据量巨大、内容不透明,这给面向视频的浏览和检索带来了很大不便。如何有效地理解和组织视频数据,使人们方便快捷地从大量视频数据中找到自己感兴趣的视频片断,是一个急待解决的问题。基于内容的视频检索是解决这一问题的关键( c a v r ) 。实现c b v r 的第一步是提取视频中的层次结构和语义信息,完成这一功能的技术统称为视频解析。视频解析是实现视频摘要和视频索引的基础和前提,是c b v r 中的关键步骤之一。作为一种重要的视频类型,新闻视频是人们获取信息的重要来源之一。新闻视频具有独特的结构特点,含有丰富的语义信息。基于内容的新闻视频解析是当前c b v r 领域中的一个热点问题。本文对基于内容新闻视频解析中的部分关键技术进行了深入的研究,提出了一些卓有成效的方法。本文的主要研究工作概括如下:首先介绍了c b v r 产生的背景、意义、以及当前研究现状。然后根据层次结构模型和叙事结构模型,介绍了新闻视频的结构特点。在此基础上,给出了一种基于内容新闻视频解析框架,它包括层次结构划分和特定对象提取两部分。简要介绍了该框架下各项关键技术的研究内容。第三章介绍了与新闻视频层次结构划分相关的关键技术。首先提出了一套镜头转换检测方案。它包括闪光灯效应检测、镜头切换检测和镜头叠化检n - - 部分。提出了一种基于模型的闪光灯效应检测算法,使用它可以有效地检测渐变闪光灯效应和连续闪光灯效应。提出了一种改进的镜头切换检测算法。去除了闪光灯效应的干扰,使用中值滤波技术降低了镜头内部物体摄像机运动造成的影响,显著减少了误检;只选用非零特征对用于f c m 聚类,减少了聚类过程的计算量。提出了一种改进的镜头叠化检测算法。从一般叠化模型出发,使用隔帧帧问差考察叠化过程的“多帧变化一致性”特征;首次提出了一种“叠化块分布率”特征,使用它区分镜头叠化和镜头内部局部区域叠化转换。与已有叠化检测方法j相比,所提方法的查全率和准确率都有所提高。在镜头转换检测基础上,提出了种改进的基于镜头聚类的播音员镜头检测算法。采用一种新的子区域划分方案计算镜头间距离,有效降低了同类播音员镜头间局部区域内容显著变化的影响;首次提出了一种“类内镜头跨度”特征,使用它去除由伪播音员镜头类引起的误检。与已有方法相比,所提方法的查全率有明显提高。第四章介绍了新闻视频中字幕文本和静态标识两类特定对象的提取。提出了一整套字幕文本提取实现方案,它包括字幕事件检测、字幕区域检测、字幕定位和字幕文本分割四个步骤。首先提出一种基于多帧信息的字幕事件检测算法,借助所提字幕事件帧匹配过程,有效检测各种类型的字幕事件。根据字幕事件检测结果,提出了一种字幕区域快速检测算法。在字幕定位部分,以字幕区域边缘图为基本特征,借助一种多级水平投影分析技术,有效减少了字幕行的漏检。最后,依次使用正反色文本调整、基于样条函数插值的分辨率增强以及基于二次聚类的二值化方法,将字幕文本从背景中分割出来。提出了一种改进的静态标识提取算法。首先选取用于标识区域定位过程的代表帧序列。提出了一种“边缘匹配率”特征定位标识区域。接下来提取用于标识图像分割的代表帧序列,计算每个标识区域的时域方差图,借助一种分段线性压缩技术对方差图进行归化处理,采用经典二值化方法将标识图像从背景中分割出来。与已有方法相比,所提方法能更有效地定位和分割半透明标识。关键词:基于内容的视频检索,基于内容新闻视频解析,闪光灯效应,镜头切换,镜头叠化,播音员镜头,字幕文本,静态标识a b s t r a c tw i t ht h er a p i dd e v e l o p m e n to fc o m p u t e rt e c h n o l o g y , 、撕d e - b a n dn e t w o r k , v i d e oc o m p r e s s i o nt e c h n o l o g y , v o d ,a n di 刖:e l c ,d i g i t a lv i d e o sh a v eb e e nw i d e l yu s e di nt h ef i e l do fb r o a d c a s t ,e d u c a t i o n , e n t e r t a i n m e n t ,m e d i c a ls e r v i c ea n ds u r v e i l l a n c ee t o o no n eh a n d ,c o m p a r e dw i t ht h et e x ti n f o r m a t i o n ,v i d e oi n f o r m a t i o nh a san u m b e ro fa d v a n t a g e s ,e g v i v i d n e s s ,p o w e r f u le x p r e s s i v ef o r c ea n de n o r m o u si n f o r m a t i o nc a p a c i t y o nt h eo t h e rh a n d ,t h ec o m p l e x i t yo ft h ed a t as t r u c t u r e ,h u g ed a t ac a p a c i t ya sw e l la st h el e a s tt r a n s p a r e n c eo ft h ev i d e oc o n t e n tb r i n gm u c hi n c o n v e n i e n c ef o rv i d e od a t ab r o w s ea n dr e t r i e v a l i th a sb e c a m eac r i t i c a lp r o b l e mt of i n daw a yt oe f f e c t i v e l yc o m p r e h e n da n do r g a n i z et h ev i d e od a t a ,a n dt om a k ep e o p l ea b l et of i n do u ti n t e r e s t i n gv i d e os e g m e n t sf r o mv i d e od a t a b a s ec o n v e n i e n t l ya n dr a p i d l y t h ek e yt or e s o l v et h ep r o b l e mi st h er e s e a r c ho f c o n t e n t - b a s e dv i d e or e t r i e v a l ( c b v r ) t h ef i r s ts t e pt or e a l i z et h ec v b ri st oe x t r a c tt h eh i e r a r c h i c a ls t r u c t u r ea n ds e m a n t i ci n f o r m a t i o no f v i d e od a t a , w h i c hi sr e a l i z e db yv i d e op a r s i n gt e c h n i q u e v i d e op a r s i n gi st h eb a s i ca n dp r e m i s es t e pf o rv i d e oa b s t r a c t i o na n di n d e x i n g ,a n di tp l a y sa ni m p o r t a n tr o l ei nc b v rs y s t e m n e w sv i d e o ,a sa ni m p o r t a n tv i d e ot y p e ,i so n eo f m a i nr e s o u r c e sf o rp e o p l et ot i m e l ya c q u i r ei n f o r m a t i o n i th a sas p e c i a ls t r u c t u r e ,a n di ti sr i c hi ns e m a n t i ci n f o r m a t i o n t h e r e f o r e ,c o n t e n t - b a s e dn e w sv i d e op a r s i n gi sah o tr e s e a r c ht o p i ci nc b v r i nt h i sd i s s e r t a t i o n ,s o m ek e yt e c h n o l o g i e so nc o n t e n t - b a s e dn e w sv i d e op a r s i n ga r es t u d i e di nd e p t ha n ds e v e r a le f f e c t i v em e t h o d sa r ep r o p o s e d t os u m m a r i z e ,o u rr e s e a r c hi n c l u d e st h ef o l l o w i n ga s p e c t s :f i r s t , w eg i v eab r i e fr e v i e wo ft h eb a c k g r o u n da n dd e v e l o p m e n to fc b v i lah i e r a r e h ys t r u c t u r em o d e la n dan a r r a t i v es t r u c t u r em o d e lf o rn e w sv i d e o sf i r ei n t r o d u c e da tf i r s ti nc h a p t e r2 t h e n , ac o n t e n t - b a s e dn e w sv i d e op a r s i n gf r a m e w o r ki sg i v e n , w h i c hi n c l u d e st w ol e v e l s c a l l e dh i e r a r c h i c a ls t r u c t u r ep a r t i t i o na n ds p e c i f i co b j e c te x t r a c t i o n , r e s p e c t i v e l y f i n a l l y , :s o m ek e yt e c h n o l o g i e so ft h ef r a m e w o r ka r ed i s c u s s e d i nc h a p t e r3 ,w ed i s c u s ss o m ek e yt e c h n o l o g i e sr e l a t e dt oh i e r a r c h i c a ls t r u c t u r ep a r t i t i o nf o rn e w sv i d e o s as h o tt r a n s i t i o nd e t e c t i o ns c h e m ea r ef i r s ti n t r o d u c e d , w h i c hi n c l u d e st h r e ep a r t s ,t h a ti s ,f l a s h l i g h te f f e c td e t e c t i o n ,s h o tc u td e t e c t i o n , a n ds h o td i s s o l v ed e t e c t i o n f i r s t , am o d e l b a s e df l a s h l i g h te f f e c td e t e c t i o na l g o r i t h mi sp r o p o s e d c o m p a r e dw i t l lp r e v i o u st e c h n i q u e s t h ep r e s e n t e dm e t h o dc a nd e t e c tt h eg r a d u a lt r a n s i t i o nf l a s h l i g h t sa n dc o n t i n u o u sf l a s h l i g h t sm o r ee f f e c t i v e l y t h e n , a l li m p r o v e ds h o tc u td e t e c t i o na l g o r i t h mi sp r e s e n t e d t h el a r g ef l a m e - t o - f r a m ed i f f e r e n c ev a l u e sc a u s e db yf l a s h l i g h t sa r er e m o v e d ,a n dam e d i a nf i l t e r i n gp r o c e s si se m p l o y e dt or e d u c et h en e g a t i v ee f f e c tc a u s e db yo b j e c t c a m e r am o t i o n o n l yt h en o n - z e r of e a t u r ep o i n t sa r ec h o s e na st h ei n p u tf o rf c mc l u s t e r c o m p a r e dw i t ht h eo r i g i n a lm e t h o d ,l i t t l ef a l s ed e t e c t i o n sa r eo c c u r r e d n e x t ,a ni m p r o v e ds h o td i s s o l v ed e t e c t i o na l g o r i t h mi sp r o p o s e d o nt h eb a s i so ft h en o r m a ld i s s o l v em o d e l ,t h ei n t e r - f r a m ed i f f e r e n c em e t r i ci sa d o p t e dt oc h a r a c t e r i z et h em u l t i f r a m ec h a n g ec o n s i s t e n c yd u r i n gt h es h o td i s s o l v et r a n s i t i o n t h es h o td i s s o l v e sa r ed i s t i n g u i s h e df r o ml o c a la r e ad i s s o l v et r a n s i t i o n se f f e c t i v e l yb yu s i n gt h ed i s s o l v eb l o c kd i s t r i b u t i o nr a t i o ,w h i c hi sp r e s e n t e df o rt h ef i r s tt i m e c o m p a r e dw i t ht h eo r i g i n a lm e t h o d ,m o r el o n g t i m es h o td i s s o l v e sc a r lb ed e t e c t e da n dl i t t l ef a l s ed e t e c t i o n sa r eo c c u r r e d o nt h eb a s i so fs h o tt r a n s i t i o nd e t e c t i o n ,a ni m p r o v e ds h o tc l u s t e r i n gb a s e da n c h o r p e r s o ns h o td e t e c t i o na l g o r i t h mi sp r e s e n t e d an e ws u b r e g i o np a r t i t i o nt e c h n i q u ei se m p l o y e dt oc a l c u l a t et h ed i s t a n c eb e t w e e nt w od i f f e r e n ts h o t s ,w h i c hc a nr e d u c eal a r g en u m b e ro fm i s s e dd e t e c t i o n sc a u s e db yt h eo b v i o u sc o n t e n td i f f e r e n c ea m o n gt h ed i f f e r e n ts h o t sw h i c hb e l o n gt ot h es a m ea n c h o r p e r s o ns h o tc l a s s af e a t u r en a m e di n t e r i o rg r o u ps h o ts p a ni sa d o p t e df o rt h ef i r s tt i m et 0r e m o v et h ef a l s ed e t e c t i o nc a u s e db yp s e u d o - a n c h o r p e r s o ns h o tc l a s s e s c o m p a r e dw i t ht h eo r i g i n a lm e t h o d ,h i g hr e c a l lr a t i oi sa c h i e v e d i nc h a p t e r4 ,t h ek e yt e c h n o l o g i e sr e l a t e dt oc a p t i o nt e x te x t r a c t i o na n ds t a t i cl o g oe x t r a c t i o na r ed i s c u s s e d f i r s t ,a ni n t e g r a t e dc a p t i o nt e x te x t r a c t i o ns c h e m ei sp r e s e n t e d ,w h i c hi sd i v i d e di n t of o u rp h a s e s :c a p t i o ne v e n td e t e c t i o n , c a p t i o na r e ad e t e c t i o n ,c a p t i o nl o c a l i z a t i o n , a n dc a p t i o nt e x ts e g m e n t a t i o n an o v e lc a p t i o ne v e n td e t e c t i o na l g o r i t h mb a s e do nt h em u l t i f r a m ei n f o r m a t i o ni sb r o u g h tf o r w a r d d i f f e r e n tt y p o so fc a p t i o ne v e n t sc a nb ed e l e t e de f f e c t i v e l yb yu s i n gt h ep r o p o s e dc a p t i o ne v e n tf r a m em a t c ht e c h n i q u e o nt h eb a s i so fc a p t i o ne v e n td e t e c t i o nr e s u l t s ,af a s tc a p t i o nr e g i o nd e t e c t i o nm e t h o di se m p l o y e dt of i n dt h ep o s s i b l el o c a t i o no fc a p t i o nr e g i o n si nt h ev i d e of r a m e s i nt h ec a p t i o nl o c a l i z a t i o np r o c e d u r e ,t h ec a p t i o nr e g i o ne d g em a pi sf i r s te x t r a c t e d ,a n dan e wm u l t i s t a g eh o r i z o n t a lp r o j e c ta n a l y s i st e c h n i q u ei se m p l o y e dt od e c o m p o s eac a p t i o nr e g i o ni n t oi n d i v i d u a lc a p t i o nl i n e se f f e c t i v e l y f i n a l l y , t h r e ei vp r o c e s s e si n c l u d i n gn o r m a l i n v e r s et e x ta d j u s t m e n t , s p l i n ei n t e r p o l a t i o nb a s e dr e s o l u t i o ne n h a n c e m e n t ,a n db i c l u s t e rb a s e db i n a r i z a t i o na r ep r e f o r m e di nt u r n st os e g m e n tc a p t i o nt e x t sf r o mb a c k g r o u n d a ni m p r o v e ds t a t i cl o g oe x t r a c t i o na l g o r i t h mi sp r o p o s e d f i r s t l y , as p e c i f i cr e p r e s e n t a t i v ef r a m es e q u e n c ei ss e l e c t e df o rl o g or e g i o nl o c a l i z a t i o np r o c e d u r e an o v e lf e a t u r en a m e de d g em a t c hr a t i oi sp r e s e n t e dt ol o c a t et h ep o s s i b l el o g or e g i o n s n e x t ,a n o t h e rs p e c i f i cr e p r e s e n t a t i v ef r a m es e q u e n c ei ss e l e c t e df o rc a l c u l a t i n gt h et e m p o r a lv a r i a n c ei m a g ec o r r e s p o n d i n gt oe a c hl o g or e g i o n t h i si m a g ei sn o r m a l i z e db yu s i n gas u b s e c t i o nc o m p r e s s i o nm e t h o d a n dt h el o g op o i n t sa r es e g m e n t e db yu s i n gac l a s s i c a lb i n a r i z a t i o nm e t h o d c o m p a r e dw i t hp r e v i o u sm e t h o d s ,t h ep r o p o s e dm e t h o dc a nl o c a t ea n ds e g m e n ts e m i t r a n s p a r e n ti o g o sm o r ea c c u r a t e l y k e yw o r d s :c o n t e n t - b a s e dv i d e or e t r i e v a l ,c o n t e n t - b a s e dn e w sv i d e op a r s i n g ,f l a s h l i g h te f f e c t ,s h o tc u t , s h o td i s s o l v e ,a n c h o r p e r s o ns h o t , c a p t i o nt e x t ,s t a t i cl o g o英文缩略语表上海交通大学学位论文原创性声明本人郑重声明:所呈交的学位论文,是本人在导师的指导下,独立进行研究工作所取得的成果。除文中已经注明引用的内容外,本论文不包含任何其他个人或集体已经发表或撰写过的作品成果。对本文的研究做出重要贡献的个人和集体,均已在文中以明确方式标明。本人完全意识到本声明的法律结果由本人承担。学位论文作者签名:日期:2 年协月i o b上海交通大学学位论文版权使用授权书本学位论文作者完全了解学校有关保留、使用学位论文的规定,同意学校保留并向国家有关部门或机构送交论文的复印件和电子版,允许论文被查阅和借阅。本人授权上海交通大学可以将本学位论文的全部或部分内容编入有关数据库进行检索,可以采用影印、缩印或扫描等复制手段保存和汇编本学位论文。保密口,在一年解密后适用本授权书。本学位论文属于,不保密囱。( 请在以上方框内打“4 ”)学位论文作者签名:五是指导教师签名:鳓解日期:如6 年f p 月i o 日日期:口6 年f 硐l1 日第一章绪论1 1 课题的研究背景与意义第一章绪论近些年来,随着宽带网络、数字视频压缩、可视电话、v o d 、d t v 、i p t v 等技术的推广和普及,视频信息的获取、存储和传播越来越方便。i n t e r a c t 的飞速发展,特别是高速宽带网络的普及,使得人们有机会使用更多类型的在线视频服务,如视频会议,新闻点播、远程教学、远程医疗等。可以预想在不远的将来,随着计算机性能的不断提高、数字电视广播的快速发展、高速宽带网在i n t e r a c t 上所占比例的提高,基于w e b 的数字视频媒体服务将会极大改变人们的生活方式。以视频为代表的多媒体信息具有形象生动、表现力强、信息量大等优点,它已取代传统的文本信息成为人们获取信息的主要来源。但视频巨大的信息量、非结构化的数据构成方式以及表现内容的不确定性,使得对视频数据的理解和管理面临着相当大的难度。传统的视频数据库管理主要依靠人工文本标注方式实现对视频内容的检索。它的一般实现过程是:首先采用人工方式使用文字信息对数据库中的视频片段进行概括和标注,构建索引数据库;在检索时由用户提供关键字,然后系统在索引数据库中搜索具有对应关键字的视频片段,并返回给用户。基于人工文本标注方式的视频数据库有以下不足【1 l :建库所需的工作量极大,成本高、周期长;人工标注的主观性强,不同人做出的文本标注结果可能存在明显差别,导致检索结果具有相当大的随机性;文本标注结果是对视频内容的高度抽象,难以描述视频数据中的视觉内容,难以与人的视觉感受联系起来,难以满足用户基于视觉内容的检索要求。为了弥补传统人工标注方法的不足,研究者提出了一种新的视频检索技术:基于内容的视频检索( c o n t e n t b a s e dv i d e or e t r i e v a l :c b v r ) 2 1 。c b v r 技术的基本思想是:使用视频数据中的音视频特征形成描述视频内容的索引,在检索时使用的是基于音视频特征的相似度匹配,并不追求传统数据库的精确查询。与人工文本标注方式相比,c b v r 的优势在于:特征提取过程自动进行,不需要过多的人工干预:充分利用已有的多媒体处理和分析技术,提取出的音视频特征很好地反映了视频内容;用来描述视频内容的特征既包括底层的视觉特征、结构特征,又包括高层的对象特征和语义特征,最大限度地满足不同用户的检索要求。图1 1 给出了一种典型的c b v r 系统的实现框梨3 1 。它包括5 个主要功能模块,即视频采集、视频解析、视频摘要、视频索引和交互接口。通过视频采集过程将拍摄到的视频数据送入c b v r 系统作为原始数据。视频解析( v i d e op a r s i n g ) 主要完成两个任务,一是将视频数据在时域上划分成为不同的层次结构,如镜头、场景、故事单元等;二是提取视频数据中的特定对象和各种语义信息。根据视频解析结果,从原始视频中提取部分数据,或者构造新的更为精简的数据子集描述原始视频数据的内容,这称作视频摘要( v i d e oa b s t r a c t i o n ) 。将视频摘要的输出结果作为检索和浏览的基本单元,对这些数据进行分类,进而实现对原视频数据的重新组织,将不同镜头或视频片段划归到不同的目录索引结构中,使得重新组织后的检索单元更便于用户进行查询和浏览,这些步骤统称为视频索i ( v i d e oi n d e x i n g ) 。上述三个步骤的输出结果都被记录进视频数据库中。系统通过交互接口获得用户的查询要求,并将查询要求转换为对视频内容的描述。系统将这些描述与数据库内部的索引进行相似度比较,将满足一定条件的视频片段提取出来,通过交互接口送至用户。交互接口可以为用户提供不同形式的查询服务,既可以是常规的表达语义的语言查询,也可以是基于示例的查询。本文的研究范围主要集中在视频解析部分。一图1 1 基于内容的视频检索框图f i g l - 1b l o c kd i a g r a mo f c o n t e n t - b a s e dv i d e or e t r i e v a l新闻视频是一种重要的视频类型。与其它类型视频相比,新闻视频具有内容丰富、实时、准确、信息量大等特点。人们通过观看新闻节目,可以方便地获取各类信息。另外,新闻视频也是一种重要的历史资料,用来记录过去发生过的重第一章绪论要事件。但一直以来,由于缺乏有效的工具对新闻视频进行组织和管理,使得用户无法方便快捷地获取感兴趣的新闻信息。为了解决这一问题,有必要设计一种通用的新闻视频检索框架,在该框架指导下融合各种音视频特征,完成新闻视频的自动解析、摘要、索引、浏览和检索功能。完成上述功能的技术统称为基于内容的新闻视频检索( c o n t e n t b a s e dn e w sv i d e or e t r i e v a l :c b n v r ) 。c b n v r 作为c b v r 中的重要组成部分,已经引起了国内外学者的广泛关注。1 2 国内外研究现状与c b v r 有关的早期文献可以追溯到2 0 世纪8 0 年代,针对c b v r 的正式研究则是始于2 0 世纪9 0 年代初期。目前,它已成为多媒体信息处理领域的一个研究热点问题。针对c b v r 的研究经历了从静态图像到动态视频、从底层层次结构划分到高层语义信息提取、从专用视频到通用视频的逐步完善过程。到目前为止,已有多个视频数据库原型系统问世。下面以几个著名的研究项h 研究团队为例,简要介绍国内外在该领域的研究现状。1 2 1 国外研究现状( 1 ) l n f o r m e d i a l ( c a r n e g i em e l l o n 大学,美国) :1 9 9 4 年,由美国国家自然科学基金委员会、美国国防部高级研究计划署和美国国家宇航局共同支持的数字图书馆预研工程( d i g i t f ll i b r a r yi n i t i a t i v e :d l i ) 项目正式立项。该项目分为六个子项目,其中c a r n e g i em e l l o n 大学承担了基于内容检索的视频数字图书馆方面的研究,该项目简称为i n f o r m e d i a 4 1 。i n f o r m e d i a 在视频解析方面做了大量研究,包括视频结构划分、视频文本识别、语音分析与识别、自然语言处理、人脸检测以及视频摘要等方面的内容。按照研究计划,它的语义信息提取引擎可以对视频流中的文本、语音、人物、台标等进行分析、识别、推理和综合,并生成基于内容的索引,允许用户对视频进行基于内容的检索。目前该项目已经完成第一阶段的工作,正处于第二阶段。( 2 ) m o c a 2 ( m a n n h e i m 大学,德国)m o c a ( m o v i ec o n t e n ta n a l y s i s ) 项目于1 9 9 4 年在德国m a n n h e i m 大学启动。h t t p :w w w i n f o r m e d i a c s e m ue d u。h n p :w w w i n f o r m a t i k u n i - m a n n h e i m d e i n f o r m a t i k p i 4 p r o j e c t m o c a- 3 上海交通大学博士学位论文m o c a 项目与i n f o r m e d i a 项目的相同之处在于:二者都包括诸如视频结构划分、视频文本识别、人脸检测和视频摘要等技术。两者不同之处在于:i n f o r m e d i a 项目在语音识别和自然语言理解方面做了大量研究;m o c a 项目则对运动对象分割和识别、广告片段检测、电影类型分类进行了探索和研究,这些都是i n f o r m e d i a 项目所没有的。( 3 ) t r e c v i d l ( 美国国家标准技术研究所,美国)t r e c v i d 全称是“文本检索会议视频检索性能评测”。它是影视检索领域中的国际性权威评测机构,由美国国家标准技术研究所负责组织实施。2 0 0 1 年,该研究所首次加入影视检索的子项目。近些年来,越来越多的研究机构参与进来。仅2 0 0 6 年就有来自不同国家的6 9 所著名大学和研究机构参加评测,其中包括来自中国内地的复旦大学、清华大学、中科院、浙江大学、华中科技大学、北京交通大学等高校。我国己成为除美国之外参加机构最多的国家,这反映了国内对c b v r 研究的重视程度在不断加强。t r e c v i d 每年举行一次测评,已有的子任务包括镜头边界检测( s h o tb o u n d a r yd e t e c t i o n ) 、故事分害u ( s t o r ys e g m e n t a t i o n ) 、底层,高层特性抽取( l o w h i g hl e v e lf e a t u r ee x t r a c t i o n ) 、搜索( s e a r c h ) 、样片开发( r u s h e se x p l o i t a t i o n ) 等。除了上述3 个著名的研究项目外,国外还有一些研究机构针对c b v r c b n v r中的某些组成部分进行了探索,取得了令人瞩目的成果。i b m 公司开发的c u e v i d e o系纠5 j 用于音视频的自动分析和检索。它主要包括视频分割、视频摘要、音视频索引和检索等模块。该系统通过选取关键帧方式实现对视频节目的快速重放,并借助语音识别技术从原始音频流中提取文本信息,为音视频片段建立索引。美国c o l u m b i a 大学开发的v i d e o q 系统1 6 1 是一个面向对象的视频查询系统。该系统的特点是可以根据用户对物体视觉特征、运动特征以及物体间相互关系的描述,从视频数据中查找相关的镜头。它拓展了基于关键字或是基于主题浏览的传统检索方式,提出了全新的基于视觉特征和时空关系的查询技术。由美国u i u c ( u n i v e r s i t yo fi l l i n o i su r b a n a - c h a m p a i g n ) 大学开发的m a r s ( m u l t i m e d i aa n a l y s i sa n dr e t r i e v a ls y s t e m ) 系统用使用一种视频层次结构框架,结合高维索引技术和相关反馈技术,有效地支持用户对视频浏览和索引的要求。a t & t ( a m e r i c a nt e l e g r a p ha n dt e l e p h o n ec o r p o r a t i o n ) 辫t 8 1 的研究人员着重对c b n v r 进行了研究。他们借助音视频特征h t t p :w w w n l p i r n i s t g o v p r o j e c t s t r e c v i d 第一章绪论对新闻视频内容进行分类,去除新闻节目中的广告视频,在此基础上检测播音员镜头,提取故事单元。爱尔兰都柏林城市大学开发的f i s e h l a r 系统1 9 1 对新闻视频的镜头转换检测、故事单元分割、广告片段检测等技术进行了研究。1 2 2 国内研究现状1 9 9 8 年,在国家科技部的支持和协调下,中国8 6 3 计划智能计算机系统主题专家组设立了数字图书馆重点项目:“中国数字图书馆示范工程”,并由国家图书馆、中国科学院和清华大学组织实施。该项目涉及的领域非常广泛,包括分类与数据描述标准、海量多媒体数据存储与管理、多媒体数据压缩与传输、基于内容的图像与视频检索等。在1 9 9 9 2 0 0 0 年度国家8 6 3 计划信息技术领域中的通信技术主题课题申请指南中,也包括基于内容的视觉信息检索技术研究开发项目( 8 6 3 3 1 7 0 1 0 7 - 9 9 ) 。它的主要研究内容包括:自动图像特征提取与标识、智能化程度较高的视频分析,特定视觉对象抽取技术、高维数据索引技术、相似度计算、性能评价准则、标准测试平台、多媒体数据库管理系统和查询语言等关键技术,并将上述技术整合,开发实现基于视觉信息检索的电视新闻节目检索系统和视频信息过滤系统。国内针对c b v r 的研究始于上世纪9 0 年代末期。到g l 前为止,国内在该领域的研究仍处于起步阶段,各研究团体只涉及了c b v r 的部分内容,没有开发出较为成熟的原型系统。下面介绍几个有代表性的研究团体以及他们的研究成果:( 1 ) 微软亚洲研究院多媒体计算纠1 0 】【l l 】【1 2 1 1 1 3 1 。他们开发了一套面向家庭用户的新闻视频浏览系统,为用户提供新闻视频的快速定位和非线性浏览等服务,并可通过选取关键帧的方式在线播放视频片段。该系统综合利用音视频信息对新闻视频进行镜头分割,使用o c r 技术提取视频文本信息,利用自然语言处理技术对文本信息进行处理,实现了对新闻内容的自动标注和分类。( 2 ) 由清华大学钟玉琢、章毓晋和林福宗教授主持的智能技术与系统国家重点实验室多媒体组【1 4 】【1 5 l 【1 6 1 m 。该组当前的研究工作集中在机器学习、图像内容检索、影视内容检索、多媒体搜索引擎和数字水印等研究课题方面。他们在t r e c v i d2 0 0 4 的镜头边界检测子任务评测中取得了总效果第一,在高层特征检测子任务中取得了一个单项评测第一。( 3 ) 由复旦大学吴立德教授主持的上海市智能信息处理重点实验室是最早参与5 t r e c v i d 的国内研究机构之一。他们在基于i n t e m e t 的特定领域智能信息处理方面,如大规模文本处理、基于w e b 的知识挖掘、提炼和集成,特别是在图像视频信息检索方面,取得了许多卓有成效的成果,发表了多篇有影响的学术论文【l s j 【1 9 1 1 2 0 i 2 1 1 。( 4 ) 由国防科技大学吴玲达和李国辉教授主持的多媒体研究中心在视频结构划分、镜头聚类和视频摘要等方面做了大量工作口2 1 1 2 3 1 1 2 4 1 ,开发出了一种基于“实体一描述一效率”模型的新闻视频浏览和检索原型系统。( 5 ) 由武汉大学周洞汝教授主持的研究组在国内较早开展了多媒体数据库方面的研究。他们出版的视频数据库导论伫5 l 一书在c b v r 研究领域影响较大。他们以新闻视频为主要研究对象,在语义信息提取【2 6 1 、视频摘要【2 7 1 以及基于多特征分析技术口8 】f 2 9 1 等方面做了大量工作,并在c o m 架构下实现了一个基于内容的新闻视频解析系统。( 6 ) 由浙江大学庄越挺教授主持的研究组主要从字幕文本信息提取和视频相似度测量等方面开展了对c b v r 的研究 3 0 1 3 1 】【3 2 i 【3 3 1 。他们实现了一个称作w e b m a r s 的视频信息检索原型系统,使用视频字幕文本信息等作为视频内容的索引,实现了基于关键字的视频片段匹配和检索。除上述研究团体之外,上海交通大学图像通信与信息处理研究所【3 4 j 【3 5 1 ,中科院计算技术研究所【3 6 】、西安电子科技大学p 7 1 、南京理工大学3 8 1 等研究机构在镜头转换检测、播音员镜头检测、字幕提取、标识提取等方面取得了一些具有启发性的研究成果。1 3c b v r 与m p e g - 7 的关系m p e g 7 是国际标准化组织

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论