已阅读5页,还剩58页未读, 继续免费阅读
(计算机软件与理论专业论文)基于音频分析的足球视频摘要系统分析研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
,蕾疆l域霄 摘要 l i i i i ti i1 1 1 ti l l1 1 ltl i l t i ii ii y 18 4 5 6 7 7 数字视频属于国家重点发展的信息产业领域,宽带网络和数字电视的迅速发 展,使得视频点播、交互电视、视频网站等应用都将面临大量涌现的数字化视频 数据,对视频摘要技术的研究对基于视频的各种应用就具有重要意义。但视频摘 要是近年来新兴的技术,国内外的研究还存在很多不足,从而限制了视频摘要技 术的广泛应用。 本课题研究的目的在于通过分析视频中的音频信息,提取出从音频信息中反 映出的精彩事件,从而对相应视频内容进行摘要。 本文以足球视频为例,分析计算了视频中对应的音频信息的一些音频特征, 并利用这些音频特征设计了本系统实现的算法。本文研究内容主要包括以下几个 方面: ( 1 ) 研究了足球视频中声音随着球场事件的变化情况,提出通过分析音频信号 短时能量变化来生成视频摘要的算法。 ( 2 ) 采用了对音频数据先滤波后分析的办法,减少了噪音对摘要结果的影响。 。( 3 ) 根据不同频段的音频信号能量变化剧烈情况不同,给出了自适应生成视频 摘要的计算方法。 ( 4 ) 通过检测精彩片段出现时是否出现哨音,区别射门事件和犯规事件,并分 析该处能量曲线的变化,给出了判断射门球进与否的计算方法。 ( 5 ) 分析了设置不同的能量阀值时,对摘要结果的影响,并且分析设置不同的 能量均方差阀值时,对判断射门是否球进的影响。 本文中由实验得到的结论反映了足球视频中音频信息的一些特性,为把视频 摘要技术进一步应用到其他体育节目视频中提供了理论基础;对音频数据先滤波 后分析的计算方法,以及对音频信号短时能量与能量变化剧烈情况分析后联合计 算摘要结果的方法,对基于音频分析的视频摘要系统设计提供了一定的参考价值。 关键词 视频摘要,视频,音频,镜头 a b s t r a c t d i g i t a lv i d e ob e l o n g st ot h ef i e l do fi n f o r m a t i o ni n d u s t r yw h i c ht h ec o u n t r y d e v e l o p se s p e c i a l l y w i t ht h er a p i dp r o g r e s so fb r o a d b a n dn e t w o r ka n dd i g i t a lt v , t h e a p p l i c a t i o n so fv i d e o o n - d e m a n d ,i n t e r a c t i v et v a n dv i d e ow e b s i t eb e c o m em o r ea n d m o r ep o p u l a r a l lo ft h e s ea p p l i c a t i o n sa r ef a c i n gt h ee m e r g i n gd i g i t a l i z e dv i d e od a t ai n al a r g ea m o u n t t h e s sa l lc o n t r i b u t et ot h ed e v e l o p m e n to fd i g i t a lv i d e op r o c e s s i n g t e c h n o l o g i e s a m o n gt h e s et e c h n o l o g i e s ,v i d e oa b s t r a c t i o ni sa ni m p o r to n ew h i c h a d d r e s st h ep r o b l e mo fh o wt oe n a b l eaq u i c kb r o w s eo fal a r g ec o l l e c t i o no fv i d e od a t a a n dh o wt oa c h i e v ee f f i c i e n tc o n t e n ta c c e s sa n dr e p r e s e n t a t i o n t h i st h e s i sa l m sa te s t a b l i s h i n gah i g h l i g h ta b s t r a c t i o ns y s t e mf o rs p o r t sv i d e o t h r o u g ha n a l y z i n gi t sa c c o r d i n ga u d i oi n f o r m a t i o n i nt h i st h e s i s ,a f t e ras u r v e yo ft h e r e s e a r c hw o r ka n da ni n t r o d u c t i o no ft h eu n i q u ef e a t u r e so ff o o t b a l l m a t c hv i d e o m a t e r i a l ,w ep r e s e n tn e wa l g o r i t h m sf o rg e n e r a t i n gv i d e oa b s t r a c t so ff o o t b a l l - m a t c h v i d e om a t e r i a la u t o m a t i c a l l y , b yp r o c e s s i n gt h ea c c o r d i n ga u d i oi n f o r m a t i o n t o t a l l y s p e a k i n g ,t h et h e s i si n c l u d e st h ef o l l o w i n gp a r t s : ( 1 ) av i d e oh i g h l i g h td e t e c t i o na l g o r i t h ma r ep u tf o r w a r db ym e a n so fa n a l y z i n g t h ea c c o r d i n ga u d i oi n f o r m a t i o n ( 2 ) b e f o r ea n a l y z i n gt h ea u d i oi n f o r m a t i o n ,t h ea u d i od a t ai s f i l t e r dt os e v e r a l f r e q u e n c yp a r t s t h e na n a l z et h em o s ti n t e r r e l a t e dp a r tt og e tt h eh i g h l i g h t s ,s oa st o a v o i dt h ei n f l u e n c eo fn o i s e ( 3 ) a c c o r d i n gt ot h ec h a r a c t e r i s t i c so fd i f f e r e n tf r e q u e n c yp a r t sa r ed i f f e r e n t ,f i n d t h em o s ti n t e r r e l a t e dp a r tw i t hh i g h l i g h tt op u tf o r w a r das e l f - a d a p t i n gh i g h l i g h t d e t e c t i o na l g o r i t h m ( 4 ) t h r o u g ha n a l y z i n gt h ea u d i oe n e r g yc h a n g ea n dd e t e c t i n gt h er e f e r e e sw h i s t l e , w ea b s t r a c tt h es p o r t sv i d e o a n da n a l y z et h ei n f l u e n c eo fd e t e c t i n gt h er e f e r e e sw h i s t l e t ot h er e s u l t ( 5 ) a c c o r d i n gt h ea p p e a r a n c eo fr e f e r e e sw h i s t l e ,t e l lt h es h o te v e n tf r o mf o u l e v e n t a n da n a l y z et h ec h a n g eo fa u d i oe n e r g yi nt h ep o i n t ,t h e np u tf o r w a r da a l g o r i t h mo fd e t e r m i n i n gw h e t h e rg e t t i n gag o a l t h ec o n c l u s i o n si n t h i st h e s i sd r a w nf r o me x p e r i m e n t sa n ds i m u l a t i o n si n d i c a t e t h ea l g o r i t h m so ft h eh i g h l i g h td e t e c t i o ni nf o o t b a l l - m a t c hi so fv a l u a b l ew o r t hf o rv i d e o a b s t r a c t i o ns y s t e md e s i g n k e y w o r d v i d e oa b s t r a c t i o n ,v i d e o ,a u d i o ,l e n s : l 目录 第一章绪论:l 1 1 课题背景1 1 2 本课题研究的目的及意义2 1 3 国内外相关技术发展现状4 1 3 1 国外视频摘要技术发展现状4 1 3 2 国内视频摘要技术发展现状6 1 4 本文主要研究内容:7 1 5 本文的结构8 第二章视频摘要相关技术9 2 1 视频摘要的概念及主要生成方法_ 9 2 1 1 视频摘要的概念9 2 1 2 视频摘要的分类9 2 1 3 视频摘要的生成算法一1 2 2 2 视频中图像分析处理技术1 4 2 2 1 镜头分割1 5 2 2 2 镜头分类1 6 2 2 3 镜头关键值的提取1 8 2 2 4 影视视频摘要技术2 0 2 3 视频中的音频处理分析2 2 2 3 1 音频特征2 2 2 3 2 音频分类2 5 2 3 3 音频分段2 7 2 3 4 音频滤波技术2 9 2 4 小结3 0 第三章基于音频分析的视频摘要算法3 1 3 1 足球视频特征分析3 1 3 1 1 足球视频的特征3 l 3 1 2 足球视频摘要系统的目标3 2 3 2 视频摘要算法3 2 3 2 1 裁判哨音检测方法3 2 3 2 2 精彩片段检测算法流程3 5 3 2 3 分析滤波后音频数据算法流程3 6 3 2 4 判断射门球进与否算法流程_ 3 7 3 3 小结3 8 第四章足球视频摘要系统实现3 9 4 1 系统功能模块3 9 4 2 系统流程3 9 4 3 关键模块介绍4 0 4 4 本文所用的主要数据结构4 2 4 5 小结i ,4 3 第五章实验评测与分析4 4 5 1 系统实验环境4 4 5 2 实验与结果分析4 4 5 2 1 能量阀值对精彩片段结果影响分析4 4 5 2 2 裁判哨音检测结果与分析4 6 5 2 3 通过能量与基频联合判断精彩片段结果与分析4 7 5 2 4 分析滤波后音频数据结果与分析4 8 5 3 小结,5 l 结论与展望5 2 参考文献5 3 科研成果5 7 致谢5 8 西北大学硕士学位论文 第一章绪论 1 1 课题背景 一 一 大家都知道,通过看一篇文章的摘要或者看一本书的内容说明就可以了解 到整篇文章或者这本书的大概内容,也可以通过阅读摘要而很快找到自己感兴 趣的点,有选择的进行文章的阅读,但摘要要比文章少的多,只是文章内容的 概括,但通过摘要我们可以在很短的时间内了解整篇文章,因此文章摘要对一 篇文章来说很重要,同样视频数据的摘要对视频来说同样重要。 数字视频是最近这些年随着互联网和宽带的普及,在信息技术领域新兴的 一种通过计算机处理视频文件的一种技术。由于互联网和宽带的普及、以及国 家广电总局数字电视的推广更是刺激了视频技术的进一步发展。随着计算机的 普及,相应的电子产品也纷至沓来,进入千家万户,例如数码摄像机、数码照 相机等,这些都为数字视频的发展奠定了基础。随之而来的就是视频文件的急 速增加,计算机中、数码摄像机中、一些大容量的存储卡中包括互联网上到处 充斥着各种各样的视频文件。怎样为广大用户提供快速浏览和检索就显得十分 重要了,视频摘要技术就能够利用对视频数据的分析,为用户提供快速浏览和 快速检索的服务。 视频摘要技术的应用领域有很多,主要集中在以下几个方面: ( 1 ) 影视宣传 大家都知道,现在拍摄一部上座率高的电影不仅要有好的演员参演,更重 要的还要有铺天盖地的宣传来介绍影片,不仅要有现场宣传还有有电影预告片 和大量的宣传海报,很多厂商更是不惜血本拍摄广告和宣传片,这些都是要花 费大量的人力、物力和财力的,视频摘要技术的出现可以让这些问题迎刃而解, 它能够依据影片自动生成用于宣传的广告素材,也可以根据需要对影片进行剪 辑生成预告片。 ( 2 ) 多媒体资源检索 随着计算机技术和多媒体技术的不断发展,越来越多的多媒体资源被数字 化,例如:电影、电视、电视剧等。那么这些存储的多媒体资源合理、科学的 组织、如何被快速、有效的检索一直困扰任人们,而视频摘要便可以有效的解 决此类问题。 ( 3 ) 家庭娱乐 第一章绪论 利用视频摘要可以把电视节目的介绍由文字描述替代为视频信息,能让观 众更为直观的看到预告。同时在播放电视连续剧的时候可以把视频摘要作为下 集的预告或者上集的回顾。在数字电视的视频点播系统中,也可以利用视频摘 要来给为观众选取、查询、浏览节目提供便利。 ( 4 ) 新闻视频 媒体的发展使得每天都会产生大量新闻视频资料,如何存储巨大的视频数 据并且快速的浏览成为一个重要的问题,视频摘要技术则可以有效的减小视频 数据量,方便存储与浏览。 1 2 本课题研究的目的及意义 上世纪4 0 年代以前,计算机还没有出现,人们要记录数字、文字等信息靠 的主要是笔和纸,保存、查询、修改都是一件比较困难的事情,特别查询就更 难了。现在有了计算机,特别是今天,计算机已经普及到各行各业、各个领域, 人们再来记录文字、数字等信息就变得非常的简单和方便,通过数据的逻辑结 构我可以方便的进行大量文字、数字数据物理存储、检索,利用数据库技术我 们可以方便的查阅、修改历史记录等等。然而,随着计算机技术的发展,人们 的需求也在发生着变化,获取和传递信息的方式也不再局限于文字、数字而更 多的是文字、声音、图像、视频等多媒体信息,这些多媒体信息为我们带来了 多姿多彩的生活,为我们的感官带来了强烈的冲击。 特别是随着信息技术的发展,声音、图形、图像、视频等多媒体信息会越 来越成为我们获取信息的渠道,多媒体信息必将成为传播信息的最主要的一种 形式,特别是视频信息,它能够以它独有的方式给我们直观的视觉、听觉上的 感受,让我们能够以一种很自然的方式来获取外界很多信息,包括一些信息的 细节。因为它能够在时间和空间上记录下各种信息,给我们最直观的感受,因 此在社会生活的各个领域的应用必将会越来越广泛。随着电子技术、计算机技 术、信息技术的发展,信息时代的到来,视频数据也将会急速增多,视频数据 又是一种非结构化的数据形式,那么如何对这些视频数据实施有效的、科学的 管理、存储就显得十分重要了。组织的合理,存储的科学,就能够从中提炼出 更有价值的信息,充分体现视频数据的价值。例如,当前很多学校都建设的有 电子图书馆,那么怎样视频信息、视频影片等信息就显得尤其重要了。 视频数据是很多数据帧所构成的,每一帧是有多个像素按照一定的排列构 2 西北大学硕士学位论文 成,用计算机技术可以很方便的实现对视频数据最基本的元素处理,但很难从 中提取只有我们人类所特有的感知的内容,无非就是通过计算机存储、放映、 快放视频等基本的操作,同时就视频数据本身的物理特征来讲,它的最大数据 单位是整个视频文件,而最小的数据单位是帧,在概念层次上没有一个自然过 渡。所以要对视频数据进行有效的组织和检索用传统的数据库管理技术在内容 上根本不能实现的。也正是因为视频数据本身所具有的这些特征以及人们对其 的需求,最近这些年,在对其内容分析基础上的一些视频分析、研究和处理技 术逐步引起大家的关注,成为了一个热点话题,特别是如何通过视频摘要更快 捷、更有效的浏览视频尤其引人注意。也正是因为这样的原因,在全世界的范 围内很多的研究者在这_ 方面都突入大量的心血,促进了视频技术不断的发展, 从过去只能通过根据一定的比例抽取部分信息逐步发展到能够根据视觉的特点 提取,视频技术发展到今天已经能够将多模式、多特点视频融合在一起,。形成 具有很多算法融入其中的视频摘要模型,进一步我们的视频摘要模型已经不再。 善 是一个视频文件剪辑而是正向着分析多个视频和专题方面发展。 这些年随着体育运动的全面发展,特别是2 0 0 8 年以来,全民运动,强身健 体,体育运动已经在人们的日常生活中占据了很重要的地位,业余时间观看各 种各样的体育比赛已经成为一种消遣和打发时间的方式,但是由于比赛的时间 一般都比较长,例如足球比赛就要9 0 分钟,有时候还有加时赛时间则更长,同 时有的时候比赛也不是很精彩,这时候对于很多观众来说就不会从头到尾都看 了,他们会有选择的观看其中的部分或者是通过观看比赛中的一些精彩片段来 了解整场比赛。那么如何把比赛中集声音、视频于一体的精彩画面连贯的、快 速的展现给观众,让观众能快速的观看到就显得很重要了。过去很多都在使用 隐马尔科夫链基于视觉特征变换【l 】【2 】,通过用把镜头进行分类的方式从中提取比 赛中的精彩画面,而这种方式会因为画面变换过于激烈和视觉识别模板对精彩 场面的限制不会被广泛使用。所以,最近这些年在基于音频内容分析基础上自 动从比赛的视频信息中提取精彩场面的研究分析比较引起了人们的注意。例如, 在棒球比赛中通过使用e n e r g y ,e n t r o p y ,m f c c 等音频特征【3 】把比赛中解说员 的声音和环境的声音之间进行有效的切分,再把现场解说的声音和棒球棍击球 的声音的音频检测出来,就能够自动的把比赛中的精彩场景提取出来。 尽管近些年关于视频摘要技术的研究已经有了长远的进步和发展,成为了 第一章绪论 人们关注和研究的热点,在视频处理技术方面,也有很多人投入了大量心血, 进行了大量的研究,也积累了丰富的经验,但大部分的研究主要集中在从视频 图像方面入手,本文则是以足球比赛视频为研究对象,提出了基于足球比赛视 频中音频信号分析的视频摘要方法。研究视频摘要技术不仅在理论上具有很高 的价值,同时在实际的应用中也有很广阔的前景。 1 3 国内外相关技术发展现状 1 3 1 国外视频摘要技术发展现状 随着计算机技术、通讯技术、网络技术、多媒体技术等信息技术的迅速发 展,出现了越来越多的数字视频,例如家庭视频、视频新闻、体育视频、视频 广告、监控视频等。特别国家广电总局在全国推广数字电视,这就导致了更多 数字视频的出现,随之而来的就是如何对视频编排、有效存取及快速查询等许 多信息处理技术的发展。 视频摘要技术是在这种形式下出现的一种新的信息处理技术,它能够很快 捷、方便的解决视频数据的快速浏览问题、能够迅速的从视频中截取有效信息 和对视频信息的有效展现,为观众提供在观看视频时提供帮助。 国内外有关视频摘要技术的研究最早可以追溯到c m u 大学开发的 i n f o r m a t i o n 工程【1 6 】【1 7 1 。上世纪9 0 年代,c m u 大学就已经在开发i n f o r m e d i a 视 频数据库【9 】【1 0 1 ,这是最早研究视频摘要系统的机构。在此以后,很多大学和科 研结构都在进行视频摘要技术的研究,例如:c o l u m b i a 大学、微软研究院、i b m a l m a d e n 、p l i l i p s 研究院研究中心等;后来,德国的大学和美国的一些大学或机 构也都开展了都视频摘要的研究,并且也开发和研究出多种形式的摘要以及一 些生成摘要的算法【1 8 1 。 c m u 大学开发的i n f o r m a t i o n 工程研究重点是新闻视频,目的是从在新闻 视频中提取有价值的的视频和音频信息从而合成视频摘要。在这个工程中人们 所熟悉的t f i d f 方法被广泛使用,通过对声音文件和从视频文件的字幕中抽 取出的文字重要度排序,把排序结果和一些关键的音频片段有机的结合起来, 最终形成音频缩略;然后从视频中把需要的一些帧提取出来,形成图像的缩略, 再根据这些帧的优先级,按照从高到低的方式排列,形成一个视频帧的集合, 包括字幕帧、人脸帧场面的开始帧、摄像机运动时的人脸帧、文本帧、帧摄像 4 西北大学硕士学位论文 机运动后的静止帧等。最后通过对得到的图像缩略、音频信息及文本信息进行 综合分析生成完整的视频缩略。 一 美国明尼苏达大学的n a m 等人【1 9 1 提出了一种动态采样的缩略方法。具体就 是将连续的视频数据分割成若干个片段,然后计算每一个片段的运动强度,并 将结果量化,根据结果划分出不同的量化区间,不同的量化区间赋予不同的采 样率,最后根据制定的采样率从每个子镜头中选取关键帧。在缩略回放时,使 用线性插值得到动态的故事板。这种方法没有解决视频中的一些伴音问题。 德国曼海姆大学的m o c a 系统【1 8 】经过长时间对电影摘要的研究分析,从电 影中获取了一些能够代表电影中心思想的剪辑通过计算机处理后自动生成该影 片的预告片。德国曼海姆大学的m o c a 系统有两个明显的特点:该系统使用了 两条启发式规则来减少关键帧的数目:第一、在镜头选择上,m o c a 系统主要 选择两方面的镜头,即与电影主色调一致的镜头和运动最多的镜头。运动镜头 在短时间内会包含更多的信息,与电影主色调一致的镜头则能够体现出电影主 旋律。第二、场景的选择依据视频的类型。通过对视频、音频信息分析和计算 从而判断是什么类型的视频,诸如:广告、新闻、卡通、体育等。从而将会选 出与该类电影最为接近的视频剪辑。电影中重要对象和重要人物场景的选取则 + 。 是用一种探测最大对比度的帧的方法来实现的。为了在剪辑中表征整个电影的 基调,把电影平均颜色相似的场景选出,然后在视频摘要中使用。最后,按照 逸l 时间的先后顺序把选取出来的全部场景进行组织,就得到了电影的预告片。这 种方法的优点在于可以生成具有制定类型风格的摘要。 英特尔公司的l i e n h a r t 2 2 1 也在视频摘要方面做出了研究,他们主要研究的 对象是对听视频,通过计算声压的方法,得到所需要的视频剪辑。很多机构摘 要的研究都是基于内容,而英特尔公司的摘要是基于模型的。 西门子研究院在视频摘要方面同样也做出了大量的研究 2 0 】,他们把把声 音、视觉信息、文本等多种信息融合在一起形成了缩略视频。具体的方法步骤 是,先通过对“主题改变和“说话者改变”的识别,自动地将镜头分组为故事单 元,每一个故事单元用一个图像代表,与故事单元相关的音频和文本也将被抽 取出来。然后将得到的文本信息和音频信息形成缩略视频,为了能够得到一个 相对满意的缩略视频,通过一个交互接口,允许用户进行信息反馈,结合用户 反馈的信息进行整合,最终得到满意的缩略视频。但是这种方法也依赖于文本。 一t 5 第一章绪论 哥伦比亚大学的s u m d a r a m 2 3 】提出了一种新颖方法即实体一效用 ( e n t i t y - u t i l i t y ) 方法。该方法主要针对实现视音频的摘要问题,核心思想是:把 多媒体序列看作是一个复合的实体或者一个满足用户信息需求的子集。为了能 够生成缩略,采用将实体与效用相关联的方法,从而生成缩略的问题就被转换 在一定条件下保留用户所需实体的最大效用问题。该方法对具有不同的设备以 及资源条件的视频都适应。大部分的视频摘要系统主要通过对视频中的图像信 息进行分析,从而对视频内容进行摘要,y o n gr u i 等人 3 9 g , l j 以棒球节目为例, 提出了通过分析棒球比赛中的音频信息,以达到对棒球比赛进行摘要的目的。 主要通过分析棒球比赛现场观众欢呼声的能量和检测击打棒球的声音,对棒球 比赛进行摘要。 还有一些机构在视频摘要研究方面做出了贡献,只不过他们研究的是视频 摘要在一些特殊定的领域。如f xp a l o a l t o 实验室设计的v i d e o m a n g a 系统 2 5 】 提出了一个图像帧大小不同的漫画书写的视频摘要方法。他们根据视频片段的 长度和新颖程度来计算视频的重要度。计算后把一些具有重要度量的帧设置成 为代表帧,最后将所有的代表帧组织成一个漫画书形式的摘要。当然,这些帧 将来在屏幕上显示的大小同样是有计算的其重要度决定的。x e r o xp a r c 中心研 制的v i d s u m 系统1 2 1 】主要是为论坛服务的,功能是把底层信号事件映射成有意 义的语义事件,从而生成摘要。 1 3 2 国内视频摘要技术发展现状 当前,我们国家也有一些学校、科研结构在进行视频摘要技术的研究,并 取得了一些令人瞩目的成果。 微软亚洲研究院多媒体计算组主要从事视频视觉信息分析的研究,以张宏 江为代表的一批研究人员做了大量的工作【4 】。文献【2 6 】中提出了一种镜头内容分 析方法及其在视频摘要中的两个应用:镜头检索与场景结构提取,为了刻画一 个镜头的内容变化,首先引入两个新的内容描述子:主色直方图和空间结构直 方图,主色直方图能够捕捉那些持续时间最长的颜色,而这些颜色是这段视频 所关注的对象或背景的主要颜色,从颜色块图提取的空间结构直方图是描述图 像空间信息的一组特征,一个变化较大的镜头可划分为几个内容一致的子镜头, 两个镜头的相似性可以从对应子镜头的相似性计算得到,镜头相似性度量可以 6 。 西北大学硕士学位论文 直接用于镜头检索,还可用于场景结构提取。另外,该文中还提出了分裂与合 并力量竞争的场景结构提取方法,并在他们所做的测试中证实了该方法在镜头 检索和场景提取的优异表现。 清华大学在如何有效的访问和利用视频信息,组织合适的视频数据方面做 了很多工作。清华大学的章毓晋等人【5 】【6 】提出将视频划分成四个层次即视频节 目、情节、镜头和图像帧的组织方法。这样一种分层结构提供了紧凑和有意义 的视频目录,方便了视频非线性浏览和基于内容的检索。文章还介绍了一系列 分割视频和组织视频的准则和方法,对视频的组织和摘要提供了有效参考。 另外,武汉大学【7 】的庄越挺,刘小明等人提出了一种新的视频相似度度量 模型,全面、系统地体现了视频间的相似程度,可以广泛地应用于针对用户提 交例子的查询中。浙江大学的冯玉材【8 】分析了多媒体数据库的功能特点及建模 过程,比较、评价了多媒体数据库三种主要的数据模型的特点、优势和不足, 指出了多媒体中非结构化信息的特点和关系数据库故有的缺陷,认为更适用于:, 采用面向对象和超媒体的数据模型。 1 4 本文主要研究内容 传统的视频摘要技术都是通过对视频里的图像信息进行分析进行摘要,而 忽略掉了与视频内容有着紧密联系的音频信息。本文正是在这种背景下,提出 了基于音频分析的视频摘要技术。以足球视频为例,本文研究内容主要包括以 下几个方面: 一 ( 1 ) 研究了足球视频中声音随着球场事件的变化情况,提出通过分析音频信 号短时能量变化来生成视频摘要的算法。 ( 2 ) 采用了对音频数据先滤波后分析的办法,最大限度的减少了噪音对摘要 结果的影响。 ( 3 ) 根据不同频段的音频信号能量变化剧烈情况不同,给出了自适应生成视 频摘要的计算方法。 ( 4 ) 分析了设置不同的能量阀值和能量变化阀值时,对摘要结果的影响。 ( 5 ) 通过检测精彩片段出现时是否出现哨音,区别射门事件和犯规事件,并 分析该处能量曲线的变化,给出了判断射门球进与否的计算方法。, 7 第一章绪论 1 5 本文的结构 本论文组织结构为:第一章是课题的背景介绍,及研究的目的和意义;第 二章是与视频摘要有关的一些技术回顾,其中有传统的镜头边界检测、镜头分 类、静态视频摘要与动态视频摘要技术,以及音频分类,音频分段和音频滤波 技术。第三章在分析了足球视频自有的特征和作用后,提出了足球视频摘要系 统的目标,并以此给出了足球视频摘要算法。第四章给出了足球视频摘要系统 实现方案。第五章是对实现方案实验评测;最后是总结和展望 。 8 西北大学硕士学位论文 第二章视频摘要相关技术 一 在基于内容的视频分析技术成为大家研究和关注热点的情形下,诱发了很 多与之相关的一些新的应用以及由此引发的关于新应用所产生的新技术的研 究。在这些新应用及新技术研究的领域内,其中有一些研究是关于如何利用对 视频内容的分析来解决视频信息的存储、检索、分类、可访问性以及怎样提高 对视频资源的使用效率等问题。本章从这一目的出发,讨论了视频摘要相关技 术。 2 1 视频摘要的概念及主要生成方法 2 1 1 视频摘要的概念 众所周知,人们在写论文、写文章的时候都会在论文或文章开头写一个摘 要,其目的就是让读者通过阅读摘要能快速的了解到本文的主要内容,包括文 章或者论文的大意、所表达的中心思想以及采用的一些分析方法等。简单的讲, 摘要就是整篇论文或者文章的高度浓缩。写论文或者文章摘要的目的要就在于 此,让读者能够快速、准确知道文章或论文在讲什么,从而选择浏览全文或者 放弃。可见一篇好的摘要对文章或者论文来讲是多么的重要。 视频摘要,顾名思义就是对视频信息的一个简短而又高度的概括。关于视 频摘要的概念,目前国内、外没有一个统一的定义,但是很多视频摘要的研究 者在对视频摘要的研究中逐步形成了共识:视频摘要就是通过用自动方式或者 半自动方式,利用多媒体技术、计算机技术来分析和处理数字视频信息,从中 提取出一个简洁的、能够高度概括整个视频信息的视频缩略 4 3 4 4 1 。 2 1 2 视频摘要的分类 在由系统分析出对某段视频摘要的结果后,需要将结果显示给用户浏览, 提供给用户进行查询的视频摘要分为两种类型:一种是静态视频摘要,另外一 种是动态视频摘要。下面简要介绍一下这两种摘要。 1 静态视频摘要 静态图像摘要也可以称作静止图像摘要或者叫静止故事板。这种摘要的生 成方式是从视频中获取一些经分析认为是重要的数据“帧 ,然后把这些“帧 组合成一个集合,这些集合中的元素也就是“帧 都是一些静态的图像,所以 9 第二章视频摘要相关技术 就称为静态视频摘要。所以生成静态图像摘要的关键就在于如何从原始视频中 获取这些重要的“帧 。 2 动态视频摘要 。 动态视频摘要被看做是一个活动的故事板,又可以称作是动态的视频缩略。 动态视频摘要主要的组成部分是图像和与图像相对应得声音信息,也就是原始 视频中的一些图像片段和对应声音的组合,只不过要比原始视频短很多。简单 讲就是通过对原有视频中图像和声音的分析,从中剪辑出最能代表原视频内容 的核心片段,然后把这些片段进行组合,形成一种动态的视频摘要。 3 两者区别 通过上面的分析,我们可以知道动态视频摘要和静态视频摘要从内容上说 一个是图像而另外一个是“帧 ,即一个是动态的图像,一个是静态的图片。两 者还有一些其他的重要区别点: 1 ) 生成视频难易程度 静态视频在生成时只是利用了原始视频中的图像信息,并没有去处理相应 的声音信息,所以就相对容易,而且速度也相对要快。 动态摘要就不同了,它不仅要处理图像,而且还要处理相应的声音,所以 相对较难,而且生成的速度也比较慢。 2 ) 采样方式 静态摘要可以从原始视频中采样,也可以不从原始视频中采样。而动态摘 要就必须要依据原始的视频信息采样来生成。 3 ) 表现形式 静态视频摘要和动态视频摘要各自具体的表现形式如图1 所示【4 1 】 1 0 西北大学硕士学位论文 图l 视频摘要分类 ( 1 ) 标题 标题【1 8 1 是对原视频内容的简明扼要的文字概括。由于只是一段文字的描 述,所以摘要就不能给观众提供一个直观了解视频信息的形式,更不能实现和 观众的互动。同时这种摘要形式如果采用计算机处理的方式得到的话,那么就 一定不能准确概括原视频内容,所以主要靠人工输入的方式实现。 ( 2 ) 海报 海报【8 】只是从视频中接截取的一些具有代表意义的图像,是以一种静态的 ,、 一 方式展示原视频信息的方式。虽然海报也能给观众提供一种可视化的信息形式, 看上去也很和直观,但却无法实现视频流在时间上连续、动态的特性,提供给 观众的图像所表现出的故事情节也都是一些片段,不能实现对故事情节的完整 描述。 ( 3 ) 故事板 故事板7 1 【8 】与海报相似,也是从视频中接截取的一些具有代表意义的图像, 但又有不同,海报是静态的,不能实现时间上的特性,而故事板则是根据这些 图像在时间上发生的先后顺序把他们组合成为能够向观众展示视频主要内容的 摘要。通过这些视频图像还可以定位到在视频中的位置,以及可以了解到更多 有关视频的详细内容及更多的故事情节。虽然能够通过故事版了解到完整的故 事情节,但却不能给观众一个动态的视频。 ( 4 ) 漫画书 漫画片【9 】同样是由从原视频中截取的图像构成的。但是截取的这些图像根 据在视频中的重要程度采用了大小不同的表现形式,有的图像大,有的图像小, 第二章视频摘要相关技术 然后把这些大小不同的图像按照原视频的故事情节进行合成,向漫画书一样展 现给观众,观众通过观看漫画书可以了解完整的故事情节,同时还能发现视频 重要的地方在哪里。 ( 5 ) 场景转移图 用视频分割的方法将原视频分割成片段,把这些片段用有向图的形式表现 出来,给观众提供一个简洁的可视化视频信息。有向图中的每一个节点代表一 组相似镜头的集合,每一条线则代表节点之间的关系,即镜头发生的先后顺序。 通过这些节点和线构成了视频场景,得到的是一个在时间上连续动态的视频转 移图。 ( 6 ) 视频概述 视频概述就是从原视频抽取一些重要的、能够代表原视频特点的一些视频 剪辑,包括一些图像和声音信息,把这些剪辑组合起来,形成一段新信息的视 频,这段视频剪辑能够反映出整个视频的主旋律和故事的结局。 ( 7 ) 精彩片段 与视频概述有类似的地方,精彩片段也是从原始整个视频提取一些重要的、 能够吸引观众眼球视频剪辑,但是并不进行组合,只让观众看到一些精彩场景, 并不表现出故事的主线,也不揭示故事的结局,从而达到吸引观众的目的。 2 1 3 视频摘要的生成算法 迄今为止视频摘要的生成算法原则上可以划分为四种: 第一种:简单的生成方法 具体的生成方法是每隔一段的时间从中抽取一个代表帧或者一个片段,也 就通过时间对视频进行采样。比如说,我们用一种技术上很容易实现的方法, 从每分钟视频中抽取前几秒来获得缩略视频,可由于没有基于视频完整的内容 来做,所以效果可靠性是很不好的。 第二种:根据视觉信息的生成方法 在抽取特征为前提下,提出了视觉信息的生成方法。该生成方法要分为两 步处理,首先是基于视频中颜色、纹理、形状、运动方向和强度等视觉信息并 与之图像融合的关键帧生成技术,通过少量预先录制的关键帧图像,生成完整 的、含有各种信息特征的关键帧库;接着是根据已知的关键帧库和输入参数动 1 2 西北大学硕士学位论文 态挑选关键帧,并在关键帧中插入中间帧,形成快速增量式中间帧生成算法, 再加上各种视频和图像处理技术,进行镜头探测、场景聚类、运动特征提取等 一系列操作,最后生成具有一定代表性的缩略视频。但是这种算法过分依赖于 视觉特征,而忽略了表现视频中音频、字幕等信息的作用。 第三种:综合性的生成方法 除了利用视觉信息的生成方法外再融入其它媒体提供的信息,从而更加确 切的判断视频片段的重要程度。例如:通过使用音频处理技术来探测体育视频 中的精彩片段;采用人脸识别技术来探测新闻中重要人物的出现等等。目前很 多数视频摘要方法都是基于这种思想的,因此这种算法也就成为研究的热点。 微软研究院、c o l u m b i a 大学、p h i l i p s 研究院、加州大学、意大利n a p o l i 大学都等做过类似的系统,其总体思想都是利用多种视频、音频特征在视频中 的重要内容进行判州3 6 1 1 3 7 3 8 1 。包括视频中是否有文字、人脸等重要对象的出现、 伴音中是否出现关键词语、是否有摄像机的运动等等;再通过建立重要度评判 模型把这些因素综合起来,从而把生成视频摘要的问题抽象成一个求解最优化 的问题,并在此基础上抽取一些重要的视频帧和音频片段来生成摘要【3 7 】。 第四种:基于视频句法语义的生成方法 一 目前的模式识别技术还不能准确、有效地从视频中抽取我们想要的文字、 人脸等信息,因此基于这些模式识别技术的方法就存在不准确性。并且模式库 也无法满足所有模式的要求,所以此方法必然会出现很多问题。事实上视频同 文本类似,也是具有句法结构的,只要我们掌握了这些句法结构规贝i j ,同样可 以像文本一样从中提取出有价值的信息生成摘要。 基于视频句法语义的生成方法就是视频的句法结构分析入手,寻求场景与 场景之间、镜头与镜头之间的结构规则,并试图分析出制作人员想用这些镜头 或者场景来表现怎样的情感和氛围【l l 】【1 2 】。然后以分析结果为基础,在制作的摘 要中尽可能的保存完整的句法语义。目前视频模式识别技术还很不完善,而这 种方法得出现为视频摘要技术的发展和研究提供了一种新的途径。 此方法的典型代表是c o l u m b i a 大学的h a f ts u n d a r a m 等人提出的基于句法 语义的效用模型【3 羽。此模型就是从分析视频的句法结构入手,并以此句法结构 为基础生成摘要。 1 3 第二章视频摘要相关技术 2 2 视频中图像分析处理技术 通过前面的介绍可以知道,视频摘要的形式是多种多样的,而且生成的方 法也有很多种。但是大多数情况下,通过视频图像信息生成摘要的一般步骤如 下: 第一步:视频分割 视频摘要的获得都是要先对视频进行分析和理解,从中获取一些信息,利 用这些信息将视频分割成一些表示信息的单位,诸如:镜头等。当然最终还要 依据分割出来的信息单位重新组合成视频片段,生成对原视频的缩略。 第二步:视频内容提取 通过一些视频处理技术,从视频中获取一些有价值的并能被计算机直接处 理的或者能够被我们的感官直接感知到的信息。 第三步:重要度评判 把第二步获取到的信息根据一定评判准则或者评判模型进行评判,评判的 目的就是把这些视频片段的重要度进行标注并分级。 第四步:合成摘要 经过第三步评判的结果,把一些重要的视频片段组合在起来,形成摘要。 在进行组合是还要充分考虑到易于观众浏览和符合人类感官的原则。 第五步:摘要表现 把第四步得到的摘要,选择合适的形式展现出来。 传统的视频摘要都是根据上面的五步得到的,有关视频摘要的研究也大多 是围绕着这几点进行的。例如,镜头探测技术、故事单元探测技术等都是在对 视频摘要研究的背景下出现的新的视频处理技术;又如在视频内容提取上所使 用的人脸识别技术、字幕识别技术等都对视频摘要的研究提供了强有力的技术 支持。本文就是通过分析视频中的音频信息进行生成视频摘要的,主要步骤为 首先从视频中提取出相应的音频信息,然后对音频数据滤波,分成各个不同频 段的音频数据,找出与精彩事件关联最大的频率段,分析该段的音频数据,求 出精彩片段时间点。 视频摘要的自动生成是以对视频中各种媒体的分析处理为基础的,那么对 这些多媒体信息处理、分析的技术方法进行探索和研究必将对视频摘要的生成 提供强有力的技术支持。以下是一些较为成熟的视音频处理技术。 1 4 西北大学硕士学位论文 2 2 1 镜头分割 。 典型的视频绪构如图【4 5 1 所示。对视频结构的描述可
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 鲁能集团就业前景
- 监控员考试试题及答案
- 高三英语一轮复习熟词生义与构词法选词填空教学设计
- 2026年辅警试卷及答案
- 高三化学教学设计:量相关方程式书写正误判断专题突破策略
- 初中九年级综合实践活动教学设计《身边环境污染问题研究》单元整体实施方案
- 事业编税务稽查岗专项训练试卷及解析
- 人工髋关节置换的中西医结合护理
- 江西九江市 2026-2027学年道德与法治九年级上学期学情自测试卷(含解析)
- 危险化学品分类信息表(含 CAS 号、危险性类别)官方完整版
- 第一单元 分类与整 理 复习课件 2026-2027学年人教版二年级上册数学
- (2026秋新版)苏教版六年级数学上册全册教案
- 2026年顺丰物流供应链优化案例与管理学分析
- 2026年危险化学品重大危险源企业安全隐患排查重点内容
- 医保结算清单质控管理制度及流程
- 2026年秋统编版(新)小学道德与法治三年级上册(全册)分层作业及答案(附目录)
- 西南政法大学模拟考试试题及答案
- 2026年甘肃省公开遴选和公开选调公务员考试(综合素质测试)综合试题及答案
- 2026关于开展树立和践行学习教育工作情况的报告汇编(9篇)
- 外墙维修措施施工方案
- 乐观积极 培养阳光心态 主题班会课件
评论
0/150
提交评论