一种基于隐条件随机场的相关反馈视频检索方法_第1页
一种基于隐条件随机场的相关反馈视频检索方法_第2页
一种基于隐条件随机场的相关反馈视频检索方法_第3页
一种基于隐条件随机场的相关反馈视频检索方法_第4页
一种基于隐条件随机场的相关反馈视频检索方法_第5页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、一种基于隐条件随机场的相关反应视频检索方法摘要:相关反应作为跨越语义鸿沟的有效手段,已经被广泛应用于基于内容的图像检索中,本文那么将相关反应用于基于内容的视频检索中。体育比赛视频、新闻视频等特定领域的视频结构简单,研究者众,本文那么以更一般的电影视频为研究对象,首次以情节为切入点,提出基于隐条件随机场HCRF的相关反应算法,检索出用户感兴趣的各类视频片断。实验结果显示本算法检索性能良好。论文关键词:基于内容的视频检索,相关反应,隐条件随机场视觉信息检索包括图像检索和视频检索,其中图像检索更为根底、简单,研究成果也较多,视频检索的研究成果那么较少。其实,人们对视频检索的兴趣更为浓厚,并且已经作了

2、一些有益的工作。随着生活中数字视频的迅速增加,人们常常需要从海量数据中寻找自己感兴趣的内容,但是这方面的工作多集中在结构简单的视频节目中,对更一般的视频节目如电影而言,检索那么比拟困难,原因是一般的视频节目中数据之间关系复杂,数据组织非结构化。在视频检索领域,前人已经做了一些有益的工作,如镜头检测、镜头聚类、关键帧提取和视频数据库管理等。我们的工作在前人的根底上,结合影视学的相关理论,提出基于隐条件随机场的相关反应方法。利用视频段内、视频段间对象之间时间、空间的关系建立隐条件随机场的模型。2 蒙太奇思维蒙太奇montage源自法语安装、组合、构成;,原是建筑学术语,指将各种不同的建筑材料根据某

3、种设计思路,安装、组合并构成有机整体的建筑,产生出新的功能和效用。引申到影视艺术中蒙太奇就成为各种元素的组合和结构。蒙太奇从技术环节上看,是影视后期制作中一道非常重要的工序镜头剪辑,它主要是指:镜头长度确实定、镜头之间的组接、画面与声音间的组合,即除去素材中多余局部,将素材以帧为单位精确地拼接在一起,再将画面与声音有机结合在一起,使素材最终成为一部完整的视听作品。3、相关反应将相关反应relevance feedback引入检索过程,可以提高检索的精度。相关反应;最早出现于文本检索中。因为用户提交的查询往往不能完全表达他们的检索目的,只能大致描述检索倾向,这样一次检索就得不到理想的检索结果。而

4、且,只是一次检索,用户需要花费在初始的查询构造上的时间并不少,相关反应的出现就解决了这个问题,初次查询的结果并不作为检索的答案,而是一个中间结果,系统根据这个结果得到用户的相关反应修改查询要求,进行再一次的查询。具体来讲,首先用户给出大致要求,系统进行粗略的查询,返回给用户初次检索的结果,用户对初次检索出的结果集合进行判断,符合用户要求的标注为正例、不符合用户要求的标注为负例也可以不标注负例,然后系统根据用户标注结果进行自我调整进行新一轮查询,如此反复,直至用户得到满意的检索结果或者系统的检索精度到达了稳定状态为止。相关反应是将用户参与作为检索的一个重要环节。31 查询点移动每一轮查询,都使得

5、查询点更接近理想查询点,检索样本中与正例相关的特征得到加强、与负例相关的特征得到减弱,通常用Rocchio公式来描述:其中, 第次查询时,查询点的位置 第次查询时,查询点的位置 特征向量 的基数 , 加权系数32 查询参数调整考察用户正例反应集合中特征向量的各个分量,如果反应集合中的各个特征向量在向量空间某维上的分布越乱,那么认为该分量与检索的相关程度就越小,所以,就应该减小该分量的权重,反之,那么应增加该分量的权重。33 支持向量机用于相关反应时的缺乏SVM在解决分类问题上取得很大成功。但是,现实很多任务面对的数据是需要多个标注的序列数据、空间数据或者结构化数据,SVM在处理这些问题时,对每

6、一个目标独立地进行标注,无视了大量有用的信息。而概率图模型可以利用这些数据的结构信息,表示出目标之间的关系,大大提高标注的精度。我们研究的对象是视频数据,这是时空信息丰富的结构化数据,所以,使用概率图模型是一个更好的选择。4、 基于隐条件随机场的相关反应算法基于隐条件随机场的相关反应模型可以方便地对用户感兴趣的多类视频进行检索。算法如下:由用户选出感兴趣的几段视频,并按类别不同给予不同的标注;由中得到的样例集训练HCRF模型;利用训练好的HCRF模型将视频库中所有视频段分类,并按概率从大到小排序,返回值最大的假设干视频片段;由用户标注返回的这些视频片断是否与用户的需求相关;将此次迭代用户标注得

7、到的样例集与之前的样例集并为新的样例集,即累积样例集。返回步骤,重复上面的步骤直至用户终止本次查询。4、 1系统框架利用HCRF模型对视频序列中的时空领域关系建模,使用在线学习的方式对相应的参数进行调整,实现对时空邻域约束关系的权重调整。查询视频 检索结果 是 最终结果否图1 系统框架51 镜头检测视频内容以情节和事件组织,包含特定时间和空间内的故事或者特定视觉信息,所以,更应该将视频看作结构信息丰富的文档,而不是毫无结构的帧序列。镜头是摄像机的一次起停操作,是视频数据的根本单元,它代表一个场景中在时间上和空间上连续的动作,任何一段视频都由假设干镜头组成的。我们用象素比照拟方法来进行镜头检测,

8、这种方法非常简单,计算量也很小。实验显示,镜头检测效果可以满足下一步工作的需要。下面简要介绍一下象素比照拟方法。对两帧相邻的帧图像和,可以计算其对应位置上两个象素的灰度差:如果这两帧图像中灰度差大于某个阈值的象素超过一定数目,即可认为发生了镜头转换。2 多媒体特征抽取用户感兴趣的镜头通常由相似的场景组成,并且具有相似的场景转换序列。因此,为了检测这些镜头,我们需要抽取能区分这些场景的特征。这些特征包括图像特征、音频特征、运动特征和时间特征。在前人针比照赛视频的检索中,认为图像特征是最为重要的,音频特征等只为检索提供补充的线索,而我们认为在影片中,音频特征等也表达了大量信息,与图像特征同等重要。

9、多媒体特征及其抽取方法描述如下。521 图像特征图像特征中我们考虑颜色分布和边缘分布。1 颜色分布色彩是直接影响观众观看心理的影视画面构成元素,影片通过对画面色彩的设计和搭配形成影片特有基调,到达衬托主题、表达情感的目的。在我们的框架中,每一个子镜头由3个关键帧表示:最开始的帧、中间的帧和最后的帧。每一个关键帧分为2x2的块,然后每个关键帧的颜色由4个一维向量ri,gi,bi组成,其中ri、gi和bi分别代表块i中红色、绿色、蓝色各占的百分比。2 边缘分布边缘分布的计算方法与颜色分布的计算方法类似。首先,利用边缘检测方法检测出每一个关键帧的边缘象素,然后,每个关键帧被分为2x2的块,分别计算4个块中的边缘象素的百分比,这4个百分比的值被用来形成这个帧的边缘分布。53 多媒体特征向量的构建将前面介绍的特征从输入的视频中抽取出来,放在一起构成每个镜头的多媒体特征向量。一旦构建出每个镜头的特征向量,我们就可以将n个连续的镜头联合起来构成1个向量输入HCRF模型。因为这个输入向量整合了从n个连续镜头得到的与时间关联的多媒体特征,所以我们可以充分利用HCRF来对多媒体特征间的相互关系和嵌入于场景转换类型的上下文信息建模。3 结论本文针对一般视频的检索,提出了基于HCRF的相关反应算法。该算法利用HCRF模型融合了视频中

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论