已阅读5页,还剩83页未读, 继续免费阅读
(信号与信息处理专业论文)mpeg2压缩域中鲁棒性摄像机运动估计算法的研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
上海交通大学硕士学位论文 i mpeg-2 压缩域中鲁棒性摄像机运动估计算法的研究 摘 要 在当今信息爆炸的时代,如何实现信息的快速检索正受到研究者们 越来越多的关注。作为多媒体信息的重要组成部分,视频信息往往以压 缩格式存在,为实现快速的视频检索,更希望寻求一种能在压缩域直接 实现视频特征提取的算法。视频拍摄中的摄像机运动反映了视频的全局 运动信息,因此研究压缩域下的摄像机运动估计算法具有重要的理论意 义和使用价值。 本文首先简单介绍了基于内容的视频检索的背景历史与发展现状, 对视频检索中的一些关键技术进行了阐述,为后文的研究打下理论基 础。其后对摄像机运动估计的理论知识进行了介绍,并介绍了现行的一 些估计算法,分析和比较了压缩域下几种典型估计算法和其存在的问 题。 随后,本文提出了一种基于“自适应样本随机一致性” (asrc)估 计的鲁棒性摄像机运动估计算法。该算法只使用 mpeg-2 中 p 帧的运动 矢量,降低了视频处理的复杂度。首先对运动矢量进行一定的预处理, 去除一部分低活动性宏块中的奇异值影响,然后采用简化的 4 参数仿射 模型描述摄像机运动,结合均值漂移、 “两步尺度估计” (tsse)鲁棒 性尺度估计和 asrc 鲁棒性参数估计算法等估计模型的参数。该算法可 上海交通大学硕士学位论文 ii 以同时进行尺度和参数的估计,即在进行参数估计的同时,可以给出该 次估计相应的估计尺度,并结合该尺度值和该尺度范围内的数据点数目 两个因素综合判断估计的好坏,这更加符合鲁棒性估计的设计思想,取 得更稳定的估计效果。 该算法的击穿点高达 80%以上,也就是说,即使数据中含有 80%的 奇异值,该估计算法也可以给出正确的参数估计结果,而且该算法对于 存在多种结构奇异值的数据有很好的鲁棒性估计效果。这很好地解决了 压缩域视频中难以避免的奇异值影响问题,比现行的几种估计算法如 lmeds、m-估计等具有更高的鲁棒性。 论文实现了所提出的算法并进行了大量的数值实验,实验中选取了 多种具有不同运动特征的视频段。实验结果表明:对于对象运动较少或 者运动速度较慢的视频段,本文提出的估计算法和现行的估计算法效果 相似;而对于对象运动较多且速度较快的视频段,即当视频中的奇异值 比例较大时,本文提出的 asrc 算法仍能准确地估计出摄像机的真实运 动信息,具有很好的鲁棒性,其性能优于经典的 lmeds 估计算法。 关键词:视频检索;mpeg-2;摄像机运动估计;tsse; asrc; 上海交通大学硕士学位论文 iii research on algorithm of robust camera motion estimator in mpeg-2 domain abstract nowdays, as fast increasing of information, how to retrieve information fastly and correctly are gained much more attention. as one important part of multimedia information, video information is mostly stored in compressed format, for faster retrieval, it is more expected to develop an algrithom to extract motion feature directly from compressed domain. camera motion reflects the global motion information of video, so it is very meanful to research the camera motion estimating algrithom in compressed domain directly. this paper firstly introduced the significance and the background of researching on video retrieval technique, on the following the researching status and major technologies used. then the basic theory of camera motion estimator is introduced, and we introduced some traditional estimator algrithoms in compressed domain and analyze the performances and disadvantages in them. and then, an algorithm about camera motion estimator based on asrc (adaptive-scale residual consensus) estimator in mpeg-2 compressed domain is developed in this paper. after pre-processing the motion vector in 上海交通大学硕士学位论文 iv mpeg-2 motion field first to remove some influence of outliers caused by low activity macroblocks, we used mean shift, mean shift valley, asrc and tsse (two step scale estimator) algrithom to estimate the motion vectors in p-frame of mpeg-2 video sequence by a 4-parameter model which is a simplication of the general 6-parameter affine model. our method can robustly estimate scale and parameters on the same time, and it give score of each fit based on both the number of data points on the model and the scale related to this candidate fit. it is more reasonable for the estimator theory, so our method has high stability. the breakpoiont of our method can be more than 80%, which means it can tolerate more than 80% outliers in video chips. and even when multiple structure-noises exist in the video our method can also be high robust and can minimize the influence of the outliers in the mpeg motion vector field. this is very signifiture in application because outliers are very hard to avoid in mpeg-2 field, and it has high robustness compared with other traditional method like lmeds. we realize the algrithom developed in this paper and have done a lot of numberic experiments. and the result of simulation shows: in video clips with little and slowly object motions, which means a low percentage of outliers, our method has the similar estimator result with traditional algrithom, 上海交通大学硕士学位论文 v but when used in clips with large and speedly object motions, which means a high percentage of outliers, our method based on asrc can still get the correct camera motion information. it is more robust and has better performance than traditional algrithom lmeds. key words: video retrieval; mpeg-2; camera motion estimation; tsse; asrc 上海交通大学硕士学位论文 viii 图片目录 图 1-1视频数据库检索系统.3 图 2-1mpeg-7 的研究范围. 11 图 2-2mpeg-7 与基于内容的多媒体信息检索的联系.12 图 2-3摄像机平移操作的示意图.13 图 2-4摄像机旋转操作的示意图.14 图 2-5相机运动参数和透视图17.16 图 2-6覆盖(显露)的背景.19 图 2-7全局运动估计与补偿算法.23 图 3-1mpeg-2 压缩域中基于 asrc 的鲁棒性摄像机运动估计算法框图.33 图 4-1基于 asrc 的鲁棒性摄像机运动估计流程图.46 图 4-2mean shift 和 mean shift valley 迭代算法流程图.48 图 4-3mean shift 和 mean shift valley 寻找峰和谷的例子.49 图 4-4tsse 估计算法流程图.51 图 4-5基于 asrc 的鲁棒性摄像机运动估计算法流程图.54 图 4-6lmeds 与 asrc 的摄像机运动估计模型参数 zoom.56 图 4-7lmeds 与 asrc 的摄像机运动估计模型参数 rotation.56 图 4-8lmeds 与 asrc 的摄像机运动估计模型参数 px.57 图 4-9lmeds 与 asrc 的摄像机运动估计模型参数 py.57 图 4-10lmeds 与 asrc 的摄像机运动模型参数 zoom.59 图 4-11lmeds 与 asrc 的摄像机运动模型参数 rotation.59 图 4-12lmeds 与 asrc 的摄像机运动模型参数 px.60 图 4-13lmeds 与 asrc 的摄像机运动模型参数 py.60 图 4-14lmeds 与 asrc 的摄像机运动估计模型参数 zoom.61 图 4-15lmeds 与 asrc 摄像机运动估计模型参数 rotation.61 图 4-16lmeds 与 asrc 的摄像机运动估计模型参数 py.62 图 4-17lmeds 与 asrc 的摄像机运动估计模型参数 px.62 图 4-18lmeds 与 asrc 的摄像机运动估计模型参数 zoom.64 图 4-19lmeds 与 asrc 摄像机运动估计模型参数 rotation.64 图 4-20lmeds 与 asrc 的摄像机运动估计模型参数 py.65 图 4-21lmeds 与 asrc 的摄像机运动估计模型参数 px.65 图 4-22实验视频段中第 399 帧解码后图片.66 图 4-23实验视频段中第 400 帧解码后图片.66 图 4-24实验视频段中第 401 帧解码后图片.67 图 4-25实验视频段中第 402 帧解码后图片.67 图 4-26实验视频段中第 403 帧解码后图片.67 图 4-27实验视频段中第 404 帧解码后图片.68 图 4-28实验视频段中第 405 帧解码后图片.68 上海交通大学硕士学位论文 ix 表格目录 表 4-1 测试视频段中各个帧内的所设定的 4 个摄像机运动参数值表.58 表 4-2 视频段中第 400 和 404 帧内 lmeds 与 asrc 估计参数值对比表.69 上海交通大学硕士学位论文 x 符号说明 范数 h () 共轭转置 t ( ) 转置 1 () 逆 * () 复共轭 argmin() i 使表达式最小的 i 的取值 med( ) 取中位数 n i n n单位阵 上海交通大学硕士学位论文 上海交通大学 学位论文原创性声明 上海交通大学 学位论文原创性声明 本人郑重声明:所呈交的学位论文,是本人在导师的指导下,独立 进行研究工作所取得的成果。除文中已经注明引用的内容外,本论文不 包含任何其他个人或集体已经发表或撰写过的作品成果。对本文的研究 做出重要贡献的个人和集体,均已在文中以明确方式标明。本人完全意 识到本声明的法律结果由本人承担。 学位论文作者签名:高硕 日期:2007 年 1 月 25 日 上海交通大学硕士学位论文 上海交通大学 学位论文版权使用授权书 上海交通大学 学位论文版权使用授权书 本学位论文作者完全了解学校有关保留、使用学位论文的规定,同 意学校保留并向国家有关部门或机构送交论文的复印件和电子版,允许 论文被查阅和借阅。本人授权上海交通大学可以将本学位论文的全部或 部分内容编入有关数据库进行检索,可以采用影印、缩印或扫描等复制 手段保存和汇编本学位论文。 保密保密,在 年解密后适用本授权书。 本学位论文属于 不保密 不保密。 (请在以上方框内打“” ) 学位论文作者签名:高硕 指导教师签名:胡剑凌 日期: 2007 年 1 月 25 日 日期:2007 年 1 月 25 日 上海交通大学硕士学位论文 - 1 - 第 第1章 章 绪论 随着多媒体技术和 web 技术的发展,包括图像、视频等多媒体信息大量涌现, 越来越多的视频内容被搬到了互联网上,如视频点播、数字图书馆等,从现有的 技术来看,其生成、表示、存储、传输已基本不成问题,但可视数据的索引、访 问以及检索技术还远未成熟,对这些海量且包含大量非结构化信息的数据如何组 织、表达、管理、查询和检索就成为迫切的需求,因其具有巨大实用价值己经成 为一个亟待解决的问题。从目前来看,多媒体数据的检索方法主要还是依靠文本, 由于文本信息难以完整描述多媒体数据丰富多变的内容,手工生成文本索引费时 费力,而且缺乏统一的描述标准,如用户可能提出这样的要求: “找出数据库中所 有赛车的场面” ,虽然看似简单的要求,却很难用现有的检索方法有效的检索出来。 而图像和视频作为多媒体资源的主要构成,具有连续性、多维性及不规则性等等 特征,没有一致的取值范围、相同的数量等级,也没有相似的属性集,如果找不 到能对多媒体数据进行有效管理的方法,则大量的信息将被淹没在数据库中,无 法在需要时被检索出来。要解决这个问题就要以基于内容的检索 cbvr(content- based video retrieval)来代替传统的检索方式。 近年来, 基于内容的多媒体数据库1 的研究逐渐升温,多媒体内容描述接口 mpeg-72的逐步制定和完善,更加推动 了高效的基于内容的多媒体搜索引擎的开发。 基于内容的视频检索是指根据视频数据的底层特征,如视频帧图像的颜色、 纹理、形状、视频中镜头、场景、镜头的运动特征以及音频的音色、音调、响度 等,提取出能在一定程度上表示视频内容的语义特征,然后根据这些特征从存储 在数据库的大量视频流中进行查找,检索出具有相似特性的视频数据来。cbvr 能以用户可以接受的响应时间从大型分布数据库中快速查询到所需求的信息。基 上海交通大学硕士学位论文 - 2 - 于内容的视频检索区别于传统的基于关键词的检索手段,它是一门涉及面很广的 综合性交叉学科,需要利用图像处理、模式识别、计算机视觉、图像理解等领域 的知识作为基础,还需从认知科学、人工智能、数据库管理系统、人机交互、信 息检索等领域引入新的媒体数据表示和数据模型,从而设计出可靠、有效的检索 算法、系统结构以及友好的人机界面。 基于内容的视频检索技术有着广阔的应用前景,可以广泛应用于各种工业、 科研领域,如应用于大型监视系统中可以检测和搜索特殊类型的事件,实现监控 系统的自动化;在电影电视制作行业,基于内容的视频检索系统可以作为非线性 编辑系统的一个组成模块,提供对大量的视频数据的组织和检索;在交互多媒体 系统和数字图书馆中,可以为用户提供友好的视频浏览和检索界面,使用户更快 地找到需要的视频信息;将基于内容的视频检索引擎嵌入到常规数据库管理系统 中实现多媒体数据检索,可以使用户在网上检索和查询视频信息时也能象查询文 本信息那样方便快捷。利用其相关反馈机制,用户能更加准确地表达自己的查询 需求,从而提供内容更加一致的检索结果。基于内容视频检索技术在网络信息检 索技术中的应用为实现快速有效、功能强大、不受时空限制的智能化、个性化搜 索引擎创造了条件;在信息检索系统中,对专用领域的视频库进行检索等。 由于基于内容的检索有着广泛的需要,并有着较好的市场前景,因而也引起 了国际标准化组织的关注。mpeg 专家制定了更高版本的 mpeg-7(多媒体内容描 述接口) ,它主要是对各种类型的多媒体数据进行规范化描述,目的是便于快速和 有效地查找用户感兴趣的材料。随着多媒体内容描述的标准化,图像内容的描述 也将随之而标准化,基于内容的图像检索将朝商业化方向迈进。本文期望通过研 究视频检索技术里摄像机运动估计问题的研究,为推动这项技术的发展尽绵绵之 力。 上海交通大学硕士学位论文 - 3 - 1.1 视频检索的关键技术简介 基于内容的视频检索技术的目的是从视觉数据库中快速且精确地提取出与一 个查询相关的图像或者图像序列。由此可知,查询时用户需要选定重要的特征和 合适的相似度量参数,为了根据感知属性来检索视频,系统需要先计算出特定的 特征或参数。这也就是要求基于内容的视频检索需要先对视频数据进行处理和分 析,提取出用户所需要的感知属性特征,以便于检索。 一个典型的基于内容的视频索引和检索系统结构如图 1 所示,一段视频入库 时,首先提取视觉特征存入特征库中用来建立索引或描述,当用户浏览或检索视 频时,系统依靠这些特征找出与查询要求最接近的视频或视频片断。根据这种结 构,基于内容的检索技术的关键在于如何提取有效的视觉特征以及如何利用这些 特征进行高效的检索4。 特征 提取 查询 界面 特征 库 检索 模块 视频 数据库 视 频 数 据 用 户 输 出 结 果 图 1-1视频数据库检索系统 fig 1-1 video data base retrieval system 在众多基于视觉特征的检索方法中,通过例子查询和通过草图查询是两种典 型的查询方法;而颜色、纹理、形状、运动、空间关系等是用于相似性匹配的最 常见的视觉特征。 纵观大量关于介绍基于 cbvr 的算法和系统,我们认为 cbvr 的研究内容应 上海交通大学硕士学位论文 - 4 - 当包括以下几个主要方面3: 1.建立视频结构化数据模型 视频结构化主要是指将视频按照内容组织为镜头和场景等比视频帧更高层描 述的过程,是实现视频检索的核心。 人们通常将视频看成一个时间上连续的图像序列,通过它叙述一件事情,但 是在视频检索中,人们需要通过视频获取信息,如何判断这一段视频中是否包含 他们感兴趣的内容,这就需要将视频数据结构化。最常见的视频结构化工作就是 镜头分割,通过镜头分割,可以实现对视频基于镜头进行浏览。但是,一般的视 频中有很多镜头,浏览起来还是很不方便,另外,镜头是些零散的剪切单元,不 能完整表述一个事件,不能成为人们关心的语义单元。因此,目前研究集中在结 合多类特征(如音频、视频、文本等)抽取视频的语义和叙事结构上,在多个层次上 组织视频内容。 2.建立适当的内容特征描述 特征描述是 cbvr 的核心问题,描述的好坏对检索的效果有直接影响。人们 在日常生活中习惯使用简便的事物概念,例如用“树林、汽车、海滩”等概念表 达具体的含义,在视频中,它们属于高层语义内容。如果能够建立视频数据底层 特征与高层语义概念的关联,就能够使计算机自动抽取视频数据的语义特征,这 也是 cbvr的目标。 3.联合多特征的检索技术 视频包括颜色、纹理、运动等多种特征,利用这些特征可以从不同的角度表 示视频内容,综合利用两种或多种视觉特征,容易达到较高的检索率。而如何按 照用户的要求有机地组织这些特征来支持查询,足一个值得研究的问题。 4.设计检索系统 设计一个完整的基于内容的视频检索系统,需要涉及人机交互、相关反馈、 高维索引等技术问题。检索系统需要一个友好的人机界而,要求具有多种模式的 查询提交方式,检索结果要直观、明了。因为视频内容的特征极其丰富,对于索 上海交通大学硕士学位论文 - 5 - 引能力的要求远远大于传统数据库,因此还需要研究新的索引结构和算法,以支 持快速检索。 5.性能评价 需要有一套能够平衡表达各种场景和事物的标准测试数据来评价检索的效率 和效果,这是一项复杂的工作,要召集相关领域专家收集大量有代表意义的视频 数据,以便能够测试各种算法的效率。在此基础上,定义标准的性能评价准则, 如检索率、查准率、查全率、响应时间等,这样就可以利用标准的检索性能评价 准则来全面检验算法的性能。 虽然基于内容的视频检索技术已经有了一定得发展,但对视频内容描述的兼 容性、灵活性和标准化还有待进一步研究。目前,mpeg-7 作为一种被广泛接受的 一种国际标准,在基于内容的视频信息检索中得到实际运用。 1.2 视频检索中运动特征提取技术的介绍和研究现状 基于内容的视频检索研究工作已经取得了很大进展,初期研究主要集中在分 析图像及视频帧的低层次特征上,如色彩、纹理结构等,近期的工作则集中在更 加接近直观内容的分析上,如视频对象的构成关系、运动特征、视频节目的伴音 分析及字幕识别等,反映了更加接近高层语义信息的趋势。 如上节所提到的视频结构化技术,虽然可以大量的降低视频处理复杂度,然 而结构化技术的本质是用一幅静态的图像来代表一段视频,它所能表达的信息通 常为“是什么” 、 “有什么” ,而无法表示“干什么”这类的动态信息,如果用户关 心的是某一个动作或某一个过程,对于关键帧的检索往往很难满足这种要求,因 此有必要提取视频数据中的运动信息来用于基于内容的视频检索,而且视频数据 区别于其它媒体的一个重要特征是它包含有丰富的运动信息,因此如何利用这些 运动信息来为视频检索服务,是一个值得深入研究的问题。 运动作为视频一个重要的特征,是反映视频变化演进的重要信息,是视频区 上海交通大学硕士学位论文 - 6 - 别于图像所特有的内容,但是它不是直观可见的,而是隐藏在其它视觉特征诸如 颜色、纹理、形状的变化之中,必须运用特定的方法才能提取出来。视频中的运 动信息又是复杂多样的,拿一个足球比赛录像来说,其中既有球员和足球的位置 移动,又有摄像机跟踪球员和足球而引起的运动。因此,在提取视频运动特征时, 通常将摄像机移动形成的运动信息和视频对象产生的运动信息分开处理,分别称 为全局运动和局部运动。 一段视频数据并不是由一系列任意的图片沿着时间轴简单堆叠而成,而是一 组在时间轴上有很强相关性的图像组成的,充分利用这种相关性,可以更好地对 视频数据进行压缩或检索。要分析视频的运动特征,首先要提取视频序列中的运 动矢量,它是对物体或摄像机在 3 维场景中的运动造成的在 2 维图像平面上投 影的变化的一种估计,运动矢量估计在计算机视觉和视频压缩中有着重要的作用。 运动估计是获取视频运动特征的一种传统方法,它基于“任意时间光流场亮 度不变”5假设,通过匹配算法估计出每个像索或区域的运动矢量,作为视频的 运动特征。最简单的全局运动估计就是估计出图像中每个像索点的运动矢量,然 后取主运动矢量为全局运动矢量,因此称为像素域运动估计。像索域运动估计算 法固然结果很好,但是由于计算量太大,导致效率过低,于是又衍生了很多种快 速算法,如块匹配运动估计、可变形块匹配、基于网格的运动估计以及分层块匹 配估计等等。 全局运动信息并不能反映视频里丰富的运动信息。随着 mpeg-4 以及 mpeg- 7 等多媒体国际标准的相继提出,对视频进行从于内容的操作的要求变得越来越明 确。mpeg-4 标准第一次提出了视频对象( video object )的概念,将视频场景表示 为各自相互独立的视频对象的组合;mpeg-7 标准则定义了四个运动描述子用来描 述视频中的运动特征,即摄像机运动、运动对象轨迹、对象参数运动和运动活动 性描述子,其中摄像机运动描述子就是用来描述全局运动信息的,而运动对象轨 迹及对象参数运动描述子则需要检测出视频中的运动对象。 当前提取视频对象的方法有很多种,按人工参与程度主要可以分为自动提取 上海交通大学硕士学位论文 - 7 - 和人工交互提取两大类。自动提取算法可以自动地从视频序列中分割出视频对象, 如基于光流法的分割、运动跟踪法和基于变化区域的检测法;而人工交互式提取 通常是由计算机进行底层的分割,然后再通过人工标记属于同一个目标的区域, 属于半自动的视频分割方法,在分割过程中需要人为施加影响,不能自动进行。 在所有的从视频序列中计算运动矢量的方法中,基于块匹配的相关性技术是 最直观且被广泛应用的方法,mpeg 视频压缩标准采用的就是这种块匹配方法2。 块匹配技术的基本假设是每个块的灰度模式在连续帧中几乎保持不变,且局部的 纹理包含了足以互相区分的信息,这样可以通过在一定大小的窗口中搜索出唯一 匹配的灰度块来得到图像序列的运动矢量。块匹配算法的最大的不足是计算的复 杂性,计算一个帧的运动矢量场需要进行 n2次匹配搜索,如果搜索限定在距离原 块为 m 的范围之内,总的时间复杂度为 n 2(2m +1)2 ,这样大的计算量即使在高 性能的计算机上也要有相当长的时间。目前,已经提出了许多方法来提高块匹配 算法的性能,如窗口亚采样法、快速搜索算法、查找表法等。目前研究的最多的 是快速搜索算法,如二维对数法、三步法、新三步法、四步法、菱形法等等。 由 horn 和 schunk 在 80 年代早期建立的光流分析法6,也是运动估计的重 要方法。从光流基本等式求解光流场是一个不适定问题,各国的研究者均在探索 求解该不适定问题的方法,其间出现了许多算法,例如,horn 提出了加在光流场 上的附加约束即整体平滑约束,将光流场的计算问题转化为一个变分问题。nagel 考虑到基本等式本身已对光流场在该点灰度场的梯度方向上有了约束,因而提出 附加的平滑性约束为光流场在沿着与梯度的垂直方向上的变化率最小7。傅洁、 吴立德提出与运动边缘检测相联系的平滑约束8。目前,光流场计算技术的研究 大致有以下几个方向:研究解决光流场计算不适定问题的方法,研究光流场计算 基本公式的不连续性,研究直线和曲线的光流场计算技术,研究由光流场重建物 体三维运动和结构。 以上介绍的各种算法都是在原始域中进行的,如果对压缩域中的视频采用这 些算法,将需要耗费大量的解码时间,极大的增加了计算复杂度,不利于视频检 上海交通大学硕士学位论文 - 8 - 索的实时实现。因此,很有必要直接在压缩域中进行运动估计。现在已有一些压 缩域上的估计算法研究,如改进的 ls 估计,lmeds 估计,m-估计等,他们大都 基于 ls 估计,在不同程度上增加可接受的计算复杂度,提高估计算法的鲁棒性, 本文将在第二章中详细介绍。 根据运动运动矢量场,可以进一步提取更高层次的运动特征,例如建立全局 运动模型对摄像机运动进行估计,运动对象分割并对物体运动模型进行估计,对 运动物体进行长时轨迹跟踪,对物体变形或流体运动的分析等等。因此本文针对 运动特征提取中的一个重要部分:摄像机运动估计算法进行了深入研究。 1.3 论文的内容安排 以上从视频检索的历史着手,简单介绍了视频检索的研究背景,并对视频检 索中的关键技术点进行了简单阐述,简略介绍了现有的研究状况和算法的比较分 析。本文将提出一种 mpeg-2 压缩域下基于 asrc 的鲁棒性摄像机运动估计算法, 并在此基础上做进一步的分析和研究。为此,本文共分五章,安排如下: 第一章 绪论。主要介绍课题的意义和历史背景、视频检索的一些关键技术和 目前国内外的研究现状。最后说明了本文的内容安排。 第二章 首先介绍视频检索的标准 mpeg-7 语义描述子中的摄像机运动描述 字,并对摄像机运动估计算法的原理进行阐述,其后将介绍两种经典的摄像机估 计算法,并对其算法性能进行分析和研究。本章的介绍将为下面的论述以及更好 的理解全文打下基础。 第三章 将提出一种 mpeg-2 压缩域下基于 asrc 的鲁棒性摄像机运动估计算 法。该算法结合 tsse 尺度估计和 ransac 参数估计,具有更好的鲁棒性估计效 果,并通过实验分析了其性能。 第四章 性能仿真与评估。本章将在上一章算法的基础上对算法实现流程、算 法参数选择和算法的估计结果做进一步分析和说明。 上海交通大学硕士学位论文 - 9 - 第五章 对本文做了总结,并对今后基于内容的视频检索方法提出展望。 上海交通大学硕士学位论文 - 10 - 第 第2章 章 摄像机运动估计的算法研究 本章从基本概念入手,首先介绍了本文所涉及到的 mpeg-7 摄像机运动描述 子,为更好地理解本文内容打下了良好的基础;其后对摄像机运动估计的原理进 行了研究,并介绍了两种很经典的压缩域中的摄像机运动估计算法。 2.1 摄像机运动描述子概述 摄像机的运动是一种重要的视频表现手段,在拍摄时,摄像机的运动也在一 定程度上体现了导演的拍摄意图,因此判定摄像机运动,可以获得视频内容的丰 富的语义信息,从而为检索提供重要的语义线索。通常,一个镜头中只包含一种 摄像机运动,但是根据剧情的需要,一个镜头中也可以包含多种摄像机运动,特 别是在体育视频中显得尤为突出,如一场足球比赛的视频。摄像机运动会造成图 像中所有点的移动,也等价于视点的更新,在新闻、体育、故事片中都有广泛的 应用。 视频中的运动信息复杂多样,在进行视频数据运动分析时,通常将摄像机移 动形成的运动信息和由场景中物体产生的运动信息分开处理,在描述一个视频的 内容时,通常把视频中的内容分为背景和前景,因此,在视频序列的运动分析中, 也常把运动信息分为背景运动信息和前景运动信息。背景运动是由摄像机的运动 造成的镜头内所有点的整体移动,它又被称为全局运动或摄像机运动;而前景运 动是指被拍摄物体在场景中的运动,又称为局部运动。人们理解视频中的运动内 容时,通常关心的主要是前景物体的运动,因此有必要将两种运动分离出来。而 且,这两种运动的性质也是截然不同的,全局运动的整体性强、计算量小、结果 上海交通大学硕士学位论文 - 11 - 不够稳定且难以用特征完整的刻画,使它可以用一组很少的模型参数来表示;而 局部运动则较为复杂,只在小范围内表现出一定的一致性,需要有比较精细的方 法才能完整的刻画。另外,物体各点的运动是由全局和局部运动叠加而成的,为 了正确的提取局部运动信息,必须首先估计出全局运动信息,并在对局部运动进 行分析时将它的影响去除9。 2.1.1 mpeg-7 标准简介 mpeg-7是由 mpeg ( moving picture experts group移动图像专家组)制定的一 个 iso/iec 标准。mpeg-7 的正式名称是“多媒体内容描述接口” , (multimedia content description interface) ,目的在于为描述多媒体内容提供一个标准。 mpeg-710是关于内容描述的,它的研究范围11如图 2-1 所示,而它与基于 内容的多媒体信息检索的联系如图 2-2 所示。可见,mpeg-7 是建立在信息分割与 特征提取之上的,也就是说它只对信息特征进行描述,而并不关心这些特征是如 何得到的。同时 mpeg-7 还与搜索引擎相连,搜索引擎可以利用 mpeg-7 描述的 内容来进行搜索并返回结果给用户,mpeg-7 本身并不直接参与信息的搜索过程。 这样,虽然特征提取的方式方法很多,搜索引擎的实现方式也不同,但 mpeg-7 在它们之间提供了标准的接口,于是搜索引擎可以不必关心实现特征提取的细节 而只需就标准的信息描述进行信息搜索,所以 mpeg-7 在基于内容的检索中起着 桥梁的作用。 特征提取标准化描述搜索引擎 mpeg-7应用范围 媒体数据 图 2-1mpeg-7 的研究范围 fig 2-1 research range of mpeg-7 上海交通大学硕士学位论文 - 12 - 特征提取特征提取特征提取 数据库 数据信息 mpeg-7 分析提取 图 2-2mpeg-7 与基于内容的多媒体信息检索的联系 fig 2-2 relations between mpeg-7 and content-based multimedia information retrieval mpeg-7 标准包括了下面几个部分:系统(system)、描述定义语言(ddl)、音 频(audio)、视觉(visual)、多媒体描述模式(mds(multimedia description schemes)、 参考软件(reference software)、一致性原则(conformance)、抽取和使用八个部分。 其中视觉描述包含有以下几种基本的视觉特征:颜色,纹理,形状,运动,定位 以及人脸检测。对每一种视觉特征都有多个基本的和高级的描述子。由于本文主 要基于摄像机运动估计算法的研究,所以本节将只介绍 mpeg-7 摄像机运动描述 子。 2.1.2 摄像机运动描述子 对于一个给定的视频序列,此描述子用来描述由于摄像机运动所产生的全局 运动。以三维相机模型为基础,支持熟知的摄像机的八种基本运动以及它们的任 意结合模式。 对于摄像机的运动模型,mpeg-7 标准从摄像机操作的角度进行了详细的规 定。摄像机的运动方式12共有 6 种: (1) 扫视(panning),即摄像机水平旋转; (2) 倾斜(tilting),即摄像机垂直旋转; 上海交通大学硕士学位论文 - 13 - (3) 变焦(zooming),即摄像机改变焦距; (4) 跟踪(tracking),即摄像机水平(横向)移动; (5) 升降(booming),即摄像机垂直(纵向)移动; (6) 推拉(dolling),即摄像机前后(水平)移动。 常用的只有前四种。它们的结合构成 3 类操作:平移操作、旋转操作、缩放 操作。 图 2-3 给出摄像机平移操作的示意图,(a)、(b)、(c)分别对应从摄像机正面、 侧面、顶面看到的情况。摄像机共有 6 个方向的移动,即前进(dolly forward)、后 退(dolly backward)、升高(boom up)、降低(boom down)、左移(track left)和右移(track right)。 升高 左移 右移 降低 后退 前进 升高 降低 左移 右移 前进后退 (a)(b)(c) 图 2-3摄像机平移操作的示意图 fig 2-3 camera flatly motion processing chart 图 2-4 给出摄像机旋转操作的示意图,(a)、(b)、(c)分别对应绕摄像机镜头轴 线转动的情况(正对镜头方向)、在垂直平面中转动的情况(左视图)和在水平平面中 转动的情况(顶视图)。摄像机共有 6 种转动,即绕轴线顺时针转动(roll clockwise) 和逆时针转动(roll counterclockwise)、向上倾斜/仰视(tilt up)和向下倾斜/俯视(tilt down)以及向左扫视(pan left)和向右扫视(pan right)。 上海交通大学硕士学位论文 - 14 - 上倾斜 左扫视右扫视 下倾斜 旋转 上倾斜 下倾斜 左扫视 右扫视 后退 (a)(b)(c) 旋转 图 2-4摄像机旋转操作的示意图 fig 2-4 camera rolly motion processing chart 摄像机的前进和后退均是沿光轴的运动,缩放操作也是沿光轴进行的,但它 是镜头焦距的变化造成的。摄像机共有两种缩放运动,即放大镜头(zoom in)用于 将摄像机对准/聚焦感兴趣的目标,缩小镜头(zoom out)用于给出一个场景由细到粗 的全景展开过程。 以上 14 种摄像机运动是两两成对的,且每对中摄像机的运动方向正好相反 13。 估计相机运动对于视频分析算法、索引和检索、科学电影分析来说都很重要。 从艺术角度来说,摄像机运动常在电影工业中作为一种表达元素。最近一些研究 人员14还提出了“计算媒体美学”这一术语,旨在消除低层特征抽取算法和用户 的高层查询之间的语义差异。 2121 描述符描述符 每个子镜头中的所有帧都只有一种特定的相机运动类型,这种相机运动类型 可以是单个的也可以是混合的,这种子镜头就是相机运动描述子的基石。每一块 基石都由以下几个因素描述:其开始时间、持续时间、通过将持续时间的片断和 一个给定的时间窗口的尺度相比较得到的图像运动速度、扩张中心(focus of expansion - foe )以及收缩中心(focus of contraction - foc )。这个描述子描绘了这 些基石的集合,并且可以选择不同相机运动类型的混合模式或是非混合模式。 上海交通大学硕士学位论文 - 15 - 在混合模式中,基础操作在一个给定的时间窗口内(例如一个视频镜头或是场 景)通过确定他们的重要性(它们的持续时间和速度)来联合描述,使这些运动类型 同时发生,捕捉了相机运动参数的全局信息,而不考虑细节的时间信息。 另一方面,在非混合模式中,基础的操作是不关联的,通过确定他们某时刻 的准确位置和速度,描述为独立的纯运动事件。也就是说非混合模式捕捉纯运动 类型以及它们在一段时间间隔内的联合。我们将多种运动类型同时发生的情况描 述为纯运动类型的一个联合。在这种描述模式下,一个特定的基本段的时间窗口 可以和另一个基本段的时间窗口重叠。有了这两种模型就可以描述在不同粒度下 随时间变化的相机运动信息。 每个相机运动段(不管是混合或非混合模式)都由它的运动类型(motion type)以 及三个参数表示15:存在的时间比(fractional presence)、运动量(amount of motion) 和扩张/收缩中心
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026中国网络安全服务行业市场发展趋势与前景展望战略研究报告
- 2026中国鲜花礼品行业市场现状供需分析及投资评估规划分析研究报告
- 2026中国纸制品行业市场供需现状分析行业发展投资评估规划研究发展报告
- 2026中国物流企业数字化转型成熟度评估及实施路线图
- 2026中国智能农产品供应链体系发展现状调研及投资评估报告
- 2026汽车塑料件行业市场需求评估投资规划研发分析研究报告
- 2026实验室培育肉产业化进程中的消费者认知改变调查报告
- 2026中国新能源交通工具制造行业市场现状供需分析及投资评估规划分析研究报告
- 2026欧洲厨卫五金产品行业竞争格局解析与超长周期投资风险评估报告
- 2026人工智能伦理治理框架国际共商与中国技术标准输出探索
- 合作项目启动联络函(8篇)
- 2026年新版应急处置卡共31项含管理和操作岗位
- 上海市2025上海同济大学生命科学与技术学院本科生教学秘书招聘1人笔试历年参考题库典型考点附带答案详解
- 隧道装配式仰拱设计与施工技术标准 征求意见稿
- 永丰县公安局招聘警务辅助人员笔试真题2025
- (2025版)中国成人患者围手术期液体治疗临床实践指南解读
- 2025年评茶员年度工作总结
- 医院保洁院感培训课件
- 应急部13号令培训课件
- 交通行政执法培训课件
- 老年慢性咳嗽中西医结合诊疗方案
评论
0/150
提交评论