(电路与系统专业论文)基于单目视频生成角色动画.pdf_第1页
(电路与系统专业论文)基于单目视频生成角色动画.pdf_第2页
(电路与系统专业论文)基于单目视频生成角色动画.pdf_第3页
(电路与系统专业论文)基于单目视频生成角色动画.pdf_第4页
(电路与系统专业论文)基于单目视频生成角色动画.pdf_第5页
已阅读5页,还剩64页未读 继续免费阅读

(电路与系统专业论文)基于单目视频生成角色动画.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

学科专业:电路与系统 研究生:邓筱楠签名:圣戡 指导教师:张志禹教授签名:刍蚴 张九龙副教授签名: 丝盘参 摘要 从视频图像信息中获取和分析人体运动的各项参数并生成动画是一个多学科融合的 重点研究方向,其主要过程是从单个或多个视频序列中检测、跟踪、获取人体运动的相关 数据,重建人体的三维运动或描述和理解人体运动。这种人体的视频运动研究在动画制作、 3 d 游戏、虚拟现实、视频监控、体育运动分析、医学诊断等领域有着广泛的应用前景。 本文针对仅有一个摄像机获取的单目视频图像序列的情况,对人体进行跟踪和分析并 生成角色动画,主要包含三个步骤:( 1 ) 从背景中提取运动人体;( 2 ) 人体运动的跟踪和分 析;( 3 ) 利用捕获到的运动参数生成角色动画。研究了单目视觉下基于关键帧的人体关节 点的跟踪方法。利用跟踪的结果对人体运动进行分析和理解,形成动作语义并进行动画模 使人体运动的跟踪和分析变成一个姿态估计问题。使用了结合概率模型的粒子滤波算法来 完成非线性动态人体的状态估计,粒子滤波算法更适合非线性系统的估计和分析,且能在 杂乱背景及遮挡情况下较好地完成跟踪任务。在图像特征的选取方面,使用了灰度、轮廓 本文算法具有较好的精度和运算速度,能够满足实时性的要求,通过试验获得了具有 真实性的运动数据。结果表明,能够完成指定的运动跟踪分析及动画生成任务。 关键词:单目视频;运动跟踪;人体模型;三维重建;角色动画 西安理工大学硕士学位论文 i l t i t l e :g e n e r a t i n gc h a r a c t e ra n i m a t i o nb a s e do n m o n o c u l a rv i d e o s e q u e n c e s m a j o r - c i r c u i t sa n ds y s t e m s n a m e - d e n g x i a on a n s u p e r v i s o r - p r o f z h i y uz h a n g a s s o c i a t ep r o f j i u l o n gz h a n g a b s t r a c t s i g n a t 叭:壁竺坐! 枷 s i g n a t u s i g n a t u t h er e s e a r c ho nh u m a nm o t i o na n a l y s i sa n da n i m a t i o ng e n e r a t i n gb a s e do n v i d e o1 s0 n e0 t t h em u l t i i n t e r d i s c i p l i n a r yr e s e a r c ha r e a s h u m a nm o t i o na n a l y s i sh a sa t t r a c t e dg r e a ti n t e r e s t s f r o mc o m p u t e rv i s i o nr e s e a r c h e r sd u et oi t sp r o m i s i n ga p p l i c a t i o ni nm a n y a r e a ss u c ha sv 1 s u a i s u r v e i l l a l l c e 。a n i m a t i o ns y s t e m ,v i d e om o n i t o r i n g ,a t h l e t i cp e r f o r m a n c ea n a l y s i s ,v i r t u a lr e a l i t y , e t c t h em a i na j mo fv i s u a la n a l y s i so fh u m a nm o t i o ni st od e t e c t ,t r a c ka n di d e n t i f yp e o p l e ,a n d m o r eg e n e r a l l y 。t oi n t e r p r e th u m a n b e h a v i o r sf r o mi m a g es e q u e n c e si n v o l v i n gm h n a n s i nt h i sp a p e r w eu s et e c h n i q u e si nc o m p m e rg r a p h i c s ,i m a g ep r o c e s s i n g ,c o m p u t e rv 王s l o n t oe x p l o r em e t h o d so ft r a c k i n ga n ds i m u l a t i n gh u m a n s3 dm o t i o nf r o mm o n o c u l a rv 1 d e o s e a u e n c e s 1 1 1 em a i nc o n t r i b u t i o n sa r ea sf o l l o w s :f i r s t ,e x t r a c tm o v i n gh u m a nb o d y 士r o m b a c k g r o u n d s e c o n d 。t r a c k i n ga n da n a l y s i sh u m a nm o t i o n t h i r d ,u s i n g t h ec a p t u r e dm o t l o n p a r a m e t e r st og e n e r a t e dc h a r a c t e r a n i m a t i o n an o v e la p p r o a c ho nm a r k e r l e s sh u m a nm o t i o nt r a c k i n gi nm o n o c u l a r v i d e o s1 sp r o p o s e d t h en e wa p p r o a c ht a k e sa d v a n t a g eo fal e a r n tm o t i o nm o d e lt op r e d i c tt h eh u m a n m o t i o n ,a n d u s e sa na p p e r a n c em o d e lt o c a l c u l a t et h el i k e l i h o o d t h ec o n d i t i o n a ld e n s i t yp r o p a g a u o n t e c h n i q u eo ft h ep a r t i c l ef i l t e r i n gi se m p l o y e dt oi m p l e m e n tt h eh u m a n t r a c k i n gi nm o n o c u l a r v i d e o s t h ec a p a b i l i t yo ft h ep a r t i c l ef i l t e r i n g i np r o c e s s i n gn o n 。g a u s s i a na n dn o n l i n e a r s i t u a t i o n sm a k e st h ea p p r o a c hr o b u s tt ot h ea m b i g u i t ya n dc l u t t e rb a c k g r o u n d s e l e c t t h e g r a v s c a l e ,o u t l i n ea n dc o l o rf e a t u r e s ,a n dt h i sv a r i e df e a t u r e sm e t h o dc a ni m p r o v e t h ea b i l i t y0 f d e t e c t i o na n dm a t c h i n g t h ee x p e r i m e n tr e s u l ts h o w st h a tt h ea l g o r i t h mc a nm e e tt h er e a l t i m er e q u i r e m e n t ,e c a l lc o m p l e t et h es p e c i f i e dh u m a nm o t i o nt r a c k i n g ,a n a l y s i sa n da n i m a t i o nb u i l d l n g ma n a c c u r a c ya n ds p e e d yw a y k e yw o r d s : m o n o e u l a rv i d e o ;m o t i o nt r a c k i n g ;h u m a nm o d e l ;t h r e ed i m e n s i o n a lr e c o n s t r u c t i o n ; c h a r a e t e ra n i m a t i o n i i l 西安理工大学硕士学位论文 目录 目录 1 绪论1 1 1 课题研究的意义1 i 2 国内外发展现状1 1 3 人体检测与跟踪概述3 1 3 1 有标记点的人体检测与运动跟踪3 1 3 2 基于视频的人体检测与运动跟踪3 1 。4 本文结构及主要内容5 2 基于视频的人体运动跟踪技术一7 2 1 基于学习的方法7 2 2 基于模型的方法7 2 3 单目视觉与多目视觉8 2 4 常用的人体运动跟踪方法9 2 4 1 基于区域的方法1 0 2 4 2 光流法1 0 2 。4 3 基于特征的方法1 2 2 5 本章小结1 2 3 从概率的角度考虑跟踪问题1 3 3 1b a y e s 滤波原理1 3 3 2k a l m a n 滤波1 5 3 3 粒子滤波1 6 3 3 1 重要性采样( b t s ) 1 6 3 3 2 序列重要性采样( s i s ) 1 7 3 3 3 退化现象1 8 3 3 4 粒子滤波的优点。2 0 3 3 5 粒子滤波存在的问题2 1 3 4 用粒子滤波来解决跟踪问题2 1 3 4 1 跟踪的目的,2 i 3 4 2 目标的先验知识。2 1 3 4 3 系统状态转移。7 2 2 3 4 4 系统观测2 2 3 4 5 后验概率的计算,一2 2 3 4 6 粒子重采样。j 2 3 3 5 标准粒子滤波算法试验及结果分析2 3 3 6 本章小结,2 6 4 基于单目视频的人体跟踪,2 7 西安理工大学硕士学位论文 4 1 人体模型的建立。2 7 4 1 1 建模的目的2 7 4 1 2 常用的人体模型2 7 4 。1 。3 人体各部位间的层次连接关系3 0 4 1 4 本文的人体模型3 l 4 2 特征的选取3 2 4 3 基于单目视频的人体跟踪实验3 2 4 4 本章小结。3 5 5 三维重建3 7 5 1 摄像机的成像模型和标定3 7 5 2 首帧三维关节点坐标的确定4 0 5 3 后续帧人体关节点三维坐标的求解4 1 5 4 二义性的消除4 2 5 5 实验结果及分析4 3 5 6 本章小结,4 3 6 动画的生成4 5 6 1 设计思路4 5 6 2 动画制作的相关理论4 5 6 3 生成角色动画4 6 6 4 运动数据文体的产生4 8 6 4 1o p e n g l 和3 ds t u d i om a x 的应用一4 8 6 4 2b v h 文件简介4 8 6 5 骨架模型的算法实现5 l 6 6 本章小结5 3 7 总结和展望5 5 7 1 总结5 5 7 2 展望5 6 致谢5 7 参考文献5 9 在校期间发表的论文6 3 绪论 1 绪论 1 1 课题研究的意义 随着计算机技术的飞速发展,人们对高效率计算机动画制作手段的需求也变得越来越 强烈。然而在传统意义上,计算机动画的生成采用的是用全人工调整关键帧的方法,这种 制作方法工作效率非常低。为了彻底解决这一问题,就逐步诞生了一种新的计算机动画制 作技术,即运动捕获技术。 运动捕获技术的核心内容就是对人体运动的跟踪与分析,是近年来图像处理与计算机 视觉领域中备受关注的前沿方向,它利用单目( 单个摄像机) 或多目( 多个摄像机) 从包含人 的图像序列或视频中检测、识别、跟踪人体并对其行为进行理解、分析和描述,属于图像 分析和理解的范畴。从技术角度而言,人体运动分析的研究内容相当丰富,主要涉及到模 式识别、图像处理、计算机视觉、人工智能等学科知识;同时,动态场景中运动的快速分 割、人体的非刚性运动、人体自遮挡和目标之间互遮挡的处理也为人体运动分析的研究工 作带来了一定的挑战。 作为一种新的、极其强大的计算机动画制作手段,人体运动捕获技术目前己经充分地 运用到影视广告和游戏制作等相关行业中去,它具有高速度、高质量、极具真实性等特点, 不仅极大地提高动画制作的水平和效率,降低了成本,而且使动画制作过程更为直观,效 果更为生动。目前,随着计算机处理速度的加快和三维制作软件性能的提高,运动捕获技 术已有取代传统的全人工调整关键帧的动画制作方法的趋势。 另外,借助各类运动捕捉系统,可以得到大量的人体运动数据,形成了丰富的人体运 动数据库。然而,绝大多数运动捕捉系统都需要特殊的、昂贵的硬件,如要求人体关键部 位标记、与计算机连接的传感器,这些都增加了妨碍和限制,所以无法将这样的运动捕捉 技术用于诸如体育运动、舞蹈表演等更复杂的人体运动。根据要求,运动捕捉应该是容易 获取的、便宜的、非侵入性的,所以采用标准的视频摄像机是可行的,尤其是使用单个摄 像机,具有价格低廉,设置简单等优点,但同时也带来了诸多困难,如深度表示的歧义性, 遮挡与自遮挡等,就目前的研究状况来看,这些困难仍是急需解决的。 综合而言,视频人体运动的跟踪与分析,尤其是人体关节运动的准确跟踪和获取,是 视频人体动画的基础,有着广阔应用前景和实用意义。然而该项研究所面临的困难和挑战 也是巨大的,需要进一步的研究探索。 1 2 国内外发展现状 根据目前的研究现状,人体运动分析的方法般可以分为两种。一是在人体的各个关 节部位分别加上传感器或者标志物。在人体运动过程中,利用传感器或标志物传递的关:节 点的空间位置信息,就可以实时精确地分析计算人体各部位在各个时刻的运动参数;二是 利用图像序列对人体运动进行分析。图像序列可以利用单个摄像机进行拍摄,也可以采用 多个摄像机同时从多个视角进行拍摄。基于图像序列本身的信息进行人体运动的跟踪和分 西安理工大学硕士学位论文 析通常包含三个步骤:( 1 ) 从复杂背景中提取运动人体;( 2 ) 人体运动的跟踪与重构,得到 各个时刻反映人体运动的参数,由此以骨架或柱体模型再现和分析人体运动的过程;( 3 ) 人体行为的识别和理解。其中( 1 ) 和( 2 ) 步是第( 3 ) 步人体行为分析的基础。目前,研究的 重点在前两项。 近年来,随着视觉理论的研究与计算机处理能力的提高,人体运动跟踪与分析正从理 论研究走向实用化。到目前为止,人体运动跟踪的研究己取得了很大成绩,有些系统己达 到了实用化阶段。 2 0 世纪8 0 年代初,计算机视觉领域就开始了从视频中分析、识别人体运动的研究。 r u o k r e 等最早采用视觉方法对合成视频中的人体运动进行了分析l l jh o l g g 的系统针对 视频中自由度为一的人体行走模型进行了研究“1 。早期的这些工作开创了利用计算机进 行人体运动分析研究的先河。此后,越来越多的学者致力于基于视频的人体运动分析的研 究。 近几年,陆续有学者对这方面的工作进行了一些总结和综述。g a v r i l a 重点回顾了不 同的人体分析方法,并将它们归为三类:基于模型的二维方法、不用模型的二维方法以及 三维方法“1 。a g g a r w a l 等则从人体部分的运动分析、单一视角或多摄像机下的人体运动 跟踪及人的行为识别三个方面对较早前的研究工作做了回顾1 。m o e s h m d 从初始化、跟 踪、姿态估计、识别这四个方面做了总结,分析了各种方法的性能及主要的应用领域,并 指出这研究工作尚处于发展的早期阶段1 。q c a i 等采用多台摄像机切换粗略地跟踪了 人体头部和上身的运动1 ,q u e n t i nd e l a r n a r r e 和o l i v i e rf a u g e r a s 基于人体轮廓信息对跑 步动作进行了初步的跟踪,由于跟踪方法存在前面提到的各种局限,跟踪的结果不能 令人满意。 同时,这一领域也引起相关研究机构的密切关注,美国国防高级研究项目署设立了以 卡内基梅隆大学为首、麻省理工学院等高校参与的视觉监控重大项目v s a m ( v i s u a l s u r v e i l l a n c ea n dm o n i t o r i n g ) | 8 j 主要研究用于战场及普通民用场景进行监控的自动视频 理解技术;英国的雷丁大学、麻省理工学院利用特征点和统计模型1 ,在单目视觉的条 件下,采用扩展的k a l m a n 滤波器的方法实时跟踪人体姿态;e p i cg a m e s 和u b is o f t 等公 司研究了大量的视频捕获技术并用于游戏中“1 。i b m 与m i c r o s o f t 等公司也正逐步将基 于视觉的手势识别接口应用于商业领域。 国内开展人体运动分析研究的单位有浙江大学人工智能研究所、中国科学院计算所 等。浙大人工智能研究所采用单目视觉对人体没有出现被遮挡部位的动作进行了跟踪,首 帧采用手工标注人体的特征点,该方法基于单目视觉,无法准确估计被遮挡部位的位置, 手工干预较多;科学院计算所的研究主要用于手语识别,被测人带有数据手套,是基于身 体带有传感器的方法。 正是人体运动分析的复杂性和应用的广泛性吸引了国内外众多的研究者,美国、德国、 日本各大学及科研院所长期获得各方面资助,开展人体运动分析的研究,i e e e 定期举办 绪论 人体运动分析的专题会议,并且在每年i e e e 举办的众多国际会议中,均有这一主题,可 见国际上对该项研究的高度重视。 总之,随着信息载体的多元化,数字视频被人们越来越多地使用。目前,人们已经在 各种领域积累了极其丰富的人体运动视频,如何有效充分地利用这些视频资源是摆在人们 面前的难题。我们就希望能从视频中提取出人体运动参数,然后用它来生成动画。这样既 可以充分利用视频资源,又可以生成更多的运动数据,本文的研究也是从这一角度展开的。 1 3 人体检测与跟踪概述 1 3 1 有标记点的人体检测与运动跟踪 用标记的方法进行人体的检测与跟踪具有比较悠久的历史,其主要思想就是借助运动 捕捉设备获得人体的运动状态。在过去的几十年中,出现了大量的运动捕捉设备,有不少 已经用于商业系统。如v i c o n ,q u a l i s y s 等。按照制造方式分为:机械设备、电子设备和光 学设备。 基于机械装置的运动捕捉通常是将一些很轻的骨骼状支架缚在运动的人体上,相邻的 两根杆之间的旋转角可以通过安置在关节点上的电压传感器测量出来。通过模数转换将模 拟电压转换为数字信号,并传送给计算机。如m e t am o t i o n 公司的g y p s y ,这种装置的运 动捕捉方法最大的优点是不受外界环境的干扰,比如环境光或者电磁场等。其缺点在于: 只能给出相对的变化信息,而没有初始位置信息,因此该设备不适用于有跳跃的运动。另 外由于使用了支架型安装方式,需要对设备进行校正,对使用者的活动造成很大不便。 基于磁装置的运动捕捉利用安置在身体上的传感器来测量由发射源发射的低频磁场。 传感器和发射源用电线连接到一个电子控制设备上,这个电子设备可以纪录下传感器的三 维坐标及其方向。这也就获得了人体的运动数据。如a s c e n s i o n 公司的f l o c ko f b i r d s 就是 使用磁装置的商业系统。这种设备的优点是实时性很好,能够给出绝对位置,包括旋转角 度和空间方向。缺点是磁场的作用范围有限,并且容易受到干扰。 基于光学装置的运动捕捉中,常用的设备是反射材料和发光二极管。根据光学原理, 通过摄像机来捕捉标记点( 反光材料或者发光二极管) 的运动。比较著名光学运动捕捉制造 商是m o t i o na n a l y s i s 公司和v i c o n 公司。光学运动捕捉系统的优点在于,由于没有繁重 的装置,使用者可以任意活动,并且对环境的要求也不高。它的缺点在于:运动过程中标 记点可能会被遮挡,无法直接提取标记的坐标位置。所以有时候需要多个摄像机才能得到 三维运动数据。 除了上述的三类运动捕捉系统之外,还有很多基于其它技术和方法的设备。因为运动 的检测与跟踪是项很有挑战性的研究方向,所以此类系统的应用前景非常广阔。 1 3 2 基于视频的人体检测与运动跟踪 基于视频的人体运动检测和跟踪技术一直是模式识别,计算机视觉等领域的一个非常 有挑战性的研究课题。在过去的几年中,这方面的研究范围逐渐扩大,相关的文献也层出 西安理工大学硕士学位论文 不穷。跟踪的方法大致分为人体整体跟踪和身体的局部区域的跟踪。按照不同的角度又可 以分为:二维与三维的方法、基于模型与基于学习的方法、单人跟踪与多人跟踪等。虽然 可以很详细地对方法进行分类,但是因为在实际应用中,准确地进行检测与跟踪是非常困 难的,所以需要多种方法的融合。下面来探讨一下人体运动检测与跟踪的大致步骤: ( 1 ) 确定人体的初始状态 所谓确定初始状态就是确定观测量的初始值,当然,观测量的选取有各种形式,这就 导致了初始化的方式不同。一种方法是在图像上直接搜索人的初始状态,因为搜索空间的 范围太大,遍历所有的状态几乎是不可能的,速度和精度都无法满足。为了简化运动检测 与跟踪的复杂度,常采用人工交互的方法得到。这样做可以把人的初始状态当作己知的先 验信息,将更多的精力放在后续图像序列的处理上。 ( 2 ) 空间及其特征的选择 在确定人体的初始状态时,首先需要解决的问题就是空间的选取,根据具体应用的不 同,空间可以分为二维空间和三维空间。二维的参数表示方法常用于监控或者检测等领域, 在这些应用中只需要知道人的形状和位置等简单信息。若采用基于模型的方法,可以使用 一些二维的多关节模型进行运动分析,但是由于入的肢体有可能在摄像机视线方向上发生 运动,造成肢体形状在二维图像上发生改变,因此在使用二维多关节模型时,通常会采取 变形模板的方法,因为每个模板是可以缩放的,所以能够适应观测的人体在深度上的变化。 二维的方法相对简单一些,对于真实的三维模型来说,得到的可以进行运动分析的信息还 是不够充足。 三维的方法主要针对更复杂的应用。当需要得到人体运动的更加详细的描述和信息 时,例如人的姿态、行为时,仅仅使用二维的人体表示方法是不够的。三维的方法更适合 描述人体的比较精确的、复杂的运动信息,从而可以进行姿态的分析和预测、处理遮挡或 者消除歧义性等。 对于人体图像而言,其中隐含了大量的运动信息。这就需要从图像中提取出可以用于 描述人体状态信息的特征。可以看出,选择哪些图像特征和怎样选取是关键问题。最常见 的是轮廓、边界、灰度、肤色、纹理等特征。 ( 3 ) 检测和跟踪 人体运动检测和跟踪的目的是从图像序列得到连续的人体位置和姿态信息。在检测和 跟踪过程中会受到杂乱背景、人体的遮挡和自遮挡、视角的改变等不利因素的影响。基于 模型的人体运动跟踪主要包含两个部分:模型建立和运动估计。通过入体模型的建立,才 能最终理解并掌握怎样构建似然度函数,而似然度函数的设计必须考虑到待估计的参数。 ( 4 ) 重建 通过对人体各个部位的检测和跟踪可以得到真实人体的运动数据,下面要做的工作就 是结合这些已有的数据进行建模,一般要进行的是在3 d 场景中的模型建立。这里涉及的 问题主要有两个,一个是重新建立的模型是否能正确地体现出定的真实性,其实这直接 4 绪论 反映了跟踪的精度。另外一个就是效率问题,随着硬件和软件技术的不断发展,一种好的 算法应该是满足实时性要求并且具备良好的可扩展性,所以在设计的时候需要兼顾计算的 精度和满足效率上的要求。 1 4 本文结构及主要内容 本文在粒子滤波算法基础上,提出了一种基于单目视频并且有模型指导的三维人体 运动跟踪框架,这种方法的特点是通过特征上的约束来指导重要性分布函数的生成,使得 高维空间中多峰后验分布函数的估计成为可能。综合考虑了图像上的时间与空间信息,利 用灰度、颜色和边界特征增强前景检测的可靠性和准确性。最后利用跟踪所获得的数据来 生成角色动画。其中图像特征表达、基于粒子滤波的跟踪模型以及动画的产生具有一定的 普遍应用意义。本文算法的流程框图如下( 图l ,1 ) : i t i l 初始化;特征选取粒子滤波 图1 - 1 算法流程图 f i g t 一1f l o wd i a g r a mo fa l g o r i t h m 本文的章节安排为: 第一章介绍了本课题的研究意义,国内外发展现状,综述了人体运动的检测和跟踪 技术,最后介绍了本文中算法的整体设计流程。 第二章着重分析了基于视频的人体运动跟踪技术和相关的基础性概念。然后列举了 一些常用的人体运动跟踪方法。 第三章从概率推理角度对运动跟踪问题做进一步解释,由此导出了基于粒子滤波的 跟踪框架,然后结合实际,对人体上臂的运动跟踪问题进行试验,并且针对实验结果做了 西安理工大学硕士学位论文 相应的分析。 第四章介绍了基于单目视频的人体跟踪,详细阐述了跟踪的步骤和涉及到的难点。 最后结合前面讨论过的算法和技术,进行了基于单目视频的人体跟踪实验,得到了比较好 的跟踪结果。 第五章为人体运动数据的三维重建部分,详细介绍了在获得人体运动的二维数据以 后如何进行三维重建的方法。 第六章介绍了生成动画的理论和方法,然后利用前文得到的人体运动数据,借助3 d s t u d i om a x 软件生成运动数据的b v h 文件。最后在v c + + 的平台下,结合o p e n g l 图像 图形接口,建立了人体骨骼的点阵模型,并在简单场景中进行动画模型的驱动,得到所需 的动画效果。 6 基于视频的人体运动跟踪技术 2 基于视频的人体运动跟踪技术 2 1 基于学习的方法 基于学习的人体跟踪方法源于姿态识别方法的思想。姿态识别需要预先定义多个姿态 类别,每个类别包含了定的姿态范围。然后为每个姿态类别标注若干训练样本,通过模 式分类的方法训练姿态分类器以实现动作的识别1 h 厶1 。用来训练分类器的样本一般是 人体的二维表观模型,是图像本身或从图像抽取得到的特征。 这一类方法并不需要对物体进行建模,一般通过图像的全局特征进行匹配分析,可以 有效的避免局部特征方法在复杂姿态和遮挡关系情况下出现的特征匹配歧义性问题。然而 姿态识别方法只能将姿态划分到事先定义的几个姿态类别中,并不能对姿态进行连续的精 确的估计。 在三维运动估计问题中,基于学习的方法一般包括分类和回归两个步骤,由于回归分 析的引入,理论上来讲使得算法可以实现连续估计,从而克服基于模式分类方法的离散化 特性。但实际上,由于在人体的三维姿态这样一个高维空间中进行连续估计所需要的密集 采样几乎是不可能的,因此算法很难保证精度。另外由于此类算法抽取的特征均为降维后 的压缩特征,降维过程中必然会失去大量的可能非常重要的信息,使得无法建立充分的观 测模型,严重影响估计的精度。r o s a l e s 首次实现了真正意义上的基于学习的人体与人手 三维姿态估计算法,将基于二维表观模型的算法扩展为三维姿态估计问题钆向1 。s h i m a d a 则是把估计问题看作最近邻查找问题,从样本集中找到与输入图像轮廓最为匹配的图像 1 t i l 。关于描述基于学习的估计算法的文献中同样把估计问题看作查找问题1 1 7 其主要贡 献还在于提供了新的基于边界的观测量,可以在定程度上克服背景噪声带来的影响。 基于学习的方法一般采用全局观测特征,可以保证算法具有较好的鲁棒性。然而这一 类方法的姿态估计精度很大程度依赖于训练的充分程度。要想比较精确地得到二维观测与 三维姿态之间的对应关系,就必须获取足够密集的样本来学习决策规则和回归函数。而一 般来说所需要样本的数量是随状态空间的维数成指数级增加的,对于人体运动状态这样的 高维状态空间,事实上不可能获取进行精确估计所需要的密集采样。因此,无法得到密集 采样而难以保证估计的精度与连续性,是基于学习的姿态估计方法无法克服的根本困难。 2 2 基于模型的方法 为了能用模型表示感兴趣目标的运动,很多研究者选取了基于模型的人体运动检测与 跟踪方法,因为人体具有非刚性结构和非刚体的运动特征,且视频中的附着物及人体本身 的柔性都决定了其高度非刚性结构,运动也是高度复杂的非刚体运动。所以采取有模型指 导的方法可以得到人体运动的更加精确的运动描述”。另外,假设目标的运动符合某个 特定的模型分布,即运动模型。跟踪问题的最终归结到这个运动模型的实际表示。具体到 人体运动跟踪问题,涉及到如下几点( 图2 1 ) : ( 1 ) 将人体表示为多关节几何模型的形式,并将三维人体模型按照摄像机定标参数投影到 西安理工大学硕士学位论文 二维图像平面上。 ( 2 ) 在获取的多个连续帧视频图像上,提取出轮廓、边界、灰度和肤色等信息,构成观测 数据。 ( 3 ) 建立观测似然模型,结合特征确定人体模型与观测数据之闻的对应关系。 图2 1 基于模型的人体跟踪流程 f i 9 2 1f l o ws h e e to fm o d e l - b a s e dh u m a nm o t i o nt r a c k i n g 这种跟踪流程非常清晰,但实际遇到的情况并不是这么简单。在这个跟踪过程中存在 大量的不确定性。我们得到的观测数据可能并不是来自于感兴趣的目标区域,可能是其它 物体,也可能是背景中的噪声。另外,对于三维人体运动跟踪而言,又存在三维到二维投 影变换的不确定性。在三维空间中的运动包含了二维空间不可能描述的深度方向运动。若 将一个二维空数据映射到三维空间,就会在深度方向上存在多个可能的相对应的三维姿 态。 2 3 单目视觉与多目视觉 在基于视频的人体检测、人体运动跟踪或者人体的行为理鳃之前,首先要确定的是视 频的来源。根据不同的研究方法和应用目的,可以分为单目视觉和多目视觉两类。 多目视觉是针对多个摄像机观测同一景物时的情形,这里以双目视觉为例做一个简单 的介绍( 如图2 2 所示) ,对于空间中任意一点p ,如果用摄像机g 观察,看到它在g 摄像 机的图像成像点位于曰。片是由通过从尸点发出的光线,经过透镜中心a 与图像平面相 交而形成的。这时我们无法由曰得知p 的三维位置,因为在o , p 连线上的任意一点尸在 摄像机g 的图像中成像点都是曰,所以我们由曰点的位置只能知道空间点p 位于。:曰连 线上的某一位置,而无法知道尸点的深度信息。如果我们用c 和c 两个摄像机同时观察 p 点,并且能够确定在g 摄像机图像上的点曰与在c 摄像机图像上的点只是空间同一物 基于视频的人体运动跟踪技术 体点p 在它们各自图像中的成像点,那么我们就可以知道空间点p 即位于a p 上,也位 于q 只上,因此尸点即为此两条射线的交点。如果两台摄像机的几何位置已知,并且摄 像机是线性的,那么利用三角原理就可以计算物体在空间的位置。 多目视觉系统的工作主要包括:确定摄像机的相对几何位置和内部参数( 摄像机的标 定) ;在若干幅同步的图像中提取共同的特征或匹配的基元,然后进行特征匹配:根据视 差和几何关系,计算成像物体与摄像机的距离。处理的难点是在图像中发现与同一空间点 对应的成像点,也就是所谓的配准问题。一旦确定了对应关系,就可容易地计算出这些图 像点所代表的物体点在空间的位置。但是对一幅图中的给定匹配基元来说,在另一幅图中 可能发现不止一个基元与之匹配,这样就产生了匹配中的多义性或匹配假目标闯题。对于 多摄像机跟踪系统而言,需要确定在每个时刻使用哪一个( 几个) 摄像机或哪一幅( 几幅) 图像。多摄像机之间的选择和信息融合是困难所在。 p 、 p 、 o 2 图2 2 双目视觉原理 f i 9 2 - 2b i n o c u l a rv i s i o np r i n c i p l e 虽然多目视觉系统在一定程度上克服了空间中景物的深度的获取问题,但仍存在上述 困难,限制了其在一些领域的应用。单目视觉系统采用单摄像机采集人体运动视频图像, 不需多图像之间的匹配,没有多摄像机之间距离条件的约束,并可以节约成本,在实际的 应用环境中被广泛采纳。虽然单目视觉所获得的信息没有多目视觉中的丰富,从成像原理 上是无法实现三维信息的恢复,但是在基于场景中深度已知点的约束条件下,并结合人体 这一特殊的研究对象,运用本文提出的算法可以简单快捷的重建人体运动的三维信息。 2 4 常用的人体运动跟踪方法 常用的人体跟踪方法主要包括三类:基于区域的匹配方法、光流法和基于特征的方法。 每类的方法都有自己的优势和不足,根据具体问题的不同,分别应用在不同的方面。在 这里我们将简要介绍一下这几类方法。 9 西安n _ z - 大学硕士学位论文 2 4 1 基于区域的方法 基于区域的方法实质上是在图像序列中完成相邻帧问某一区域的对应任务。一般是选 取一个图像块,然后假设块内的所有像素做相同的运动,以此来跟踪相邻帧间的对应位置。 例如w r e n 利用小区域特征进行室内单人的跟踪。这种方法容易表述、算法比较规则、 简单、硬件上易于实现,因简单高效的特点而常被采用。计算方法如下( 图2 3 ) :给定的 两帧序列图像i 帧和i + 1 帧,存在第1 帧图像中的某个象素点阮v 1 ,以此像素为中心形成 一个大小为( 2 n + 1 ) ( 2 n + 1 ) 的像素区域b 。围绕图像i + 1 帧中的对应像素点阮们建立一 个尺寸为f 2 n + 1 ) ( 2 n + 1 1 的搜索窗口r 。搜索窗口可根据有关两图像间最大可能位移的 先验知识来确定。假设一个像块区域内所有的像素作速度相同的平移运动,然后在搜索窗 口r 内进行搜索匹配,在基于一定的误差度量准则下寻找与其最匹配的像素区域b 。 图2 - 3 基于区域的匹配方法 f i 9 2 - 3r e g i o n - b a s e dm a t c h i n g 基于区域的匹配方法可以较好得解决简单运动的跟踪问题。但缺点是跟踪结果比较粗 糙。另外就是无法解决遮挡问题,当在物体运动过程中出现大面积遮挡时就会发生计算错 误。这类算法对图像质量的要求较高,通常拍摄到的视频往往无法满足。虽然滤波可以消 除一部分的噪声干扰,但残余噪声及光照效应对图像的影响还是很大。由于实际运动图像 场景复杂,富于变化,所以很难找到最佳的匹配点,存在明显的缺陷,所以必须寻求更为 准确有效的跟踪算法。 2 4 2 光流法 光流法是目前运动图像分析的重要方法,它的概念是由g i b s o n 于1 9 5 0 年首先提出的, 是指时变图像中模式运动速度。因为当物体在运动时,它在图像上对应点的亮度模式也在 运动。这种图像亮度模式的表观运动称为光流。光流表达了图像的变化,由于它包含了目 标运动的信息,因此可被观察者用来确定目标的运动情况( 如图2 - 4 所示) 。 基于视频的人体运动跟踪技术 _ 、 i - t , ;l 、- - , 、越轴一, 、- _ , 、_ p , 、_ _ ,一 - u - _ _ , 噜- _ + - 4 图2 4 光流不意图 f i 9 2 4o p t i c a lf l o wd i a g r a m 由光流的定义可以引申出光流场,它是指图像中所有像素点构成的一种二维瞬时速度 场,其中的二维速度矢量是景物中可见点的三维速度矢量在成像表面的投影。所以光流不 仅包含了被观察物体的运动信息,而且还包含有关景物三维结构的丰富信息。从光流中恢 复物体三维结构和运动是计算机视觉研究中面临的最富有意义和挑战性的任务之一。正是 由于光流的重要地位和作用,近年来,研究人员提出了许多种计算光流的方法,而且新的 方法还在不断涌现。 最初光流的计算方法是由美国学者h o m 和s c h u n c k 提出的 2 0 l , h o m 等人在相邻图 像之间的间隔时间很小( 小于l o m s 数量级) ,且其图像中灰度变化也很小的前提下,假设 灰度守恒,推导出灰度图像光流计算的基本等式: l 甜+ ,v + z = 0( 2 1 ) 这就是光流场计算的基本公式,被称为光流约束方程。令:。【vj , 改写成梯度形式为: ( w ) 。u + i = 0( 2 2 ) 由于光流场含有两个变量,而光流约束方程只有一个,因此不能同时求出光流场的两个速 度分量扰和v 。这就是说,从基本等式求解光流场是一个不适定问题。为求解u 的两个 分量必须附加另外的约束条件。目前的光流计算大多是针对图像每一点进行得,计算平面 中某一点处的图像流速度。现在光流计算中比较经典算法有h s ( h o r n - - s c h u n c k ) 方法和 l k ( l u c a s - - k a n a d e ) 方法。 相对于区域的匹配方法,光流具备的优点是其检测的精度较高,可以基本正确的检测 到小于一个象素的移动距离,另外它适合检测相对复杂的运动模式,如旋转、缩小和放大。 光流法的不足之处是计算复杂度比较高,而且要求连续两帧之间的物体在投影平面上的所 成像的移动距离较小。在实际应用情况中,光流场基本方程的亮度守恒假设往往不能满足, 如光源的运动和不均匀性,对象的遮挡性和透明性等原因。虽然光流反映了物体在空间的 运动,但是它并不能反映出所有的运动形式,无法完全与物体的实际运动相对应。 西安理工大学硕士学位论文 2 4 3 基于特征的方法 基于特征的跟踪包括特征的选取和特征的对应两个过程。首先是定义特征,一个好的 特征必须符合对于噪声的不敏感,易于识别,以及具有唯一性等条件。而一般的常用特征 点包括点、线、边界、颜色、角点以及更为复杂的特征。简单的特征易于提取和判别,但 不利于跟踪。复杂的特征提取较为困难,但易于定位与跟踪。这些需要在不同的应用领域 及所要达到的目标作一个权衡。 p o l a n a 与n e l s o n 就提出过一个很好的点特征跟踪的例子| 2 1 1 7 文中将每个行人用一个 矩形框封闭起来,封闭框的质心被选择作为跟踪的特征,用以代表人体的位置;前一帧的 质心位置被用于估计下一帧中人体质心的位置。在跟踪过程中若两

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论