模态基础及学习 2_第1页
模态基础及学习 2_第2页
模态基础及学习 2_第3页
模态基础及学习 2_第4页
模态基础及学习 2_第5页
已阅读5页,还剩29页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

MultimodalMachineLearning视频特征多模态机器学习2视频由连续图像帧构成,同时包含静态外观与动态运动。视频分类、字幕生成、视频问答等任务,都依赖准确的视频特征。目前主要包括三类方法:手工特征提取、神经网络特征提取和预训练模型特征提取。视频本身是多模态信息的结合体,不仅包含图像和声音,还包含深度、动作等其他模态信息。为什么要学习视频特征多模态机器学习3手工设计的视频特征:从时空兴趣点、轨迹和梯度中描述动作。基于神经网络的视频特征:以双流网络和三维卷积自动学习表示。基于预训练模型的视频特征:借助大规模预训练迁移空间与时间知识。其他模态的视频特征:利用骨架、深度、点云、音频等补充视觉信息。本章内容多模态机器学习4时空兴趣点(STIP):寻找空间和时间上变化显著的局部区域。改进的密集轨迹(iDT):用光流跟踪密集采样点并编码轨迹。三维尺度不变特征变换(3D-SIFT):把SIFT扩展到时间维。三维方向梯度直方图(HOG-3D):统计三维时空梯度方向。立方体特征(Cuboid):检测局部响应峰值并描述邻域。手工设计的视频特征多模态机器学习5STIP(Space-timeInterestPoints)在时间和空间两个维度上,图像强度都发生显著变化的局部点。例如:行走视频中,腿部区域随时间变化最明显,因此产生较多兴趣点。常见检测器:Hessian、Harris-3D、Dollar。时空兴趣点(STIP)图5.1行走动作中的时空兴趣点多模态机器学习6构造线性尺度空间:L=g∗f,对视频进行时空平滑。建立二阶矩矩阵:由Lₓ、Lᵧ、Lₜ描述局部空间与时间梯度。计算响应函数:H=det(μ)−k[trace(μ)]³。当x、y、t三个方向的变化都足够大时,该位置被判定为时空兴趣点。Harris-3D兴趣点检测多模态机器学习7DT的核心步骤:多尺度密集采样→光流跟踪→基于轨迹提取关键特征。在各尺度以固定步长采样,排除结构不明显的点,再跟踪其运动路径并提取描述符。密集轨迹:整体流程多模态机器学习8

利用光流跟踪采样点多模态机器学习9轨迹形状:对长度为L的位移序列归一化,得到30维轨迹描述符。轨迹邻域:围绕轨迹构造N×N×L的Cuboid,并划分为时空网格。局部描述符:HOG为96维、HOF为108维、MBH为96维。特征串联:将轨迹、HOG、HOF和MBH描述符连接起来。固定长度编码:使用Bag-of-Features(BoF)得到视频特征表示。轨迹周围的局部描述子多模态机器学习10相机运动估计:假设帧间满足单应性,用RANSAC估计单应性矩阵。特征点选择:结合SURF与Shi-Tomasi。轨迹处理:剔除相机移动产生的背景轨迹。正则化:L₂→L₁。编码:BoF→FisherVector(FV)。改进的密集轨迹(iDT)图5.3改进的密集轨迹多模态机器学习11SIFT具有尺度不变性和旋转不变性,但二维SIFT不能表达时间变化。3D-SIFT将时间轴加入局部邻域,用三维时空梯度描述动作。三维尺度不变特征变换多模态机器学习12时空梯度方向计算:在3D邻域中计算梯度大小m₃D和方向θ、φ。构建加权直方图:对θ、φ分组,经立体角归一化和高斯加权;峰值作为主方向。构建3D-SIFT描述符:将主方向对齐到θ=φ=0,划分子块并串联直方图,形成256维或2048维描述符。3D-SIFT的计算过程多模态机器学习13HOG-3D将二维HOG扩展到x、y、t三个维度。它同时编码局部几何结构与时间运动信息,适用于动作识别。三维方向梯度直方图多模态机器学习14确定局部区域:采样点为中心确定区域Q,并划分单元和子块。平均梯度向量计算:计算每个子块在x、y、t方向的平均梯度。平均梯度量化:使用正多面体(通常n=12或20)量化梯度方向。梯度投影求和:将同一单元内各子块的描述符相加。构建HOG-3D描述符:连接所有单元;M=N=4、n=12时为768维。HOG-3D的计算过程多模态机器学习15为解决Harris-3D对噪声敏感、计算复杂度高等局限,Dollar等提出Cuboid方法。空间域采用高斯滤波器,时间域采用相互正交的一维Gabor滤波器。响应函数的局部最大值为时空兴趣点,并在每个兴趣点处提取Cuboid。立方体特征(Cuboid)多模态机器学习16兴趣点检测:以空间高斯和时间正交一维Gabor滤波计算响应,局部最大值为兴趣点。生成Cuboid:在每个时空兴趣点处提取三维区域,边长约为检测尺度的6倍。构建局部直方图:划分子区域并统计直方图,再用PCA对描述符降维。生成Cuboid原型:对训练集描述符做K-means,聚类中心构成原型库。生成描述子:将新Cuboid与原型库进行比较;相似度超过阈值则归入相应类型,否则作为异常排除。统计视频片段中各类型Cuboid的出现次数,形成Cuboid类型直方图。Cuboid特征提取流程多模态机器学习17手工特征依赖预先定义的检测器、梯度公式和编码规则。神经网络能够从数据中端到端学习外观与运动表示。本节重点介绍两类经典方法:双流网络与三维卷积网络。关键问题:如何保留图像空间信息,同时建模跨帧时间变化?从手工设计到自动学习多模态机器学习18光流是在连续视频帧之间描述物体位置变化的位移向量场。位移向量dₜ(u,v)表示t帧中点(u,v)到t+1帧对应点的移动。光流:显式描述运动多模态机器学习19空间流输入单张图像,学习视频帧中的空间信息。时间流输入连续稠密光流的堆叠,学习运动信息。两路网络分别预测,并在预测阶段进行概率融合。双流卷积神经网络多模态机器学习20二维卷积只在高、宽方向滑动;即使多帧作为通道输入,也会较早压缩时间信息。三维卷积在时间、高、宽三个维度滑动,输出仍是时空特征。体。二维卷积与三维卷积多模态机器学习21八个卷积层:使用3×3×3

的卷积核,步长为1×1×1,并进行边缘填充。五个最大池化层:Pool1为1×2×2,Pool2~Pool5为

2×2×2。两个全连接层:连续连接,为输出层做准备。一个Softmax输出层:用于最终的分类预测。训练完成后,C3D可以作为其他视频分析任务的特征提取器。C3D网络结构多模态机器学习22撑杆跳示例先关注人物全身,并在后续帧中跟踪运动;化妆示例先关注眼睛,再跟踪眼周动作。可视化表明:C3D在初阶帧主要捕捉外观信息,在后续帧主要关注显著运动。C3D学到了什么多模态机器学习23I3D以Inception-V1为基础,把二维卷积核和池化核“膨胀”为三维。双流I3D分别处理RGB与光流,再融合预测结果。I3D:膨胀的三维卷积网络多模态机器学习24核膨胀:为卷积核和池化核增加时间维度,将N×N扩展为N×N×N。参数自展:沿时间维复制二维滤波器权重N次,再除以N。保持响应:使二维网络对单图的输出与三维网络对静态视频的输出一致。双流推断:RGB流与平滑光流流分别推断,预测结果取平均。时间维度:感受野增长过快或过慢,都可能影响早期特征和动态捕捉。I3D的膨胀与自展多模态机器学习25视频数据集通常比图像数据集小,直接从头训练大型Transformer效果有限。图像模型初始化能提供空间知识,但静态图像与视频时空上下文并不完全一致。视频预训练需要同时学习空间外观和时间动态。核心思路:设计适合视频的掩码建模或提示学习任务。为什么需要视频预训练多模态机器学习26图像流执行掩码图像建模(MIM),视频流执行掩码视频建模(MVM)。两条流的编码器共享大部分模型权重:图像提供空间知识,视频补充时间建模能力。BEVT:联合图像与视频预训练多模态机器学习27MIM:遮挡二维图像块,预测被遮挡区域的离散视觉标记。MVM:遮挡三维视频块,恢复其时空视觉标记。联合优化:总损失由图像建模损失与视频建模损失共同组成。下游迁移:预训练编码器经过微调后用于动作识别等任务。BEVT的训练目标多模态机器学习28提示是添加到输入中的词语或短语,用于为模型补充任务上下文。它不必改变模型主体结构,就能引导预训练模型完成新的分类任务。动作类别往往需要更有区分度的上下文描述。静态人工提示成本高,也难以表达不同视频实例的动态差异。提示学习多模态机器学习29模块包含MHSA与FFN;文本表示c为查询,视频表示z为键和值,得到提示c̃。残差增强ĉ=c+αc̃;α可学习且初值为0.1,ĉ用于分类。X-CLIP:视频特定的提示多模态机器学习30人体结构:骨架序列。距离与热信息:深度、红外。三维与异步视觉:点云、事件流。声学与惯性:音频、加速度。环境感知:雷达、WiFi。其他模态的视频特征多模态机器学习31骨架:编码人体关节轨迹,具有尺度不变、对服装纹理和背景变化鲁棒等优点;但数据稀疏、有噪声,且缺少人-物交互的形状信息。深度:像素值表示视点到场景各点的距离,对颜色和纹理变化鲁棒,并提供三维结构;但不包含外观信息,通常与其他模态相结合。红外:不依赖外部环境光,可分主动与被动红外;但图像可能存在低对比度、低信噪比问题。骨架、深度与红外多模态机器学习32点云:空间点表示目标的空间分布和表面特征,可由3D传感器或图像重建获得,擅长表达空间轮廓和三维几何。点云的挑战:噪声、点分布不均匀,处理大量点所需的计算。事件流:事件相机只对视觉场景变化作出反应,为每个像素独立产生异步事件。事件流特点:高动态范围、低延迟、低功耗、无运动模糊;但数据时空稀疏且异步,处理较困难。点云与事件流多模态机器学习33音频:借助音视频同步定位动作、减少人工标注与计算;信息不足,通常不能独立使用。加速度:对遮挡、视点、照明与背景变化鲁棒;需携带可穿戴传感器。雷达:适合恶劣天气和视线受阻环境;分辨率低、计算量大。WiFi:便捷、保护隐私、

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论