模态基础及学习 8_第1页
模态基础及学习 8_第2页
模态基础及学习 8_第3页
模态基础及学习 8_第4页
模态基础及学习 8_第5页
已阅读5页,还剩25页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

MultimodalMachineLearning多模态人类行为识别多模态机器学习2人类行为识别(HAR)判断视频或传感器序列中正在发生的动作应用范围:健康监测、智能监控、虚拟现实和人机交互单模态局限:RGB视频容易受到遮挡、光照变化和视角变化影响互补信息:深度提供三维形状,骨架描述姿态,音频和惯性数据补充运动线索多模态目标:通过信息融合或知识迁移,提高动作识别的准确性与鲁棒性Ch.9人类行为识别为何需要多模态MultimodalMachineLearning多模态机器学习3多模态HAR方法归纳为两条主要技术路线:融合学习:训练和测试阶段都整合多种模态,共同完成动作预测协同学习:辅助模态只在训练阶段提供知识,测试时可以只使用目标模态共同目标:利用模态互补性,减少单一数据源信息不足造成的误判关键区别:融合强调“同时使用”,协同强调“知识传递”Ch.9本章方法框架MultimodalMachineLearning多模态机器学习4RGB基准主要用于比较视频动作识别模型的基础性能。UCF101:约13K个样本,包含101类动作HMDB51:约7K个样本,包含51类动作Kinetics系列:Kinetics-400/600/700分别约306K、496K和650K个样本ActivityNet:约27K个样本,包含203类动作Something-Something:约108K个样本,强调物体交互与时序变化Ch.9常用数据集(一)MultimodalMachineLearning多模态机器学习5多模态数据集同时提供两种或更多传感器信息NTURGB+D:57K样本、60类动作,提供RGB、深度和骨架NTURGB+D120:114K样本、120类动作,是前者的扩展UTD-MHAD:861个样本、27类动作,增加惯性传感器数据EpicKitchens-55:约40K样本,提供RGB与音频EpicKitchens-100:约90K样本,同时包含RGB、音频与惯性数据Ch.9常用数据集(二)MultimodalMachineLearning多模态机器学习6融合学习通过联合使用不同模态,提高HAR的判别能力RGB+深度:结合外观信息与三维形状RGB+骨架:结合场景外观与关节运动骨架+深度:结合稀疏姿态与稠密轮廓RGB+音频:结合可见动作与动作声音相机+惯性:结合远距离观测与贴身运动测量其他组合:进一步引入WiFi、蓝牙等非视觉信号Ch.9融合学习MultimodalMachineLearning多模态机器学习7RGB和深度分别描述动作的外观线索与三维结构RGB模态:保留颜色、纹理、场景和人体外观信息深度模态:反映人与相机的距离、轮廓和三维形状互补作用:当RGB受光照影响时,深度仍可提供稳定几何信息基本流程:分别提取两种模态特征,再映射、融合并进行动作分类Ch.9RGB与深度互补MultimodalMachineLearning多模态机器学习8两种模态先保留各自时空结构,再映射到共享特征空间Ch.9RGB-D双线性异构信息机MultimodalMachineLearning多模态机器学习9

Ch.9共享空间与动作预测公式MultimodalMachineLearning多模态机器学习103D-CNN提取RGB外观,RNN建模骨架时序,再融合两路输出Ch.9RGB与骨架MultimodalMachineLearning多模态机器学习11双流网络既可以在预测结果层融合,也可以在特征层融合决策融合:把RNN与CNN的置信度分别乘以信任权重,选择加权置信度较高的预测特征融合:串联骨架时序特征和RGB视觉特征,完成L2归一化后交给SVM分类决策融合特点:结构简单、模块独立,但模态交互较弱特征融合特点:能够联合利用两路表示,但特征维度和训练复杂度更高Ch.9RGB与骨架的两种融合策略MultimodalMachineLearning多模态机器学习12骨架和深度从不同角度描述人体的三维动作骨架优势:关节位置直接反映姿势和身体部位运动骨架不足:表示稀疏,容易受到关节检测误差和噪声影响深度优势:提供稠密的三维轮廓、形状和身体外观融合思路:按身体部位对齐骨架几何与深度外观,再学习二者的交互关系Ch.9骨架与深度MultimodalMachineLearning多模态机器学习13模型按身体部位对齐两种表示,再聚合为视频级动作特征Ch.9身体部位级骨架-深度融合模型MultimodalMachineLearning多模态机器学习14骨架-深度模型通过四个步骤形成最终类别预测双线性紧致池化:对每个身体部位的两种表示降维并计算外积,得到2000维部位表示全连接层:串联全部身体部位特征,并映射为4000维向量时间池化层:利用Rank-pool聚合连续时间步,形成视频级表示Softmax层:根据视频表示输出各动作类别的概率Ch.9四层处理完成动作分类MultimodalMachineLearning多模态机器学习15图像帧、光流和声谱图分别编码空间、运动与声音线索Ch.9RGB与音频MultimodalMachineLearning多模态机器学习16视听特征可以在分类前融合,也可以在预测后融合早期融合:先连接空间、时序和音频特征,再训练一个通用分类器晚期融合:各模态独立得到预测分数,再连接分数并训练最终分类器早期融合优势:能学习更充分的跨模态交互,但依赖较好的时间同步晚期融合优势:模块化程度高、对模态噪声更稳健,但可能损失细粒度交互Ch.9早期融合与晚期融合MultimodalMachineLearning多模态机器学习17移动机器人与可穿戴设备同步采集视觉、骨架、定位和惯性信息Ch.9RGB、深度与惯性传感器融合MultimodalMachineLearning多模态机器学习18系统先独立识别不同传感器分支,再进行决策级融合机器人分支:从骨架与定位数据提取特征,使用多类SVM完成分类可穿戴分支:从腕部和食指传感器提取惯性特征,使用随机森林分类决策融合:融合两个独立分类器的预测结果,得到最终动作类别互补价值:可穿戴传感器弥补相机遮挡,机器人提供场景和人体整体信息Ch.9多传感器系统如何完成决策MultimodalMachineLearning多模态机器学习19除常见视觉组合外,HAR还可以利用更多非视觉信号信号图像化:把骨架、惯性与WiFi序列转成彩色图像,再用CNN分类三流架构:1D-CNN、2D-CNN和RNN分别处理陀螺仪、RGB和骨架,再用CCA融合RGB+WiFi:RGB帧进入C3D,WiFi帧进入CNN,最后对预测结果加权求和共同思想:先把异构传感器数据转换为可比较的表示,再完成融合Ch.9其他融合方法MultimodalMachineLearning多模态机器学习20信号经降噪和图像化后,可直接利用成熟的二维CNN完成识别Ch.9将多变量信号转换为图像MultimodalMachineLearning多模态机器学习21把多变量时序信号统一转换成CNN可以处理的二维表示信号降噪:根据标准差设置阈值,将对动作识别贡献较小的信号位置置零图像表示:把N×M信号矩阵映射到HSV颜色空间,形成N×M×3彩色表示动作分类:使用EfficientNet预测动作类别数据增强:在信号层执行插值、采样、缩放、滤波和加噪声等操作Ch.9信号图像化的三个步骤MultimodalMachineLearning多模态机器学习22模态组合应根据任务环境、传感器条件和部署成本选择RGB+深度:外观与三维形状互补,适合固定视觉传感器RGB+骨架:兼顾场景和关节运动,但依赖骨架提取质量骨架+深度:强化身体部位建模,计算过程相对复杂RGB+音频:适合具有明显动作声音的任务,要求时间同步相机+惯性:抗遮挡能力强,但需要额外佩戴设备和标定WiFi等信号:拓展感知范围,但需要设计合适的表示转换方法Ch.9融合方法总结MultimodalMachineLearning多模态机器学习23协同学习关注如何把辅助模态的知识迁移到目标模态训练阶段:同时使用目标模态与辅助模态,建立表示约束或教师指导测试阶段:辅助模态可以缺失,仅使用目标模态完成动作识别现实价值:解决昂贵传感器不可用、模态缺失或部署受限的问题与融合的区别:融合依赖多模态共同推理,协同学习强调训练期间的知识传递Ch.9协同学习MultimodalMachineLearning多模态机器学习24eLSTM学习骨架语义空间,RGB视频表示被约束向该空间靠近Ch.9骨架知识如何约束RGB视频模型MultimodalMachineLearning多模态机器学习25骨架分支提供动作结构知识,视频分支负责最终分类eLSTM编码器:把3D人体骨架序列编码为特征向量rseLSTM解码器:根据rs重建骨架序列,并用重建误差训练编码器RLSTM+DCNN:DCNN提取逐帧图像特征,LSTM聚合为视频表示rv协同约束:令rv与rs具有相同维度,并利用骨架空间约束视频表示部署阶段:训练完成后只保留RGB视频模型,不再需要骨架输入Ch.9eLSTM与RLSTM+DCNN如何协同MultimodalMachineLearning多模态机器学习26

Ch.9正则化约束在优化什么MultimodalMachineLearning多模态机器学习27多个非视觉教师提供软目标,注意力模块决定各教师的贡献Ch.9多教师注意力蒸馏框架MultimodalMachineLearning多模态机器学习28

Ch.9教师网络与学生网络如何训练MultimodalMachineLearning多模态机器学习29多模态HAR仍面临数据、模型效率和泛化能力等挑战数据集:从受控实验走向真实、非受控环境的大规模多模态采集融合与协同:设计更有效的关系建模方法,缓解过拟合和模态冲突高效分析:降低CPU、GPU和能耗开销,实现快速实时识别小样本学习:在动作类别样本有限时仍获得可靠识别能力无监督与半监督:利

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论