模态基础及学习 7_第1页
模态基础及学习 7_第2页
模态基础及学习 7_第3页
模态基础及学习 7_第4页
模态基础及学习 7_第5页
已阅读5页,还剩21页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Introduction

to

Information

Retrieval第12章跨模态视频时序片段定位Live

Q&A/jinCS3245

–

Information

Retrieval多模态机器学习2学习目标理解跨模态视频时序片段定位的任务定义与特点。熟悉常用数据集及其标注方式。掌握有监督、弱监督和无监督方法的基本思路。理解两阶段、单阶段和强化学习方法的典型流程与代表模型。Ch.

11-12跨模态视频时序片段定位CS3245

–

Information

Retrieval多模态机器学习3跨模态时序定位给定一个视频与一段自然语言查询,从视频中定位出与查询匹配的目标时序片段,并返回其开始和结束时刻。与跨模态时序定位相关的任务视频动作识别:给定一段视频和一组预定义动作类别,判断视频整体属于哪一类动作,输出动作类别标签,不关注动作发生的具体时间。时序动作定位:给定一段未裁剪视频和一组预定义动作类别,在视频时间轴上检测动作实例,输出动作类别及其开始、结束时间。Ch.

11-12什么是跨模态视频时序定位?CS3245

–

Information

Retrieval多模态机器学习4查询文本:网球运动员弯腰连续拍球,随后起身准备发球。Ch.

11-12什么是跨模态视频时序定位?0:0000:06与视频动作识别/时序动作定位的区别不局限于特定动作类别或预定义动作列表;可以查询任意复杂的行为活动。CS3245

–

Information

Retrieval多模态机器学习5Ch.

11-12方法总览跨模态视频时序片段定位有监督方法弱监督方法无监督方法训练数据含有精确的“视频时序片段-查询”对标注。特点定位性能最强依赖细粒度标注标注成本高存在标注偏差训练数据含有“视频-查询”对标注,无时间边界的监督信息特点节省标注成本避免人为认知偏差训练难度大性能略低于有监督训练数据无任何标注。特点无标注成本扩展性/适用性最强依赖预训练视觉概念定位精度最低按训练数据的标注粒度划分,现有跨模态视频时序片段定位方法可以分为三大类CS3245

–

Information

Retrieval多模态机器学习6Ch.

11-12数据集数据集名称视频数量查询数量DiDeMo10,46440,543TEMPO(基于DiDeMo扩展)10,46440,543Charades-STA(基于Charades扩展)9,84816,128TACos(基于MPIICompositive扩展)12718,818ActivityNet-Captions(目前应用最广)19,20971,957CS3245

–

Information

Retrieval多模态机器学习7Ch.

11-12数据集DiDeMo视频时长限制在30秒以内,按5秒一段切分为6份;候选片段由一段或多段连续5秒片段构成;通过枚举组合,每条视频一共生成21个候选片段。Charades–STA素材为记录日常室内活动的视频;把整条视频描述拆分为多条简短子句,每条子句匹配视频内对应的时间片段;视频平均时长31秒。TEMPO复用DiDeMo原始视频,新增包含多事件的语言描述;1)TEMPO-TL为模板语言,依靠before/after/while/then连接事件;2)TEMPO-HL是人工构建的自然人类语言,语句复杂度更高。TACoS聚焦烹饪领域各类动作;每条视频配备两类标注:细粒度动作标签+自然语言描述,文本描述由众包采集;数据集规模为127条视频、18818条查询,视频较长,对上下文理解能力要求高。ActivityNet–Captions面向视频字幕任务,覆盖多领域视频,规模为19209条视频、71957条文本查询;每条视频至少划分两个片段,片段各自匹配一条字幕CS3245

–

Information

Retrieval多模态机器学习8Ch.

11-12有监督学习方法定义将时序定位建模为顺序决策问题,用智能体逐步调整时序范围。代表模型RWM(端到端RL框架)TSP-PRL(树结构策略)SM-RL(语义匹配RL)两阶段单阶段强化学习定义先生成候选片段,再计算候选与查询的匹配分数。代表模型MCN(手动启发式)CTRL(多尺度滑动窗口)QSPN(时序生成网络)定义端到端直接预测目标片段,避免大量候选与查询的成对匹配。代表模型TGN(基于锚点)SCDM(基于采样)LNet(基于无提议)CS3245

–

Information

Retrieval多模态机器学习9Ch.

11-12两阶段的有监督学习方法候选片段生成方式视频+查询输入数据候选片段生成生成大量候选片段候选与查询匹配打分跨模态相似度计算目标片段(ts,te)手动启发式使用人工设定的规则处理视频,如按人工设定的时序窗口大小分割视频,获取大量候选片段。代表模型MCN(MomentContextNetwork)MLIC(LatentContextLocalization),CMN(TemporalCompositionalModular)多尺度滑动窗口利用不同时间尺度的滑动窗口依次覆盖长视频中连续时间段,提取不同时间长度的候选片段。代表模型CTRL(Cross-modalTemporalRegression)CARN(AttentiveCross-ModalRetrieval)SLTA,MMRGROLE时序生成网络利用深度神经网络对视频进行候选片段提取和时序建模,同时可引入查询信息作为引导。代表模型QSPN(Query-guidedSegmentProposal)SAP(SemanticActivityProposal)BPNet(BoundaryProposalNetwork)CS3245

–

Information

Retrieval多模态机器学习10Ch.

11-12手动启发式-MCN时刻上下文网络

固定5s分段并穷举连续组合;RGB与光流分别编码局部/全局上下文LSTM编码查询,排序损失拉近正样本CS3245

–

Information

Retrieval多模态机器学习11Ch.

11-12CTRL跨模态时序回归定位

C3D提取候选及前后文视觉特征;加法、乘法与拼接联合视觉—文本表示同时学习对齐分数与起止偏移量CS3245

–

Information

Retrieval多模态机器学习12Ch.

11-12QSPN查询引导片段提议

查询引导片段提议网络:减少与文本无关的候选;跨模态检索模块:用两层LSTM匹配并重构查询;联合检索损失与查询重构损失CS3245

–

Information

Retrieval多模态机器学习13Ch.

11-12单阶段的有监督学习方法基于锚点的方法通过生成一组时序锚点定位目标片段。代表模型TGNCBPBSSTLFANI2NCMNCSGMANPMI-LOC基于采样的方法通过采样策略生成不同时间尺度的候选时序视频片段。代表模型SCDM基于无提议的方法不生成候选片段,直接预测目标片段的开始/结束时刻。代表模型LNet(LocalizingNetwork)ABLREXCLSSMN两阶段方法生成大量不同时间尺度的候选片段(可能重叠),需要将所有候选片段与查询进行匹配。→计算效率低,且必然会耗费大量的计算资源。单阶段方法端到端地定位目标片段,效率更高。候选片段处理方式CS3245

–

Information

Retrieval多模态机器学习14Ch.

11-12TGN基于锚点

CS3245

–

Information

Retrieval多模态机器学习15Ch.

11-12SCDM基于采样

CS3245

–

Information

Retrieval多模态机器学习16Ch.

11-12LNet基于无提议双向GRU编码视频与文本;跨模态交互生成查询感知视频特征;自交互聚合跨帧证据时序定位头输出起止时刻CS3245

–

Information

Retrieval多模态机器学习17Ch.

11-12RWM强化学习7个动作:分别或同时移动起止边界;状态融合句子、全局/局部视觉及当前边界;Actor-Critic学习动作策略与状态价值

CS3245

–

Information

Retrieval多模态机器学习18Ch.

11-12弱监督学习方法精确的“查询文本–视频时序片段”标注对:需要大量的人力以及时间成本会因个人认知偏差产生歧义—

同一查询+同一视频,不同标注者却给出不同的时序范围仅使用“查询文本–视频”标注对可以规避以上问题,对研究定位任务更有积极影响两阶段TGA(文本引导注意力)VLANet(视频–语言对齐)LoGAN(潜在图共同注意力)单阶段SCN(语义实现网络)VCARTBPNLCNetWSTAN强化学习BAR(BoundaryAdaptiveRefinement)CS3245

–

Information

Retrieval多模态机器学习19Ch.

11-12TGA两阶段C3D与GRU分别编码视频和文本;文本引导注意力生成查询相关视频表示;双向排序同时约束视频→文本与文本→视频

CS3245

–

Information

Retrieval多模态机器学习20Ch.

11-12SCN单阶段提议生成模块覆盖完整目标范围;Top-K候选进入语义完成模块;查询重构质量作为反馈,缓解关注区域过窄闭环:候选评分→语义完成→奖励反馈→评分细化CS3245

–

Information

Retrieval多模态机器学习21Ch.

11-12BAR强化学习上下文感知特征提取器编码环境状态;A2C动作规划器推断边界调整序列;跨模态对齐评估器提供目标导向奖励它不直接依赖片段边界标注,而以跨模态一致性指导搜索。CS3245

–

Information

Retrieval多模态机器学习22Ch.

11-12无监督学习方法弱监督仍需“视频–查询文本”标注对。无监督方法进一步不再依赖任何视频标注,通过预训练的视觉概念检测器和图像–句子嵌入模型学习“视觉概念↔图像嵌入”关联。代表模型:U-VMR优势:无需任务标注挑战:伪文本噪声与跨域泛化视觉概念生成伪句子并与视频对齐关系感知定位器通过图神经网络选择关键片段关系感知定位器通过图神经网络选择关键片段三大范式·综合对比按“定义·特点·优缺点·适用场景”的组织方式统一比较对比维度有监督方法弱监督方法无监督方法监督信号“视频时序片段–查询”对含精确时间边界“视频–查询”对无时间边界既不需要视频–查询对无任何视频标注代表模型MCN·CTRL·QSPNTGN·SCDM·LNet·RWMTGA·SCN·BARVLANet·LoGAN等U–VMR(无配对定位)核心思路候选提议+匹配打分/端到端预测起止时刻注意力权重/语义完成/MASK重构等间接信号预训练视觉概念+图像句子嵌入迁移✓优势定位精度最高方法研究最成熟大幅降低标注成本避免人为认知偏差完全无需标注扩展性、适用性最强✗局限标注成本高存在标注歧义精度低于有监督训练稳定性弱精度最低依赖预训练模型质量适用场景对定位精度要求高、标注预算充足大量视频+描述、但缺乏时间戳标注无标注数据/开放域快速部署场景多模态机器学习23典型应用场景跨模态视频时序片段定位可用于快速定位具有特定活动或行为的目标片段,应用领域非常广泛SCENARIO1🔒视频监控与安防异常事件检测:快速定位监控视频中的可疑行为片段目标追踪:跨镜头查找特定人/物出现的时段事件溯源:根据事件描述回溯发生时间,辅助刑侦或安防分析→提高安全性和响应效率SCENARIO2🎬视频剪辑与编辑帮助用户从大量视频素材中选取所需片段支持自然语言检索素材片段(如“进球瞬间”)制作个性化视频内容,如短视频、精彩集锦→显著提升创作效率SCENARIO3🏥智能医疗与康复手术视频中定位关键操作步骤康复训练视频的动作评估与错误动作定位医患对话结合视频,实现精准的临床检索→辅助教学与临床决策SCENARIO4🤖人机交互与教育视频问答:面向自然语言的问答式视频理解在线教育:按知识点自动跳转到相关讲解片段多模态智能助手:面向视频的对话式检索→构建人机自然交互体验多模态机器学习24难点、挑战与未来方向🚧关键挑战①标注歧义与成本同一“查询–视频”对,不同标注者产生不同时序边界精细标注耗费大量人力和时间弱/无监督方法性能仍显著低于有监督②长视频与上下文建模TACoS等长视频对上下文建模能力要求高目标片段占比小、干扰片段多→时序检索难度大现有LSTM/GRU难以建模数分钟以上的依赖③复杂语言的理解查询可涉及多个事件、时序关系、否定/条件现有模型对组合语义与细粒度关系建模不足需要更强大的语言&常识推理能力④数据集偏差与泛化现有数据集覆盖领域有限,存在位置偏差模型可能依赖“描述–位置”先验

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论