版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
Introduction
to
Information
Retrieval多模态讽刺检测Live
Q&A/jinCS3245
–
Information
Retrieval多模态机器学习28.1多模态讽刺检测数据集PADMSD(图文数据集)MUStARD(音视频文本数据集)8.2多模态讽刺检测相关方法基于注意力机制的方法(HFM、D&R-Net)基于图网络的方法(InCrossMGs、CMGCN、MILNet)核心思想:讽刺常通过多模态语义不一致表达,需综合多模态信息进行判断。Ch.
11-12本章内容概述CS3245
–
Information
Retrieval多模态机器学习3讽刺本质:字面意义与隐含意图之间存在差异,常扭转情绪极性;应用价值:情感分析、意见挖掘、公众舆情监测传统方法的局限:仅基于文本,忽略视觉信息多模态的必要性:社交媒体中图文结合表达讽刺已成为常态Ch.
11-12为什么需要多模态讽刺检测?很高兴公司派来了更多的车辆以确保座位的充足多模态讽刺样本示例CS3245
–
Information
Retrieval多模态机器学习4任务类型:二分类任务,即包含讽刺和不包含讽刺。
输入:多模态样本(文本+图像/视频+音频+文本)输出:是否包含讽刺(是/否)核心挑战:捕捉跨模态之间的语义不一致性Ch.
11-12任务定义很高兴公司派来了更多的车辆以确保座位的充足多模态讽刺样本示例CS3245
–
Information
Retrieval多模态机器学习5发布机构:北京大学团队(2019年)数据来源:推特(Twitter)多模态推文(文本+图像)正例标注:包含讽刺相关话题标签(如#sarcasm)负例:其他推文数据清洗:剔除直接包含“humor”“joke”等词汇的样本剔除包含URL的推文(避免噪声)划分比例:训练集80%/验证集10%/测试集10%验证/测试集:经人工检查确保标签准确性Ch.
11-12PADMSD(图文多模态讽刺数据集)CS3245
–
Information
Retrieval多模态机器学习6Ch.
11-12PADMSD统计数据数据集训练集验证集测试集总样本数19,8162,4102,409正样本数8,642959959负样本数11,1741,4511,450说明:正负样本均衡,适合二分类任务训练与评估。CS3245
–
Information
Retrieval多模态机器学习7发布机构:密歇根大学+新加坡国立大学(2019年)模态:视频+音频+文本数据来源:YouTube搞笑类美剧(《生活大爆炸》《老友记》等)规模:690个对话视频,总时长约9,626秒标注信息:说话人、上下文(对话历史)、视频、音频、讽刺标签适用场景:多模态讽刺检测、对话理解等多类研究Ch.
11-12MUStARD(多模态对话讽刺数据集)
CS3245
–
Information
Retrieval多模态机器学习8Ch.
11-12MUStARD对话与上下文统计统计项对话对话的上下文平均话语长度1410最大话语长度7371平均持续时间(秒)5.2213.95说明:数据量较小但标注丰富,适合精细化的多模态对话分析。CS3245
–
Information
Retrieval多模态机器学习9两大主流方法:基于注意力机制利用注意力机制聚焦与讽刺相关的内容代表模型:HFM、D&R-Net基于图网络构建图结构建模无序、非结构化的多模态关联代表模型:InCrossMGs、CMGCN、MILNetCh.
11-12多模态讽刺检测方法分类CS3245
–
Information
Retrieval多模态机器学习10思想:综合利用图像模态特征、图像属性模态特征、文本模态特征,基于注意力机制进行层次融合Ch.
11-12HFM(多模态多层次融合模型)北京大学团队(2019年)CS3245
–
Information
Retrieval多模态机器学习11图像模态将图像划分为14×14区域ResNet提取区域特征→平均得到指导向量图像属性模态ResNet-101预测5个图像属性属性词嵌入作为原始向量注意力加权得到指导向量文本模态Bi-LSTM编码文本平均池化得到指导向量Ch.
11-12HFM——模态特征学习模块CS3245
–
Information
Retrieval多模态机器学习12早期融合:将图像属性指导向量作为Bi-LSTM初始参数注入多模态信息增强文本理解表示融合:利用各模态指导向量计算注意力权重加权重建各模态特征向量模态融合:统一各模态表示维度计算模态级注意力权重→加权平均得到分类特征分类:两层全连接网络(ReLU+Sigmoid)Ch.
11-12HFM——融合与分类CS3245
–
Information
Retrieval多模态机器学习13思想:显式建模跨模态不一致性和语义关联两大子网络:Ch.
11-12D&R-Net(分解与关系网络)中国科学院团队(2020年)D-Net(分解网络)
:提取模态间差异表示R-Net(关系网络)
:建模模态间语义关联CS3245
–
Information
Retrieval多模态机器学习14图像预处理:借助SentiBank提取5条视觉语义信息每条以“形容词-名词对(ANP)”形式呈现编码模块:文本→Bi-LSTM→文本表示H^wANP→词嵌入最大池化→ANP表示H^p图像→ResNet→映射至文本空间→图像表示H^mCh.
11-12D&R-Net——预处理与编码CS3245
–
Information
Retrieval多模态机器学习15D-Net(分解网络)
:将各模态表示分解到三个子空间共享子空间→提取共有特征独有子空间→提取独有特征拼接文本/图像独有特征→跨模态对比特征r_decR-Net(关系网络)
:计算每个ANP与每个文本单词的相关性注意力加权得到多视图文本表示按ANP概率加权平均→跨模态关联表示r_rel分类:拼接r_dec和r_rel→全连接层→SigmoidCh.
11-12D&R-Net——核心模块CS3245
–
Information
Retrieval多模态机器学习16注意力机制的局限:讽刺信息常与零散的关键短语和关键图像区域相关这些元素之间的关联是无序、非结构化的图网络的优势:天然适合建模非结构化关系可细粒度捕捉模态内部和跨模态的复杂关联Ch.
11-12为什么引入图网络?CS3245
–
Information
Retrieval多模态机器学习17发布机构:哈尔滨工业大学团队(2021年)核心思想:为每个样本构建单模态图和跨模态图创新点:开创性地采用图结构建模多模态讽刺表达
Ch.
11-12InCrossMGs(跨模态图网络)CS3245
–
Information
Retrieval多模态机器学习18编码模块:文本→BERT+Bi-LSTM→文本表示H^T图像→划分为p×p小块→ViT→图像表示H^I模态关系图构建:文本模态图:基于上下文依赖树构建邻接矩阵图像模态图:基于图像块连续关系构建邻接矩阵跨模态图:文本节点与图像节点全连接,同时保留单模态图关系Ch.
11-12InCrossMGs——编码与图构建CS3245
–
Information
Retrieval多模态机器学习19讽刺特征提取:将单模态图和跨模态图输入多层图卷积网络(GCN)每层根据邻接矩阵更新节点表示GCN输出作为权重,加权平均原始特征→讽刺特征r分类:全连接层进行二分类贡献:首次将图结构引入多模态讽刺检测,为后续研究奠定基础Ch.
11-12InCrossMGs——讽刺特征提取CS3245
–
Information
Retrieval多模态机器学习20针对问题:现有方法忽略图像中仅特定区域与文本相关忽视视觉对象与文本短语间的语义关联核心改进:Faster-RCNN检测关键视觉对象引入外部情感知识(SenticNet)建模情感一致性
Ch.
11-12CMGCN(跨模态图卷积网络)CS3245
–
Information
Retrieval多模态机器学习21Ch.
11-12CMGCN(跨模态图卷积网络)哈尔滨工业大学团队(2022年)CS3245
–
Information
Retrieval多模态机器学习22跨模态图边权重考虑三方面关系:文本单词间的依赖关系文本单词与视觉对象的语义相似度(WordNet计算)文本单词与属性词的情感一致性(SenticNet检索情感权重)边权重公式:权重=语义相似度×情感调制因子+1调制因子衡量情感极性的一致程度贡献:引入外部知识库增强跨模态图的情感建模能力Ch.
11-12CMGCN——核心创新CS3245
–
Information
Retrieval多模态机器学习23针对问题:全局图像特征过于笼统仅关注检测对象区域会忽略上下文关联核心思路:结合对象级和全局级图像特征
Ch.
11-12MILNet(互学习增强不一致性学习网络)山东大学团队(2023年)CS3245
–
Information
Retrieval多模态机器学习24编码模块文本→RoBERTa→文本表示图像→Faster-RCNN(对象级)+ViT(全局级)局部语义不一致性学习构建文本/图像/跨模态图(GCN)IoU强调对象空间相关性知识图谱构建常识关联(替代词汇相似度)全局不一致性学习互注意力机制,图像特征引导关注不一致文本Ch.
11-12MILNet——模块结构CS3245
–
Information
Retrieval多模态机器学习25双路径不一致性建模:局部路径→细粒度挖掘词汇-对象不一致全局路径→宏观捕捉图文整体不一致互学习增强两个模块相互共享可靠知识,实现协同增强利用KL散度衡量两个模块预测分布差异仅传递可靠的预测(正确时共享知识)取置信度更高的结果作为最终预测Ch.
11-12MILNet——贡献CS3245
–
Information
Retrieval多模态机器学习26任务核心:捕捉多模态间的语义不一致性数据集:PADMSD(图文,大规模)MUStARD(视频/音频/文本,对话场景)方法演进:注意力机制(HFM、D&R-Net)→聚焦关键内容图网络(InCrossMGs、CMGCN、MILNet)→建模非结构化关联发展趋势:从全局特征→细粒度对象/短语级关联从单一融合→多模块协同学习引入外部知识库增强语义理解Ch.
11-12本章总结MultimodalMachineLearning多模态人类行为识别多模态机器学习2人类行为识别(HAR)判断视频或传感器序列中正在发生的动作应用范围:健康监测、智能监控、虚拟现实和人机交互单模态局限:RGB视频容易受到遮挡、光照变化和视角变化影响互补信息:深度提供三维形状,骨架描述姿态,音频和惯性数据补充运动线索多模态目标:通过信息融合或知识迁移,提高动作识别的准确性与鲁棒性Ch.9人类行为识别为何需要多模态MultimodalMachineLearning多模态机器学习3多模态HAR方法归纳为两条主要技术路线:融合学习:训练和测试阶段都整合多种模态,共同完成动作预测协同学习:辅助模态只在训练阶段提供知识,测试时可以只使用目标模态共同目标:利用模态互补性,减少单一数据源信息不足造成的误判关键区别:融合强调“同时使用”,协同强调“知识传递”Ch.9本章方法框架MultimodalMachineLearning多模态机器学习4RGB基准主要用于比较视频动作识别模型的基础性能。UCF101:约13K个样本,包含101类动作HMDB51:约7K个样本,包含51类动作Kinetics系列:Kinetics-400/600/700分别约306K、496K和650K个样本ActivityNet:约27K个样本,包含203类动作Something-Something:约108K个样本,强调物体交互与时序变化Ch.9常用数据集(一)MultimodalMachineLearning多模态机器学习5多模态数据集同时提供两种或更多传感器信息NTURGB+D:57K样本、60类动作,提供RGB、深度和骨架NTURGB+D120:114K样本、120类动作,是前者的扩展UTD-MHAD:861个样本、27类动作,增加惯性传感器数据EpicKitchens-55:约40K样本,提供RGB与音频EpicKitchens-100:约90K样本,同时包含RGB、音频与惯性数据Ch.9常用数据集(二)MultimodalMachineLearning多模态机器学习6融合学习通过联合使用不同模态,提高HAR的判别能力RGB+深度:结合外观信息与三维形状RGB+骨架:结合场景外观与关节运动骨架+深度:结合稀疏姿态与稠密轮廓RGB+音频:结合可见动作与动作声音相机+惯性:结合远距离观测与贴身运动测量其他组合:进一步引入WiFi、蓝牙等非视觉信号Ch.9融合学习MultimodalMachineLearning多模态机器学习7RGB和深度分别描述动作的外观线索与三维结构RGB模态:保留颜色、纹理、场景和人体外观信息深度模态:反映人与相机的距离、轮廓和三维形状互补作用:当RGB受光照影响时,深度仍可提供稳定几何信息基本流程:分别提取两种模态特征,再映射、融合并进行动作分类Ch.9RGB与深度互补MultimodalMachineLearning多模态机器学习8两种模态先保留各自时空结构,再映射到共享特征空间Ch.9RGB-D双线性异构信息机MultimodalMachineLearning多模态机器学习9
Ch.9共享空间与动作预测公式MultimodalMachineLearning多模态机器学习103D-CNN提取RGB外观,RNN建模骨架时序,再融合两路输出Ch.9RGB与骨架MultimodalMachineLearning多模态机器学习11双流网络既可以在预测结果层融合,也可以在特征层融合决策融合:把RNN与CNN的置信度分别乘以信任权重,选择加权置信度较高的预测特征融合:串联骨架时序特征和RGB视觉特征,完成L2归一化后交给SVM分类决策融合特点:结构简单、模块独立,但模态交互较弱特征融合特点:能够联合利用两路表示,但特征维度和训练复杂度更高Ch.9RGB与骨架的两种融合策略MultimodalMachineLearning多模态机器学习12骨架和深度从不同角度描述人体的三维动作骨架优势:关节位置直接反映姿势和身体部位运动骨架不足:表示稀疏,容易受到关节检测误差和噪声影响深度优势:提供稠密的三维轮廓、形状和身体外观融合思路:按身体部位对齐骨架几何与深度外观,再学习二者的交互关系Ch.9骨架与深度MultimodalMachineLearning多模态机器学习13模型按身体部位对齐两种表示,再聚合为视频级动作特征Ch.9身体部位级骨架-深度融合模型MultimodalMachineLearning多模态机器学习14骨架-深度模型通过四个步骤形成最终类别预测双线性紧致池化:对每个身体部位的两种表示降维并计算外积,得到2000维部位表示全连接层:串联全部身体部位特征,并映射为4000维向量时间池化层:利用Rank-pool聚合连续时间步,形成视频级表示Softmax层:根据视频表示输出各动作类别的概率Ch.9四层处理完成动作分类MultimodalMachineLearning多模态机器学习15图像帧、光流和声谱图分别编码空间、运动与声音线索Ch.9RGB与音频MultimodalMachineLearning多模态机器学习16视听特征可以在分类前融合,也可以在预测后融合早期融合:先连接空间、时序和音频特征,再训练一个通用分类器晚期融合:各模态独立得到预测分数,再连接分数并训练最终分类器早期融合优势:能学习更充分的跨模态交互,但依赖较好的时间同步晚期融合优势:模块化程度高、对模态噪声更稳健,但可能损失细粒度交互Ch.9早期融合与晚期融合MultimodalMachineLearning多模态机器学习17移动机器人与可穿戴设备同步采集视觉、骨架、定位和惯性信息Ch.9RGB、深度与惯性传感器融合MultimodalMachineLearning多模态机器学习18系统先独立识别不同传感器分支,再进行决策级融合机器人分支:从骨架与定位数据提取特征,使用多类SVM完成分类可穿戴分支:从腕部和食指传感器提取惯性特征,使用随机森林分类决策融合:融合两个独立分类器的预测结果,得到最终动作类别互补价值:可穿戴传感器弥补相机遮挡,机器人提供场景和人体整体信息Ch.9多传感器系统如何完成决策MultimodalMachineLearning多模态机器学习19除常见视觉组合外,HAR还可以利用更多非视觉信号信号图像化:把骨架、惯性与WiFi序列转成彩色图像,再用CNN分类三流架构:1D-CNN、2D-CNN和RNN分别处理陀螺仪、RGB和骨架,再用CCA融合RGB+WiFi:RGB帧进入C3D,WiFi帧进入CNN,最后对预测结果加权求和共同思想:先把异构传感器数据转换为可比较的表示,再完成融合Ch.9其他融合方法MultimodalMachineLearning多模态机器学习20信号经降噪和图像化后,可直接利用成熟的二维CNN完成识别Ch.9将多变量信号转换为图像MultimodalMachineLearning多模态机器学习21把多变量时序信号统一转换成CNN可以处理的二维表示信号降噪:根据标准差设置阈值,将对动作识别贡献较小的信号位置置零图像表示:把N×M信号矩阵映射到HSV颜色空间,形成N×M×3彩色表示动作分类:使用EfficientNet预测动作类别数据增强:在信号层执行插值、采样、缩放、滤波和加噪声等操作Ch.9信号图像化的三个步骤MultimodalMachineLearning多模态机器学习22模态组合应根据任务环境、传感器条件和部署成本选择RGB+深度:外观与三维形状互补,适合固定视觉传感器RGB+骨架:兼顾场景和关节运动,但依赖骨架提取质量骨架+深度:强化身体部位建模,计算过程相对复杂RGB+音频:适合具有明显动作声音的任务,要求时间同步相机+惯性:抗遮挡能力强,但需要额外佩戴设备和标定WiFi等信号:拓展感知范围,但需要设计合适的表示转换方法Ch.9融合方法总结MultimodalMachineLearning多模态机器学习23协同学习关注如何把辅助模态的知识迁移到目标模态训练阶段:同时使用目标模态与辅助模态,建立表示约束或教师指导测试阶段:辅助模态可以缺失,仅使用目标模态完成动作识别现实价值:解决昂贵传感器不可用、模态缺失或部署受限的问题与融合的区别:融合依赖多模态共同推理,协同学习强调训练期间的知识传递Ch.9协同学习MultimodalMachineLearning多模态机器学习24eLSTM学习骨架语义空间,RGB视频表示被约束向该空间靠近Ch.9骨架知识如何约束RGB视频模型MultimodalMachineLearning多模态机器学习25骨架分支提供动作结构知识,视频分支负责最终分类eLSTM编码器:把3D人体骨架序列编码为特征向量rseLSTM解码器:根据rs重建骨架序列,并用重建误差训练编码器RLSTM+DCNN:DCNN提取逐帧图像特征,LSTM聚合为视频表示rv协同约束:令rv与rs具有相同维度,并利用骨架空间约束视频表示部署阶段:训练完成后只保留RGB视频模型,不再需要骨架输入Ch.9eLSTM与RLSTM+DCNN如何协同MultimodalMachineLearning多模态机器学习26
Ch.9正则化约束在优化什么MultimodalMachineLearning多模态机器学习27多个非视觉教师提供软目标,注意力模块决定各教师的贡献Ch.9多教师注意力蒸馏框架MultimodalMachineLearning多模态机器学习28
Ch.9教师网络与学生网络如何训练MultimodalMachineLearning多模态机器学习29多模态HAR仍面临数据、模型效率和泛化能力等挑战数据集:从受控实验走向真实、非受控环境的大规模多模态采集融合与协同:设计更有效的关系建模方法,缓解过拟合和模态冲突高效分析:降低CPU、GPU和能耗开销,实现快速实时识别小样本学习:在动作类别样本有限时仍获得可靠识别能力无监督与半监督:利用大量未标注动作数据,减少人工标注成本Ch.9多模态HAR的五个研究方向MultimodalMachineLearning多模态机器学习30多模态HAR的核心是利用不同数据源描述同一动作的互补信息融合学习:多种模态共同参与训练和推理,提升当前预测的准确性协同学习:辅助模态在训练阶段传递知识,测试时可只使用目标模态方法选择:需要综合考虑模态可用性、同步质量、计算成本和部署条件发展趋势:更少标注、更低计算量、更强缺失模态鲁棒性Ch.9小结MultimodalMachineLearning图像文本检索MultimodalMachineLearning多模态机器学习2给定一种模态作为查询,在另一种模态中找出语义最匹配的结果图像到文本:以图像为查询,从候选描述中返回语义一致的句子文本到图像:以自然语言为查询,从图库中返回与描述相符的图像核心问题:把异构的视觉内容和语言表达转换成可比较的语义表示检索输出:计算图文匹配分数,并按分数对候选项进行排序主要难点:需要区分完全匹配与仅有部分语义相似的困难负样本Ch.10图像文本检索解决问题MultimodalMachineLearning多模态机器学习3查询不仅要找到完全匹配项,还要排除只有部分语义相似的干扰项Ch.10图像文本检索的双向任务MultimodalMachineLearning多模态机器学习4图像文本检索让用户可以用自然语言访问视觉内容。图像标注:自动寻找与图像匹配的描述,降低人工标注成本语义搜索:根据句子含义检索图像,而不是只依赖关键词机器人问答:通过语言查询视觉环境中的对象、动作和场景模态差异:像素与词语的数据结构不同,但需要表达共同语义细粒度匹配:对象、属性、动作和关系必须同时对齐才能避免误检Ch.10任务价值与核心挑战MultimodalMachineLearning多模态机器学习5不同数据集覆盖通用检索、行人检索和中文跨模态检索CUHK-PEDES:40206幅行人图像、80412条描述,主要用于行人文本检索Flickr8K:8092幅图像、40460条描述,每幅图像对应5条文本Flickr30K:31783幅图像、158915条描述,是常用通用检索基准MSCOCO:123287幅图像、616435条描述,场景与对象类别更丰富MUGE:包含约1.9TB图像与292GB文本,面向中文多模态评测Wukong:包含超过1亿个中文图像—文本对,适合大规模预训练Ch.10常用数据集MultimodalMachineLearning多模态机器学习6数据集选择应同时考虑任务类型、语言、规模与标注质量通用性能比较:Flickr30K和MSCOCO规模较大、划分成熟,最常用于模型评估行人文本检索:CUHK-PEDES关注服装、外观和身份相关的细粒度描述中文检索:MUGE和Wukong提供大规模中文图文资源预训练需求:数据越大越利于学习通用表示,但噪声和重复样本也更多公平比较:实验必须统一训练、验证、测试划分与召回率评价设置Ch.10不同数据集适用的研究MultimodalMachineLearning多模态机器学习7从表示粒度、知识来源、训练约束和预训练规模四方面演进全局检索:使用整幅图像和整句文本的全局表示进行匹配局部检索:建立图像区域、对象、单词和短语之间的细粒度对应外部知识:借助场景概念图和常识关系补充图像中未显式出现的语义度量学习:设计排序、实例和困难负样本损失,提高特征可区分性多模态预训练:在大规模图文对上学习通用表示,再迁移到检索任务扩展任务:包括弱监督、零样本、场景文本感知和跨语言检索Ch.10本章方法框架MultimodalMachineLearning多模态机器学习8全局检索高效,但能否充分融合图文信息取决于模型架构嵌入架构:分别编码整幅图像和整句文本,再映射到共享空间计算相似度交互架构:先融合图文特征,通过专门的交互网络直接预测匹配分数嵌入优势:候选特征可以离线计算,适合大规模快速检索交互优势:能够捕捉更丰富的跨模态联系,但在线计算成本更高Ch.10全局方法MultimodalMachineLearning多模态机器学习9DeViSE是早期全局嵌入方法,目标让匹配图文在共享空间中靠近视觉编码:利用预训练AlexNet提取整幅图像的全局视觉特征文本编码:利用预训练Skip-gram获得文本描述的全局语义特征空间映射:通过可训练线性变换统一两种特征的维度和语义坐标相似度:在共享嵌入空间中用点积或余弦相似度判断图文匹配训练目标:真实描述得分高于随机负描述,并至少保持一个间隔Ch.10DeViSEMultimodalMachineLearning多模态机器学习10图像与文本由独立编码器处理,再通过映射层进入同一嵌入空间Ch.10DeViSE模型结构MultimodalMachineLearning多模态机器学习11
Ch.10DeViSE的铰链损失MultimodalMachineLearning多模态机器学习12MM-CNN不只比较最终向量,而是直接学习图像与不同文本片段的匹配图像特征:使用OverFeat或VGG提取全局视觉表示文本特征:使用Skip-gram获得查询描述中每个单词的向量交互方式:把图像特征与单词、短语和句子级文本特征拼接匹配网络:各层级使用独立CNN与MLP输出匹配分数最终决策:累加各层级得分,得到完整查询描述与图像的匹配分数Ch.10MM-CNNMultimodalMachineLearning多模态机器学习13模型并行计算单词、短语和句子级匹配,再汇总为最终得分Ch.10MM-CNN模型结构MultimodalMachineLearning多模态机器学习14
Ch.10单词、短语与句子三级匹配MultimodalMachineLearning多模态机器学习15
Ch.10MM-CNN排序损失MultimodalMachineLearning多模态机器学习16仅用全局向量容易忽略对象、属性和动作关系等局部差异全局方法局限:整幅图像和整句文本被压缩后,局部语义可能被平均掉局部视觉实体:使用对象框、区域网格或显著区域表示图像细节局部文本实体:使用单词、短语或句法节点表示语言细节核心目标:建立“区域—单词”“对象—短语”等细粒度对齐关系代价:局部实体数量多,匹配和注意力计算复杂度随之增加Ch.10局部方法为何更适合细粒度匹配MultimodalMachineLearning多模态机器学习17DVSA把每个单词与相似度最高的图像区域对齐,再汇总局部得分图像编码:使用在ImageNet上预训练的RCNN提取对象区域和全局特征文本编码:使用双向RNN学习上下文相关的单词特征局部相似度:计算每个单词与每个图像区域的点积最大对齐:为当前单词选择相似度最高的区域作为其对齐区域图文得分:把句子中所有单词与对齐区域的相似度相加Ch.10DVSAMultimodalMachineLearning多模态机器学习18图像对象区域与文本单词逐一比较,形成可解释的局部语义对齐Ch.10DVSA模型结构MultimodalMachineLearning多模态机器学习19
Ch.10DVSA双向排序约束MultimodalMachineLearning多模态机器学习20局部实体不仅要跨模态对齐,还需要先理解各自模态内部的关系视觉模态关系:建模对象之间的空间、动作与语义关系,增强视觉表示文本模态关系:建模单词、短语和句法结构之间的依赖,增强语言表示双模态内关系:同时处理图像内部关系与文本内部关系常用机制:语义重组、层次结构、注意力、图卷积和一致性约束代表模型:SCO、HM-LSTM与SM-LSTM分别体现三种路线Ch.10模态内关系建模的三条路线MultimodalMachineLearning多模态机器学习21SCO要求视觉概念按正确语义顺序生成与原描述一致的文本文本表示:以LSTM最后一个单元输出作为查询描述特征概念提取:从图像区域预测名词、动词、形容词和数字等语义概念顺序学习:融合全局视觉特征与概念置信度,用LSTM按链式顺序生成词语匹配与生成:同时计算图文相似度,并监督模型生成正确语义序列关键价值:区分“长颈鹿吃篮子里的东西”和相反语序Ch.10SCOMultimodalMachineLearning多模态机器学习22视觉概念检测、语义顺序生成与图文匹配在同一模型中联合训练Ch.10SCO模型结构MultimodalMachineLearning多模态机器学习23
Ch.10SCO的联合优化目标MultimodalMachineLearning多模态机器学习24HM-LSTM把句子解析成树结构,用短语层级建立更细致的视觉对应视觉区域:RCNN提取图像中的候选区域特征v句法树:叶节点表示单词,中间节点表示短语,根节点表示完整句子候选限制:利用名词短语、动词短语等句法类型筛选合理对齐对象区域选择:根据区域特征与短语特征相似度选择最佳对应关系层次优化:同时最小化短语—区域损失与句子—图像损失Ch.10HM-LSTMMultimodalMachineLearning多模态机器学习25文本句法树提供单词、短语和句子层级,分别与图像区域建立对应Ch.10HM-LSTM模型结构MultimodalMachineLearning多模态机器学习26
Ch.10HM-LSTM的层次损失MultimodalMachineLearning多模态机器学习27SM-LSTM同时筛选重要图像区域和重要单词,再聚合局部匹配实例候选:Bi-LSTM获得单词特征,CNN从均匀图像区域提取视觉候选全局上下文:句子隐藏状态n和图像全连接特征m概括整体语义显著性预测:结合候选实例、全局上下文和上一时刻状态估计注意力局部匹配:加权聚合两种实例特征,经MLP输出每一步匹配分数最终聚合:最后时刻隐藏状态hT汇总全部局部相似性Ch.10SM-LSTMMultimodalMachineLearning多模态机器学习28显著图使模型集中关注“狗”等关键对象及其相关单词,忽略背景噪声Ch.10SM-LSTM模型结构MultimodalMachineLearning多模态机器学习29BSSAN从文本引导视觉和视觉引导文本两个方向建立细粒度对齐单词—区域:以当前单词为引导,为相关图像区域分配视觉注意力对象—单词:以当前图像对象为引导,突出查询文本中的相关单词双向独立:两个模块使用不同视觉特征和文本编码方式。匹配输出:LSTM与MLP输出单词—区域得分sw2r,对象—单词得分so2w联合训练:同时优化两个方向,并用L2正则化降低过拟合Ch.10BSSANMultimodalMachineLearning多模态机器学习30两个注意力分支分别回答“这个词对应哪里”和“这个对象对应哪些词”Ch.10BSSAN模型结构MultimodalMachineLearning多模态机器学习31
Ch.10BSSAN的联合损失MultimodalMachineLearning多模态机器学习32OAN用跨模态注意力完成对齐,再用模态内注意力增强各自表示编码模块:CNN编码文本上下文,Faster-RCNN提取图像对象特征模态间注意力:包括视觉—文本和文本—视觉两个方向的交叉增强模态内注意力:文本—文本和视觉—视觉分支挖掘同模态实体关系相似度融合:组合模态间相似度与模态内相似度得到最终得分困难负样本:重点惩罚语义接近但不匹配的图像或文本Ch.10OANMultimodalMachineLearning多模态机器学习33跨模态和模态内注意力并行增强视觉对象与文本单词的表示Ch.10OAN模型结构MultimodalMachineLearning多模态机器学习34
Ch.10OAN的混合相似度与难负样本MultimodalMachineLearning多模态机器学习35局部检索方法的差别在于优先增强哪里,以及何时进行跨模态交互仅模态内:先理解图像内部或文本内部关系,再进行图文匹配仅模态间:直接用双向注意力建立区域、对象与单词之间的联系混合交互:同时建模模态内外关系,表达最充分但计算开销最大串行模式:先模态内后模态间,或先模态间后模态内同步模式:并行更新模态内与跨模态表示,再融合多路相似度Ch.10三类局部关系建模选择MultimodalMachineLearning多模态机器学习36图像本身可能缺少常识信息,外部知识可补足隐含概念和对象关系语义缺失:局部特征能看到“人”和“书”,但未必理解“阅读”场景场景概念图:记录对象和概念在现实场景中的共现关系概念扩展:从已检测概念推断可能存在但视觉模型漏检的概念视觉关系:补充对象间动作、空间和属性联系风险:外部知识也会引入噪声,因此需要相关性预测与门控过滤Ch.10外部知识改善检索MultimodalMachineLearning多模态机器学习37SCG联合视觉特征、概念检测、概念扩展和文本特征完成匹配Ch.10SCG整体框架MultimodalMachineLearning多模态机器学习38概念图以共现场景连接对象,例如“房子—窗户”“笔记本—键盘”Ch.10场景概念图提供常识关联MultimodalMachineLearning多模态机器学习39检测概念沿场景图扩展,再预测相关性以过滤与当前图像无关的概念Ch.10概念扩展与噪声过滤MultimodalMachineLearning多模态机器学习40
Ch.10SCG的五步增强流程MultimodalMachineLearning多模态机器学习41度量学习不限定特征来源,而是改进正负样本之间的距离约束基础特征:ResNet-50提取图像特征,类CNN结构提取文本特征第一阶段:仅使用实例损失,让每个图文组形成可区分的类别第二阶段:联合排序损失和实例损失,兼顾匹配关系与组间差异排序作用:正样本相似度高于图像负样本和文本负样本实例作用:学习不同图文组之间更细粒度、更鲁棒的差异Ch.10度量学习增强图文可区分性MultimodalMachineLearning多模态机器学习42
Ch.10实例损失学习组级身份MultimodalMachineLearning多模态机器学习43大规模图文预训练缓解小数据训练的泛化不足单流框架:把视觉嵌入和文本嵌入一起输入同一个多模态Transformer双流框架:视觉与文本先独立编码,再利用跨模态注意力交换信息单流代表:VisualBERT通过联合序列隐式学习图文对齐双流代表:ViLBERT使用视觉流和语言流,并以协同注意力融合迁移方式:预训练获得通用表示,再针对图像文本匹配任务微调Ch.10多模态预训练MultimodalMachineLearning多模态机器学习44视觉对象嵌入与文本词元嵌入组成同一序列,由一个Transformer联合编码Ch.10VisualBERT单流模型MultimodalMachineLearning多模态机器学习45视觉流与语言流分别建模,并通过Co-TRM模块执行双向跨模态注意力Ch.10ViLBERT双流模型MultimodalMachineLearning多模态机器学习46两种预训练框架的主要差异是图文信息在何时、以什么方式交互单流输入:视觉区域和文本词元直接拼接,统一进入Transformer单流特点:交互充分、结构紧凑,但长联合序列增加自注意力计算量双流输入:两个编码器先分别建模各自模态,再交换上下文双流特点:保留模态专用表示,融合结构更灵活,但模块数量更多共同目标:学习能够迁移到检索、问答和视觉语言理解任务的联合表示Ch.10单流与双流框架对比MultimodalMachineLearning多模态机器学习47扩展任务降低了对完整图文标注和已见类别的依赖弱监督动机:高质量人工标注图文对成本高,难以覆盖海量数据弱监督方法:A3VSE结合强监督图文对与自动提取的弱监督信号小样本方法:ACMM利用跨模态记忆缓解训练样本不足零样本目标:训练类别与测试类别完全不重叠时仍能完成跨模态检索零样本机制:AAEGAN与LCALE学习共享潜空间并生成或对齐未见类别表示Ch.10弱监督与零样本检索MultimodalMachineLearning多模态机器学习48图像中的文字和不同语言描述为跨模态检索带来新的语义来源。场景文本感知:联合查询描述、视觉内容与图像中的自然文字,缓解模态差异CTC数据集:COCO-TextCaptioned为场景文本感知检索提供专用标注跨语言检索:以中文句子查询带英文描述的图像,同时跨越模态和语言差异COCO-CN:在MSCOCO上扩充中文描述,支持中文—英文—视觉对齐W2VV:把不同语言词向量与视觉表示映射到可比较的共享空间Ch.10场景文本与跨语言检索MultimodalMachineLearning多模态机器学习49全局方法:计算高效,适合大规模候选检索,但容易忽略局部关系局部方法:通过区域、对象、单词和短语对齐提升细粒度理解知识与度量:外部知识补足常识,度量学习增强正负样本可区分性多模态预训练:单流和双流框架利用大规模图文对学习通用表示扩展方向:弱监督、零样本、场景文本和跨语言检索拓展实际应用边界Ch.10小结Introduction
to
Information
Retrieval组合式图像检索Live
Q&A/jinCS3245
–
Information
Retrieval多模态机器学习10711.1组合式图像检索数据集基于固定语言模板vs基于自然语言描述11.2组合式图像检索相关工作基于属性的方法(AMGAN)基于自然语言的方法传统模型(TIRG、CLVC-Net)多模态预训练大模型(CLIP4CIR)其他工作(多轮检索)核心思想:参考图像+修改文本→精准表达复杂查询意图Ch.
11-12本章内容概述CS3245
–
Information
Retrieval多模态机器学习108传统检索方式的局限:基于文本:难以描述视觉细节基于图像:无法表达修改意图Ch.
11-12为什么需要组合式图像检索?组合式检索的优势:参考图像:表达整体需求修改文本:表达局部修改需求CS3245
–
Information
Retrieval多模态机器学习109提出者:李飞飞教授团队(2019年)输入:参考图像+修改文本(多模态组合查询)输出:符合用户意图的目标图像任务形式:三元组数据:<参考图像,修改文本,目标图像>示例:“这件衣服不错,但换成黑色长袖”意义:革新检索范式,提升用户体验Ch.
11-12任务定义CS3245
–
Information
Retrieval多模态机器学习110Ch.
11-12组合式图像检索数据集分类类型数据集名称规模图像/三元组数据领域组合查询示例参考图像修改文本基于固定语言模板Fashion200K200k/20.3k服装
Replaceflare-legwithwide-leg.CSS34k/32k几何体Addredcylindertobottom-middle.MIT-States60k/125.9k物品changestatetoancient.基于自然语言描述FashionIQ70k/30k服装isblackandmoreelegant.Shoes14.7k/10.7k鞋子havefurontheoutside.Birds-to-Words3.5k/13.3k鸟类animal1hasalongerbeakthananimal2.CIRR4.3k/36.6k开放域Removeonedog.Addgrass,makeonedogblack.CS3245
–
Information
Retrieval多模态机器学习111Ch.
11-12基于固定语言模板的数据集构造方式:将图像属性的不同取值填入固定模板示例:“replaceAwithB”数据集规模(图像/三元组)领域示例Fashion200K200k/20.3k服装Replaceflare-legwithwide-legCSS34k/32k几何体Addredcylindertobottom-middleMIT-States60k/125.9k物品changestatetoancient局限:修改文本不灵活,不贴近实际应用CS3245
–
Information
Retrieval多模态机器学习112构造方式:人工标注自然语言修改文本Ch.
11-12基于自然语言描述的数据集数据集规模(图像/三元组)领域示例FashionIQ70k/30k服装isblackandmoreelegantShoes14.7k/10.7k鞋子havefurontheoutsideBirds-to-Words3.5k/13.3k鸟类hasalongerbeakthanCIRR4.3k/36.6k开放域Removeonedog,addgrass优势:自然灵活,符合真实应用场景CS3245
–
Information
Retrieval多模态机器学习113Ch.
11-12组合式图像检索方法分类基于属性的方法仅允许修改预定义属性代表:AMNet、FashionSearchNet、AMGAN基于自然语言的方法允许灵活的自然语言修改传统模型:TIRG、VAL、CosMo、CLVC-Net预训练模型:CLIP4CIR其他工作多轮组合式图像检索代表:DialogManager、CFIR
CS3245
–
Information
Retrieval多模态机器学习114Ch.
11-12基于属性的组合式图像检索模型核心思想AMNet记忆模块存储属性模板特征FashionSearchNet属性定位网络提取区域特征AMGAN生成满足要求的模板图像后检索特点:仅允许对预定义属性进行修改应用领域:时尚(颜色/材质)、人脸(发色/脸型)核心思路:将修改的属性信息与参考图像融合代表模型:CS3245
–
Information
Retrieval多模态机器学习115核心思想:先根据查询生成模板图像,再基于模板检索框架:对抗生成网络(GAN)生成器:生成满足用户需求的模板图像判别器:学习距离度量函数,衡量图像相似度Ch.
11-12AMGAN(属性修改生成对抗网络)CS3245
–
Information
Retrieval多模态机器学习116两大模块:模板图像生成基于度量学习的图像检索
Ch.
11-12AMGAN(属性修改生成对抗网络)CS3245
–
Information
Retrieval多模态机器学习117参考图像编码卷积层+BN+ReLU→视觉特征图属性修改编码可学习属性语义嵌入矩阵指示向量提取目标属性嵌入特征融合通道方向级联视觉特征+语义特征残差块进行特征变换(保留关键视觉信息)图像解码上采样层+卷积层→模板图像训练约束:视觉-语义一致性+L1像素级损失Ch.
11-12AMGAN——生成器(模板图像生成)CS3245
–
Information
Retrieval多模态机器学习1181.语义判别学习训练属性分类器判断模板图像属性是否正确生成器目标:生成满足属性修改需求的图像2.对抗度量学习二元组策略:最小化正例距离,最大化负例距离三元组策略:正例距离<负例距离生成器:生成模仿目标图像的模板欺骗判别器测试阶段:生成器生成模板→判别器编码→检索排序局限:属性必须预定义,限制了应用场景Ch.
11-12AMGAN——判别器(度量学习)CS3245
–
Information
Retrieval多模态机器学习119Ch.
11-12基于自然语言的组合式图像检索类型特征提取器代表模型传统模型ResNet,LSTM,FasterR-CNNTIRG,VAL,CosMo,CLVC-Net预训练模型CLIPCLIP4CIR优势:允许用户通过自然语言灵活表达修改意图根据特征提取器分类:
CS3245
–
Information
Retrieval多模态机器学习120门控机制:过滤参考图像中需修改的部分残差模块:将修改文本转化为视觉修改信息模型结构:图像编码器(ResNet)+文本编码器(LSTM)+门控-残差组合模块Ch.
11-12TIRG(开创性工作,2019)首个正式提出基于自然语言的组合式图像检索任务CS3245
–
Information
Retrieval多模态机器学习121Ch.
11-12TIRG(开创性工作,2019)CS3245
–
Information
Retrieval多模态机器学习122组合公式:φ_xt^rg=w_g×f_gate(φ_x,φ_t)+w_r×f_res(φ_x,φ_t)门控模块:决定保留/过滤参考图像哪些部分f_gate=σ(W_g2*ReLU(W_g1*[φ_x,φ_t]))⊙φ_x残差模块:将文本修改意图转化为视觉修改量f_res=W_r2*ReLU(W_r1*[φ_x,φ_t])损失函数:基于小批次的分类损失组合特征接近目标图像,远离其他图像Ch.
11-12TIRG——核心模块CS3245
–
Information
Retrieval多模态机器学习123首次定义任务:正式提出基于自然语言的组合式图像检索提出经典架构:门控-残差机制成为后续工作的基础范式门控机制的核心思想:什么样的信息需要保留?什么样的信息需要修改?残差模块的核心思想:修改需求→视觉空间中的变化量通过残差叠加实现特征转换影响:门控和残差设计被VAL、CosMo等后续工作广泛借鉴Ch.
11-12TIRG——贡献CS3245
–
Information
Retrieval多模态机器学习124核心思想:局部+全局双角度组合,互学习增强四个模块:图像与文本编码模块;细粒度局部多模态组合模块(FLC)细粒度全局多模态组合模块(FGC);互学习增强模块Ch.
11-12CLVC-Net(2022)CS3245
–
Information
Retrieval多模态机器学习125
Ch.
11-12CLVC-Net——编码与局部组合CS3245
–
Information
Retrieval多模态机器学习126细粒度全局组合(FGC):从全局特征层面进行组合针对每个文本词计算不同的图像全局特征实现多角度全局特征融合互学习增强模块:相似度分布层面:KL散度约束两个模块的排序分布特征层面:L2损失约束组合特征向量距离Ch.
11-12CLVC-Net——全局组合与互学习CS3245
–
Information
Retrieval多模态机器学习127效果:两个模块相互蒸馏知识,检索效果进一步提升Ch.
11-12CLVC-Net——互学习互学习增强模块CS3245
–
Information
Retrieval多模态机器学习128贡献:首次从局部和全局两个视角进行多模态组合互学习策略使两个模块协同增强验证了多角度特征融合的有效性局限:仍使用传统单模态特征提取器特征表达能力有限与基于预训练模型的方法存在差距Ch.
11-12CLVC-Net——小结CS3245
–
Information
Retrieval多模态机器学习129Ch.
11-12为什么引入多模态预训练模型?传统模型的局限:图像编码器(ResNet)在ImageNet上预训练→与检索任务存在差异文本编码器(LSTM)从零训练→语义理解能力有限图像和文本特征分别提取→缺乏跨模态对齐预训练模型优势:大规模图文预训练→强大的跨模态理解能力统一的语义空间→图像和文本可直接比较简单融合即可达到领先效果CS3245
–
Information
Retrieval多模态机器学习130首个将多模态预训练模型(CLIP)引入组合式图像检索的工作思想:借助CLIP的跨模态能力,简单融合即可实现高效检索两阶段训练:CLIP微调阶段→适配下游任务多模态组合训练阶段→训练轻量融合网络Ch.
11-12CLIP4CIR(2022)CS3245
–
Information
Retrieval多模态机器学习131定义:允许用户对检索结果进行多轮修改交互流程:用户输入查询→系统返回结果用户不满意→继续修改→系统返回新结果;重复直至满意技术要点:每轮使用单轮检索方法处理多模态查询额外引入序列化建模捕捉历史交互代表模型:DialogManager:循环网络结构CFIR:建模多轮历史需求应用场景:智能导购、交互式搜索Ch.
11-12多轮组合式图像检索CS3245
–
Information
Retrieval多模态机器学习132Ch.
11-12组合式图像检索方法对比方法类型修改形式代表模型优势局限基于属性预定义属性AMGAN控制精准场景受限传统模型自然语言TIRG,CLVC-Net开创性工作特征能力有限预训练模型自然语言CLIP4CIR效果最优计算资源要求高多轮检索自然语言DialogManager更符合实际交互建模更复杂CS3245
–
Information
Retrieval多模态机器学习133任务定义:参考图像+修改文本→检索目标图像核心挑战:如何有效融合异构的多模态查询信息数据集演进:固定模板→自然语言描述(更贴近实际)方法演进:基于属性(AMGAN)→预定义属性,场景受限传统自然语言(TIRG/CLVC-Net)→开创性工作预训练模型(CLIP4CIR)→跨模态能力带来突破多轮检索→更符合实际交互需求趋势:从手工设计融合→借助预训练模型实现跨模态对齐Ch.
11-12本章总结Introduction
to
Information
Retrieval第12章跨模态视频时序片段定位Live
Q&A/jinCS3245
–
Information
Retrieval多模态机器学习135学习目标理解跨模态视频时序片段定位的任务定义与特点。熟悉常用数据集及其标注方式。掌握有监督、弱监督和无监督方法的基本思路。理解两阶段、单阶段和强化学习方法的典型流程与代表模型。Ch.
11-12跨模态视频时序片段定位CS3245
–
Information
Retrieval多模态机器学习136跨模态时序定位给定一个视频与一段自然语言查询,从视频中定位出与查询匹配的目标时序片段,并返回其开始和结束时刻。与跨模态时序定位相关的任务视频动作识别:给定一段视频和一组预定义动作类别,判断视频整体属于哪一类动作,输出动作类别标签,不关注动作发生的具体时间。时序动作定位:给定一段未裁剪视频和一组预定义动作类别,在视频时间轴上检测动作实例,输出动作类别及其开始、结束时间。Ch.
11-12什么是跨模态视频时序定位?CS3245
–
Information
Retrieval多模态机器学习137查询文本:网球运动员弯腰连续拍球,随后起身准备发球。Ch.
11-12什么是跨模态视频时序定位?0:0000:06与视频动作识别/时序动作定位的区别不局限于特定动作类别或预定义动作列表;可以查询任意复杂的行为活动。CS3245
–
Information
Retrieval多模态机器学习138Ch.
11-12方法总览跨模态视频时序片段定位有监督方法弱监督方法无监督方法训练数据含有精确的“视频时序片段-查询”对标注。特点定位性能最强依赖细粒度标注标注成本高存在标注偏差训练数据含有“视频-查询”对标注,无时间边界的监督信息特点节省标注成本避免人为认知偏差训练难度大性能略低于有监督训练数据无任何标注。特点无标注成本扩展性/适用性最强依赖预训练视觉概念定位精度最低按训练数据的标注粒度划分,现有跨模态视频时序片段定位方法可以分为三大类CS3245
–
Information
Retrieval多模态机器学习139Ch.
11-12数据集数据集名称视频数量查询数量DiDeMo10,46440,543TEMPO(基于DiDeMo扩展)10,46440,543Charades-STA(基于Charades扩展)9,84816,128TACos(基于MPIICompositive扩展)12718,818ActivityNet-Captions(目前应用最广)19,20971,957CS3245
–
Information
Retrieval多模态机器学习140Ch.
11-12数据集DiDeMo视频时长限制在30秒以内,按5秒一段切分为6份;候选片段由一段或多段连续5秒片段构成;通过枚举组合,每条视频一共生成21个候选片段。Charades–STA素材为记录日常室内活动的视频;把整条视频描述拆分为多条简短子句,每条子句匹配视频内对应的时间片段;视频平均时长31秒。TEMPO复用DiDeMo原始视频,新增包含多事件的语言描述;1)TEMPO-TL为模板语言,依靠before/after/while/then连接事件;2)TEMPO-HL是人工构建的自然人类语言,语句复杂度更高。TACoS聚焦烹饪领域各类动作;每条视频配备两类标注:细粒度动作标签+自然语言描述,文本描述由众包采集;数据集规模为127条视频、18818条查询,视频较长,对上下文理解能力要求高。ActivityNet–Captions面向视频字幕任务,覆盖多领域视频,规模为19209条视频、71957条文本查询;每条视频至少划分两个片段,片段各自匹配一条字幕CS3245
–
Information
Retrieval多模态机器学习141Ch.
11-12有监督学习方法定义将时序定位建模为顺序决策问题,用智能体逐步调整时序范围。代表模型RWM(端到端RL框架)TSP-PRL(树结构策略)SM-RL(语义匹配RL)两阶段单阶段强化学习定义先生成候选片段,再计算候选与查询的匹配分数。代表模型MCN(手动启发式)CTRL(多尺度滑动窗口)QSPN(时序生成网络)定义端到端直接预测目标片段,避免大量候选与查询的成对匹配。代表模型TGN(基于锚点)SCDM(基于采样)LNet(基于无提议)CS3245
–
Information
Retrieval多模态机器学习142Ch.
11-12两阶段的有监督学习方法候选片段生成方式视频+查询输入数据候选片段生成生成大量候选片段候选与查询匹配打分跨模态相似度计算目标片段(ts,te)手动启发式使用人工设定的规则处理视频,如按人工设定的时序窗口大小分割视频,获取大量候选片段。代表模型MCN(MomentContextNetwork)MLIC(LatentContextLocalization),CMN(TemporalCompositionalModular)多尺度滑动窗口利用不同时间尺度的滑动窗口依次覆盖长视频中连续时间段,提取不同时间长度的候选片段。代表模型CTRL(Cross-modalTemporalRegression)CARN(AttentiveCross-ModalRetrieval)SLTA,MMRGROLE时序生成网络利用深度神经网络对视频进行候选片段提取和时序建模,同时可引入查询信息作为引导。代表模型QSPN(Query-guidedSegmentProposal)SAP(SemanticActivityProposal)BPNet(BoundaryProposalNetwork)CS3245
–
Information
Retrieval多模态机器学习143Ch.
11-12手动启发式-MCN时刻上下文网络
固定5s分段并穷举连续组合;RGB与光流分别编码局部/全局上下文LSTM编码查询,排序损失拉近正样本CS3245
–
Information
Retrieval多模态机器学习144Ch.
11-12CTRL跨模态时序回归定位
C3D提取候选及前后文视觉特征;加法、乘法与拼接联合视觉—文本表示同时学习对齐分数与起止偏移量CS3245
–
Information
Retrieval多模态机器学习145Ch.
11-12QSPN查询引导片段提议
查询引导片段提议网络:减少与文本无关的候选;跨模态检索模块:用两层LSTM匹配并重构查询;联合检索损失与查询重构损失CS3245
–
Information
Retrieval多模态机器学习146Ch.
11-12单阶段的有监督学习方法基于锚点的方法通过生成一组时序锚点定位目标片段。代表模型TGNCBPBSSTLFANI2NCMNCSGMANPMI-LOC基于采样的方法通过采样策略生成不同时间尺度的候选时序视频片段。代表模型SCDM基于无提议的方法不生成候选片段,直接预测目标片段的开始/结束时刻。代表模型LNet(LocalizingNetwork)ABLREXCLSSMN两阶段方法生成大量不同时间尺度的候选片段(可能重叠),需要将所有候选片段与查询进行匹配。→计算效率低,且必然会耗费大量的计算资源。单阶段方法端到端地定位目标
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025-2026学年八年级英语上册英语说课稿
- 2025-2026学年大班开课阅读说课稿
- 2025-2026学年地方说课稿
- 2025-2026学年低年级数学说课稿
- 2025-2026学年关汉卿 说课稿
- 2025-2026学年好玩的易拉罐说课稿
- 2026下半年下半年小学美术教资面试结构化答辩
- 2025-2026学年八下人教版语文优说课稿
- 2025-2026学年《黄河颂》的说课稿
- 2025-2026学年一年级识字4说课稿
- 2026新苏教版六年级数学上册第二单元第2课《估算》课件
- 2026年重庆市中考数学试题(原卷版)
- 2026年广东省广州市辅警人员招聘考试试卷(含答案及解析)
- 实验室生物安全演练脚本
- 2026年西南电力设计院招聘考试指南及模拟题
- 2026年流感预防知识宣传测试题及答案
- 中英文产品研发项目合同协议
- 《内科学》名词解释
- 人教PEP版三年级英语上册第一单元Unit 1 Making friends 单元试卷(含答案含听力原文)
- 胎盘早剥教学课件
- CJ/T 454-2014城镇供水水量计量仪表的配备和管理通则
评论
0/150
提交评论