版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
MultimodalMachineLearning图像文本检索MultimodalMachineLearning多模态机器学习2给定一种模态作为查询,在另一种模态中找出语义最匹配的结果图像到文本:以图像为查询,从候选描述中返回语义一致的句子文本到图像:以自然语言为查询,从图库中返回与描述相符的图像核心问题:把异构的视觉内容和语言表达转换成可比较的语义表示检索输出:计算图文匹配分数,并按分数对候选项进行排序主要难点:需要区分完全匹配与仅有部分语义相似的困难负样本Ch.10图像文本检索解决问题MultimodalMachineLearning多模态机器学习3查询不仅要找到完全匹配项,还要排除只有部分语义相似的干扰项Ch.10图像文本检索的双向任务MultimodalMachineLearning多模态机器学习4图像文本检索让用户可以用自然语言访问视觉内容。图像标注:自动寻找与图像匹配的描述,降低人工标注成本语义搜索:根据句子含义检索图像,而不是只依赖关键词机器人问答:通过语言查询视觉环境中的对象、动作和场景模态差异:像素与词语的数据结构不同,但需要表达共同语义细粒度匹配:对象、属性、动作和关系必须同时对齐才能避免误检Ch.10任务价值与核心挑战MultimodalMachineLearning多模态机器学习5不同数据集覆盖通用检索、行人检索和中文跨模态检索CUHK-PEDES:40206幅行人图像、80412条描述,主要用于行人文本检索Flickr8K:8092幅图像、40460条描述,每幅图像对应5条文本Flickr30K:31783幅图像、158915条描述,是常用通用检索基准MSCOCO:123287幅图像、616435条描述,场景与对象类别更丰富MUGE:包含约1.9TB图像与292GB文本,面向中文多模态评测Wukong:包含超过1亿个中文图像—文本对,适合大规模预训练Ch.10常用数据集MultimodalMachineLearning多模态机器学习6数据集选择应同时考虑任务类型、语言、规模与标注质量通用性能比较:Flickr30K和MSCOCO规模较大、划分成熟,最常用于模型评估行人文本检索:CUHK-PEDES关注服装、外观和身份相关的细粒度描述中文检索:MUGE和Wukong提供大规模中文图文资源预训练需求:数据越大越利于学习通用表示,但噪声和重复样本也更多公平比较:实验必须统一训练、验证、测试划分与召回率评价设置Ch.10不同数据集适用的研究MultimodalMachineLearning多模态机器学习7从表示粒度、知识来源、训练约束和预训练规模四方面演进全局检索:使用整幅图像和整句文本的全局表示进行匹配局部检索:建立图像区域、对象、单词和短语之间的细粒度对应外部知识:借助场景概念图和常识关系补充图像中未显式出现的语义度量学习:设计排序、实例和困难负样本损失,提高特征可区分性多模态预训练:在大规模图文对上学习通用表示,再迁移到检索任务扩展任务:包括弱监督、零样本、场景文本感知和跨语言检索Ch.10本章方法框架MultimodalMachineLearning多模态机器学习8全局检索高效,但能否充分融合图文信息取决于模型架构嵌入架构:分别编码整幅图像和整句文本,再映射到共享空间计算相似度交互架构:先融合图文特征,通过专门的交互网络直接预测匹配分数嵌入优势:候选特征可以离线计算,适合大规模快速检索交互优势:能够捕捉更丰富的跨模态联系,但在线计算成本更高Ch.10全局方法MultimodalMachineLearning多模态机器学习9DeViSE是早期全局嵌入方法,目标让匹配图文在共享空间中靠近视觉编码:利用预训练AlexNet提取整幅图像的全局视觉特征文本编码:利用预训练Skip-gram获得文本描述的全局语义特征空间映射:通过可训练线性变换统一两种特征的维度和语义坐标相似度:在共享嵌入空间中用点积或余弦相似度判断图文匹配训练目标:真实描述得分高于随机负描述,并至少保持一个间隔Ch.10DeViSEMultimodalMachineLearning多模态机器学习10图像与文本由独立编码器处理,再通过映射层进入同一嵌入空间Ch.10DeViSE模型结构MultimodalMachineLearning多模态机器学习11
Ch.10DeViSE的铰链损失MultimodalMachineLearning多模态机器学习12MM-CNN不只比较最终向量,而是直接学习图像与不同文本片段的匹配图像特征:使用OverFeat或VGG提取全局视觉表示文本特征:使用Skip-gram获得查询描述中每个单词的向量交互方式:把图像特征与单词、短语和句子级文本特征拼接匹配网络:各层级使用独立CNN与MLP输出匹配分数最终决策:累加各层级得分,得到完整查询描述与图像的匹配分数Ch.10MM-CNNMultimodalMachineLearning多模态机器学习13模型并行计算单词、短语和句子级匹配,再汇总为最终得分Ch.10MM-CNN模型结构MultimodalMachineLearning多模态机器学习14
Ch.10单词、短语与句子三级匹配MultimodalMachineLearning多模态机器学习15
Ch.10MM-CNN排序损失MultimodalMachineLearning多模态机器学习16仅用全局向量容易忽略对象、属性和动作关系等局部差异全局方法局限:整幅图像和整句文本被压缩后,局部语义可能被平均掉局部视觉实体:使用对象框、区域网格或显著区域表示图像细节局部文本实体:使用单词、短语或句法节点表示语言细节核心目标:建立“区域—单词”“对象—短语”等细粒度对齐关系代价:局部实体数量多,匹配和注意力计算复杂度随之增加Ch.10局部方法为何更适合细粒度匹配MultimodalMachineLearning多模态机器学习17DVSA把每个单词与相似度最高的图像区域对齐,再汇总局部得分图像编码:使用在ImageNet上预训练的RCNN提取对象区域和全局特征文本编码:使用双向RNN学习上下文相关的单词特征局部相似度:计算每个单词与每个图像区域的点积最大对齐:为当前单词选择相似度最高的区域作为其对齐区域图文得分:把句子中所有单词与对齐区域的相似度相加Ch.10DVSAMultimodalMachineLearning多模态机器学习18图像对象区域与文本单词逐一比较,形成可解释的局部语义对齐Ch.10DVSA模型结构MultimodalMachineLearning多模态机器学习19
Ch.10DVSA双向排序约束MultimodalMachineLearning多模态机器学习20局部实体不仅要跨模态对齐,还需要先理解各自模态内部的关系视觉模态关系:建模对象之间的空间、动作与语义关系,增强视觉表示文本模态关系:建模单词、短语和句法结构之间的依赖,增强语言表示双模态内关系:同时处理图像内部关系与文本内部关系常用机制:语义重组、层次结构、注意力、图卷积和一致性约束代表模型:SCO、HM-LSTM与SM-LSTM分别体现三种路线Ch.10模态内关系建模的三条路线MultimodalMachineLearning多模态机器学习21SCO要求视觉概念按正确语义顺序生成与原描述一致的文本文本表示:以LSTM最后一个单元输出作为查询描述特征概念提取:从图像区域预测名词、动词、形容词和数字等语义概念顺序学习:融合全局视觉特征与概念置信度,用LSTM按链式顺序生成词语匹配与生成:同时计算图文相似度,并监督模型生成正确语义序列关键价值:区分“长颈鹿吃篮子里的东西”和相反语序Ch.10SCOMultimodalMachineLearning多模态机器学习22视觉概念检测、语义顺序生成与图文匹配在同一模型中联合训练Ch.10SCO模型结构MultimodalMachineLearning多模态机器学习23
Ch.10SCO的联合优化目标MultimodalMachineLearning多模态机器学习24HM-LSTM把句子解析成树结构,用短语层级建立更细致的视觉对应视觉区域:RCNN提取图像中的候选区域特征v句法树:叶节点表示单词,中间节点表示短语,根节点表示完整句子候选限制:利用名词短语、动词短语等句法类型筛选合理对齐对象区域选择:根据区域特征与短语特征相似度选择最佳对应关系层次优化:同时最小化短语—区域损失与句子—图像损失Ch.10HM-LSTMMultimodalMachineLearning多模态机器学习25文本句法树提供单词、短语和句子层级,分别与图像区域建立对应Ch.10HM-LSTM模型结构MultimodalMachineLearning多模态机器学习26
Ch.10HM-LSTM的层次损失MultimodalMachineLearning多模态机器学习27SM-LSTM同时筛选重要图像区域和重要单词,再聚合局部匹配实例候选:Bi-LSTM获得单词特征,CNN从均匀图像区域提取视觉候选全局上下文:句子隐藏状态n和图像全连接特征m概括整体语义显著性预测:结合候选实例、全局上下文和上一时刻状态估计注意力局部匹配:加权聚合两种实例特征,经MLP输出每一步匹配分数最终聚合:最后时刻隐藏状态hT汇总全部局部相似性Ch.10SM-LSTMMultimodalMachineLearning多模态机器学习28显著图使模型集中关注“狗”等关键对象及其相关单词,忽略背景噪声Ch.10SM-LSTM模型结构MultimodalMachineLearning多模态机器学习29BSSAN从文本引导视觉和视觉引导文本两个方向建立细粒度对齐单词—区域:以当前单词为引导,为相关图像区域分配视觉注意力对象—单词:以当前图像对象为引导,突出查询文本中的相关单词双向独立:两个模块使用不同视觉特征和文本编码方式。匹配输出:LSTM与MLP输出单词—区域得分sw2r,对象—单词得分so2w联合训练:同时优化两个方向,并用L2正则化降低过拟合Ch.10BSSANMultimodalMachineLearning多模态机器学习30两个注意力分支分别回答“这个词对应哪里”和“这个对象对应哪些词”Ch.10BSSAN模型结构MultimodalMachineLearning多模态机器学习31
Ch.10BSSAN的联合损失MultimodalMachineLearning多模态机器学习32OAN用跨模态注意力完成对齐,再用模态内注意力增强各自表示编码模块:CNN编码文本上下文,Faster-RCNN提取图像对象特征模态间注意力:包括视觉—文本和文本—视觉两个方向的交叉增强模态内注意力:文本—文本和视觉—视觉分支挖掘同模态实体关系相似度融合:组合模态间相似度与模态内相似度得到最终得分困难负样本:重点惩罚语义接近但不匹配的图像或文本Ch.10OANMultimodalMachineLearning多模态机器学习33跨模态和模态内注意力并行增强视觉对象与文本单词的表示Ch.10OAN模型结构MultimodalMachineLearning多模态机器学习34
Ch.10OAN的混合相似度与难负样本MultimodalMachineLearning多模态机器学习35局部检索方法的差别在于优先增强哪里,以及何时进行跨模态交互仅模态内:先理解图像内部或文本内部关系,再进行图文匹配仅模态间:直接用双向注意力建立区域、对象与单词之间的联系混合交互:同时建模模态内外关系,表达最充分但计算开销最大串行模式:先模态内后模态间,或先模态间后模态内同步模式:并行更新模态内与跨模态表示,再融合多路相似度Ch.10三类局部关系建模选择MultimodalMachineLearning多模态机器学习36图像本身可能缺少常识信息,外部知识可补足隐含概念和对象关系语义缺失:局部特征能看到“人”和“书”,但未必理解“阅读”场景场景概念图:记录对象和概念在现实场景中的共现关系概念扩展:从已检测概念推断可能存在但视觉模型漏检的概念视觉关系:补充对象间动作、空间和属性联系风险:外部知识也会引入噪声,因此需要相关性预测与门控过滤Ch.10外部知识改善检索MultimodalMachineLearning多模态机器学习37SCG联合视觉特征、概念检测、概念扩展和文本特征完成匹配Ch.10SCG整体框架MultimodalMachineLearning多模态机器学习38概念图以共现场景连接对象,例如“房子—窗户”“笔记本—键盘”Ch.10场景概念图提供常识关联MultimodalMachineLearning多模态机器学习39检测概念沿场景图扩展,再预测相关性以过滤与当前图像无关的概念Ch.10概念扩展与噪声过滤MultimodalMachineLearning多模态机器学习40
Ch.10SCG的五步增强流程MultimodalMachineLearning多模态机器学习41度量学习不限定特征来源,而是改进正负样本之间的距离约束基础特征:ResNet-50提取图像特征,类CNN结构提取文本特征第一阶段:仅使用实例损失,让每个图文组形成可区分的类别第二阶段:联合排序损失和实例损失,兼顾匹配关系与组间差异排序作用:正样本相似度高于图像负样本和文本负样本实例作用:学习不同图文组之间更细粒度、更鲁棒的差异Ch.10度量学习增强图文可区分性MultimodalMachineLearning多模态机器学习42
Ch.10实例损失学习组级身份MultimodalMachineLearning多模态机器学习43大规模图文预训练缓解小数据训练的泛化不足单流框架:把视觉嵌入和文本嵌入一起输入同一个多模态Transformer双流框架:视觉与文本先独立编码,再利用跨模态注意力交换信息单流代表:VisualBERT通过联合序列隐式学习图文对齐双流代表:ViLBERT使用视觉流和语言流,并以协同注意力融合迁移方式:预训练获得通用表示,再针对图像文本匹配任务微调Ch.10多模态预训练MultimodalMachineLearning多模态机器学习44视觉对象嵌入与文本词元嵌入组成同一序列,由一个Transformer联合编码Ch.10VisualBERT单流模型MultimodalMachineLearning多模态机器学习45视觉流与语言流分别建模,并通过Co-TRM模块执行双向跨模态注意力Ch.10ViLBERT双流模型MultimodalMachineLearning多模态机器学习46两种预训练框架的主要差异是图文信息在何时、以什么方式交互单流输入:视觉区域和文本词元直接拼接,统一进入Transformer单流特点:交互充分、结构紧凑,但长联合序列增加自注意力计算量双流输入:两个编码器先分别建模各自模态,再交换上下文双流特点:保留模态专用表示,融合结构更灵活,但模块数量更多共同目标
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025-2026学年单脚原地站说课稿
- 2025-2026学年S版四年级下册百花园一说课稿
- 2025-2026学年关于乌龟健康说课稿
- 2025-2026学年各种冰淇淋绘画说课稿
- 2025-2026学年6敬业与乐业说课稿
- 2026年河北省南宫市高二历史下册期末考试试卷及答案(典优)
- 2025年云南省文山市高二历史下册期末考试自测卷附答案(精练)
- 2025-2026学年大班做瑜伽说课稿
- 2025-2026学年安全说课稿小班手工
- 河南政务服务招聘考试历年真题题库及答案
- 工程保险投保及理赔管理办法
- 2026事业单位招聘考试《公共基础知识》真题库及答案
- 新版2026年湖南物理卷高考真题(含答案)(网络参考)
- 深圳市中金岭南有色金属股份有限公司2026届校园招聘备考题库及参考答案详解
- 2025中国华电集团有限公司校园招聘笔试历年参考题库附带答案详解
- 威宁县病死畜禽无害化处理中心项目建设项目环境影响报告表
- 耳迷走神经刺激仪
- 25春国家开放大学《药剂学(本)》形考任务1-3参考答案
- 审计岗位笔试试题及答案
- 2025年职业院校技能大赛高职组(融媒体内容策划与制作赛项)考试题库(含答案)
- 委托代收拖欠物业费协议
评论
0/150
提交评论