模态基础及学习 10_第1页
模态基础及学习 10_第2页
模态基础及学习 10_第3页
模态基础及学习 10_第4页
模态基础及学习 10_第5页
已阅读5页,还剩23页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Introduction

to

Information

Retrieval组合式图像检索Live

Q&A/jinCS3245

–

Information

Retrieval多模态机器学习211.1组合式图像检索数据集基于固定语言模板vs基于自然语言描述11.2组合式图像检索相关工作基于属性的方法(AMGAN)基于自然语言的方法传统模型(TIRG、CLVC-Net)多模态预训练大模型(CLIP4CIR)其他工作(多轮检索)核心思想:参考图像+修改文本→精准表达复杂查询意图Ch.

11-12本章内容概述CS3245

–

Information

Retrieval多模态机器学习3传统检索方式的局限:基于文本:难以描述视觉细节基于图像:无法表达修改意图Ch.

11-12为什么需要组合式图像检索?组合式检索的优势:参考图像:表达整体需求修改文本:表达局部修改需求CS3245

–

Information

Retrieval多模态机器学习4提出者:李飞飞教授团队(2019年)输入:参考图像+修改文本(多模态组合查询)输出:符合用户意图的目标图像任务形式:三元组数据:<参考图像,修改文本,目标图像>示例:“这件衣服不错,但换成黑色长袖”意义:革新检索范式,提升用户体验Ch.

11-12任务定义CS3245

–

Information

Retrieval多模态机器学习5Ch.

11-12组合式图像检索数据集分类类型数据集名称规模图像/三元组数据领域组合查询示例参考图像修改文本基于固定语言模板Fashion200K200k/20.3k服装

Replaceflare-legwithwide-leg.CSS34k/32k几何体Addredcylindertobottom-middle.MIT-States60k/125.9k物品changestatetoancient.基于自然语言描述FashionIQ70k/30k服装isblackandmoreelegant.Shoes14.7k/10.7k鞋子havefurontheoutside.Birds-to-Words3.5k/13.3k鸟类animal1hasalongerbeakthananimal2.CIRR4.3k/36.6k开放域Removeonedog.Addgrass,makeonedogblack.CS3245

–

Information

Retrieval多模态机器学习6Ch.

11-12基于固定语言模板的数据集构造方式:将图像属性的不同取值填入固定模板示例:“replaceAwithB”数据集规模(图像/三元组)领域示例Fashion200K200k/20.3k服装Replaceflare-legwithwide-legCSS34k/32k几何体Addredcylindertobottom-middleMIT-States60k/125.9k物品changestatetoancient局限:修改文本不灵活,不贴近实际应用CS3245

–

Information

Retrieval多模态机器学习7构造方式:人工标注自然语言修改文本Ch.

11-12基于自然语言描述的数据集数据集规模(图像/三元组)领域示例FashionIQ70k/30k服装isblackandmoreelegantShoes14.7k/10.7k鞋子havefurontheoutsideBirds-to-Words3.5k/13.3k鸟类hasalongerbeakthanCIRR4.3k/36.6k开放域Removeonedog,addgrass优势:自然灵活,符合真实应用场景CS3245

–

Information

Retrieval多模态机器学习8Ch.

11-12组合式图像检索方法分类基于属性的方法仅允许修改预定义属性代表:AMNet、FashionSearchNet、AMGAN基于自然语言的方法允许灵活的自然语言修改传统模型:TIRG、VAL、CosMo、CLVC-Net预训练模型:CLIP4CIR其他工作多轮组合式图像检索代表:DialogManager、CFIR

CS3245

–

Information

Retrieval多模态机器学习9Ch.

11-12基于属性的组合式图像检索模型核心思想AMNet记忆模块存储属性模板特征FashionSearchNet属性定位网络提取区域特征AMGAN生成满足要求的模板图像后检索特点:仅允许对预定义属性进行修改应用领域:时尚(颜色/材质)、人脸(发色/脸型)核心思路:将修改的属性信息与参考图像融合代表模型:CS3245

–

Information

Retrieval多模态机器学习10核心思想:先根据查询生成模板图像,再基于模板检索框架:对抗生成网络(GAN)生成器:生成满足用户需求的模板图像判别器:学习距离度量函数,衡量图像相似度Ch.

11-12AMGAN(属性修改生成对抗网络)CS3245

–

Information

Retrieval多模态机器学习11两大模块:模板图像生成基于度量学习的图像检索

Ch.

11-12AMGAN(属性修改生成对抗网络)CS3245

–

Information

Retrieval多模态机器学习12参考图像编码卷积层+BN+ReLU→视觉特征图属性修改编码可学习属性语义嵌入矩阵指示向量提取目标属性嵌入特征融合通道方向级联视觉特征+语义特征残差块进行特征变换(保留关键视觉信息)图像解码上采样层+卷积层→模板图像训练约束:视觉-语义一致性+L1像素级损失Ch.

11-12AMGAN——生成器(模板图像生成)CS3245

–

Information

Retrieval多模态机器学习131.语义判别学习训练属性分类器判断模板图像属性是否正确生成器目标:生成满足属性修改需求的图像2.对抗度量学习二元组策略:最小化正例距离,最大化负例距离三元组策略:正例距离<负例距离生成器:生成模仿目标图像的模板欺骗判别器测试阶段:生成器生成模板→判别器编码→检索排序局限:属性必须预定义,限制了应用场景Ch.

11-12AMGAN——判别器(度量学习)CS3245

–

Information

Retrieval多模态机器学习14Ch.

11-12基于自然语言的组合式图像检索类型特征提取器代表模型传统模型ResNet,LSTM,FasterR-CNNTIRG,VAL,CosMo,CLVC-Net预训练模型CLIPCLIP4CIR优势:允许用户通过自然语言灵活表达修改意图根据特征提取器分类:

CS3245

–

Information

Retrieval多模态机器学习15门控机制:过滤参考图像中需修改的部分残差模块:将修改文本转化为视觉修改信息模型结构:图像编码器(ResNet)+文本编码器(LSTM)+门控-残差组合模块Ch.

11-12TIRG(开创性工作,2019)首个正式提出基于自然语言的组合式图像检索任务CS3245

–

Information

Retrieval多模态机器学习16Ch.

11-12TIRG(开创性工作,2019)CS3245

–

Information

Retrieval多模态机器学习17组合公式:φ_xt^rg=w_g×f_gate(φ_x,φ_t)+w_r×f_res(φ_x,φ_t)门控模块:决定保留/过滤参考图像哪些部分f_gate=σ(W_g2*ReLU(W_g1*[φ_x,φ_t]))⊙φ_x残差模块:将文本修改意图转化为视觉修改量f_res=W_r2*ReLU(W_r1*[φ_x,φ_t])损失函数:基于小批次的分类损失组合特征接近目标图像,远离其他图像Ch.

11-12TIRG——核心模块CS3245

–

Information

Retrieval多模态机器学习18首次定义任务:正式提出基于自然语言的组合式图像检索提出经典架构:门控-残差机制成为后续工作的基础范式门控机制的核心思想:什么样的信息需要保留?什么样的信息需要修改?残差模块的核心思想:修改需求→视觉空间中的变化量通过残差叠加实现特征转换影响:门控和残差设计被VAL、CosMo等后续工作广泛借鉴Ch.

11-12TIRG——贡献CS3245

–

Information

Retrieval多模态机器学习19核心思想:局部+全局双角度组合,互学习增强四个模块:图像与文本编码模块;细粒度局部多模态组合模块(FLC)细粒度全局多模态组合模块(FGC);互学习增强模块Ch.

11-12CLVC-Net(2022)CS3245

–

Information

Retrieval多模态机器学习20

Ch.

11-12CLVC-Net——编码与局部组合CS3245

–

Information

Retrieval多模态机器学习21细粒度全局组合(FGC):从全局特征层面进行组合针对每个文本词计算不同的图像全局特征实现多角度全局特征融合互学习增强模块:相似度分布层面:KL散度约束两个模块的排序分布特征层面:L2损失约束组合特征向量距离Ch.

11-12CLVC-Net——全局组合与互学习CS3245

–

Information

Retrieval多模态机器学习22效果:两个模块相互蒸馏知识,检索效果进一步提升Ch.

11-12CLVC-Net——互学习互学习增强模块CS3245

–

Information

Retrieval多模态机器学习23贡献:首次从局部和全局两个视角进行多模态组合互学习策略使两个模块协同增强验证了多角度特征融合的有效性局限:仍使用传统单模态特征提取器特征表达能力有限与基于预训练模型的方法存在差距Ch.

11-12CLVC-Net——小结CS3245

–

Information

Retrieval多模态机器学习24Ch.

11-12为什么引入多模态预训练模型?传统模型的局限:图像编码器(ResNet)在ImageNet上预训练→与检索任务存在差异文本编码器(LSTM)从零训练→语义理解能力有限图像和文本特征分别提取→缺乏跨模态对齐预训练模型优势:大规模图文预训练→强大的跨模态理解能力统一的语义空间→图像和文本可直接比较简单融合即可达到领先效果CS3245

–

Information

Retrieval多模态机器学习25首个将多模态预训练模型(CLIP)引入组合式图像检索的工作思想:借助CLIP的跨模态能力,简单融合即可实现高效检索两阶段训练:CLIP微调阶段→适配下游任务多模态组合训练阶段→训练轻量融合网络Ch.

11-12CLIP4CIR(2022)CS3245

–

Information

Retrieval多模态机器学习26定义:允许用户对检索结果进行多轮修改交互流程:用户输入查询→系统返回结果用户不满意→继续修改→系统返回新结果;重复直至满意技术要点:每轮使用单轮检索方法处理多模态查询额外引入序列化建模捕捉历史交互代表模型:DialogManager:循环网络结构CFIR:建模多轮历史需求应用场景:智能导购、交互式搜索Ch.

11-12多轮组合式图像检索CS3245

–

Information

Retrieval多模态机器学习27Ch.

11-12组合式图像检索方法对比方法类型修改形式代表模型优势局限基于属性预定义属性AMGAN控制精准场景受限传统模型自然语言TIRG,CLVC-Net开创性工作特征能力有限预训练模型自然语言CLIP4CIR效果最优计算资源要求高多轮检索自然语言DialogMa

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论