模态基础及学习 14_第1页
模态基础及学习 14_第2页
模态基础及学习 14_第3页
模态基础及学习 14_第4页
模态基础及学习 14_第5页
已阅读5页,还剩30页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Introduction

to

Information

Retrieval多模态对话系统Live

Q&A/jinCS3245

–

Information

Retrieval多模态机器学习214.1多模态对话系统数据集MMD(电商领域)MMConv(娱乐领域,多领域)14.2多模态对话系统相关工作基于序列模型(UMD)基于图模型(TREASURE)基于Transformer模型(MATE)核心思想:突破纯文本限制,实现图文交互的智能对话Ch.

11-12本章内容概述CS3245

–

Information

Retrieval多模态机器学习3对话系统历史:始于20世纪60年代的简单模式匹配系统行业规模(中国):2019年:14亿元2022年:44.7亿元2025年(预计):98.5亿元传统单模态对话系统的局限:仅涉及文本模态交互方式单一难以表达复杂意图无法直观呈现信息Ch.

11-12从单模态到多模态对话系统从单模态到多模态对话系统对话系统展示。单模态对话系统(左)与多模态对话系统(右)CS3245

–

Information

Retrieval多模态机器学习5用户侧:可借助图像生动表达需求更丰富的交互方式系统侧:通过图像直观呈现反馈提升用户体验(如商品挑选)应用前景:智能导购、虚拟助手、娱乐对话等Ch.

11-12多模态对话系统的价值CS3245

–

Information

Retrieval多模态机器学习6Ch.

11-12多模态对话系统数据集数据集构建团队领域特点MMDIBMResearchAI电商首个大规模公开数据集MMConv新加坡国立大学+清华大学娱乐(5个领域)多领域、多模态两个代表性公开数据集:CS3245

–

Information

Retrieval多模态机器学习7Ch.

11-12MMD数据集(电商领域)数据集数据训练集规模验证集规模测试集规模对话数目105,43922,59522,595对话数目比例70%15%15%每个对话平均语句数目404040系统的图像回复数目90.4万19.4万19.3万系统的文本回复数目154万33.1万33.0万用户语句平均单词数目121212系统语句平均单词数目141414知识库单品数目105万每个单品涉及的图像数目4单品属性数目52规模:15万余条对话数据平均每个对话40条语句外部知识库:105万个单品;单品属性:52个知识类型:属性、搭配技巧、受欢迎程度CS3245

–

Information

Retrieval多模态机器学习8领域覆盖:食物、宾馆、夜生活、商场、观光(5个领域)Ch.

11-12MMConv数据集(娱乐领域)数据集数据数据集规模对话数目5,106对话轮数39,759涉及单个领域主题的对话数目808涉及多个领域主题的对话数目4,298单模态对话数目751多模态对话数目4,355知识库中实体数目1,771知识库中图像数目113,953知识库中用户评论数目42,850丰富的多模态知识支持用户评论提供真实反馈信息CS3245

–

Information

Retrieval多模态机器学习9Ch.

11-12多模态对话系统方法分类类型核心思想代表模型基于序列模型建模时序关系UMD基于图模型建模语义关系图TREASURE基于Transformer模型建模元素级语义关系MATE根据对话上下文建模方法分类:核心挑战:多模态对话上下文中用户意图的准确理解CS3245

–

Information

Retrieval多模态机器学习10核心思想:建模多模态对话上下文的时序关系代表工作:位置编码引导的注意力机制UMD(用户注意力引导)UMD特点:层次化商品属性关系增强图像编码注意力机制探索用户对属性的关注

Ch.

11-12基于序列模型的多模态对话系统CS3245

–

Information

Retrieval多模态机器学习11核心创新:层次化图像编码器商品类别层次(树结构)商品属性层次(键值属性树)任务:文本回复生成+图像回复检索Ch.

11-12UMD(用户注意力引导)CS3245

–

Information

Retrieval多模态机器学习12

Ch.

11-12UMD——文本编码CS3245

–

Information

Retrieval多模态机器学习13两个层次:类别层次(树结构)L层,M个叶节点每个叶节点对应一个商品类别逐层编码:v^1→...→v^L属性层次(键值树)每个键对应一个属性(如颜色)每个值对应属性特定值(如蓝色)输出:N个属性表征V={v_1,v_2,...,v_N}

Ch.

11-12UMD——层次化图像编码CS3245

–

Information

Retrieval多模态机器学习14

Ch.

11-12UMD——用户属性注意力

CS3245

–

Information

Retrieval多模态机器学习15

Ch.

11-12UMD——对话上下文编码CS3245

–

Information

Retrieval多模态机器学习16

Ch.

11-12UMD——文本回复解码CS3245

–

Information

Retrieval多模态机器学习17

Ch.

11-12UMD——图像回复解码CS3245

–

Information

Retrieval多模态机器学习18贡献:层次化图像编码器增强图像表征用户属性注意力建模用户关注点统一框架同时处理文本和图像回复局限:主要关注时序关系忽略对话语句间无序的语义关系图模型方法对此进行了改善

Ch.

11-12UMD——小结CS3245

–

Information

Retrieval多模态机器学习19核心思想:构建图网络探索多模态对话上下文中的语义关系代表工作:TREASURE:语义关系图+图注意力网络LARCH:多模态层次化图优势:捕捉对话语句间的语义关联非时序关系的灵活建模

Ch.

11-12基于图模型的多模态对话系统CS3245

–

Information

Retrieval多模态机器学习20三大模块:节点初始化模块

→多模态语句表征关系上下文建模模块

→语义关系图响应生成器模块

→文本/图像回复

Ch.

11-12TREASURE(图注意力多模态对话)CS3245

–

Information

Retrieval多模态机器学习21Ch.

11-12TREASURE(图注意力多模态对话)核心创新:属性矩阵增强单词表示稀疏图注意力网络(动态删边)每条对话语句=一个图节点CS3245

–

Information

Retrieval多模态机器学习22文本编码器:定义若干属性矩阵存储属性值词向量注意力机制关联每个单词与相关属性增强后的单词表示→Bi-LSTM→文本表征视觉编码器:图像划分为多个视觉区域文本引导的注意力网络分配区域权重加权求和→图像表征融合组件:动态门控机制融合文本和图像→节点初始表征Ch.

11-12TREASURE——节点初始化CS3245

–

Information

Retrieval多模态机器学习23

Ch.

11-12TREASURE——稀疏图注意力网络CS3245

–

Information

Retrieval多模态机器学习24响应生成:文本回复:RNN解码器+最大似然估计图像回复:余弦相似度排序+最大间隔损失贡献:首次用图结构建模多模态对话上下文稀疏图注意力减少噪声干扰属性增强的文本表示局限:每条对话语句作为一个节点无法捕捉语句内部元素级(单词、图像)关联Ch.

11-12TREASURE——响应生成与小结CS3245

–

Information

Retrieval多模态机器学习25核心思想:利用Transformer探索元素级(单词、图像)语义关系代表工作:MATE:元素级语义关系建模MDS-S2:BART预训练模型优势:更细粒度的语义交互强大的上下文建模能力Ch.

11-12基于Transformer模型的多模态对话系统CS3245

–

Information

Retrieval多模态机器学习26多模态元素级别编码器探索单词-图像元素级关系建模用户意图Ch.

11-12MATE(元素级编码+两阶段知识解码)两阶段知识解码器第一阶段:生成隐藏状态第二阶段:引入外部知识增强CS3245

–

Information

Retrieval多模态机器学习27

Ch.

11-12MATE——多模态元素级编码

CS3245

–

Information

Retrieval多模态机器学习28

Ch.

11-12MATE——多模态元素级编码CS3245

–

Information

Retrieval多模态机器学习29

Ch.

11-12MATE——用户查询与图像交互

CS3245

–

Information

Retrieval多模态机器学习30

Ch.

11-12MATE——两阶段解码器

CS3245

–

Information

Retrieval多模态机器学习31

Ch.

11-12MATE——两阶段解码器

CS3245

–

Information

Retrieval多模态机器学习32

Ch.

11-12MATE——外部知识编码

CS3245

–

Information

Retrieval多模态机器学习33Ch.

11-12MATE——小结模型建模粒度核心机制UMD语句级(时序)LSTM+层次化图像编码TREASURE语句级(图)图注意力网络MATE元素级(Transformer)单词-图像交互+知识增强贡献:元素级编码器捕捉单词-图像细粒度关系两阶段解码器引入外部知识增强生成Transformer架构实现强大的上下文建模创新点对比:CS3245

–

Information

Retrieval多模态机器学习34Ch.

11-12三种方法对比维度序列模型(UMD)图模型(TREASURE)Transformer(MATE)建模粒度语句级语句级元素级(单词+图像)关系类型时序关系语义图关系元素级语义关系核心架构LSTM/RNN+CNN图注意力网络Transformer图像编码层次化属性编码视觉区域注意力元素级交互知识融合属性知识属性知识搭配技巧+受欢迎程度优势时序建模清晰灵活语义关联细粒

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论