模态基础及学习 4_第1页
模态基础及学习 4_第2页
模态基础及学习 4_第3页
模态基础及学习 4_第4页
模态基础及学习 4_第5页
已阅读5页,还剩32页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Introduction

to

Information

Retrieval多模态摘要生成Live

Q&A/jinCS3245

–

Information

Retrieval多模态机器学习213.1多模态摘要生成数据集仅支持文本摘要输出支持多模态摘要输出13.2多模态摘要生成相关工作抽取式摘要生成(Multimodal-RNN)生成式摘要生成基于非预训练模型(MSMO)基于预训练模型(V2P)核心思想:多模态数据相辅相成→生成更高质量的摘要Ch.

11-12本章内容概述CS3245

–

Information

Retrieval多模态机器学习3信息爆炸时代:多模态数据成为网络信息的主流形式多模态数据的特性:同一事物的不同模态互相关联模态间存在一致性和互补关系相辅相成地刻画同一事物多模态摘要生成(MMS)

:输入:多模态信息(文本、图像、视频等)输出:满足实际需求的摘要(文本/图像)Ch.

11-12为什么需要多模态摘要生成?CS3245

–

Information

Retrieval多模态机器学习4输入:商品图像信息商品标题信息商品详情描述输出:总结性文本摘要目的:帮助用户快速理解商品核心特性和卖点节省用户挑选商品的时间成本Ch.

11-12应用场景1:电子商务CS3245

–

Information

Retrieval多模态机器学习5Ch.

11-12应用场景2:新闻领域输入:新闻文本内容多张新闻配图输出:多模态新闻摘要文本摘要内容最相关的图像作为配图目的:帮助人们在有限时间内快速了解新闻事件提升信息获取效率CS3245

–

Information

Retrieval多模态机器学习6Ch.

11-12多模态摘要生成数据集分类输出模态数据集名称数据来源输入模态输出模态数据集规模仅支持文本摘要输出MMSS新闻文本,图像文本60kE-DailyMail新闻文本,图像文本220kMMS新闻文本,图像,音频,视频文本1kCEPSUM电子商务文本,图像文本16k支持多模态输出MSMO新闻文本,图像文本,图像300kVMSMO新闻文本,音频,视频文本,图像127kSinaWeibo社交媒体文本,图像文本,图像184kCS3245

–

Information

Retrieval多模态机器学习7构建基础:纯文本摘要数据集Gigaword图像获取:将新闻摘要输入图像搜索引擎检索返回5张最相关图像人工标注选出最相关1张规模:约60k个样本样本组成:<新闻文本内容,相关图像,新闻摘要>Ch.

11-12MMSS(新闻领域,仅文本摘要输出)CS3245

–

Information

Retrieval多模态机器学习8Ch.

11-12E-DailyMail(新闻领域,仅文本摘要输出)构建基础:纯文本摘要数据集DailyMail图像获取:收集每条新闻原始网页中包含的图像规模:约220k个样本样本组成:<新闻文本内容,多张相关图像,新闻摘要>特点:规模大,每篇新闻包含多张图像CS3245

–

Information

Retrieval多模态机器学习9Ch.

11-12MMS(新闻领域,仅文本摘要输出)构建方式:确定50个热门新闻话题谷歌新闻检索→文本+图像CCTV/Youtube检索→视频规模:约1k个样本样本组成:<文本内容,多张图像,多段视频,新闻摘要>特点:多模态信息最丰富(文本+图像+视频)CS3245

–

Information

Retrieval多模态机器学习10Ch.

11-12CEPSUM(电子商务领域,仅文本摘要输出)构建基础:中国某电子商务平台数据收集:商品详情页信息商品总体介绍和细节描述一张商品介绍图像平台优质博主撰写的商品摘要规模:约16k个样本样本组成:<商品详细信息,商品图像,商品摘要>特点:电商场景,服务实际应用CS3245

–

Information

Retrieval多模态机器学习11Ch.

11-12支持多模态摘要输出的数据集数据集领域输入模态输出模态规模MSMO新闻文本+图像文本+图像300kVMSMO新闻文本+音频+视频文本+图像127kSinaWeibo社交媒体文本+图像文本+图像184k特点:不仅支持纯文本输出同时支持图像作为摘要输出输出图像来自输入多模态信息中的已有图像更高要求:模型需评判输入图像与文本的相关性CS3245

–

Information

Retrieval多模态机器学习12构建基础:DailyMail数据集筛选条件:同时包含多张图像的新闻样本标注方式:人工标注与该新闻最相关的图像作为图像摘要规模:约300k个样本样本组成:<文本,多张图像,文本摘要,图像摘要>Ch.

11-12MSMO(新闻领域,多模态输出)CS3245

–

Information

Retrieval多模态机器学习13数据来源:新浪微博(Weibo)新闻推文筛选条件:同时包含文本和视频的推文自动标注:新闻标题→文本摘要视频封面图片→图像摘要规模:约127k个样本样本组成:<文本,视频,文本摘要,图像摘要>Ch.

11-12VMSMO(新闻领域,多模态输出)CS3245

–

Information

Retrieval多模态机器学习14数据来源:新浪微博热门话题推文筛选条件:同时包含文本和图像的推文标注方式:文本摘要:人工撰写图像摘要:公开图文匹配模型自动选择规模:约184k个样本样本组成:<文本,多张图像,人工摘要,自动选图>

Ch.

11-12SinaWeibo(社交媒体,多模态输出)CS3245

–

Information

Retrieval多模态机器学习15Ch.

11-12多模态摘要生成方法分类类型核心思想代表模型抽取式摘要生成从原文中抽取关键句子DE-MMS-MOO,MMS,Multimodal-RNN生成式摘要生成理解后生成新的文本MSMO(非预训练),V2P(预训练)按输出形式分类:仅支持纯文本摘要输出支持多模态摘要输出按文本摘要生成方法分类:CS3245

–

Information

Retrieval多模态机器学习16Ch.

11-12抽取式摘要生成核心思想:从原始文本输入中抽取关键信息作为摘要早期方法:人工预定义评判标准模态内显著性:模态内信息与目标摘要的匹配度跨模态冗余性:不同模态间信息的冗余度覆盖率:句子包含的信息量占全文比例局限:需要人为设定抽取标准,缺乏灵活性CS3245

–

Information

Retrieval多模态机器学习17核心创新:首次联合神经网络自动判断句子重要性无需人为设定抽取标准三大模块:图像编码模块(VGGNet+RNN);文档编码模块(RNN);判别模块(判断关键句子)

Ch.

11-12Multimodal-RNN(抽取式)CS3245

–

Information

Retrieval多模态机器学习18图像编码模块:VGGNet提取单张图像特征双向RNN捕获图像序列上下文拼接+平均池化→整体图像表示imgrep文档编码模块:RNN提取文档特征(词→句→文档层次编码)拼接+平均池化→整体文档表示docrepCh.

11-12Multimodal-RNN——编码模块CS3245

–

Information

Retrieval多模态机器学习19判断句子是否应被抽取为摘要:内容信息:句子本身的内容文档覆盖量:句子相对整个文档的信息覆盖程度信息冗余量:与已生成摘要的信息重复程度图像覆盖量:句子相对整个图像序列的覆盖程度位置信息:句子在文档中的位置原则:覆盖量越大越好,冗余量越小越好训练:最大似然估计优化模型参数

Ch.

11-12Multimodal-RNN——判别模块CS3245

–

Information

Retrieval多模态机器学习20语言生成质量差只能拼接原始句子可读性、连贯性不佳信息压缩不充分无法简要概括核心内容存在冗余和次要信息多段信息处理弱无法融合不同段落信息难以进行更全面、整体的概括结论:转向生成式方法成为必然趋势Ch.

11-12抽取式方法的三大问题CS3245

–

Information

Retrieval多模态机器学习21核心思想:模型理解多模态输入内容,生成新的文本作为摘要技术演进:Ch.

11-12生成式摘要生成阶段编码器代表工作早期RNN/LSTM+CNNMMSS,MSMO当前Transformer预训练模型V2PCS3245

–

Information

Retrieval多模态机器学习22文本编码器:LSTM/GRU编码器层级编码(词→句→文档)图像编码器:CNN(VGGNet)提取图像特征双向RNN捕捉多张图像的上下文视频编码器:抽取视频帧序列CNN编码+双向RNN捕捉时序依赖Ch.

11-12基于非预训练模型的生成式方法CS3245

–

Information

Retrieval多模态机器学习23目的:让模型关注多模态输入中最相关的部分演进历程:分层多模态注意力低层:文本+图像注意力层高层:模态融合注意力层引入注意力过滤器保证多模态交互避免图像噪声融入覆盖机制解决用词单调重复问题生成更丰富的信息Ch.

11-12核心:多模态注意力机制CS3245

–

Information

Retrieval多模态机器学习24Ch.

11-12MSMO(代表性非预训练模型)创新:覆盖机制使模型关注先前未被注意的特征,缓解重复生成三大模块:图像和文本特征提取(VGGNet+Bi-LSTM);融入覆盖机制的多模态注意力网络;多模态摘要生成MSMO——文本注意力层

文本注意力权重计算:e_txt^t=v^Ttanh(W_hd_i+W_ss_t+W_ccov_txt,i^t)α_txt^t=softmax(e_txt^t)文本覆盖向量:cov_txt,i^t=Σ_{x=0}^{t-1}α_txt,i^x记录历史注意力分配情况覆盖损失:L_tcov^t=Σ_imin(α_txt,i^t,cov_txt,i^t)迫使模型关注未被注意的部分MSMO——图像注意力与多模态融合

图像注意力层:图像特征映射到文本空间类似机制计算注意力权重图像覆盖损失:L_icov^t多模态融合:c_mm^t=Σα_txt,i^td_i+Σα_img,j^tg_j^*加权求和得到融合特征文本摘要生成:LSTM解码器生成摘要词序列最大似然估计优化MSMO——图像摘要选择

选择依据:将图像视为连续的图像块(patch)拼接并序列化所有候选图像的图像块记录每个图像块的覆盖向量重要性评分:S_i=Σ_{patch}cov_patch,i^t评分越高→图像越重要→越应被选为图像摘要图像摘要损失:L_img^t=Σ_imin(α_patch,i^t,cov_patch,i^t)MSMO——贡献

首次引入覆盖机制到多模态摘要生成解决摘要生成中词语重复问题提升生成摘要的信息量统一处理文本和图像摘要选择相同框架同时生成文本摘要和图像摘要验证多模态注意力的有效性多模态融合机制可显著提升摘要质量

为什么引入预训练模型?

传统模型的局限:LSTM/CNN编码能力有限缺乏大规模预训练知识预训练模型的优势:Transformer架构→强大特征编码能力大规模预训练→优秀文本生成能力可适配多模态任务核心挑战:如何将视觉信息适配到预训练语言模型

V2P(电商领域,2022)

定位:首个将多模态预训练模型适配到电商摘要生成的工作基础模型:文本:BART(预训练语言模型)图像:SwinTransformer核心思路:图像信息→商品属性词信息→统一到文本嵌入空间两阶段训练:基于视觉的商品属性预测商品属性提示引导的摘要生成V2P(电商领域,2022)基于视觉的商品属性预测商品属性提示引导的摘要生成V2P——阶段一

任务:从商品图像预测商品属性流程:SwinTransformer编码商品图像预测商品属性词监督信号:预定义商品属性词典提取参考属性二元交叉熵(BCE)损失约束目的:视觉信息→文本属性信息实现视觉与文本的对齐V2P——阶段二

输入:商品源长文本+预测属性(字符串拼接)编码-解码:BART编码器编码联合信息BART解码器生成摘要词序列监督信号:交叉熵损失(CE):约束摘要生成质量测试阶段:使用阶段一预测的属性(按概率排序筛选)V2P——损失函数

损失项含义L_CE摘要生

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论