模态基础及学习 5_第1页
模态基础及学习 5_第2页
模态基础及学习 5_第3页
模态基础及学习 5_第4页
模态基础及学习 5_第5页
已阅读5页,还剩21页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Introduction

to

Information

Retrieval多模态讽刺检测Live

Q&A/jinCS3245

–

Information

Retrieval多模态机器学习28.1多模态讽刺检测数据集PADMSD(图文数据集)MUStARD(音视频文本数据集)8.2多模态讽刺检测相关方法基于注意力机制的方法(HFM、D&R-Net)基于图网络的方法(InCrossMGs、CMGCN、MILNet)核心思想:讽刺常通过多模态语义不一致表达,需综合多模态信息进行判断。Ch.

11-12本章内容概述CS3245

–

Information

Retrieval多模态机器学习3讽刺本质:字面意义与隐含意图之间存在差异,常扭转情绪极性;应用价值:情感分析、意见挖掘、公众舆情监测传统方法的局限:仅基于文本,忽略视觉信息多模态的必要性:社交媒体中图文结合表达讽刺已成为常态Ch.

11-12为什么需要多模态讽刺检测?很高兴公司派来了更多的车辆以确保座位的充足多模态讽刺样本示例CS3245

–

Information

Retrieval多模态机器学习4任务类型:二分类任务,即包含讽刺和不包含讽刺。

输入:多模态样本(文本+图像/视频+音频+文本)输出:是否包含讽刺(是/否)核心挑战:捕捉跨模态之间的语义不一致性Ch.

11-12任务定义很高兴公司派来了更多的车辆以确保座位的充足多模态讽刺样本示例CS3245

–

Information

Retrieval多模态机器学习5发布机构:北京大学团队(2019年)数据来源:推特(Twitter)多模态推文(文本+图像)正例标注:包含讽刺相关话题标签(如#sarcasm)负例:其他推文数据清洗:剔除直接包含“humor”“joke”等词汇的样本剔除包含URL的推文(避免噪声)划分比例:训练集80%/验证集10%/测试集10%验证/测试集:经人工检查确保标签准确性Ch.

11-12PADMSD(图文多模态讽刺数据集)CS3245

–

Information

Retrieval多模态机器学习6Ch.

11-12PADMSD统计数据数据集训练集验证集测试集总样本数19,8162,4102,409正样本数8,642959959负样本数11,1741,4511,450说明:正负样本均衡,适合二分类任务训练与评估。CS3245

–

Information

Retrieval多模态机器学习7发布机构:密歇根大学+新加坡国立大学(2019年)模态:视频+音频+文本数据来源:YouTube搞笑类美剧(《生活大爆炸》《老友记》等)规模:690个对话视频,总时长约9,626秒标注信息:说话人、上下文(对话历史)、视频、音频、讽刺标签适用场景:多模态讽刺检测、对话理解等多类研究Ch.

11-12MUStARD(多模态对话讽刺数据集)

CS3245

–

Information

Retrieval多模态机器学习8Ch.

11-12MUStARD对话与上下文统计统计项对话对话的上下文平均话语长度1410最大话语长度7371平均持续时间(秒)5.2213.95说明:数据量较小但标注丰富,适合精细化的多模态对话分析。CS3245

–

Information

Retrieval多模态机器学习9两大主流方法:基于注意力机制利用注意力机制聚焦与讽刺相关的内容代表模型:HFM、D&R-Net基于图网络构建图结构建模无序、非结构化的多模态关联代表模型:InCrossMGs、CMGCN、MILNetCh.

11-12多模态讽刺检测方法分类CS3245

–

Information

Retrieval多模态机器学习10思想:综合利用图像模态特征、图像属性模态特征、文本模态特征,基于注意力机制进行层次融合Ch.

11-12HFM(多模态多层次融合模型)北京大学团队(2019年)CS3245

–

Information

Retrieval多模态机器学习11图像模态将图像划分为14×14区域ResNet提取区域特征→平均得到指导向量图像属性模态ResNet-101预测5个图像属性属性词嵌入作为原始向量注意力加权得到指导向量文本模态Bi-LSTM编码文本平均池化得到指导向量Ch.

11-12HFM——模态特征学习模块CS3245

–

Information

Retrieval多模态机器学习12早期融合:将图像属性指导向量作为Bi-LSTM初始参数注入多模态信息增强文本理解表示融合:利用各模态指导向量计算注意力权重加权重建各模态特征向量模态融合:统一各模态表示维度计算模态级注意力权重→加权平均得到分类特征分类:两层全连接网络(ReLU+Sigmoid)Ch.

11-12HFM——融合与分类CS3245

–

Information

Retrieval多模态机器学习13思想:显式建模跨模态不一致性和语义关联两大子网络:Ch.

11-12D&R-Net(分解与关系网络)中国科学院团队(2020年)D-Net(分解网络)

:提取模态间差异表示R-Net(关系网络)

:建模模态间语义关联CS3245

–

Information

Retrieval多模态机器学习14图像预处理:借助SentiBank提取5条视觉语义信息每条以“形容词-名词对(ANP)”形式呈现编码模块:文本→Bi-LSTM→文本表示H^wANP→词嵌入最大池化→ANP表示H^p图像→ResNet→映射至文本空间→图像表示H^mCh.

11-12D&R-Net——预处理与编码CS3245

–

Information

Retrieval多模态机器学习15D-Net(分解网络)

:将各模态表示分解到三个子空间共享子空间→提取共有特征独有子空间→提取独有特征拼接文本/图像独有特征→跨模态对比特征r_decR-Net(关系网络)

:计算每个ANP与每个文本单词的相关性注意力加权得到多视图文本表示按ANP概率加权平均→跨模态关联表示r_rel分类:拼接r_dec和r_rel→全连接层→SigmoidCh.

11-12D&R-Net——核心模块CS3245

–

Information

Retrieval多模态机器学习16注意力机制的局限:讽刺信息常与零散的关键短语和关键图像区域相关这些元素之间的关联是无序、非结构化的图网络的优势:天然适合建模非结构化关系可细粒度捕捉模态内部和跨模态的复杂关联Ch.

11-12为什么引入图网络?CS3245

–

Information

Retrieval多模态机器学习17发布机构:哈尔滨工业大学团队(2021年)核心思想:为每个样本构建单模态图和跨模态图创新点:开创性地采用图结构建模多模态讽刺表达

Ch.

11-12InCrossMGs(跨模态图网络)CS3245

–

Information

Retrieval多模态机器学习18编码模块:文本→BERT+Bi-LSTM→文本表示H^T图像→划分为p×p小块→ViT→图像表示H^I模态关系图构建:文本模态图:基于上下文依赖树构建邻接矩阵图像模态图:基于图像块连续关系构建邻接矩阵跨模态图:文本节点与图像节点全连接,同时保留单模态图关系Ch.

11-12InCrossMGs——编码与图构建CS3245

–

Information

Retrieval多模态机器学习19讽刺特征提取:将单模态图和跨模态图输入多层图卷积网络(GCN)每层根据邻接矩阵更新节点表示GCN输出作为权重,加权平均原始特征→讽刺特征r分类:全连接层进行二分类贡献:首次将图结构引入多模态讽刺检测,为后续研究奠定基础Ch.

11-12InCrossMGs——讽刺特征提取CS3245

–

Information

Retrieval多模态机器学习20针对问题:现有方法忽略图像中仅特定区域与文本相关忽视视觉对象与文本短语间的语义关联核心改进:Faster-RCNN检测关键视觉对象引入外部情感知识(SenticNet)建模情感一致性

Ch.

11-12CMGCN(跨模态图卷积网络)CS3245

–

Information

Retrieval多模态机器学习21Ch.

11-12CMGCN(跨模态图卷积网络)哈尔滨工业大学团队(2022年)CS3245

–

Information

Retrieval多模态机器学习22跨模态图边权重考虑三方面关系:文本单词间的依赖关系文本单词与视觉对象的语义相似度(WordNet计算)文本单词与属性词的情感一致性(SenticNet检索情感权重)边权重公式:权重=语义相似度×情感调制因子+1调制因子衡量情感极性的一致程度贡献:引入外部知识库增强跨模态图的情感建模能力Ch.

11-12CMGCN——核心创新CS3245

–

Information

Retrieval多模态机器学习23针对问题:全局图像特征过于笼统仅关注检测对象区域会忽略上下文关联核心思路:结合对象级和全局级图像特征

Ch.

11-12MILNet(互学习增强不一致性学习网络)山东大学团队(2023年)CS3245

–

Information

Retrieval多模态机器学习24编码模块文本→RoBERTa→文本表示图像→Faster-RCNN(对象级)+ViT(全局级)局部语义不一致性学习构建文本/图像/跨模态图(GCN)IoU强调对象空间相关性知识图谱构建常识关联(替代词汇相似度)全局不一致性学习互注意力机制,图像特征引导关注不一致文本Ch.

11-12MILNet——模块结构CS3245

–

Information

Retrieval多模态机器学习25双路径不一致性建模:局部路径→细粒度挖掘词汇-对象不一致全局路径→宏观捕捉图文整体不一致互学习增强两个模块相互共享可靠知识,实现协同增强利用KL散度衡量两个模块预测分布差异仅传递可靠的预测(正确时共享知识)取置信度更高的结果作为最终预测Ch.

11-12MILNet——贡献CS324

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论