CN117609882B 基于多模态前缀和跨模态注意力的情感分析方法及系统 (山东交通学院)_第1页
CN117609882B 基于多模态前缀和跨模态注意力的情感分析方法及系统 (山东交通学院)_第2页
CN117609882B 基于多模态前缀和跨模态注意力的情感分析方法及系统 (山东交通学院)_第3页
CN117609882B 基于多模态前缀和跨模态注意力的情感分析方法及系统 (山东交通学院)_第4页
CN117609882B 基于多模态前缀和跨模态注意力的情感分析方法及系统 (山东交通学院)_第5页
已阅读5页,还剩32页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

号MultimodalSentimentAnalysisMultimodal-PrefixedandCross-M基于多模态前缀和跨模态注意力的情感分本发明公开了基于多模态前缀和跨模态注2将待情感分析的视频片段,输入到训练后的多模态情感分析模型中所述语音特征编码模块的输出端与音频前缀生成模块的输所述视觉特征编码模块的输出端与视觉前缀生成模块的输音频前缀生成模块的输出端、视觉前缀生成模块的输出端和文所述第一线性层的输入端与BiGRU模块的输所述第二激活函数层的输出端与层归一化模块的输所述音频前缀生成模块和视觉前缀生成模块的工作过程是一3其中,所述通过注意力机制对音频上下文特征和音频特征构建第一训练集,所述第一训练集为已知情感分4在对多模态情感分析模型进行训练的过程中,保持预训练语获取模块,其被配置为:获取待情感分析的视频片段;所述所述语音特征编码模块的输出端与音频前缀生成模块的输所述视觉特征编码模块的输出端与视觉前缀生成模块的输音频前缀生成模块的输出端、视觉前缀生成模块的输出端和文5所述第一线性层的输入端与BiGRU模块的输所述第二激活函数层的输出端与层归一化模块的输所述音频前缀生成模块和视觉前缀生成模块的工作过程是一67一个或多个处理器上运行的时候用于实现上述规模语言模型的优势并在MSA任务取得良8[0037]BERT(Bidir人在单峰输入对中及多模态融合和单峰输入之间分层最大化互信息来优化多模[0042]受到Transformer的影响,预训练语言模型飞速发展并成功扩展到多模态相关任务中展现出强大的性能。Li等人在ALBEF的基础上加入MultimodalmixtureofEncoder_Transformer的大规模预训练模型在各类下游任务中的出色表现,研究者们开始在多模态9用,使用12层的RoBERTa作为文本编码器,然后将文本输入Xt传入RoBERTa的分词器g,"表示来自VIT的预训练参数。[0096]本发明在语音上下文编码器A_LAA的基础上延伸出视觉编码器V_LAA,结构如图1[0100]构建第一训练集,所述第一训练集为已知情感分类标签的修[0109]MaskedLMOutput是MLM的输出对象,本发明使用MaskedLMOutput的损失属性作为[0113]在对多模态情感分析模型进行训练的过程中,保持预训后通过RoBERTa模型的分类头RobertaClassificationHead,分类头的作用是将RoBERTa的隐藏状态映射到特定的输出空间,然后得到预测结果。本发明选择MSELoss作为损失函[0122]接下来的编码阶段中,本发明使用Wav2vec2.0和VisionTrans提取音频和视觉模态的特征,然后使用A_LAA(AudioLightweightAttentiveAggregation)和V_LAA(VisualLightweightAttentiveAggregation)将两种模态特征处[0123]本发明的目标是对多模态情感分析任务进行研究分析,本发明将预训练得到的模型迁移到多模态情感分析数据集CMU_MOSI[0125]在具体介绍模型之前,先为模型准备预训练数据。本发明选择的数据集是CMU_相较于CMU_MOSI,CMU_MOSEI的规模更大,主题也更加的丰富多样。所以本发明选择CMU_MOSEI作为预训练数据集,CMU_MOSI作为微调数据集。CMU_MOSEI包含了视频网站上来自频来自89个不同的演讲者,每位演讲者在视频中讲述了她们对于某个电影或话题的看法。发明最终选择了使用基于Transformer语言模型的方法和目[0134]LMF:Low_rankMultimodalFusion通过将高阶权重张量分解为模态特定的低秩[0135]ICCN:InteractionCanonicalCorrelationNetwork通过deepcanonicalcorrelationanalysis学习多模态[0136]MISA:Modality_Invariantand_SpecificRepresentations通过划分出两个子[0137]Self_MM:Self_SupervisedMulti_taskMultimodalsentimentanalysis于BERT和XLNet模型来利用多模态信息进[0141]EMT_DLFR:EfficientMultimodalTransformerwithDual_LevelFeatureRestoration利用EMT和DLFR实现更高效的多模态融合并且着增[0142]UniMSE:UnifiedMultimodalSentimentAnalysisandEmotionRecognition[0144]由于多模态情感分析涉及回归和分类任务,因此通常采用的评价指标包括MAE用于量化预测值与真实值之间的平均绝对误差。准确率被用来评估分类的准确性,而F1_Score在二元分类任务中提供了精度和召回率的综合衡量。为了对模型进行综合评价,本发明不仅采用了二元精度(Acc_2),还引入了多级精度指标(Acc_5、Acc_7)作为评价标[0148]表3显示了本发明的模型与基线模型的性能比较,通过实现细节部分中介绍的评方重新实现代码提供的结果。为了对本发明的模型进行更全面的评估,本发明还比较了[0149]从表3的结果中本发明可以观察到,本发明的模型在大多数指标上优于现有的最先进的模型(UniMSE)。具体来说,它比表现最好的UniMSE高出0.16%/1.15%Acc2,果来自EMT_DLFR,对于

中Acc_7和Acc_5的空缺结果,使用EMT_DLFR的数据。R:TejasF1_score,/的左侧和右侧分别代表negative/non_negative和negative/positive两组评手势和音频上的上升语调。[0171]此处需要说明的是,上述获取模块和输出模块对应于实施例一中的步骤S101至

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论