CN119416088A 基于音视频的多模态情感识别方法及系统 (齐鲁工业大学(山东省科学院))_第1页
CN119416088A 基于音视频的多模态情感识别方法及系统 (齐鲁工业大学(山东省科学院))_第2页
CN119416088A 基于音视频的多模态情感识别方法及系统 (齐鲁工业大学(山东省科学院))_第3页
CN119416088A 基于音视频的多模态情感识别方法及系统 (齐鲁工业大学(山东省科学院))_第4页
CN119416088A 基于音视频的多模态情感识别方法及系统 (齐鲁工业大学(山东省科学院))_第5页
已阅读5页,还剩20页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本发明提出了基于音视频的多模态情感识预处理后的面部视频数据和音频数据输入至DepITCM网络模型中,得到面部视频数据的聚合聚合特征和音频数据的聚合特征分别依次通过类任务模块对情感待识别人员是否含有抑郁情2将预处理后的面部视频数据和音频数据输入至DepITCM网络模型中,分别提取全局特将面部视频数据的聚合特征和音频数据的聚合特征分别依次通过将面部视频数据最终特征和音频数据最终特征进行融合,得到融输入至多任务学习模块中,利用回归任务模块学习情感待识别人员关于抑郁情感的特征,类任务模块对情感待识别人员是否含有抑郁对面部视频数据进行子采样,获取多个帧的图像并删除没有成功检测通过DepITCM网络模型中的InceptionDilatedConv对预处理后的面部视频数据和音频数据提取全局特征,所述InceptionDilatedConv包括并联的多个卷积层和最大池化通过InceptionDilatedConv后的Maxpool层对提取的全局特征各自进行聚合,分别CAM(TAM(Fin))=3二分类任务模块通过回归任务模块共享的情感待识别人员关于其中,Lre和Lcl分别为PHQ_8回归任务模块和二分类任务模块的损失函数;a和b为超参j和分别为第j个样本的真实和预测的PHQ_8得分。多注意力特征提取模块,被配置为:将面部视频权利要求1_7任一项所述的基于音视频的多模态情感识别方法中的4特征在于,所述处理器执行所述程序时实现如权利要求1_7任一项所述的基于音视频的多5提高情感待识别人员是否含有抑郁情感的检测[0011]将预处理后的面部视频数据和音频数据输入至DepITCM网络模型中,分别提取全6[0012]将面部视频数据的聚合特征和音频数据的聚合特征分别依次通过时间注意力模二分类任务模块对情感待识别人员是否含有抑[0017]全局特征提取模块,被配置为:将预处理后的面部视频数据和音频数据输入至执行时实现如本发明第一方面所述的基于音视频的多模态情感识别[0024]本发明在利用InceptionDilatedConv得到面部视频数据的聚合特征和音频数78[0041]将预处理后的面部视频数据和音频数据输入至DepITCM网络模型中,分别提取全[0042]将面部视频数据的聚合特征和音频数据的聚合特征分别依次通过时间注意力模二分类任务模块对情感待识别人员是否含有抑[0048](3)使用基于音视频的多模态情感识别模型DepITCM进行情感待识别人员的情感9DilatedConv和TCPCA模块构成;TCPCA模块由时间注意力模块(TAM)和通道优先卷积注意模态数据的多尺度长程信息。在Inception结构中的卷积层(Conv)引入扩展因子来补充全局信息,增加模型多样性。并通过InceptionDilatedConv后的Maxpool层对信息进行聚f[0062]通过InceptionDilatedConv和Maxpool组合堆叠的方式,计算出最终的特征[0064]TCPCA模块的工作是解决简单串联导致的信息丢失问题,使模型能够更好地聚焦优先卷积注意力机制(CPCA)构建了全局信息与局部重要信息的映射方法,通过这种方法,分别表示输入特征沿着时间注意力通道注意力空间注意力的[0069]时间注意力模块(TAM)的作用是突出时间维度上的依赖关系,从而增强时间信息[0072]通道优先卷积注意力机制(CPCA)主要由通道注意力模块(CAM)和空间注意力模块[0075]TAM(Fin)表示CAM的输入,σ表示sigmoid激活函数,MLP表示全连接的神经网络,模型能够通过共享特征提取层来增强特征表示。对[0081]其中,Lre和Lcl分别为PHQ_8回归和二分类的损失函数。a和b被设计为利用这两个[0087]回归任务通过预测PHQ_8得分帮助模型更细致地学习抑郁症的特征,提供了额外[0094]通过DepITCM网络模型中的InceptionDilatedConv对预处理后的面部视频数据[0095]通过InceptionDilatedConv后的Maxpool层对提取的全局特征各自进行聚合,[0096](3)将面部视频数据的聚合特征和音频数据的聚合特征分别依次通过时间注意力in表示TAM的输入,TAM(Fin)表示CAM的输入;CAM(TAM(Fin))表示SAM的输入;σ表示[0104]二分类任务模块通过回归任务模块共享的情感待识别人[0106]通过二分类任务模块对情感待识别人员是否含有抑郁情感进行分类也为现有技[0109](2)多任务学习模块的加入使模型充分考虑到共享特征提取层能够提高特征表示[0115]全局特征提取模块,被配置为:将预处理后的面部视频数据和音频数据输入至公开实施例

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论