CN119478612A 一种基于细粒度分层语义融合的注意力状态分析方法、系统、装置及存储介质 (南京晓庄学院)_第1页
CN119478612A 一种基于细粒度分层语义融合的注意力状态分析方法、系统、装置及存储介质 (南京晓庄学院)_第2页
CN119478612A 一种基于细粒度分层语义融合的注意力状态分析方法、系统、装置及存储介质 (南京晓庄学院)_第3页
CN119478612A 一种基于细粒度分层语义融合的注意力状态分析方法、系统、装置及存储介质 (南京晓庄学院)_第4页
CN119478612A 一种基于细粒度分层语义融合的注意力状态分析方法、系统、装置及存储介质 (南京晓庄学院)_第5页
已阅读5页,还剩27页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于细粒度分层语义融合的注意力状本发明公开了一种基于细粒度分层语义融将多模态图像数据输入预先训练好的特征提取语义特征输入预先训练好的特征融合模型进行通过融合多模态细粒度特征显著提高了对注意2获取目标对象的多模态图像数据,其包括表情图像数据、头部姿将所述多模态图像数据输入预先训练好的特征提取映射模型,经过分将所述各模态的细粒度语义特征输入预先训练好的特征融合模型进行多模态特征融基于所述最终融合特征,通过预先构建好的注意力状态预测模型得2.根据权利要求1所述的基于细粒度分层语义融合的注意力状态分析方法,其特征在通过所述表情细粒度特征提取模块提取表情图像数据中的表情细粒度;表示第i个面部动作单元的激活强度,sau,e[0,1];Dau;表示第i个面部动作单元的持续通过所述头部姿态细粒度特征提取模块提取头部姿态图像数据中的头部姿态细粒度;;;其中,X2表示头部姿态细粒度特征向量,pstatic表示静态特征,Bpitch表示俯仰角,的速度,ax(y(z分别表示x、y、z轴的加速度;通过所述眨眼细粒度特征提取模块提取眨眼图像数据中的眨眼细粒度;;;3tduration表示眨眼持续时间,tinterpal表示眨眼时间间隔,Bpatterm表示眨眼模式特征,vduration表示眨眼持续时间方差,sinterval表示眨眼间隔偏度,T'pattern表示眨眼节律3.根据权利要求2所述的基于细粒度分层语义融合的注意力状态分析方法,其特征在;;;4.根据权利要求3所述的基于细粒度分层语义融合的注意力状态分析方法,其特征在;;其中,Am1表示各模态的时序注意力,softmax表示归一化,Qmr表示查询向量,表示Qmu的映射权重,km1表示键向量,表示km1的映射权重,vm1表示值向;;其中,Am2表示各模态的特征注意力,softmax表示归一化,Qm2表示查询向量,表示Qm2的映射权重,km2表示键向量,表示km2的映射权重,vmz表示值向4;其中,smn表示各模态的细粒度语义特征,LayerNorm表示层归一化,FFN表示双层5.根据权利要求1所述的基于细粒度分层语义融合的注意力状态分析方法,其特征在于,所述将各模态的细粒度语义特征输入预先训练好的特征融合模型进行多模态特征融;l个模态和第j个模态的注意力权重,si表示第l个模态的细粒度语义特征,wj表示第l个模态和第j个模态之间的注意力权重矩阵,l,j,ke{1,2,3},均表示不;;;;其中,Frimat表示最终融合特征,F6.根据权利要求1所述的基于细粒度分层语义融合的注意力状态分析方法,其特征在所述注意力状态预测模型包括上下文信息编码模块,上下文信息编码;5所述注意力状态预测模型还包括时序建模模块,时序建模模块用;7.根据权利要求6所述的基于细粒度分层语义融合的注意力状态分析方法,其特征在;;特征提取模块,用于将所述多模态图像数据输入预特征融合模块,用于将所述各模态的细粒度语义特征输入预分析模块,用于基于所述最终融合特征,通过预先构建好的注意9.一种基于细粒度分层语义融合的注意力状态分所述处理器用于根据所述指令进行操作以执行权利要求1~7任一项所述基于细粒度分执行时实现权利要求1~7任一项所述基于细粒度分层语义融合的注意力状态分析方法的步6过预先构建好的注意力状态预测模型得到目标对象的注意力状态分析[0008]通过所述表情细粒度特征提取模块提取表情图像数据中7表情细粒度特征,xau,=[lau,sau,DauJ,Inu表示第i个面部动作单元的激活状态,[0011]通过所述头部姿态细粒度特征提取模块提取头部姿态图像数据中的头部姿态细[0016]通过所述眨眼细粒度特征提取模块提取眨眼图像数据中8[0033]其中,Am1表示各模态的时序注意力,softmax表示归一化,Qmr表示查询向[0037]其中,Am2表示各模态的特征注意力,softmax表示归一化,Qm2表示查询向语义特征,wj表示第l个模态和第j个模态9;[0051]其中,Finter表示第一融合特征,MultiHead表示多注意力头特征融合操作,[0054]其中,Frimat表示最终融合特征,FFN表示双层前馈神经网络,LayerNorm表id(w*ht+b);[0071]特征提取模块,用于将所述多模态图像数据输入预先训练好的特征提取映射模[0078]图1是本发明实施例中基于细粒度分层语义融合的注意力状态分析方法的流程表情细粒度特征,xau,=[lau,sau,DauJ,Inu表示第i个面部动作单元的激活状态,lau,E(0,1};SAU,表示第i个面部动作单元的激活强度,表示第i个面[0119]其中,Am1表示各模态的时序注意力,softmax表示归一化,Qmr表示查询向[0123]其中,Am2表示各模态的特征注意力,softmax表示归一化,Qm2表示查询向语义特征,wj表示第l个模态和第j个模态;[0138]其中,Finter表示第一融合特征,MultiHead表示多注意力头特征融合操作,[0142]其中,Frimat表示最终融合特征,FFN表示双层前馈神经网络,LayerNorm表id(w*ht+b);[0162]特征提取模块,用于将所述多模态图像数据输入预先训练好的特征提取映射模器执行时实现实施例1所述基于细粒度分层语义融合的注意力状态现在流程图一个流程或多个流程和/或方框图一个方框或多个方框中指定[0171]这些计算机程序指令也可存储在能引导计算机或其他可编程数据处理设备以特令装置的制造品,该指令装置实

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论