第二十三届华为杯研究生数学建模竞赛D题参考思路 多模态情感预测完整论文_第1页
第二十三届华为杯研究生数学建模竞赛D题参考思路 多模态情感预测完整论文_第2页
第二十三届华为杯研究生数学建模竞赛D题参考思路 多模态情感预测完整论文_第3页
第二十三届华为杯研究生数学建模竞赛D题参考思路 多模态情感预测完整论文_第4页
第二十三届华为杯研究生数学建模竞赛D题参考思路 多模态情感预测完整论文_第5页
已阅读5页,还剩35页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1多模态情感预测在真实场景中面临三重挑战:模态间采样尺度差异导致的对齐困难、来源,围绕这三个挑战依次完成特征提取与时序对考转写的LCS强制对齐为锚点,按词时间窗聚合语音与视觉帧描述子,统一到Lmax=50输出(余弦相似度1.000000据此为附件3补齐同接口文本特征,使三份附件的输入接失率均值约25.5%、缺失段长以1–2个位置为主。据此本文异性双向GRU编码、缺失位置掩码重建、跨模态注意力插补、可靠性感知门控融合,并降至0.590;把三模态完全置零后模型退化为常数预测(Macro-F10.147证实性能来自2音0.253、视觉0.244,主要参考模态为文本的占18条。在唯一一条视觉完全缺失的样本上,模型自动把视觉作用度由0.244降至0.147、文本由0.502升至0.6符。对照实验显示注意力权重会将文本占比高估至0.594,而Shapley值具备反事实语义;位置遮蔽与积分梯度的归因排序一致率为0.78本文全部结论均给出可复现的工具链版本与参量信息有限、视觉描述子为代理量而非经AU标注校准、辅助模块存在冗余3 2.1总体分析 2.2问题一的分析 2.3问题二的分析 2.4问题三的分析 2.5技术路线 3.模型假设 5.2.1词级语音识别与强制对齐 5.2.2BERT逐位置编码 5.3.174维声学描述子的定义 5.3.2词窗聚合 5.4.135维视觉描述子的定义 5.4.2两级人脸检测回退 5.4.3词窗聚合 5.5.1公共时间轴 5.5.2长度归一化 5.6求解结果 5.6.1全量结果与覆盖完整性 5.6.2对齐质量 45.6.3典型样本验证 5.6.4结果讨论 6.2关键设计 6.2.1有效长度的权威定义 6.2.2缺失模拟 6.2.3可用性上下文 6.4结果 6.4.1与基线的对比 6.4.2极性判定规则 6.4.3缺失规律分析 6.4.4消融实验 6.4.5验证集性能诊断 6.4.6附件3全量预测 7.1建模思路 7.2模态作用度:精确Shapley值分解 7.2.1定义 7.2.2结果 7.2.3真实缺失样本的验证 7.3.1定义 7.3.2证据片段选择与回溯 7.3.3结果 7.5验证集上的性能与可解释性一致性 8.3缺失类型、位置与段长的灵敏度 5 9.1模型优点 9.2模型不足 9.3改进方向 9.4推广应用 A附录程序代码与运行说明 6只由单一通道表达,而是通过文本语义、语音韵律、同呈现。多模态信息联合建模因此成为突破单模态识然而,多模态情感预测在实际落地中面临三重征维度与时间尺度上差异显著:文本以词元为离散单位段][j]。对齐版本中文本、语音、视觉分别组织为(N,50,768)、(N,50,74)、(N,50,35),附件3为模态局部缺失专项测试集,含30条无标签样本。所谓模态局部缺失,指一附件4为可解释性专项测试集,含20条无标签样本及其配套原始视频,三模态信息1.3待求目标对齐的数学模型,明确原始样本的处理流程、各模态情7问题二:针对局部时段模态信息缺失的复杂场景,构建鲁棒性多模态情感预测模型,在局部模态信息不完整的条件下稳定输出情感极性与情感强度预测,并分析缺失模态类起主要作用的模态以及各模态中与判断密切相关的1.4约束与评价口径何公开或私有情感数据集参与训练、微调、参数优化型均在附件2的训练集上学习参数、在验证集上选择模型结构与超参数;附件3、附件42.1总体分析三个问题共同构成一条”从原始素材到可信预测”的完整链路,彼此存在严格的依赖关系:问题一解决表征与对齐,产出三模态时序特征与在同一特征版本上训练与推理;若问题二不解决缺失鲁在脆弱的预测之上。因此本文采用”统一特征接口+统一骨术路线,如图2.1所示。对特征抽取而言,三模态的采样尺度差异极大:文本是离散词元,语音是16kHz连的序列位置”,且实测表明其文本注意力掩码长度与语音有效长度满足Lt=La+1的严格8kHz单声道音频,再用Whisper做词级语音识别以获得词级时间戳,最后把语音与视觉的帧级描述子按词时间窗聚合。难点在于Whisper的识3的语音与视觉存在连续缺失。若直接在完整数据上训练,模型会学到”任何位置都可信”的隐含假设,一旦测试时某些位置被置零,固定权重:(的统计形态与附件3的实测形态对齐,否则模型学到的鲁棒性是错位的2)缺失位置的信息如何补全——既可利用模态内的上下文,也可利用未缺失模态的跨模态线索3)各模态的可信度如何随缺失情况自适应——融合权基于上述分析,本文设计”模态内掩码重建+跨模态注意力插补+可靠性感知门控融问题三要求解释同时具备可量化与可复核两个属性。”可量化”意味着解释不能是注据此本文把解释拆成两个层次。层次一是模态级:用精确Shapley值分解回答”哪个在反事实之上——”移除该模态后输出变化多少”,且三个模态时可由23=8个子集穷举精确求解,满足有效性、对称性、虚拟性与可加性四度给出每个模态内部的逐位置重要性曲线,再从中选出92.5技术路线本文整体技术路线如图2.1所示,可概括为”一套接口、一个骨干、两种能力”:问题一产出统一的三模态时序特征接口(图5.2、图5.3问题二在该接口上训练鲁棒骨干模3.模型假设1.标注可信假设:附件1与附件2中的修改。适用范围:全部三个问题。该假设是监督学2.词元位置可对齐假设:附件2中三个模态的第i个序列位置描的信息,且文本注意力掩码长度与语音有效长度满足Lt=La+1。依据:对附件2训练集3395条样本实测,该关系100%问题三的输入接口。该假设使三模态可以在同一时间轴上直接融合,避免额外的动态3.零值即缺失假设:在序列的有效区间内,某模态位置的特征全部为零即表示该位置信息不可用,而非”情感强度为零”或”静音”。依据:赛题对模态局部缺失的定义即为”特征值全部为零的随机连续序列区间”。适用范围:问题二。该假设要求先准确区分自4.缺失可模拟假设:附件3的缺失模式可由”在有效区间内随机注入连续零区间”生成,且其统计形态(段长、段数、缺失率)可从附件3本身实测得到并用于训练时的缺失模拟。依据:对附件3全量30条样本实测,语音与视觉缺失率均值分别为25.5%与5.背景音与无脸帧可忽略假设:视频中未被参考转写覆盖的语音片段,以及未检出人脸零并标记为缺失)能够真实反映该模态/位置缺席时的模型行为。依据:该操作与问题4.符号说明m模态索引,m∈{text,audio,vision}—L统一最大序列位置数,本文取L=50个Lvalid个N条xm(L,Dm)Dm模态m的特征维度(文本768/语音74/视觉35)维mm(t)模态m在第t个位置的缺失指示(1表示缺失)vt第t个位置是否属于有效区间hm模态m经编码器后的隐表示,hm∈耽L×256—EQ\*jc3\*hps21\o\al(\s\up1(˜),h)m—αmhEQ\*jc3\*hps13\o\al(\s\up3(c),m)—cm—wmz—µ,σEQ\*jc3\*hps21\o\al(\s\up2147483647(y),ˆ)clsyregϕmv(S)—IGt第t个序列位置的积分梯度归因值—[si,ei)第i个词的时间窗sK积分梯度的路径采样步数,取K=24步λi—5.1总体流程与数据输入语音(声学帧)与视觉(图像帧)的中间量:一旦每5.2文本模态特征提取5.2.1词级语音识别与强制对齐到识别词序列A={(aj,τjs,τje及其起止时刻。由于视频片段包含的语音通常多于标注区间,识别结果与参考转写R={ri并不EQ\*jc3\*hps24\o\al(\s\up0(r),˜)EQ\*jc3\*hps24\o\al(\s\up0(a),˜)D(i,j)=max,D(0,·)=D(·,0)=0,回溯D即得匹配块。对匹配上的参考词ri,取其对应识别词的时间戳作为该词的时间窗;未匹配上的词在相邻锚点之间按位置比例线性插值;最后对时间窗序(si←max(si,ei__1),ei←max(ei,si+δ),δ=0.02s保证时间轴严格递增。定义锚定命中率为被LCS直接匹配的参考词占比。5.2.2BERT逐位置编码T=BERT(Tok(参考转写))lasthidden∈Rntok×768,ntok≤512.(5.2)上做了逐元素比对。结果是:取末层隐状态时,全部序列位置的余弦相似度为1.000000,5.3语音模态特征提取5.3.174维声学描述子的定义0111浊音概率(YIN判浊x能量门限x谱非平坦度)9H1–H2谐波差、谱倾斜、HNR、CPP、谐波能量比、一阶差分ΔMCEP0–24二阶差分Δ2MCEP0–12其中S(f,t)为功率谱。倒谱峰显著度(CPP)取实倒谱在倒频率区间[1/400,1/80]s内的CPPc(q,t)=F_1[log|X(f,t)|],Q=[1/400,1/80].5.3.2词窗聚合记第i个词的时间窗为[si,ei),落在窗内的帧中心时刻集合为Ti={t:si≤t<ei},Ai74,若Ti=g,则取距窗中心最近的帧。(5.5)5.4视觉模态特征提取5.4.135维视觉描述子的定义视觉描述子由MediaPipeFaceLan面部动作单元强度AU1,2,4,5,6,7,9,10,12,14,15,17,20345面部几何:嘴部纵横比、左/右眼开合比、眉–6运动动态:光流均值/标准差、头部平移∆x,∆y、帧差能量、眨眼起始代理17个动作单元的取值由blendshape线性组合得到,例如AUbrowOuterUpLeft+5.4.2两级人脸检测回退样本在整帧上完全检不出人脸(其中最极端者人脸面积仅占画面的1.07%)放大到224px,再送入以IMAGE模式运行的FaceLandmarker。该策略把人脸检出率(逐帧平均)从0.791提升到0.889,完全检不出人脸的样关键点只用于比值型几何量与AU/注视(均具尺度不变性头部平移量按1/z折算回原5.4.3词窗聚合35。5.5跨模态时序对齐模型5.5.1公共时间轴本文采用BERT词元位置作为三模态的公共对齐单元,对齐规则如式(5.6)::词元到词的归属由tokenizer的word_ids给出。该规则使三个模态在同5.5.2长度归一化n:即不足L时右侧零填充并记录有效长度Lvalid=n;超过L时对词元序列等距抽样到L个5.6求解结果5.6.1全量结果与覆盖完整性对全部100条样本运行上述流程,得到三模态时序特征文件。覆盖完整性核验结果为:视频文件数100、标注行数100、特征行数100,三者一一对应,缺失项与多余项均关键信息汇总于随附件提交的p1_feature_summar5.6.2对齐质量识别与对齐的质量指标如表5.4所示。全句WER均值0.3能反映对齐质量的是对齐区间WER:只在LCS匹配到的区间内比较,其中位数为0.045,5.6.3典型样本验证词时间窗内的声学帧均值、同一时间窗内的视觉词时间窗与三模态取值的完整明细见随附件提交的p1_typical_sample.json,其与有效序列位置数Lvalid5.6.4结果讨论5.7可复现性说明完整流程的工具链、版本号与核心参数如表5.5所示。全部脚本按p1_01至p1_06编号串行执行,中间结果落盘于cache/p1/,可断点续跑;固定随机种子;总运行时间MediaPipeFaceLandmarker(floaNumPy2.5.3/pandas3.0.6L=50,右侧零填充,pickleprotocol46.问题二:模态局部缺失下的鲁棒情感预测6.1问题刻画与建模思路1.缺失只出现在语音与视觉。30条样本的文本区间内零缺失(有效区间内文本零值占比为0文本只存在自然右填充;缺失注入在语音与视觉上发生,且两者的缺失掩码在2.缺失率不低。语音与视觉在有效区间内的缺失率均值分别为25.5%与25.9%,范围据此本文设计”模态内掩码重建+跨模态注意力插补+可靠性感知门控融合”的四段L=Lcls+λ1Lreg+λ2Lrec+λ3Lcons+λ4Lnll,(6.8)其中Lcls为类别加权交叉熵(含0.05标签平滑,权重按训练集频次取逆:负/中/正=1.75/2.23/1.01Lreg为SmoothL1(β=0.5Lrec为仅在缺失位置上计算的重构MSE,Lcons为缺失输入与完整输入的样本级表示一致性,Lnll为异方差高斯负对数似然。经验证集寻优取λ1=1.0、λ2=0.5、λ3=0.5、λ4=0.3。6.2关键设计6.2.1有效长度的权威定义此本文以text_bert注意力掩码给出的长度减一作为三模态公共有效长度的权威定义,而6.2.2缺失模拟训练时对每条样本每条模态独立地注入连续缺失段:以概率pm决定该模态是否被注入(ptext=0.25,paudio=pvision=0.90,与附件3的”文本从不缺失、音视频几乎必缺”一6.2.3可用性上下文三维上下文cm(t)=[邻域可见率,瞬时可见性,模态完好率]:前两者由5点滑动平均与逐位置指示给出(刻画局部缺口的宽度第三者由该模态在整个有效区间内的可见比例给6.3训练方案与超参数6.4结果6.4.1与基线的对比表6.6给出在附件2验证集(728条)上的横向对比。所有基线均使用与本文模型相Pearsonr悬殊(文本Macro-F10.601对语音0.388、视觉0.414说明文本是期融合(0.585)反而略低于文本单模态,这与已有研究一致——简单拼接会让缺失通道的零向量污染融合表示,而本文的可靠性门控正是针6.4.2极性判定规则6.4.3缺失规律分析后模型退化为常数预测,Macro-F1骤降至0.147,说明这一稳健性并非来自标签先验。性在相同总缺失率下,”多个短缺口”与”一个长缺口”难度相当6.4.4消融实验单次训练的验证集指标波动约±0.01,单种子消融无法区分真实效应与随机噪声,因小于0.015的差异视为不显著。按此口径,表6.7给出的结论是:•没有任何一个辅助模块带来统计显著的增益。去掉跨模态注意力插补后,三档工况为0.613/0.612/0.597,与完整模型的0.609/0.611/0.594无显著差异;去掉表示一致性后完整输入甚至更高(0.613对0.609但幅度同样在噪声内。下为0.602±0.004(完整模型0.594±0.004去掉置信门控在同一工况下为0.613±0.009度匮乏时去掉它们反而略好。一个可能的解释是:重构缺失时重构项会把编码器拉向”恢复原始特征”而非”提取判别信息”;而本文的可用性上下文在最坏情况下也可能把门控带偏。单种子实验给出的”去掉表示一致性更好”(0.6190本文如实列出这些负面结论,而不是用单种子实验的偶然波动支撑”模块有效”的论断。它们说明一个更朴素的事实:本文模型之所以在缺失下不崩,主要来自缺失感知的训练策略——训练时就按附件3的实测形态注入缺失,使模型在”某些位置不可信”的条件下习得了可用的表示;而掩码重建、跨模态注意力插补、置信门控这类复杂模块在本数据集上的边际贡献有限。这提示架构存在冗余,在算力受限场景下可以裁剪;也说明合机制的提升空间并不大。这一负面结论同时构成了对叠融合模块,不如先解决”如何从音视频通道中提取真6.4.5验证集性能诊断被误判为正向,这与标注本身的性质有关——情感强度落在|y|<1/3的样本在语义上常值的方差小于真实值(图6.11f即模型存在向均值收缩的倾向6.4.6附件3全量预测段包括样本编号、极性预测与中文标签、判定规则预测结果为:负向9条、中性13条、正向8条;情感强度预测均值0.256,范围MAE0.5934)以及在附件3上表现出的行为一致性:缺失率越高的样本,预测标准差越大完整条件下稳定输出”相吻合。7.问题三:可解释性情感预测7.1建模思路•模态级——”这次判断主要依据哪个模态?”用精确Shapley值量化,三个模态仅需•片段级——”该模态中哪一段最关键?”用积分梯度给出逐位置归因曲线,再自动切分两条路径互补:Shapley值给出模态作用度占比,积分梯度给帧,形成完整可复核的证据链。整体框架如图7.13所示。7.2模态作用度:精确Shapley值分解7.2.1定义v(S)=F({xm}m∈S),SSM={1,2,3},(7.9)其中F为模型的标量输出,”移除”某模态的操作是将该模态特征置零并把其缺失指示置它满足有效性(Σmϕm=v(M)__v(g)对情感强度输出μ与极性置信度分别计算φm后取平均,再归一化为占比m=φm/Σm′φm′,作为最终的模态作用度。7.2.2结果一结论与多模态情感分析的普遍认识一致:文本携带最图7.14(b)对比了Shapley值与融合层注意力权重两种度量。两者7.2.3真实缺失样本的验证缺失”工况。本文模型的判定为:文本作用的文本模态,这一重构无需任何人工干预,是可靠性7.3局部片段重要性:积分梯度7.3.1定义曲线Im(t)=|IGm,t|/maxt|IGm,t|。关闭cuDNN让GRU走原生实现;由于模型处于评估模式,dropout为恒等映7.3.2证据片段选择与回溯在有效区间内从Im(t)中依次选出至多3个互不重叠的高重要性连续片段:每次取当:语音:合并后的连续时段,视觉:时段中点的视频关键帧.7.3.3结果三个典型样本的归因曲线与自动定位的证据片段如图7.15所示,解释卡如图7.16所对附件4全部20条样本完成推理,结果写入随附件提交的附件4_预测与解释结7.5验证集上的性能与可解释性一致性:(样本的文本作用度显著高于正向样本,说明模型确实依据语义极性调整了模态依赖2)在唯一一条真实缺失视觉的样本上,视觉作用度自动降至0.147,方向与事实相符3)8.灵敏度与稳健性分析8.1超参数灵敏度轻微下降,说明模型对正则强度不敏感但对过度正则较为敏感。8.2模态缺失强度的灵敏度实依赖残余的有效信息。缺失率曲线在0.6处才出现明显下滑,与训练时缺失率上限0.558.3缺失类型、位置与段长的灵敏度注意力池化的行为一致——句首多为语气词与主语,信息密度低于承载情感转折的中–8.4判定阈值的灵敏度F1为0.6386;采用”分类头置信度低于0.40时退化为回归输出阈值化(t=0.5)”的规则(极差小于0.001说明该规则对阈值不敏感,选择是稳健的。值得注意的是,纯回归阈值化(t=1/3,即赛题标注口径)的表现略低于分类头,说明两个预测头确实携带互补信息,融合二者比单独使用任一更好。8.5解释方法的交叉校验为检验积分梯度归因的可靠性,本文另做了位置遮蔽(occlusion)对照置把输入置零并记录输出变化量,与积分梯度曲线比较。两者在20条样本上的排序一致率为0.78(Spearman秩相关均值0.71即两种8.6特征提取环节的灵敏度问题一的两个关键参数是词语音识别的质量与视觉人脸检出率。若把对齐区间WER通道不会引入错误信息,只是贡献被门控权重自动9.模型的评价与推广9.1模型优点觉统一到Lmax=50的同一索引体系上,与附件2的原始组织方式一致。100条样本的与填充规则全部落表,可全量核验。三份附件的文本特征进一步验证为同一BERT的2.缺失鲁棒性来自结构而非数据增强。可靠性感知门控融合把”该位置这个模态是否可信”显式建模为可用性上下文(邻域可见率、瞬时可见性、模态完好率融合权重随缺失情况自适应调整。实测在”至少一个模态缺失的位置占比”由11.5%升3.解释具备反事实语义且可回落到原始素要性用积分梯度而非单纯梯度,避免饱和失真。证据片段再经时间映射回落到原始文本词片段、语音时段与视频关键帧,可逐帧复核。9.2模型不足1.视觉特征的物理语义弱于专业工具链。本文的35维视觉描述子由MediaPipeFmarker的blendshape与几何量作单元强度是代理量而非经AU标注校准的强度值;4条样本完全检不出人脸、另有6条检出率低于0.5,这些样本的视觉通道信息严重不足。若能接入OpenFace2.0或2.模态间信息量差异未被完全利用。验证集上单模态基线显示文本(Macr强于视觉(0.414)与语音(0.388本文模型(0.619)相对文本单模态仅这说明在CMU-MOSEI上,音视频通道的增量信息有限,多模态融合的收益空间本身较小;本文的鲁棒性设计主要保证”信息不全时不崩”,而非”3.消融实验显示部分模块增益不显著。多组

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论