CN119479705A 一种在线辅助语音对话场景的多模态情感提示方法及系统 (合肥综合性国家科学中心人工智能研究院(安徽省人工智能实验室))_第1页
CN119479705A 一种在线辅助语音对话场景的多模态情感提示方法及系统 (合肥综合性国家科学中心人工智能研究院(安徽省人工智能实验室))_第2页
CN119479705A 一种在线辅助语音对话场景的多模态情感提示方法及系统 (合肥综合性国家科学中心人工智能研究院(安徽省人工智能实验室))_第3页
CN119479705A 一种在线辅助语音对话场景的多模态情感提示方法及系统 (合肥综合性国家科学中心人工智能研究院(安徽省人工智能实验室))_第4页
CN119479705A 一种在线辅助语音对话场景的多模态情感提示方法及系统 (合肥综合性国家科学中心人工智能研究院(安徽省人工智能实验室))_第5页
已阅读5页,还剩21页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

路5089号,中国科学技术大学先进技一种在线辅助语音对话场景的多模态情感本发明公开了一种在线辅助语音对话场景2对训练数据集中的原始语音数据进行特征提取后输入到稀疏桥接Transformer模块将融合特征输入到大语言模型中,通过文本解码生成连贯的语音情增强语音信号的清晰度,得到处理后的语音数据集合sn表示第n个语使用语音活动检测算法计算处理后的每条语音数据中每一帧的短时能量并设定阈值根据语音活动区和静音区信息,检测处理后的每条语音数据中的停粗粒度标签生成:对于每个语音片段,通过情感分类模型计算情感类别的概细粒度标签生成:人工根据语音片段的情感特征及情境设计Prompt提示词并转换为文本向量,将原始语音特征向量输入到稀疏桥接;3;wr分别为稀疏基于预测输出的语音情感提示信息与人工标注的真实字幕构;;注的真实标签,表示在输入数据linput属于情感标签的概率,MI(v,T)为原所述多模态情感提示大模型的训练过程包括数据准备与语音特征提取所述数据准备与语音特征提取模块用于构建情感识别的训练数据集,4所述稀疏桥接Transformer模块用于对所输入的原始语音特征向量处理,得到融合特所述大语言模型模块用于将融合特征输入到大语言模型中,通过文所述损失构建模块用于构建总损失函数,反向传播调整多模态情感提56对训练数据集中的原始语音数据进行特征提取后输入到稀疏桥接Transformer模将融合特征输入到大语言模型中,通过文本解码生成连贯的语音情感提示信息,声并增强语音信号的清晰度,得到处理后的语音数据集合sn表示第n使用语音活动检测算法计算处理后的每条语音数据中每一帧的短时能量并设定设计Prompt提示词并转换为文本向量,将原始语音特征向量输入到稀疏桥接;wr分别为7基于预测输出的语音情感提示信息与人工标注的真实字幕构;;工标注的真实标签,表示在输入数据linput属于情感标签的概率,MI(v,T)为原始语音特征向量v与文本向量T之间的互信息量,p(v)表示原始语音特征向量v中特所述稀疏桥接Transformer模块用于对所输入的原始语音特征向量处理,得到融[0015]本发明提供的一种在线辅助语音对话场景的多模态情感提示方法及系统的优点8构设计使得多模态情感提示大模型能够在不同情感层次上提取并捕捉语音信号中的丰富Transformer模块的稀疏自注意力和稀疏交叉注意力机制,进一步强化了语音特征与文本传统模型在复杂对话情感场景下的适应性和表达不[0018]如图1和2所示,本发明提出的一种在线辅助语音对话场景的多模态情感提示方每条语音数据si表示一段包含情感信息的语音信于将语音数据分成固定长度的帧,i表示单位长度,s:(t+j)表示语音信号在时间t的采样9签转换为更符合情感表达的细粒度标签,生成的细粒度情感标签可以通过映射函数grefine表示为:⃞p=grefine(ix,p段的情感标签。质量的训练数据集:D={(pr,⃞p)lk=1,2…,m},数据集D为后续多模态情感提示大模基于WavLM预训练语音模型对对训练数据集中的原始语音数据进行特征提取,得块负责从原始语音数据中提取关键语音特征。为了更精确地捕捉语音片段中的情感信息,多模态情感提示大模型采用了稀疏化的自注意力(self_attention)机制和交叉注意力向量与经过线性层处理后的语音情感向量融合得到学习参数向量。Q_query在多模态情感提示大模型的训练过程中被更新,训练完成后在推[0027]稀疏桥接Transformer模块在提取情感相关的语音特征时,通过稀疏自注意力和稀疏交叉注意力机制通过将Q_query对应的语音情感向量作为查询,将来自原始入到Qwen2大型语言模型进行情感标签和描述信息机制生成与文本向量对齐的语音向量。这些语音向量与文本向量在情感语义上保持一致,了文本与语音在情感层面的对齐,为Qwen2大语言模型的情感提示和标签生成提供了高质[0034]语音向量输入:将步骤三生成的融合特征Iinpur=[T;Aorossl输入到Qwen2大语言[0035]文本解码生成语音情感提示信息(即情感提示字幕Qwen2大语言模型根据输入的融合特征linput,通过其解码机制生成语音特征linput中的情感信息生成相应的情感标签。Qwen2大语言模型根据融合特征linput的特征分布和语义内容为语音情感提示信息选择其中p(c:lIinpu)表示情感标签ci在融合特征linput下的概率分布。通过选择最大概率的情感标签作为对应的情感标签,Qwen2大语言模型示大模型的情感识别和语音情感提示信息的生成精度。总损失函数包含以下两个主要部其中,MI(V,T)为原始语音特征向量V与文本向量T之间的互信息量,音信息的对齐,使生成的语音情感提示信息更加符征t的边际概率分布,p(v,t)表示特征v和特征t之间的联合分布概率;p(v)是通过统计所征t出现的频率得到,这两个概率用来计算特征v和t之间的联合分布p(v,t)与边际分布概率p(v)、p(t)之间的差异,从而衡量原始语音特征其中,a,f分别表示交叉熵损失和互信息损失的权重系数,用于平衡不同损失项[0042]反向传播与优化:利用总损失函数Lroral

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论