版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
别模型训练方法包括:获取待测视频和待测音标签集合中的各个情绪标签分别与待测文本模板拼接生成各个情绪标签分别对应的待测文本各个待测文本数据分别对应的各个待测文本编测相似度数据对应的情绪标签确定为待测视频2在待测视频中确定多个待测视频帧,并利用标签集合中的各本模板拼接生成各个所述情绪标签分别对应的待测文将所述待测视频帧、所述待测文本数据和所述待测音频输入情绪识非文本编码数据和各个待测文本数据分别对应的各个待测文利用所述待测非文本编码数据分别和各个所述待测文本编码数据生成待测相似度数将最大待测相似度数据对应的情绪标签确定为所所述利用标签集合中的各个情绪标签分别与待测文本模板拼接生成各个所述情绪标对所述待测文本模板分别和各个所述情绪标签进行向量映射处理,在所述训练视频中确定多个训练视频帧,并从预设模板库中选取一个目标文本模板,将所述训练视频帧、所述训练文本数据和所述训练音频输入初编码数据以及训练非文本编码数据;所述训练文本编码数据基于所述训练文本数据得到,表征情绪标签的情绪语义特征;所述训练非文本编码数据基于训练视频帧和训练音频得所述初始模型包括文本编码器、图像编码器和音频编码器,还包括池所述将所述训练视频帧、所述训练文本数据和所述训练音频将所述训练视频帧输入所述图像编码器,得到多个初始图像编码3基于所述损失值对所述初始模型中的所述池化网络模块和所述时间递归网络模块进在所述目标测试视频中确定多个目标测试视频帧,并利用标将所述目标测试视频帧、所述目标测试文本数据和所述目标测试音计算所述目标非文本编码数据分别和各个目标文本编码数据之间的测试相似度数据,并利用所述测试相似度数据确定所述至少一个文本模板分别对应的至少一个最大相似度将所述至少一个最大相似度数据对应的情绪标签确定为所述目标测试视频对应的初待测数据处理模块,用于在待测视频中确定多个待测视频帧,并个情绪标签分别与待测文本模板拼接生成各个所述情绪标签分别对应的待测待测输入模块,用于将所述待测视频帧、所述待测文本数据待测相似度生成模块,用于利用所述待测非文本编码数据分别和各个所4识别结果确定模块,用于将最大待测相似度数据对应的情绪待测向量映射单元,用于对所述待测文本模板分别和各个所述情绪标待测拼接单元,用于将所述模板向量分别和各个所述标签向量进行拼训练数据处理模块,用于在所述训练视频中确定多训练输入模块,用于将所述训练视频帧、所述训练训练相似度生成模块,用于利用所述训练文参数调节模块,用于利用所述相似度数据生成损失值,并基于模型确定模块,用于若检测到满足训练完成条件,则将参数调节后所述初始模型包括文本编码器、图像编码器和音频编码器,还包括池训练文本编码单元,用于将所述训练文本输入所述文本编训练池化处理单元,用于将所述多个初始文本编训练音频编码单元,用于将所述训练视频帧输入训练图像编码单元,用于将所述多个初始图像编码输入所述训练拼接单元,用于将所述中间图像编码和所述初始5文本向量拼接单元,用于对所述模板向量和所述标签向量所述处理器,用于执行所述计算机程序,以实现如权利要求1至7任序被处理器执行时以实现如权利要求1至7任一6常将人脸情感识别分为静态人脸情感识别(staticfacialemotionrecognition)和动态人脸情感识别(dynamicfacialemotionrecognition).前者通过单张测文本模板拼接生成各个所述情绪标签分别待测非文本编码数据和各个待测文本数据分别对应的各个待测文本[0008]利用所述待测非文本编码数据分别和各个所述待测文本编码数据生成待测相似[0009]将最大待测相似度数据对应的情绪标签确定为所述待测视频对应的情绪识别结[0016]在所述训练视频中确定多个训练视频帧,并利用所述情绪标签生成训练文本数7[0028]可选地,所述文本编码器和所述图像编码器属于语言图[0030]基于所述损失值对所述初始模型中的所述池化网络模块和所述时间递归网络模8[0042]计算所述目标非文本编码数据分别和各个目标文本编码数据之间的测试相似度[0043]将所述至少一个最大相似度数据对应的情绪标签确定为所述目标测试视频对应[0044]基于所述预测结果和所述目标测试标签确定所述目标测试子数据对应的测试子的各个情绪标签分别与待测文本模板拼接生成各个所述情绪标签分别对应的待测文本数待测相似度数据对应的情绪标签确定为待测视频对应的情绪识9情绪标签,情绪识别模型也能够基于该情绪标签的语义信息将其与其他情绪标签进行区图像的特征(不管是见过还是没见过的),跟脑海中的自然语言的特征进行关联和对应的,输出为时间递归网络模块的输入。时间递归网络模块具体可以为LSTM(LongShort-Term[0083]本实施例并不限定初始模型得到训练文本编码数据和训练非文本编码数据的方码数据和训练非文本编码数据均为向量像是,此时可以技术算余弦相似度作为相似度数对比学习预训练模型即为CLIP(ContrastiveLanguage-ImagePre-Training)模型,经过声音编码器)可以采用的是YAMNET模型,该模型是在AudioSet数据集上训练的音频事件分练完成条件为准确率条件时,可以利用测试数据对参数调节后的初始模型进行准确率测本编码数据分别和各个目标文本编码数据之间的测试相似本编码数据和各个待测文本数据分别对应的各个待测文本编[0113]c、标签向量y(特指训练视频对应的情绪标签的向量)与向量p分别经过文本预处Ti)])表示final_t。Ti)])表示final_t0。原本的概率预测问题转换为了相似匹配问题,同时引入了标签的本身所包含的语义信息,[0144]在实际应用中,检测部件可以包括检测接口和采集部件(例如摄像头和麦克风[0145]图4为本申请实施例提供的一种识别终端的结构示意图,识别终端可以包括处理别模型,得到待测非文本编码数据和各个待测文本数据分别对应的各个待测文本编码数[0148]本申请实施例提供的情绪识别方法可以部署于基于FPGA(FieldProgrammable模型进行压缩处理的方式,除了应用于文本答案的确定外,也可以应用于基于LSTM(Long中的各个情绪标签分别与待测文本模板拼接生成各个所述情绪标签分别对应的待测文本[0172]训练图像编码单元,用于将所述多个初始图像编码输入[0174]可选地,所述文本编码器和所述图像编码器属于语言图输出(I/O)接口104以及通信组件105中的一种或非易失性存储设备或者它们的组合实现,例如静态随机存取存储器(StaticRandomAccessMemory,SRAM)、电可擦除可编程只读存储器(ElectricallyErasableProgrammableRead-OnlyMemory,EEPROM)、可擦除可编程只读存储器(Erasable[0196]电子设备100可以被一个或多个应用专用集成电路(ApplicationSpecificIntegratedCircuit,简称ASIC)、数字信号处理器(DigitalSignalProcessor,简称件(ProgrammableLogicDevice,简称PLD)、现场可编程门阵列(FieldProgrammable[0199]该计算机可读存储介质可以包括:U盘
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 挫折教育:正确面对考试失败小学主题班会课件
- 多任务处理职场指南手册
- 旅游公司导游服务质量与顾客评价KPI考核表
- 亲子互动:小学主题班会课件
- 多彩艺术的世界:欣赏与创作小学主题班会课件
- 机械设备安装工KPI考核表
- 投资分析与管理顾问业绩收益KPI考核表
- 建筑项目经理项目进度与成本绩效考核表
- 警惕心理困扰塑造坚强意志小学主题班会课件
- 礼仪教育:日常交往中的礼貌用语小学主题班会课件
- 2025年江苏省无锡市梁溪区侨谊教育集团小升初数学招生试卷(含答案解析)
- 行政人事自我介绍
- 博雷顿产品介绍
- 四川水电集团招聘岗位综合能力测试客观题题库
- 支气管哮喘急性发作的紧急救护技巧
- 【耳鼻喉9版】绪论和耳科学第七章 中耳炎性疾病
- 创伤性肾破裂的护理课件
- 安装断桥窗合同范本
- 医院品管圈大赛课题研究型、问题解决型、平衡记分卡评分标准
- 第八届全国职工职业技能大赛(网络和信息安全管理员)浙江选拔赛试题库-上(单选题部分)
- 轮椅转运法操作评分标准
评论
0/150
提交评论