版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
基于多模态蒸馏情感分析的推荐预告片生本发明公开了基于多模态蒸馏情感分析的导向视频合成模块。本发明结合自然语言处理过知识蒸馏技术实现了模型的高效压缩和性能2多模态视频预处理模块,完成对原始视频文件的视多模态视频特征识别模块,分别完成文本模态、情感导向视频合成模块,根据情感导向特征检索并筛选情感特征匹配视频片段集合,2.根据权利要求1所述的基于多模态蒸馏情感分析的推荐预告片生成系统,其特征在多模态拆分中利用包括AI中文语音识别API获得文本模态,利用语音信号的短时能量STE和短时过零率STZCR进行语音活动检测VAD获得音频模态,利用视频帧间相似度的变化3.根据权利要求1所述的基于多模态蒸馏情感分析的推荐预告片生成系统,其特征在多模态特征提取,使用OpenCV库读取视频帧序列,并采用级联进行Mel尺度滤波器组滤波,经过DCT离散余弦变换DCT得到VGGish特征,生成音频特征向解耦蒸馏的多模态情感识别与模型训练,搭建一个共享编码器和三个独并以总的分类损失和一致性损失的加权和为目标,使用Adam优化器训练GCN和GAT的参数;4.利用权利要求1_3任一所述系统的基于多模态蒸馏情感分析导向的推荐系统预告片35.根据权利要求4所述的基于多模态蒸馏情感分析导向的推荐系统预告片智能生成方对分轨后的音频流和视频流按镜头拆分成文本模态、语音模态和视觉模态的2)将每个句子的起止时间戳都记为cand(2)拆分语音模态:利用语音信号的短时能量STE和短时过零率STZCR进行语音活动检2)对每帧计算STE和STZCR特征使用双门限法进行语音/非语音判决,得到语音事件的2)利用SURF特征匹配方法比较相邻关键帧的相3)将镜头边界所在的时间戳记为shotscandidatecutpoints,其中每个镜头有多条(4)根据音频切分点确定其他模态的切分点candidatecutpoints:最终按时间戳排(5)遍历所有切分后的视频片段:提取每个片段的起止时间戳、终止时间戳和持续时对切分后的视频片段文件和切分日志文件进行数据清洗与对齐的具体步(1)根据切分日志中记录的每个片段的时间戳candidatecutpoints,提取语音时间46.根据权利要求4所述的基于多模态蒸馏情感分析导向的推荐系统预告片智能生成方1)使用OpenCV库读取MP4格式视频片段文件,根据起始时间戳和终止时间戳截取出相应的视频帧序列;2)对于截取出的视频帧序列,采用MTCNN人脸检测模4)使用预训练的包括FaceNet模型提取每一帧对齐后的人脸图像特征:Fa5)对于一个镜头,将每一帧提取到的人脸特征6)对5)中的特征序列在时间维度上进行统计分析,2)对截取的音频波形序列进行预加重和分帧:预加重用以平衡高频和低频成分的能3)对预加重的每一分帧音频数据进行特征54)将每一帧提取到的VGGish特征向量按时间顺序排列,构成5)对按时序生成的特征序列在时间维度上列转换为BERT模型要求的输入格式,包括添加[CLS]和[SEP]标记,以及进行WordPiece分择优选取jieba分词工具针对中文语料进行优化,考虑其分词粒度适中,且自定义词3)将预处理后的文本输入预训练选取的中文BERT模型:BERT模型基于Transformer结4)提取BERT最后一层Transformer的输出作为每个词的嵌入向量,得到一个词嵌入矩将词嵌入矩阵与掩码矩阵进行Hadamard积处理,得到一个去除填充标记影响的嵌入矩阵;对提取的多模态特征数据合成多模态集成向(2)将多模态特征集成向量与对应的视频片段元信息打包构成一个数据单元,元信息(3)将所有视频片段的数据单元按照视频ID和时间戳的顺序排列,构成一个视频片段共享编码器接收1024维的合成多模态集成向量,经过两6接层(128_>128_>128)映射到128维的视觉独占特征空间;语音独占编码器接收128维的语独占编码器接收768维的文本特征向量;经过两个全连接层(768_>512_>512)映射到512维3)以重构误差为目标,训练共享编码器和独征与原始的多模态特征集成向量之间的均方误差作为重构误差;以最小化重构误差为目(2)对多模态解耦表征的多模态共享特征向量、视觉独占特征向量、语音独占特征向4)在同源图和异源图上分别计算损失:以每个视频片段5)联合优化同源图和异源图上的损失函数图和异源图在节点分类任务上达成一致;以总的分类损失和一致性损失的加权和为目标,71)将原始的多模态特征与蒸馏后的共享特征和独占特征拼接合成多模态情感特征向2)将多模态情感特征向量输入分类器进行分类:分类器由3)以交叉熵为损失函数,计算分类器的预测概率4)多模态情感特征向量输入分类器,获得分类器的输出概率ar两个全连接层和softmax层的语音分类器,建立三个全连接层和softmax层的文本分类器;3)在多模态情感分类的总的训练目标中,将7.根据权利要求4所述的基于多模态蒸馏情感分析导向的推荐系统预告片智能生成方8(2)采用BERT嵌入方法,将并将用户画像匹配的关键词列表中的每个关键词转换为固8.根据权利要求7所述的基于多模态蒸馏情感分析导向的推荐系统预告片智能生成方并利用注意力机制自适应加权融合,得到综合相似度进行排序,最终选取Top_K个相关片9.根据权利要求8所述的基于多模态蒸馏情感分析导向的推荐系统预告片智能生成方9对最小生成树进行广度优先遍历,得到一个相似度高且具有情感起伏的候选片段序10.根据权利要求9所述的基于多模态蒸馏情感分析导向的推荐系统预告片智能生成(1)计算候选序列的平均情感嵌入向量:将序列中每个候选片段的同源节点嵌入取平(2)将平均情感强度与情感类别对应的典型强度值进行比较,选取最接近的情感类别[0005]推荐片段内容情感分类缺失:当前的推荐系统往往忽视了节目内容中的情感元[0008]本发明的技术目的在于提供了一种基于多模态蒸馏情感分析导向的推荐系统预的短时能量STE和短时过零率STZCR进行语音活动检测VAD获得音频模态,利用视频帧间相[0024](1)利用FFmpeg库对输入的原始视频文件进行解封装,获取其中的音频流和视频[0025](2)对音频流进行重新编码,转换为PCM格式,并统一重采样为示意性的16kHz、[0031](2)拆分语音模态:利用语音信号的短时能量STE和短时过零率STZCR进行语音活[0033]2)对每帧计算STE和STZCR特征使用双门限法进行语音/非语音判决,得到语音事[0038]3)将镜头边界所在的时间戳记为shotscandidatecutpoints,其中每个镜头有[0040](4)根据音频切分点确定其他模态的切分点candidatecutpoints:最终按时间戳排序后的final_cuts即为最终[0053](1)提取视觉模态特征,对预处理的视觉模态数据和切分日志进行视觉模态特征[0054]1)使用OpenCV库读取MP4格式视频片段文件,根据起始时间戳和终止时间戳截取[0060](2)提取语音模态特征,对预处理的语音模态数据和切分日志进行语音模态特征[0066](3)提取文本模态特征,对预处理的文本模态数据和切分日志进行文本模态特征[0070]3)将预处理后的文本输入预训练选取的中文BERT模型:BERT模型基于[0071]4)提取BERT最后一层Transformer的输出作为每个词的嵌入向量,得到一个词嵌[0075](2)将多模态特征集成向量与对应的视频片段元信息打包构成一个数据单元,元[0076](3)将所有视频片段的数据单元按照视频ID和时间戳的顺序排列,构成一个视频全连接层(128_>128_>128)映射到128维的视觉独占特征空间;语音独占编码器接收128维的语音特征向量,经过两个全连接层(128_>128_>128)映射到128维的语音独占特征空间;文本独占编码器接收768维的文本特征向量。经过两个全连接层(768_>512_>512)映射到[0092]1)将原始的多模态特征与蒸馏后的共享特征和独占特征拼接合成多模态情感特[0093]2)将多模态情感特征向量输入分类器进行分类:分类器由三个全连接层(2048_>化分类损失和双图卷积蒸馏的损失:将分类损失与总的分类损失和一致性损失加权相加,[0096](4)分别将视觉独占特征、语音独占特征、文本独占特征分别实现三模态独立分[0103]3)设置触发早停机制:当连续一定数量的epoch大于等于10,验证集性能不再提[0107]将目标情感类别映射为情感嵌入one_hot向量,将用户画像匹配的关键词列表采[0108](1)将目标情感类别映射为一个情感嵌入one_hot向[0109](2)采用BERT嵌入方法,将并将用户画像匹配的关键词列表中的每个关键词转换j)为:[0124](1)计算候选序列的平均情感嵌入向量:将序列中每个候选片段的同源节点嵌入[0125](2)将平均情感强度与情感类别对应的典型强度值进行比较,选取最接近的情感[0133](4)按照顺序将所有添加特效后的视频片段拼接为一个完整的视频文件,导出为[0134]本发明提出一种基于多模态蒸馏情感分析导向的推荐系统预告片智能生成系统[0136](1)该系统通过深度分析用户的情感偏好和多模态信息,能够生成高度个性化的[0137](2)而本系统利用多模态蒸馏情感分析技术,能够全面捕捉用户的兴趣点和情感[0139](4)通过生成与用户情感紧密相关的预告片,系统能够激发用户的参与度和讨论[0144]图4是根据本申请实施例的基于多模态蒸馏情感分析导向的推荐系统预告片智能员在没有做出创造性劳动前提下所获得的所有其他实施例,都应当属于本申请保护的范于多模态蒸馏情感分析导向的推荐系统预告片智能生成系统及方法提高用户的体验迫在利用语音信号的短时能量(STE)和短时过零率(STZCR)进行语音活动检测(VAD)获得音频模15%预设阈值语音占比的无效音频片段和切分日志,利用包含但不限于jieba分词工具对FaceNet模型提取每一帧对齐后的人脸图像特征,生成视觉特征向量;使用包括但不限于librosa库读取音频波形序列,通过快速傅里叶变换(FFT)转换到频域并进行Mel尺度滤波建包括但不限于图卷积网络(GCN)的同于注意力网络(GAT)的异源图实现模[0161]图4是本申请一实施例提供的基于多模态蒸馏情感分析导向的推荐系统预告片智[0162]基于多模态蒸馏情感分析导向的推荐系统预告片智能生成方法可以包括以下步[0165](1)利用包括但不限于FFmpeg库对输入的原始视频文件进行解封装,获取其中的[0174]2)对每帧计算STE和STZCR特征使用双门限法进行语音/非语音判决,得到语音事[0179]3)将镜头边界所在的时间戳记为shotscandidatecutpoints,其中每个镜头有[0196](1)提取视觉模态特征,对预处理的视觉模态数据和切分日志进行视觉模态特征[0197]1)使用包括但不限于OpenCV库读取示例性的MP4格式视频片段文件,根据起始时[0198]2)对于截取出的视频帧序列,采用包括但不限于MTCNN人脸检测模型逐帧检测人[0201]4)使用预训练的包括但不限于FaceNet模型提取每一帧对齐后的人脸图像特征:FaceNet输出的示例性128维特征向量可以很好地表征[0205](2)提取语音模态特征,对预处理的语音模态数据和切分日志进行语音模态特征快速傅里叶变换(FFT)转换到频域音频序列,进而利用Mel尺度滤波器组滤波得到Mel频谱[0211](3)提取文本模态特征,对预处理的文本模态数据和切分日志进行文本模态特征[0213]2)对截取出的字幕文本进行预处理:使用包括但不限于jieba分词工具将文本切分为词序列。将词序列转换为包括但不限于BERT模型要求的输入格式,包括添[0215]3)将预处理后的文本输入预训练选取的示例性中文BERT模型:BERT模型可基于Transformer结构的双向语言模型,有效建模文本的上下文信息。示例性的选用中文版[0217]4)提取BERT最后一层Transformer的输出作为每个词的嵌入向量,得到一个词嵌入标记化序列构造一个形状相同的掩码矩阵,其中示例性设置词对应位置为1,填充标记[0219]择优选取MaskAveraging而非768维文本特征向量顺序合成得到102[0222](2)将多模态特征集成向量与对应的视频片段元信息打包构成一个数据单元,示[0223](3)将所有视频片段的数据单元按照视频ID和时间戳的顺序排列,构成一个视频[0228]示例性地,共享编码器接收1024维的合成多模态集成向量,经过两个全连接层器接收128维的语音特征向量,经过两个全连接层(128_>128_>128)映射到128维的语音独层(128_>1或512_>1)将独占特征压缩为一个标量权重。将独占特征与对应的标量权重相立三个全连接层(512_>256_>64_>7)和softmax层的文本分类器。其中7分类情感提取结果解过拟合的作用。模态特征送入双图卷积蒸馏模块和分类器,计算总的训练目标(分类损失+蒸馏损失+模态[0255]2)每训练一定的epoch后,在验证集上评估模型的包含但不限于accuracy、F1_[0261]
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025-2026学年公园里的花 说课稿
- 2025-2026学年反思性说课稿
- 2025-2026学年大班毕业的说课稿
- 2025-2026学年下雨咯美术说课稿
- 2025-2026学年大熊储藏室说课稿
- 2025-2026学年厨房小班说课稿
- 2025-2026学年儿歌创编说课稿
- 压缩机装配调试工岗后能力考核试卷含答案
- 镀层工岗前技能综合实践考核试卷含答案
- 液压元件及液压系统制造工道德能力考核试卷含答案
- COX 痛经症状评分量表(CMSS)
- 2026年中国超高性能轮胎市场数据研究及竞争策略分析报告
- 厦门大学介绍
- 手术安全核查制度课件
- 国家安全法培训课件
- 2025 初中语文一年级上册语文教材编排特点分析课件
- T/CSPSTC 70-2021短线法节段预制拼装桥梁监控量测技术规程
- QGDW12258-2022深基坑作业一体化装置
- 2024年苍南县旅游投资集团有限公司招聘笔试冲刺题(带答案解析)
- 老年步态训练技术之走路姿势指导护理课件
- 解放思想-实事求是思想路线课件
评论
0/150
提交评论