版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
类级别语义特征以及第一视觉特征向量进行特2通过预设的多模态训练模型对所述支持集视频、所述查询集视频以及所将所述第一视觉特征向量、所述类级别语义特征以及所述第二理语义以及与所述第二视觉特征向量对应的第二实例级代通过所述特征融合模块对所述第一实例级代理语义、所述类通过所述原型匹配模块对所述查询特征表示以及所述类别原型进行将所述支持集视频输入预设的多模态训练模型,以使所述共享视觉将所述查询集视频输入预设的多模态训练模型,以使所述共享视觉所述第一视觉特征向量对应的第一实例级代理语义以及与所述第二视觉特征向量对应的通过所述第二语义扩散子模块对所述第二视觉特征向量进行逐步扩散,通过所述第一语义扩散子模块对所述类级别语义特征进行前向扩散将所述第一视觉特征向量、所述噪声化语义特征以及所述嵌入表3将所述第一实例级代理语义、所述类级别语义特征以及所述第一视将所述帧信息输入所述帧间融合层,以使所述帧间融合层根据所述对所述支持集视频中同一类别的特征表示进行取均值操作,以构建将所述查询特征表示以及所述类别原型输入所述原型匹配模块进行相似度根据所述匹配结果对所述查询集视频中的第二动作视频帧进行动通过预设的监督损失函数训练所述代理语义;f是类级别语义特征;e~N(0,1)是服从标准正态分布的z;45[0003]近年来,大规模多模态预训练模型的崛起,特别是图文自监督对比学习模型视频特征与类级别的动作名称文本嵌入进行简单对齐,未能充分挖掘实例级的语义多样级代理语义以及与所述第二视觉特征向量对应的第二实例级6通过所述帧间融合层建立所述融合结果中不同帧的时序关系,得到查询特征表7将所述查询特征表示以及所述类别原型输入所述原型匹配模块进行相似度匹配,向量对应的第一实例级代理语义以及与所述第二视觉特征向量对应的第二实例级代理语通过预设的监督损失函数训练所述代理语义;f是类级别语义特征;e~N(0,1)是服从标准正态分z;8动作种类的精准识别。本申请实施例语义内容的丰富性和时序性上增加语义表示的多样图2是本申请一实施例提供的通过预设的多模态训练模型对支持集视频、查询集视频以及类别标签模板进行特征处理的具体方法图3是本申请一实施例提供的将第一视觉特征向量、类级别语义特征以及第二视觉特征向量输入代理语义扩散模块进行噪声扩散图4是本申请一实施例提供的通过特征融合模块对第一实例级代理语义、类级别语义特征以及第一视觉特征向量进行特征表示的具体图5是本申请一实施例提供的通过特征融合模块对第二实例级代理语义进行特征图6是本申请一实施例提供的通过原型匹配模块对查询特征表示以及类别原型进图11是本申请一示例提供的ProLIPS框架在SSv2_Small和HMDB51数据集下的性能9[0021]近年来,大规模多模态预训练模型的崛起,特别是图文自监督对比学习模型视频特征与类级别的动作名称文本嵌入进行简单对齐,未能充分挖掘实例级的语义多样作种类的精准识别。本申请实施例语义内容的丰富性和时序性上增加语义表示的多样性,通过多步预训练知识引导机制和时间条件反向扩散步骤逐步生成具有时间动态的实例级[0024]参照图1,图1是本申请一实施例提供的小样本动作识别该小样本动作识别方法包括但不限于以下步骤S10[0026]在一些实施例的步骤S101中,实例级别的语义信息体现在每个视频在动作主体、往往无法通过简单的动作类标签来传达。为了解决上述问题,本申请实施例先获取支持集括多帧第二动作视频帧,并获取类别标签模板,类别标签模板存储有与第一动作视频帧对以及与第二视觉特征向量对应的第二实例级代导机制用以挖掘视频中固有的实例级语义,并在整个反向扩散过程中逐步改进语义的质[0038]参照图2,图2是本申请一实施例提供的通过预设的多模态训练模型对支持集视的多模态训练模型,以使共享视觉编码器对支持集视频中的第一动作视频帧进行特征提[0042]可以理解的是,本申请实施例中的共享视觉编码器采用预训练的CLIPViT_B/16本动作识别方法包括但不限于以下步骤S301至步骤S[0046]需要说明的是,语义扩散模块包括第一语义扩散子模块表示Iff2fn;f是类级别语义特征;e~N(0,1)是服从标准正态分块通过去噪神经网络对第一视觉特征向量、噪声化语义特征以及嵌入表示进行反向扩散,z;[0056]值得注意的是,本申请实施例的反向扩散通过去噪逐步生成每帧的代理语义特语义特征能够捕捉动作的时间动态变化,从而解决了目前方法中静态语义表达的局限性,成的输出是一个包含时间维度的代理语义特征s=,其中,表示视频帧数,每个[0058]参照图4,图4是本申请一实施例提供的通过特征融合模块对第一实例级代理语建立融合结果中不同帧的时序关系,减少由于单个帧的噪声或不完整性导致的识别错误,[0074]参照图7,图7是本申请另一实施例提供的小样本动作识别方法的具体方法流程第一实例级代理语义以及与第二视觉特征向量对应的第二实例级代理语;现有的方法在特征建模方面的局限性在于对视觉模态或类别级语义的过度依赖,未能充分利用实例级的丰富语义信息,这限制了模型在面对复杂动作识别任务时的表现。[0082]本申请实施例提出了一种基于实例级代理语义渐进式学习(Progressive[0084]在一些实施例中,多模态训练模型主要包括视觉编码与类级语义特征提取模块、向扩散步骤则是通过时间条件插值器结合反向扩散生成具有时间持集视频和查询集视频的视频数据经过共享的视觉编码器(采用预训练的CLIPViT_B/16[0088]在一些实施例中,ProLIPS的核心是代理语义扩散模块(ProxySemanticDiffusion,PSD该模块接收实例级视频特征(第一视觉特征向量和第二视觉特征向量)一种新颖的渐进式实例级代理语义学习框架(ProLIPS用于解决小样本动作识别任务中转换为一系列噪声程度逐渐增加的潜在表示Iff2fn,并且每个扩散步骤对应一个嵌入;f是类级别语义特征;e~N(0,1)是服从标准正态分z;[0098]时间插值器通过K步反向递归循环,第一语义扩散子模块最终生成的输出是一个;[0106]参照图10,图10是本申请一示例提供的ProLIPS框架在SSv2_Full、Kinetics和SSv2_Small和HMDB51数据集下的性能对[0107]由图10和图11可知,ProLIPS框架在多个常用的少样本动作识别数据集,例如SSv2_Full,SSv2_Small,Kinetics,UCF101,HMDB51,上与当前竞争性方法进行了性能对比可以根据实际的需要选择其中的部分或者全部模块来实现本
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年电大国开计算机应用基础形考任务(1-4)模拟题及答案详解
- 2026年初会考模拟题及答案详解
- 2026年中国通信基站锂电池市场营销现状及投资前景预测研究报告
- 2026年劳动保障协理员三级安全教育(公司级)考核模拟试卷(含答案)
- etf考模拟试题库(含答案)
- 2026年广西145纲要解读模拟题及答案详解
- 2026年畜牧兽医养殖技术考试模拟题及答案详解
- 2026年财务机器人预算编制模拟题及答案详解
- 2026年中国伺服电机产业投资前景分析报告
- 涉税服务实务题库(含答案)
- 《系统性红斑狼疮公开教学》课件
- 车位出售转让合同模板
- 2024年江苏省泰州市保安员理论考试题库及答案(完整)
- 3输变电工程施工质量验收统一表式(变电工程电气专业)-2024年版
- 电杆检测报告
- 《围手术期健康教育》课件
- 双减背景下家校共育的问题及策略
- 八年级语文上册《〈孟子〉三章》分层作业(第一课时)
- 终末期患者的姑息性镇静治疗-安宁疗护的理念与用药
- 三年级写人作文(41篇)
- 2023年农银人寿保险股份有限公司招聘笔试题库及答案解析
评论
0/150
提交评论