CN115035455B 一种基于对抗多模态领域自适应的跨类别视频时间定位方法、系统和存储介质 (浙江大学)_第1页
CN115035455B 一种基于对抗多模态领域自适应的跨类别视频时间定位方法、系统和存储介质 (浙江大学)_第2页
CN115035455B 一种基于对抗多模态领域自适应的跨类别视频时间定位方法、系统和存储介质 (浙江大学)_第3页
CN115035455B 一种基于对抗多模态领域自适应的跨类别视频时间定位方法、系统和存储介质 (浙江大学)_第4页
CN115035455B 一种基于对抗多模态领域自适应的跨类别视频时间定位方法、系统和存储介质 (浙江大学)_第5页
已阅读5页,还剩30页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于对抗多模态领域自适应的跨类别本发明公开了一种基于对抗多模态领域自过跨模态特征校准器目标类别视频的视觉特征构器对目标类别视频的视觉特征随机掩码并进频特征和文本特征进行单模态领域不变性特征2始视觉特征vs,vt和查询文本的初始文本特征编码后作为最终的视觉特征vs,vt和文本特征S3:通过视频特征重构器对步骤S1得到的目标S4:通过跨模态特征融合器对步骤S1得到的视qS4-4:根据步骤S4-3计算得到的视频-查询文本注意力矩阵Av和查询文本-视频注意力qS5:通过领域鉴别器分别对步骤S1得到的视频S6:通过双仿射预测器对步骤S4得到的源类别视频2.根据权利要求1所述的基于对抗多模态领域自适应的跨类别视频时间定位方法,其代表源类别视频中的第i个源视频及其对应的查询文本,代表源类别视频中第i3取源类别视频的查询文本Qs和目标类别视频的查询文本Qt的语义信息,得到初始文本特征第i个目标类别视频的查询文本中第j个单词的文本特3.根据权利要求2所述的基于对抗多模态领域自适应的跨类别视频时间定位方法,其4.根据权利要求3所述的基于对抗多模态领域自适应的跨类别视频时间定位方法,其4所述的跨模态特征融合器的训练损失采用均5.根据权利要求2所述的基于对抗多模态领域自适应的跨类别视频时间定位方法,其的文本特征的均值,表示第i个源类别视频的查询文本中所有单词的文本特征的均值的S2-3:利用正负样本训练跨模态特征校准器,6.根据权利要求1所述的基于对抗多模态领域自适应的跨类别视频时间定位方法,其视频-查询文本注意力矩阵Av和查询文本-视频注意力矩阵Aq的计算过5fs表示源类别视频的t表示目标类别视频的初始融合特征,Ff表示第i个目标类别视7.根据权利要求2所述的基于对抗多模态领域自适应的跨类别视频时间定位方法,其所述的视觉特征鉴别器Dv用于鉴别步骤S1得到源类别视频的视觉特征vk和目标类别视频的视觉特征vt,计算过程如下:所述的文本特征鉴别器D用于鉴别步骤S1所述的文本特征鉴别器D用于鉴别步骤S1得到源类别视频的查询文本的文本特征所述的融合特征鉴别器Df用于鉴别步骤S4得到的源类别视频的初始融合特征Fs和目标vpf分别是针对视觉特征、文本特征和初始融合特征的多所述的视频特征鉴别器Dv、文本特征鉴别器Dq以及融合特征鉴别器Df输出8.根据权利要求6所述的基于对抗多模态领域自适应的跨类别视频时间定位方法,其从步骤S4得到的每一个视频的最终融合特征中提取候选片段开始帧和结6为线性层可学习参数;由于源类别视频中每一视频由n个视频帧组成,因此可以将所有的候选片段表示段P预测概率的矩阵将矩阵M的最大值对应的帧组合为最终预测结mmm9.一种基于对抗多模态领域自适应的跨类别视频时8中任一项所述的基于对抗多模态领域自适应的跨类别视频时间定位方法,所述的系统包数据获取及特征提取模块,其用于获取源类别视频、目标类别跨模态特征校准模块,其用于通过跨模态特征校准器对得到的目视频特征重构模块,其用于通过视频特征重构器对目标类别视频的视跨模态特征融合模块,其用于通过跨模态特征融合器对得到的视频特领域鉴别模块,其用于通过领域鉴别器分别对得到的视频特征双仿射预测模块,其用于通过双仿射预测器对得到的源类别视频的用于实现权利要求1-8中任一项所述的基于对抗多模态领域自适应的跨类别视频时间定位7[0002]视频时间定位任务旨在从没有经过处理的视频中给出与查询文本对应的视频片场景之间的域偏移。基于上述两种方法训练出来的模型应对未知类别数据的泛化性较差,8[0015]本发明提出了一个基本训练模块,主要用于对带标签的源类别数据进行监督学[0016]图1为根据一示例性实施例示出的一种基于对抗多模态领域自适应的跨类别视频[0020]下面结合附图和实施例对本发明进行进一步说明。附图仅为本发明的示意性图[0021]如图1所示,本发明提出的一种基于对抗多模态领域自适应的跨类别视频时间定得到视觉特征s、t并通过视觉编码器进行特征编码最终得到编码后的视觉特征s、t;接着通过Glove模型提取源类别查询文本和目标类别查询文本的语义信息,得到文本特征并通过文本编码器进行特征编码最终得到编码后的文本9息,得到初始视觉特征DS,Dt:通过Glove模型提取源类别视频的查询文本Qs和目标类别视特征和初始文本特征分别通过一个卷积层和一个线性投影层投影到相同的为目标类别视频的查询文本的文本特征,第i个目标类别视频的查询文本的文本特征,为视觉编码器,将用于编码初始文本特征的一个卷积层和一个线性投影层记为文[0037]本步骤中,跨模态特征校准器应用损失函数Lca使得正样本中的视觉特征和文本[0050]S3-1:随机对步骤S1得到的目标类别视频的初始视觉特征pt以β概率进行掩码操[0051]S3-2:通过跨模态特征融合器对步骤S3-1得到的掩码视觉特征vm和步骤S1得到[0058]S4:通过跨模态特征融合器分别对步骤S1得到的视频特征、文本特征vs、和qq表的最终融合特征其中,表示第i个源类别视频的最,得到目标类别视频的初始融合特征Ft和最终融合特征Ft。[0069]S5:通过领域鉴别器分别对步骤S1得到的视频特征s、t和文本特征进行单模态领域不变性特征表达学习和对步骤S4得到的初始融合特征Fs、Ft进行跨模态领域[0071]对于视频特征和文本特征视频特征鉴别器Dv和文本特征鉴别器Dq计[0079]在训练过程中,首先定义领域标签o,[0083]S6:通过双仿射预测器对步骤S4得到的特征中提取候选片段开始帧和结束帧对应的融合特征通过线性层[0087]由于源类别视频中每一视频由n个视频帧组成,因此可以将所有的候选片段表示视频片段P预测概率的矩阵将矩阵M的最大值对应的帧组合为最终P为查询文本对应视[0091]本实施例中,步骤S6所述双仿射预测器在训练过程中使用缩放交并比(IoU)函数λ3为超参数。[0100]在本实施例中还提供了一种基于对抗多模态领域自适应的跨类别视频时间定位[0109]上述系统中各个模块的功能和作用的实现过程具体详见上述方法中对应步骤的[0111](2)通过跨模态特征校准器对步骤1得到的目标类别视频的视觉特征和文本特征[0112](3)通过视频特征重构器对步骤1得到的目标类别视频的视觉特征随机掩码并进[0114](5)通过领域鉴别器分别对步骤1得到的视频特征和文本特征进行单模态领域不变性特征表达学习,以及对步骤4得到的初始融合特征进行跨模态领域不变性特征表达学是通过其所在任意具备数据处理能力的设备的处理器将非易失性存储器中对应的计算机系统所在的任意具备数据处理能力的设备通常根据该任意具备数据处理能力的设备的实[0119]所述计算机可读存储介质可以是前述任一实施例所述的任意具备数据处理能力据处理能力的设备的外部存储设备,例如所述设备上配备的插接式硬盘、智能存储卡述计算机可读存储介质用于存储所述计算机程序以及所述任意具备数据处理能力的设备[0121]本发明采用ActivityNetCaptions数据集和Charades-STA数据集进行模型训练[0122]本发明实验参数设置如下:采用衰减率为1e-6的AdamW优化器对训练过程进行优

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论