CN114898259B 一种基于动作关联注意力的弱监督视频时序动作定位方法 (北京联合大学)_第1页
CN114898259B 一种基于动作关联注意力的弱监督视频时序动作定位方法 (北京联合大学)_第2页
CN114898259B 一种基于动作关联注意力的弱监督视频时序动作定位方法 (北京联合大学)_第3页
CN114898259B 一种基于动作关联注意力的弱监督视频时序动作定位方法 (北京联合大学)_第4页
CN114898259B 一种基于动作关联注意力的弱监督视频时序动作定位方法 (北京联合大学)_第5页
已阅读5页,还剩24页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

号一种基于动作关联注意力的弱监督视频时本申请涉及一种基于动作关联注意力的弱训练,并将查询机制的输出输入到Transformer利用Transformer架构的编码器确定视频片段特申请实现了采用弱监督方法实现视频的时序动2其中,所述的动作关联注意力模型通过全局匹配损失算法进现唯一预测;采用分类损失函数cc特征重建损失函数cn和定位损失函数cs进行联合训对特征的不同偏好;定位损失函数cs用于定位给定特征的开始和结束时间中sc(i)是其中,是由最优二分匹配计算的α(i)的动作序号;当预测出的标签在集合中时2.根据权利要求1所述的基于动作关联注意力的弱监督视频时序动作定位方法,其特将每个时间区域编码为动作查询areRO,则包含N个动作查询的动作查询集为将所述查询集Qu均分给所述查询片段集FS,即N/M个动作查询对应一个获得具有将所述的具有对应关系的查询集输入Transformer架构的解码器中,用有时间戳的3.根据权利要求2所述的基于动作关联注意力的弱监督视频时序动作定位方法,其特34.根据权利要求2所述的基于动作关联注意力的弱监督视频时序动作定位方法,其特5.根据权利要求1所述的基于动作关联注意力的弱监督视频时序动作定位方法,其特输入包含动作的视频作为训练数据;对所述的训练数据进行预处将所述视频片段的视频时序位置编码和I3D特征输入动作关联注意力模型的编码器序位置编码输入动作关联注意力模型的解码器中,同时利用查询机制建立弱监督的预训将所述编码器和解码器输出的查询集合进行合并,得到视频中动作片段的定位及分6.根据权利要求1所述的基于动作关联注意力的弱监督视频时序动作定位方法,其特征在于,所述的定位损失函数用于定位给定特征的开始和结束时间中测量邻近性的视频片段损失,将所述的片段损失定义为预测和真值之间的L1损失和Lion器加载并执行如权利要求1至6中任一种方法的8.一种计算机可读存储介质,其特征在于,4[0002]时序动作定位(TAL)是视频理解中的一项具有挑战性的任务,被广泛应用于快速[0004]为了解决现有技术中的弱监督时序动作定位技术无法模拟长期时间片段之间的作关联注意力模型,利用查询机制建立弱监督的预训练,并将查询机制的输出输入到督的预训练,解决了弱监督训练中无真值监督训练的问题,再将查询机制的输出输入到5[0010]将每个时间区域编码为动作查询areRO,则包含N个动作查询的动作查询集为应关系的查询集us戳的查询片段集FS,去监督动作查询集QU={q,qa询片段集FS),使得Qu中有M个动作查询的时间区域一一对应FS中记录的时间戳(即不断训利用查询机制结合冻结参数的I3D*网络提取所述的M个视频片段的特征,从而可以有效平6[0022]将所述视频片段的视频时序位置编码和I3D特征输入动作关联注意力模型的编码[0023]采用分类损失函数和定位损失函数cs对所述的动作关联注意力模型进行联合衡分类和定位对特征的不同偏好;定位损失函数cs用于定位给定特征的开始和结束时间ss中测量邻近性的视频片段损失,将所述的片段损失定义为预测和真值之间的L1损失(对实7申请的整个方法)来建立时间间隔较长的动作片段之间的关系,最终获得准确的视频时序8的解码器中用于实现查询集合的时间定位;利用Transformer架构的编码器确定视频片段[0053]具体的,本申请为数据预处理输出的I3D特征FV设计了可学习的位置编码peRe[0055]每个编码块的核心是多头自我注意(multi_headself_attention,缩写为mh_s_[0056]Q;-Qf,K,=kwf,V=V'(i=1,…h)(1)[0059]其中,通常默认v瓜=8o在归一化操作(softmax)之后,得到注意力映射图为tn"eRXD。经过全连接模块(FFN)和层标准化模块(add&normal9[0062]S14,将所述的视频片段的视频时序位置编码输入动作关联注意力模型的解码器表示为Dl,其中l∈[1,Ld]。Dl的输入和输出定义为和因此作为一个级联结构,缩写为mh_s_attn)模块和多头交叉注意(multi_headcross_attention,缩写为mh_c_attn)模块如图5所示。[0067]多头交叉注意模块是h个单头交叉注意(single_headcross_attention,缩写为R.与相乘后得到[0076]为了平衡定位和分类对特征的偏好,提高最终视频时序动作定位和分类的准确对特征的不同偏好;定位损失函数LS用于定位给定特征的开始和结束时间中[0077]训练过程如图6所示,定位损失函数cs用于定位给定特征的开始和结束时间[0078]查询片段的特征FS和最终预测Pr被输入到LnLn保留了分类的特征识别。CC用ss[0084]所述的定位损失函数es表示定位给定特征的开始和结束时间中测量邻近性的视频片段损失,将所述的片段损失定义为预测和真值之间的L1损失(对实例持续[0095]S24,将每个时间区域编码为动作查询qeRO,则包含N个动作查询的动作查询时间戳的查询片段集FS,去监督动作查询集QU={q1,qs,[0098]为了满足每个动作查询qi的独立性,在分配查询集Qu时,将掩模矩阵xeR"添存储器上存储有能够被处理器加载并执行如前述任一种方法的(DigitalSignalProcessingDevice,DSPD)、可编程逻辑装置(ProgrammableLogic也可以为电子设备的外部存储设备,例如,电子设备上配备的插接式硬盘、智能存储卡储有能够被处理器加载并执行如前述任一种方法的计明人将W_ART模型

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论