CN118378123B 基于跨模态Transformer的视觉-音频多模态目标跟踪方法及装置 (武汉大学)_第1页
CN118378123B 基于跨模态Transformer的视觉-音频多模态目标跟踪方法及装置 (武汉大学)_第2页
CN118378123B 基于跨模态Transformer的视觉-音频多模态目标跟踪方法及装置 (武汉大学)_第3页
CN118378123B 基于跨模态Transformer的视觉-音频多模态目标跟踪方法及装置 (武汉大学)_第4页
CN118378123B 基于跨模态Transformer的视觉-音频多模态目标跟踪方法及装置 (武汉大学)_第5页
已阅读5页,还剩34页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

ExploringUnifiedVision-TrackingwithMulti-ModalAlignment.ObjectTrackingofMult基于跨模态Transformer的视觉-音频多模本发明公开了一种基于跨模态Transformer的视觉音频多模态目标跟踪方法及装置,首先2S3:从输入的搜索区图像对应图像帧的音频片段以S4:对提取出的图像tokens与音频tokens进S5:将跨模态对齐后的音频tokens与交叉模态对齐后的图像tokens进行模态混合操其中,步骤S4对提取出的图像tokens与音频tokens进行跨通过训练好的音频编码器得到跨模态对齐后的图像和音频的步骤S4将跨模态对齐后的搜索区图像tokens和跨模态对齐后的模板区图像tokens进将经过跨模态对齐的视觉模态中的搜索区域和模板区域的tokens进2.如权利要求1所述的基于跨模态Tra34.如权利要求1所述的基于跨模态TransforS5.2:将注入音频信息的搜索区视觉嵌入和模板区视觉嵌入进行拼接,然后送入L层多头自注意模块采用多头自注意机制允许模型在多个注意力视角下对输入序列进行交互,音频tokens提取模块,用于从输入的搜索区图像对应图像帧的音交叉模态对齐模块,用于对提取出的图像tokens与音频tokens特征提取与融合模块,用于将跨模态对齐后的音频tokens与交叉模态对齐后的图像4边界框预测头模块,用于根据最后一层编码器输出的搜索区图像通过训练好的音频编码器得到跨模态对齐后的图像和音频的将经过跨模态对齐的视觉模态中的搜索区域和模板区域的tokens进行时实现如权利要求1至5中任一项权利要求8.一种计算机设备,包括存储器、处理器及5[0004]目前,使用Transformer的目标跟踪方法包括基于CNN一Transformer、完全基于于CNN的跟踪器更为出色的特点。根据对具有挑战性的基准数据集的经验评估,完全基于[0005]其中完全基于Transformer的跟踪器包括双流跟踪框架和单流跟踪框架。双流两阶段完全Transformer跟踪器采用骨干Transformer模型提取目标模板和搜索区域的特征,两阶段跟踪器展示了简单而整洁的跟踪架构,并在性能上优于基于CNN和基于CNN一Transformer的跟踪器,充分发挥了Transformer的注意力机制以实现更为精准的目标跟[0006]另一方面,单流单阶段跟踪器采用完全Transformer架构将特征提取和特征融合这些优势,完全基于Transformer的单流单阶段跟踪器在各个基准数据集上表现出卓越的6[0010]针对上述问题,本发明创新性地提出了一种基于Transformer和多模态融合的视觉音频目标跟踪方法,以填补目标跟踪领域中缺乏使用跨模态Transformer将视觉和音频合后的多模态特征包括搜索区图像特征和模[0028]在一种实施方式中,步骤S4对提取出的图像tokens与音频tokens进行跨模态对7[0033]将经过跨模态对齐的视觉模态中的搜索区域和模板区域的tokens进行融合,其层Transformer编码器进行联合处理,其中,每一层编码器包括多头自注意模块和前馈网[0039]S6.1:利用分类分支将Transform[0045]图像tokens提取模块,用于从输入的搜索区图像和模板区图像中提取出图像[0047]交叉模态对齐模块,用于对提取出的图像tokens与音频tok89识证明将视觉和音频两个模态融合的方法应用在目标跟踪中可以有效提升系统的鲁棒性合后的多模态特征包括搜索区图像特征和模[0074]步骤S5通过多层编码器对搜索区图像和模板区图像的特首先将其分割为无重叠的分辨率大小为P×P的图像块组,分割得到的图像[0083]然后将线性投影应用到这些图像块组来生成图像模态数据的tokens,称之为指经过线性投影得到的模板区图像tokens,Posix和Posiz分别指搜索区图像和模板区图像的位置编码,指添加了位置编码的搜索区图像toke[0133]再经过线性投影层得到D维的音频tokens,再添加可学习的位置嵌[0139]在一种实施方式中,步骤S4对提取出的图像tokens与音频tokens进行跨模态对[0141]通过最大化B个正对的余弦相似性,同时最小化B2_B个负对的余弦相似性来训练[0145]本实施方式把搜索区图像的tokens模板区图像的tokens和音频片段[0147]f=Linear(HY)[0149]fx表示经过线性投影得到的[0150]在将图像和音频的tokens输入编码器层之前,执行跨模[0160]将经过跨模态对齐的视觉模态中的搜索区域和模板区域的tokens进行融合,其得经过跨模态对齐和模态内对齐之后的图像[0169]最终将获得经过跨模态对齐和模态内对齐的图像的tokens(即交叉模态对齐后的层Transformer编码器进行联合处理,其中,每一层编码器包括多头自注意模块和前馈网[0175]将经过交叉模态对齐后的音频tokens分别注入到两个视觉tokens中,具体方法[0179]表示第0层编码器输入的搜索区图像tokens,表示第0层编码器输入的模板在于允许模型在多个注意力视角下对输入序列进行交互,捕捉输入序列中的不同特征关据被输入多头自注意模块和前馈网络模块之前都应用了层归一化(LayerNormalization)[0190]S6.1:利用分类分支将Transform有三个输出,分别是目标分类的得分图局部偏移量和归一化的边界框大小分类的损失用来增强模型区分对象与背景的能力,是对真实的目标中心使用高斯核生成的热力图,是真实的目标中心相应的低分[0200]边界框回归分支用于根据FCN全卷积网络的输出来预测对象的中心坐标偏移和对失,IoU表示的是真实目标框面积和预测目标框面积的交并比,U表示真实目标框面积和预测目标框面积的交集,Ac表示两个框的最小闭包区域面积。Areai表示第i帧预测框面积,[0209]L=λcrossLcross+λintraLintra+Lr[0224]图像tokens提取模块,用于从输入的搜索区图像和模板区图像中提取出图像[0226]交叉模态对齐模块,用于对提取出的图像tokens与音频tok征提取与融合模块采用图4中的Transfor[0230]由于本发明实施例二所介绍的装置为实施本发明实施例一中基于跨模态本发明实施例一中方法所采用的装置都属于本发明所欲保护[0233]由于本发明实施例三所介绍的计算机可读存储介质为实施本

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论