CN119478349A 一种基于多尺度自注意力运动背景建模的红外小目标检测方法 (哈尔滨工业大学)_第1页
CN119478349A 一种基于多尺度自注意力运动背景建模的红外小目标检测方法 (哈尔滨工业大学)_第2页
CN119478349A 一种基于多尺度自注意力运动背景建模的红外小目标检测方法 (哈尔滨工业大学)_第3页
CN119478349A 一种基于多尺度自注意力运动背景建模的红外小目标检测方法 (哈尔滨工业大学)_第4页
CN119478349A 一种基于多尺度自注意力运动背景建模的红外小目标检测方法 (哈尔滨工业大学)_第5页
已阅读5页,还剩15页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于多尺度自注意力运动背景建模的本发明公开了一种基于多尺度自注意力运对网络多尺度全局特征进行充分挖掘以建模时尺度自注意力解码网络能够增强解码过程中查2步骤2:构建一个由尺度内编码器、尺度间编码器和FPN解算利用目标查询和输入特征计算出用于红外小目标检2.根据权利要求1所述的基于多尺度自注意力运动背景建模的红外小目标检测方法,首先,采用VideoSwinTransformer作为backbone提取输像的高度和宽度,随后将其按照2x4x4x3的尺度划分为T/2xH/4xW/4个patches,每个xW/32x4C和TxH/32xW/32x4C,输出的各级特征将作为多尺度自注意力网络的输入。3.根据权利要求2所述的基于多尺度自注意力运动背景建模的红外小目标检测方法,3nn对尺度内编码器输出的特征FT,计算相邻尺度的注意力,由粗到细地计算包含更多语义信息的深层特征与包含丰富细节信息的浅层特征之间的注意力权重,并对浅层特终输出的特征将作为多尺度自注意力解码网络的输入以实现红外小目4.根据权利要求1所述的基于多尺度自注意力运动背景建模的红外小目标检测方法,按照传统的Transformer编码器查询设计思路构建随机初始化的原始查询计算如下:pp4式中pN-n+1表示特征的位置编码,由1xC维度的可学习尺度位置编码对于原始查询和分组查询经过查询迭代操作后生成最终的原始目标查询和将最底层特征与和分别计算得到注意力图和计算过程如下:式中E为注意力的头数,和为和对应的学习权重,是对应的学习权目标检测的特征p"-CUF,)以及5涉及一种基于多尺度自注意力运动背景建模[0007]步骤1:对于输入的多帧红外序列图像,按照规定的尺度划分为patch并执行scaleencoder)和FeaturePyramidNetwork(FPN)三个部分组成的多尺度自注意力编码网计算全局注意力权重并生成全局特征,Cross_scaleencoder利用相邻尺度的特征由粗到6特征解算利用目标查询和输入特征计算出用于红[0010]步骤4:利用由四层3D卷积组成的检测头(Detectionhead)接收用于执行红外小[0012](1)提出了一个适用于提取输入序列图像全局多尺度特征的多尺度自注意力编码[0013](2)提出了一个适用于红外小目标检测任务的多尺度自注意力解码网络。该网络首先利用输入特征加权随机初始化的查询以增加目标查询对于运动目标和背景的适应性,[0014]图1为基于多尺度自注意力运动背景建模的红外小目标检测方法的整体架构示意[0019]步骤1:对于输入的多帧红外序列图像,按照规定的尺度划分为patch并执行7[0020]首先,采用VideoSwinTransformer作为backbone提取输入序列图像的时空特表示图像的高度和宽度,随后将其按照2×4×4×3的尺度划分为T/2×H/4×W/4个非重叠窗口和平移窗口划分patches以减少Transformer计算的复杂度并且提取图像序列scaleencoder)和FeaturePyramidNetwork(FPN)三个部分组成的多尺度自注意力编码网计算全局注意力权重并生成全局特征,Cross_scaleencoder利用相邻尺度的特征由粗到[0028]对于骨干网络提取的多层特征中的第n层特征Fn,计算对应的位置编码的结果pneRB(,Hn和Wn表示尺度n的高度和宽度,N为尺度的数量,多语义信息的深层特征与包含丰富细节信息的浅层特征之间的注意力权重,并对浅8尺度特征完成计算后,得到尺度间编码器的输出特征对其执行重排操[0036]利用FPN将丰富的语义信息逐步传递至浅层特征,从而增强浅层特征中的全局信询的基础之上引入分组查询即使用的全局特征计算原始查询的分组权重计算得到[0040]按照传统的Transformer编码器查询设计思路构建随机初始化的原始查询[0042]式中表示第j组分组卷积的权值,为Qi,eR"[0043]由于FF中的最浅层特征包含最丰富的细粒度的信pp[0046]单纯使用进行训练会增加训练的难度,因此本发明将和共同作为多尺度9[0052]式中pN-n+1表示特征的位置编码,由1×C维度的可学习尺度位置编码-m复制T×HN-n+1×WN-n+1次得到,可以使得尺度相关信息被嵌入交叉注意力中。经过N(N[0053]对于原始查询和分组查询经过查询迭代操作后生成最终的原始目标查询f与i和分别计算得到注意力图和f,这样可以允许模型根据输入特征f[0059]步骤4:利用由四层3D卷积组成的检测头(Detectionhead)接收用于执行红外小[0060]在得到用于红外小目标检测的特征p"-caf,f)以及后,通过检[0063]式中Dh为detectionhead,Gm为目标掩码真值,FL为focalloss,DICE为dice10_7。每帧图像使用5个查询,批次大小设置为1。网络使用PyTorch实现,并在Nvidia[0068]图3给出了多种算法在TSIRMT数据集和NUDT_MIRSDT数据集不同场景下的检

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论