版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
基于Keypoint的CenterNet++目标检测网络分析概述目录TOC\o"1-3"\h\u18063基于Keypoint的CenterNet++目标检测网络分析概述 1220911.1网络结构 134851.2尺度自适应编码模块 2247801.3类别注意力模块 4137571.4损失函数 61.1网络结构CenterNet++整体结构如图2.1所示。在实验中,我们采用ResNet和DLANet作为骨架网络,用于特征的提取。将骨架网络提取的特征使用Up-Sampling模块放大到原图像尺度的1/4。Up-Sampling模块使用可变性卷积和转置卷积交替组成,在保留有效信息的同时放大特征图。放大后的特征图连接到三个检测头部,分别为分类预测头(Classpredictionhead)、宽高预测头(W&Hpredictionhead)和中心点偏移量预测头(Centeroffsetpredictionhead)。分类预测头用于确认目标的存在并通过通道ID确认目标分类,分类预测头中加入了类别注意力模块,用于挖掘类内和类间的相距较远但语义相关的目标之间的有效信息。宽高预测头用于中心点所代表的目标框的宽高。中心点偏移量预测头用于预测目标中心点在尺度自适应编码模块编码过程中存在的精度丢失的数值。分类预测头、宽高预测头和中心点偏移量预测头训练采用的监督信息均由尺度自适应编码模块对于真实目标框编码获得。图2.1CenterNet++网络结构图1.2尺度自适应编码模块CornerNet[37]提出将目标框的角点作为关键点进行预测,再构建角点匹配模块完成目标的预测。作者在heatmap特定分类通道上使用以角点为中心的未归一化圆形2D高斯核填充,设为1/3倍的半径,高斯核半径以确保高斯核半径范围内的一对点将生成一个与GT的IoU为的边界框对象为准则的大小来确定。CenterNet沿用了CornerNet的目标框编码方案,并设计了与之对应了宽高和中心点偏移量编码方法。然而,CenterNet[38]没有考虑到不同长宽比的情况下,直接采用圆形2D高斯核填充Heatmap,这就导致Heatmap对于目标尺度敏感性差,不利于网络的收敛。为了优化CenterNet的目标框编码方式,提高网络对于目标尺度的敏感性,我们设计了尺度自适应编码模块。CornerNet[37]、CenterNet[38]与本文设计的尺度自适应编码模块示意图如图2.2所示。图2.2CornerNet、CenterNet与我们设计的尺度自适应编码模块示意图数据输入到尺度自适应编码模块会编译出三个特征图,一个是类别heatmap图,一个尺度宽高图和一个中心点偏移量图,其中代表批量大小(batch-size),代表输出的步长,代表目标类个数,和分别代表图片的高和宽。对于每一个真实目标框的中心点,其类别为,计算其下采样倍后的等效值,将所有的目标通过高斯核的方式编码进Heatmap图中,特定类别占据特定通道。当两个或多个目标的中心点重合时,采用目标框面积最大的目标代表。对应位置的数值由2D高斯核确认,高斯核为 (2-1)其中是与IoU和目标框的宽相关的参数,为计算的椭圆横向轴的1/3,是与IoU和目标框的高相关的参数,为计算的椭圆纵向轴的1/3,该高斯核构成椭圆。以下将推导出、与IoU和目标框的高宽的计算公式:具体的IoU的计算公式为 (2-2)进一步推导出(2-3)由于,其中为高斯核横向轴的一半,为高斯核横向轴的一半,为矩形对角线与高斯核外圈交点到矩形中心的距离,进一步推出 (2-4)进而有 (2-5)由椭圆公式推得 (2-6) (2-7)由此获得与、目标框的长宽相关的高斯核参数,的计算方法。 ,(2-8)为了进一步适应不同尺度的目标框,根据目标框面积的大小自适应调整大小。 (2-9)其中为设定的IoU取值范围,为目标框的面积,为小目标框的面积阈值,为大目标框的面积阈值,将面积小于的目标框IoU统一设置成,面积大于的目标框IoU统一设置成,面积之间的目标框IoU设定为自适应值。为了进一步预测出输入图像中的尺度中心点精确位置,添加一个中心点偏移量图在坐标处分别填入真实目标框的中心点的损失浮点值,用于恢复由于下采样引起的中心点定位精度损失,所有类别共享同一个。使用代表类别为的目标框,尺度宽高图在坐标处分别填入真实目标框的宽和高的数值,不将尺度归一化。为减少计算量,我们使用一个的图来预测所有类别。1.3类别注意力模块为了充分挖掘类别之间和类别内部的高级语义关系,我们设计了类别注意力模块(ClassAttentionBlock,CAB),并切入到分类预测头中,类别注意力模块与其他注意力模块的对比如图2.3所示。图中(a)SEblock[14]关注通道间的注意力机制;(b)Non-localblock[76]用于捕获长程的依赖关系(c)Classattentionblock(CAB,ours)用于捕获类内和类间的依赖关系,构建类内和类间的注意力机制。等代表特征图尺度及其变化。各结构块含义参见图例。图2.3主要注意力模块结构图SENet[14]是ImageNet2017比赛的冠军,也是ImageNet的最后一届。SENet通过对卷积的特征图进行压缩(Squeeze)操作,得到特征图上通道级的全局特征,并对Channel全局特征进行激发(Excitation)操作,主动学习各个Channel间的语义关联,构建通道注意力机制,SENet的结构图如图2.(a)所示。Non-LocalNeuralNetwork[76]是第一篇用于将计算机视觉中经典的非局部均值方法和Transform工作中的注意力机制引入到目标检测任务的研究工作,用以捕获长距离语义依赖关系,建立图像中两个距离较远的像素间的依赖关系。然而Non-localblock的网络结构(图2.(b))结构不够精巧且参数量和计算量都非常庞大,在实际项目使用中无法直接使用。为了有效地挖掘类内和类间的语义关联,特别是相距较远的目标之间的语义关联,我们参考SENet[14]和Non-LocalNeuralNetwork[76]的设计思想,进一步简化Non-Local模块,构建类别注意力模块(CAM),类别注意力机制如图2.(c)所示。类别注意力机制先将分类预测头的输入通过卷积层转化为类别特征图,其中目标类别数,再通过卷积层将构建类内注意力图,经过Softmax层归一化,并与原特征图进行矩阵乘法,获得类间特征图,并通过Excitation操作,构建类间注意力机制,最后将类间注意力图通过广播逐元素加法叠加到原特征图中,完成类别注意力的提取。1.4损失函数在类别Heatmap图中,只将图中数值为1的位置认定为真样本,其他的都是负样本,这将会导致正样本和负样本极度不均衡,为平衡正负样本的数量分布不均衡的问题,采用何凯明等人提出的RetinaNet[36]中的focalloss来赋予不同样本不同的权重, (2-10)其中为分类预测头输出的对应位置的预测结果,在所有实验中,。为了更加准确地确定中心点位置和目标框,我们引入中心点偏移量损失 (2-11)所有的类别共享相同的偏移量预测,采用L1损失,只对目标中心点位置进行约束,忽略所有其他位置。为精确回归到目标的宽高,我们采用L1损
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025-2026年餐饮服务与管理实务操作模拟试题
- 2025-2026年福建省湘教版九年级化学第7课化学与环境保护测试题
- 食品加工防腐处理条例
- 某机械厂安全生产责任制度
- 医院工作总结范文2篇
- 改善医疗服务行动总结归纳
- 2026高中体育教资面试必刷题题库
- 2026下半年高中信息技术教资面试试讲题库及解析
- 湖北省自考13838交通规划高频考点重点
- DB3502∕Z 5036-2018 厦门市建筑起重机械防治台风灾害安全技术导则
- 2026-2027学年岭南版(新版)初中美术七年级上册教学计划及进度表(第一学期)
- 2026年六安霍邱县沣源水务有限责任公司公开招聘工作人员10名考试备考试题及答案详解
- (语文)2027版高中《晨读晚测小纸条》高三二轮复习(学生+教师版)
- 湖北省鄂州市鄂城区2025-2026学年七年级下学期期末质量监测语文试卷(含答案)
- 消防接警询问要素和规范用语
- 鸟粪石细菌矿化:原理、进展及资源环境领域的创新应用
- 焊接施工进度管控方案
- 人工智能训练师(三级高级工)国家职业技能考试题库(2026年版)
- 污水处理池模板工程专项施工方案
- 2026年一级建造师《建设工程经济》考前冲刺练习题库(完整版)附答案详解
- 节假日值班值守工作制度
评论
0/150
提交评论