CN119478442A 一种改进的YOLOv7人体关键点检测方法 (华南农业大学)_第1页
CN119478442A 一种改进的YOLOv7人体关键点检测方法 (华南农业大学)_第2页
CN119478442A 一种改进的YOLOv7人体关键点检测方法 (华南农业大学)_第3页
CN119478442A 一种改进的YOLOv7人体关键点检测方法 (华南农业大学)_第4页
CN119478442A 一种改进的YOLOv7人体关键点检测方法 (华南农业大学)_第5页
已阅读5页,还剩24页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本发明公开一种改进的YOLOv7人体关键点替换为L_MP模块改进特征提取,新增LiftDown提升了网络对小目标的检测能力;增加改进的RSwinTransformer编码器,用于提升对复杂场参照Wise_IoULOSS改为基于L2损失的改进关键于体育运动中人体关键点检测识别与计数任务21.一种改进的YOLOv7人体关键点检测方法,其特征在于构建改进的YOLOv7网络结构,间增加EDH_Conv模块,并将改进的RSwinTransformer编码器引入到YOLOv7的第三个和第进的L_MP模块替换YOLOv7原有MP模块以提升特征提取;(5)在YOLOv7网络的Backbone模块标注,是指通过OpenCV库调整输入图像的大小统一为608x608,使用Ope聚焦机制用于关键点的误差权重分配,并增加几何约束以确保关键点之间的合理位置关的新模块;所述的新增一个包含LiftDownPool模块的分支是指由LiftDownPool模块和1x1卷积模块串联而成的分支;所述的将LiftDownPool模块和Maxpool模块的输出通过跳跃连接方式输出到后续模块是指将LiftDownPool模块的结果通过跳跃连接的方式输入到catC模块,所述的catC模块是指第一分支的LiftDownPool模块和1x1卷积模块进行串catB模块是指第二分支的Maxpool模块和第二分支的1x1卷积模块进行串联后与第三分支中的四个1x1卷积模块串联后通过cat的方式汇总所得;跳跃连接方式允许输入特征直的三分支的结果通过cat方式进行汇总是指将上述包含第一分支结果的catC模块与包含积模块与一个3x3卷积模块串联修改为四个1x1卷积模块串联,减少了每层的参数量,从的中与主干网络有连接关系的两个CBS模块的输出和主干网络中的ELAN模块的输出作为3x3的转置卷积组成;第二分支由一个1x1卷积、一个3x3的卷积和一个膨胀率为3的3x3个膨胀率为1的3x3的卷积;将上述三分支得到的特征图串联汇x1的卷积,得到最终特征图的输出;EDH_Conv模块改进了YOLOv7网络对小目标的检测能改进的RSwinTransformer编码器,是指在YOLOv7的第三个和第四个CBS模块之间新增RSwinTransformer模块;所述的RSwinTransformer模块是指将YOLOv7网络中的CBS模块RSwinTransformerBlock模块;所述的RSwinTransformerBlock模块,是指将SwinTranformerBlock中的多层感知机MLP替换为基于残差的Res_MLP,该Res_MLP包括两层全练效率;将上述四个并联stage模块的特征图汇总进行Concat得到一个完整的特征图;RSwinTransformer模块改进了TOLOv7网络的多尺度特征提取能力,改善了对长距离依赖4[0002]人体关键点检测识别是计算机视觉领域中的一个重要的研究方向,在体育领域广泛应用到人体关键点检测识别领域,极大提高了人体关键点检测识别的的准确度和效[0004]对于目标检测,ZENG等人(ZENGLM,HOUJ,CHENZR,etal.Lightweighttrafficsigndetectionnetworkbasedonweaksemanticsegmentation[J].Computer样,Zhao等人(ZhaoJ,SnoekCGM.Liftpool:Bidirectionalconvnetpooling[J]任务。对于视觉变压器方面,Liu等人(LiuZ,LinY,CaoY,etal.Swintransformer:Hierarchicalvisiontransformerusingshiftedwindows[C]//ProceedingsoftheIEEE/CVFinternationalconferenceoncomputervision.2021:10012_10022.)提出改数方面,Tong等人(TongZ,ChenY,XuZ,etal.Wise_IoU:bound5withdynamicfocusingmechanism[J].arXivpreprintarXiv:2301.10051,2023.)提出一种基于IoU的动态非单调FM的损失方法,并根据梯度增益分配策略来降低高质量锚盒的将YOLOv7的原有MP模块替换为改进的L_MP模块,所述的改进L_MP模块是指在MP模块基础第三分支的卷积方式而得到的新模块;所述的新增一个包含LiftDownPool模块的分支是Maxpool模块的输出通过跳跃连接方式输出到后续模块是指将LiftDownPool模块的结果通过跳跃连接的方式输入到catC模块,所述的catC模块是指第一分支的LiftDownPool模块和1×1卷积模块进行串联所得的模块;同时将Maxpool模块的结果通过跳跃连接的方式输入到catB模块,所述的catB模块是指第二分支的Maxpool模块和第二分支的1×1卷积模块进行串联后与第三分支中的四个1×1卷积模块串联后通过cat的方式汇总所得;跳6免梯度消失和特征衰减;所述的三分支的结果通过cat方式进行汇总是指将上述包含第一分支结果的catC模块与包含第二分支、第三分支结果的catB模块通过cat方式串联汇总第三分支中原有的一个1×1卷积模块与一个3×3卷积模块串联修改为四个1×1卷积模块块,是指在YOLOv7网络的Backbone模块和Head模块之间新增EDH_Conv模块;所述的EDH_Conv模块是指将YOLOv7网络的中与主干网络有连接关系的两个CBS模块的输出和主干网络包括一个1×1的卷积和一个膨胀率为1的3×3的卷积;将上述三分支得到的特征图串联汇总经过一个Concat和一个1×1的卷积,得到最终特征图的输出;EDH_Conv模块改进了指在YOLOv7的第三个和第四个CBS模块之间新增RSwinTransformer模块;所述的RSwinTransformer模块是指将YOLOv7网络中的CBS模块的输出作为RSwinTransformer模块的输反卷积Deconv模块上采样以提取更准确的特征;所述的stage模块是指由conv层和RSwinRSwinTransformer模块改进了YOLOv7网络的多尺度特征提取能力,改善了对长距离依赖7为一张图像,通过随机改变图像中的RGB通道值,并调整亮度来模拟不同光照条件下的变[0036]用改进的L_MP模块替换YOLOv7原有MP模块以提升特征提取能力:为了解决原始的基础上,增加了一个包含LiftDownPool模块的新分支,并通过跳跃连接将LiftDown[0040]关于LiftDownPool,以一维信号为例,LiftDownPool对给定信号x=[x1,x2,[0042]其中F(-)=funaatofmedinofspnt(-)(这里"0"表示函数组合运算符),包括三个8[0044]预测功能按公式(2)利用偶数索引信号xe来预测奇数索引的问题,显著提高关键点检测的准确性,减少计算量并加速推理过程,在可视化方面,LiftDownPool在特征图上的表现优于MaxPool,LiftDownPool不仅保留了更丰富的结构行压缩或转换,以减小特征维度并优化计算效率;catC模块通过跳跃连接将LiftDownPool模块的结果直接传递到后续层,确保特征图的低级信息保留并顺利传递;最终,特征信息衰减,确保低级特征在后续层中仍具有影响力,catC模块是一个融合LiftDown姿态变化的敏感性和对关键特征的保留能力,catB模块中的第二分支包含Maxpool模块,[0052]将catC模块与catB模块一起运用并最终融合输出,可以实现特征多样性增强、9细节和全局信息的全面整合以及更高的检测精度与稳定性,catC模块专注于细节特征的C和catB的联合使用通过1×1卷积的优化减少了整体计算负担,catC保留了低级特征,[0057]第一分支(LiftDownPool分支):包含LiftDownPool模块和1×1卷积模块串LiftDownPool操作可以保留仰卧起坐图像中的关键细节特征,例如头部与肩部之间的细于提取相对较大范围的动作结构特征,如仰卧起坐过程中的躯干和腿部运动轨迹,设conv(·),则第三分支输出按公式(6)计算。[0069]catC模块和catB模块的输出通过cat操作进行最终汇总,生成L_MP模块的融合关键点检测模块中的作用,使得最终输出的关键点Pkeypoints在实时仰卧起坐检测中能够兼行分支分别为一个包括一个步长为2的3×3的卷积和一个步长为2的3×3的转置卷积组成分支及一个包括一个1×1的卷积和一个膨胀率为1的3×3的卷积的第三分支。第一分支使[0078]EDH_Conv模块的输入I经过第二分支后得到O2,设第二分支中1×1卷积的操作函[0080]EDH_Conv模块的输入I经过第三分支后得到O3,设第三分支中1×1卷积的操作函[0082]最后将上述三个分支的输出O1、O2、O3作为输入经过一个Concat和一个1×1的卷度,将落在标注框边界上的像素值设置为255,将生成的像素值图映射到与YOLOv7网络的鲁棒性;其中,RSwinTransformer由ConvolutionalTokenEmbeeding、Conv、RSwin_[0089]在原始YOLOv7网络的主干网络中的第三个和第四个CBS模块之间新增RSwin和全局的特征表示。在完成各自的特征提取后,通过Concat层将四个stage的输出进行拼成后,利用Deconv模块对特征图进行3次上采样处理,每次上采样使特征图长宽均增大一卷积的参数来灵活地控制token特征维度和数量,在减少token序列长度的同时能够增加多头自注意力(SW_MSA)层、残差多层感知器(Res_MLP)层和层归一化(LN)等计算单元通过Transformation)之间添加一个输入张量作为identity的分支,并在第二次Dropout层与[0097]将损失函数由Wise_IoULOSS换为基于L2损失的改进关键点检测损失,动态权重pr-ll2(18)[0115](1)本发明中将原有YOLOv7网络中的MP模块替换为改进的L_MP模块,相较于传统[0116](2)本发明在原有的YOLOv7网络的基础上,再在YOLOv7网络的Backbone模块和Head模块之间新增EDH_Conv模块,即Encoder_Decoder_HoleConvolutional模块,EDH_括一个1×1的卷积和一个膨胀率为1的3×3的卷积,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论