【人体姿态估计研究现状的文献综述1800字】_第1页
【人体姿态估计研究现状的文献综述1800字】_第2页
【人体姿态估计研究现状的文献综述1800字】_第3页
【人体姿态估计研究现状的文献综述1800字】_第4页
【人体姿态估计研究现状的文献综述1800字】_第5页
已阅读5页,还剩1页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

35人体姿态估计研究现状的文献综述早期的人体姿态估计大多是基于图结构模型[1],以人体运动学和姿态学的理论约束和优化人体模型,采用如尺度不变特征描述子(SIFT)[2]和方向梯度直方图描述子(HOG)[3]等方法;这些方法存在着模型单一的问题,因此在较为复杂的环境下难以工作,对于复杂的人体动作的检测能力也较差。在2012年AlexNet[4]被提出并在当年的ImageNet竞赛上一举夺冠后,深度学习方法在姿态估计上的巨大潜力被发掘出来,由此开始,各种优秀的姿态估计网络结构不断被提出。1.1基于深度学习的单人姿态估计网络现代的姿态估计算法绝大多数都是基于热图检测的方法,先获取人体关节点热图,以像素值表示该关节点在此位置的概率,再获取关节点的位置信息。图1-1AlexNet网络结构[4]AlexKrizhevsky等人提出的AlexNet结构中的上下两部分对应两块GPU,分别由五个卷积池化层和两个全连接层组成,最后再由一个全连接层输出。AlexNet首次尝试使用了ReLu激活函数和GPU加速,为之后众多网络的提出奠定了基础,但它的结构和原理在现在看来已经过于落后,几乎没有应用的可能性。2014年,由牛津大学与DeepMind公司共同开发的VGGNet[5]对AlexNet中参数量巨大这一问题做出了优化,采用了3×3的卷积核的串联来替代AlexNet中的大卷积核,极大地减少了参数量。在这样的结构下,网络深度的提高不会过大的增加参数量,却可以带来很大的性能提升。然而,在网络深度增加到一定程度后,网络的收敛速度与准确度均会开始大幅下降。为了应对这一问题,何凯明于2015年提出ResNet[6]结构,通过引入shortcut(直连通路)的机制和残差学习来提高深度。图1-2普通网络结构(左)与Shortcut机制(右)引入Shortcut机制后,网络训练的目标由学习F(x)与x的潜在映射关系变为学习F(x)=H(x)-x→0的恒等映射,而对于冗余的模块,可以直接令F(x)等于0而变为直连通路使得性能不减。这一网络的提出解决了深层网络的训练问题。在上述的网络中,最终预测时仅使用了最后一级生成的特征图,由此可能造成一部分信息的丢失而降低精度。为了解决这一问题,AlejandroNewell等人提出了沙漏堆叠网络[7]。图1-3沙漏堆叠网络基本结构这是一种基于编码器和解码器的卷积网络结构,该网络首先将特征图逐步下采样到不同分辨率图像,再进行逐步的上采样,将同分辨率的图像相加。每个小方块中都是网络的卷积池化层,因此这一网络结构可以与之前的许多卷积层的优化方法相结合从而提升性能;将多个这样的沙漏模块进行堆叠,上一个的输出作为下一个的输入,并加入中继监督,可以很大地提升网络的性能。然而,沙漏堆叠网络中只有相邻分辨率的特征图间才能进行融合,并且不同层输出的尺度不同,最终还需要经过上采样来恢复分辨率;为了解决这一问题,孙可等人提出了以并联而非串联的方法来进行各分辨率间连接的HRNet[8],结构如图1-4所示。图1-4HRNet基本结构[8]这一结构是典型的以复杂度换取精度的网络结构。图中每一个特征图均需要占用存储空间,层间的交互全部都要经过上采样或下采样来进行,因此,这一模型的参数量和计算量都非常的大,不太适合移动端的应用。1.2基于深度学习的多人姿态估计网络一般的多人姿态估计方法大致分为自顶至下和自底至上两类。采用自顶至下方法[9]的网络先对图像中的人进行分割,再对每个人分别进行单人姿态估计。这类方法本质上将多人姿态估计分为了目标识别、图像分割和单人姿态估计三个步骤。即先将图片或视频中的每个人分辨出来并分割成单独的图像,再输入到单人姿态识别网络中,最后将结果映射到原图片的对应位置输出。这类方法精度相对较高,但速度较慢。采用自底至上方法[10]的网络先找出所有关键点,再区分各个关键点分别属于哪个人。主要思路为得到关键点的位置分布后,通过数学方法计算得到各点间的连接方案。目前最好的方法是一种双分支结构,一个分支输出部位置信度图(PCM),另一个输出部位亲和域场(PAFs),然后在PAFs的帮助下将PCM中的关键点连接起来。这类方法在精度上与自顶至下方法有较大差距,但速度上领先很多。参考文献[1]王国桢,方贤勇.基于图模型的姿态分割估计方法[J].计算机技术与发展,2016,26(12):53-57.[2]LowDG.DistinctiveImageFeaturesfromScale-InvariantKeypoints[J].InternationalJournalofComputerVision,2004,60(2),91-110.[3]DalalN,TriggsB.Histogramsoforientedgradientsforhumandetection[C].ComputerVisionandPatternRecognition,2005.CVPR2005.IEEEComputerSocietyConferenceon.IEEE,2005,1:886-893.[4]KrizhevskyA,SutskeverI,HintonG.ImageNetClassificationwithDeepConvolutionalNeuralNetworks[J].Advancesinneuralinformationprocessingsystems,2012,25(2).[5]SimonyanK,ZissermanA.VeryDeepConvolutionalNetworksforLarge-ScaleImageRecognition[J].arXivpreprintarXiv:1409.1556,2014.[6]K.He,X.Zhang,S.RenandJ.Sun.DeepResidualLearningforImageRecognition[C].IEEEConferenceonComputerVision&PatternRecognition.IEEEComputerSociety,2016.[7]NewellA,YangK,JiaD.StackedHourglassNetworksforHumanPoseEstimation[C].EuropeanConferenceonComputerVision.SpringerInternationalPublishing,2016.[8]孙可.人体姿态估计的深度网络结构研究[D].中国科学技术大学,2020.[9]WeiSE,RamakrishnaV,KanadeT,etal.ConvolutionalPoseMachines[J].IEEE,2016.[10]ZheC,SimonT,WeiSE,etal.RealtimeMulti-person2DPoseEstimationUsingPartAffinityFields[C].2017IEEEConferenceonComputerVisionandPatternRecognition(CVPR).IEEE,2017.[11]LecunY,BottouL.Gradient-basedlearningappliedtodocumentrecognition[J].3ProceedingsoftheIEEE,1998,86(11):2278-2324.[12]LinM,ChenQ,YanS.NetworkInNetwork[J].ComputerScience,2013.[13]SandlerM,HowardA,ZhuM,etal.MobileNetV2:InvertedResidualsandLinearBottlenecks[C].2018IEEE/CVFConferenceonComputerVisionandPatternRecognition(CVPR).IEEE,2018.[14]MaN,ZhangX,ZhengHT,etal.ShuffleNetV2:PracticalGuidelinesforEfficientCNNArchitectureDesign[C].EuropeanConferenceonComputerVision.Springer,C

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论