版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
基于MaskR-CNN的瑜伽动作识别ThesisforMaster’sdegree,ShanxiUniversity,2020YogaPosesRecognitionBasedonMaskR-CNNStudentNameFenWangSupervisorLecturerHao-xuanLiMajorElectronicandCommunication EngineeringSpecialtyArtificialintelligenceandBigDataDepartmentSchoolofPhysicsand ElectronicEngineeringResearchDuration2017.09-2020.06June,2020
目录中文摘要 [73]进行标注制作的数据集。VGGImageAnnotator(VIA)标注工具是一款基于HTML,Javascript和CSS(不依赖外部库)的开源项目,用于图像、音频和视频的手动标注,由VisualGeometryGroup开发。VIA是单个独立的HTML页面,可以在大多数Web浏览器中作为脱机应用程序运行,不需要任何安装或设置可以在线和离线使用,该页面的大小小于400KB。既可用于学术项目,也可用于商业应用。标注完成后,可以导出为csv和json文件格式。图4.SEQ图4.\*ARABIC8标注图片示例使用VIA应用程序标注图片,执行步骤如下:(1)准备所需的样本图像;(2)打开VIA应用程序,并定义区域属性;(3)选择区域形状为多边形,标注目标名称与区域;(4)保存工程文件,导出json标注数据文件。将数据样例展示如下,图中为部分瑜伽动作图片展示,包括图片尺寸、掩膜图形、姿势名称等信息。图4.SEQ图4.\*ARABIC9数据样例展示将图像输入至网络中时需要进行图像尺寸调整,为了支持不同尺寸的图像检测,将图像调整为统一尺寸(1024×1024),保留图像长宽比例。如果图像不是正方形,则在顶部底部或右侧左侧添加零填充。图4.SEQ图4.\*ARABIC10零填充后的图片由于训练所需数据集中包括掩膜数据,使用分辨率较高的图像进行训练时,图像二进制掩码会非常大大,因此使用低分辨率掩膜进行网络训练。例如,使用1024×1024图像进行训练,则单个实例的掩码需要1MB的内存。如果一个图像有100个图像,那么仅掩膜所需的内存为100MB。为了提高训练速度,我们通过以下方法优化掩膜:存储目标边界框内的蒙版像素,而不是完整图像的蒙版。与图像尺寸相比,大多数目标较小,在目标周围存在很多数值为0的数据,因此通过丢弃这些数据来节省空间。将掩膜调整为较小的尺寸(56×56)。对于大于这个尺寸的目标,会造成准确性偏低。由于大多数目标标注在起初的标注过程中都会存在一定误差,因此对于大多数实际目标而言,这种损失可以忽略不计。图片可以看出,掩膜出现了锯齿状边缘。在训练中使用低分辨率掩膜,可以有效减少内存的占用。图4.SEQ图4.\*ARABIC11低分率掩膜图片锚点的顺序很重要,需要保证在训练和预测阶段使用相同的顺序,并且匹配卷积执行的顺序。对于FPN网络,必须对锚进行排序,以使其易于将锚与预测锚得分和位移的卷积层的输出进行匹配。首先按金字塔等级排序。第一级的所有锚点,然后是所有第二级,依此类推。这样可以更容易地按级别分离锚点。在每个级别内,按特征图处理顺序对锚点进行排序。通常,卷积层处理从左上开始并逐行右移的特征图。REF_Ref35094815\h图4.12展示了图片中心生成的锚点。图4.SEQ图4.\*ARABIC12图像中的锚点REF_Ref35095183\h表4.1展示了各个级别对应的锚点数量与特征图尺寸。表4.SEQ表4.\*ARABIC1各级别锚点数量与特征图尺寸等级锚点特征图尺寸0196608[256256]149152[128128]212288[6464]33072[3232]4768[1616]实验结果与分析TC"4.5Experimentalresultsandanalysis"\l2实验使用不同深度的主干网络训练数据集,REF_Ref35095210\h表4.2中展示了不同深度的残差网络作为主干网络时,各自的检测结果。较浅的网络相对来说计算负荷小,网络加深,可以改善检测结果,同时检测精度能够有效提高。表4.SEQ表4.\*ARABIC2网络检测分割精度主干网络深度APMIOU5055.165.910158.469.5特征提取主干网络选取50层的网络深度,在由RPN提出的候选区域ROI上进行特征图映射的量化操作。相同网络深度下,实验对比了ROIPooling与ROIAlign对兴趣区域的处理效果。通过REF_Ref35095396\h表4.3可以得出,取消量化操作,以及映射过程中与输入数据进行对齐操作,能够提高网络检测精度。表4.SEQ表4.\*ARABIC3实例分割性能主干网络深度APROIPoolingROIAlign47.850.1网络中的掩膜分割分支中,使用更加轻量级的深度可分离网络,加快了网络的速度,提高准确率。利用本文设计的改进MaskR-CNN网络进行瑜伽动作识别实验。在试验过程中,将测试图像输入至训练好的网络中,执行预测计算,并对网络输出的图像识别结果进行对比。如REF_Ref35095529\h图4.13,图中不同颜色的边界框表示检测出的目标,矩形框体中的掩码部分表示预测分割出的动作区域。可以得出,网络预测结果能够保证一个边界框中只有一个目标,检测具有可靠性。改进的网络具有更强的学习能力,可以更准确分割目标区域,提高分割精度,更好地拟合预测分割边缘与目标边缘。a)改进前测试结果b)改进后测试结果图4.SEQ图4.\*ARABIC13实验结果示例本章小结TC"4.6Chaptersummary"\l2本章构建了数据集并在此基础上进行了实验验证改进MaskR-CNN网络的有效性和可靠性。此模型使用改进的深度残差网络作为主干网络来进行特征提取,通过RPN网络生成候选区域,并输入至ROIAlign选取ROI,使用全连接层实现目标检测,使用改进的卷积网络实现分割。实验验证表明,通过主干网络的改进,ROIAlign处理候选区域以及深度可分离卷积在掩膜分支中的应用,在保证网络可靠性的同时能够提高网络的检测精度。第五章总结与展望
总结与展望TC"Chapter5Summaryandoutlook"\l1工作总结TC"5.1Worksummary"\l2本文对瑜伽动作识别、目标检测和实例分割的研究背景和意义进行了总结与说明,研究了目前的研究现状以及存在的问题。介绍了本文的算法所用到的卷积神经网络的基础结构,以及在网络训练过程中防止过拟合与优化训练的基本技术。目标检测增加一项语义分割的任务即为实例分割,任务的增加对网络提出了更高的要求。本文基于卷积神经网络的理论基础,结合当前的相关网络,提出了基于改进深度残差网络的识别检测网络,并结合识别检测网络提出了优化分割图像的网络,实现了瑜伽动作识别与检测分割与候选区域处理网络。研究工作与成果具体如下:(1)研究现有常用的主干提取网络,基于神经网络随着深度加深容易产生梯度弥散的问题,使用残差网络进行人脸目标关键点检测。相对于传统的卷积神经网络,残差网络增加了快捷连接,并对残差块添加批归一化层来改进,通过残差块的叠加构成了改进深度残差网络。改进深度残差网络在多次训练后能够达到更小的平均误差,具有较高的检测精度。(2)瑜伽动作识别网络基于MaskR-CNN,使用改进深度残差网络的主干结构实现目标检测的特征提取,使用改进的分割分支网络进一步完成掩膜分割任务。利用金字塔特征网络融合上下文特征,对多样化尺度下的特征图像进行学习。利用区域候选网络生成候选窗口并筛选与排序,接着进行检测与分割,实现了对图像的检测与分割一体化处理。工作展望TC"5.2Workoutlook"\l2本文研究了瑜伽动作的图像检测与分割领域的现状及问题,设计了目标检测与分割网络,并进行实验验证。目前相关领域依然面临许多问题,需要广大研究者的不断探索与辛勤工作。在本文实验过程中也发现了一些问题,还存在几点今后可以改进的方向:(1)掩膜数据使用自己人工标注的数据集,效率较低,数据集标注图片数量不足。在后续研究中补充数据集或者使用应用更为广泛的数据集,以便加强网络的训练,提高网络性能。(2)网络在训练过程中下降速度慢,可能出现网络权重参数未能找到全局最优解。可以在以后研究更多的参数优化方法,优化网络训练。(3)为了提高网络学习特征的能力,本文采用深度残差网络。层数的加深是的网络的复杂性与计算难度被增加。因此今后研究应对特征提取模块进行优化,用更简洁的模型实现更充分的特征提取。(4)当前MaskR-CNN网络的应用主要集中于二维图像,在复杂环境下,目标的三维特征能够补充平面图像特征。后续研究要结合三维技术探索物体检测,以便实现高效的识别检测。参考文献基于MaskR-CNN的瑜伽动作识别
参考文献TC"References"\l1YongRuiandThomasS.Huang.ImageRetrieval:CurrentTechniques,PromisingDirections,andOpenIssues[J].JournalofVisualCommunicationandImageRepresentation,1999,(10):39-62MoeslundTB,GranumE.Asurveyofcomputervision-basedhumanmotioncapture[J].Computervisionandimageunderstanding,2001,8l(3):231-268.钱堃,马旭东,戴先中.基于抽象隐马尔科夫模型的运动行为识别方法[J].模式识别与人工智能.2009,(3):433-439ChenHT,HeYZ,HsuCC,etal.YogaPostureRecognitionforSelf-training[C]//InternationalConferenceonMultimediaModeling.Springer,Cham,2014.张梦营.基于Kinect的电子瑜伽教学系统的研究与实现[D].黑龙江大学,2017.CarlssonS,SullivanJ.Actionrecognitionbyshapematchingtokeyframes[C].WorkshoponModelsversusExemplarsinComputerVision.2001,1:18.WangW,YaoM.Intelligenttransportationmonitoringsystembasedoncomputervision[J].JournalofZhejiangUniversityofTechnology,2010,5-023.JoyA,JayanthiV,BaskarD.Automaticobjectdetectionincar-drivingsequenceusingneuralnetworkandopticalflowanalysis[C],2014IEEEInternationalConferenceon.IEEE,2014,1-4.GuoG,LaiA.Asurveyonstillimagebasedhumanactionrecognition[J].PatternRecognition,2014,47(10):3343-3361.ZouZ,ShiZ,GuoY,etal.ObjectDetectionin20Years:ASurvey[J].2019.SakaiT,NagaoM,FujibayashiS.Lineextractionandpatterndetectioninaphotograph[J].PatternRecognition,1969,1(3):233-248.WojekC,DollarP,SchieleB,etal.PedestrianDetection:AnEvaluationoftheStateoftheArt[J].IEEETransactionsonPatternAnalysisandMachineIntelligence,2012,34(4):743-761.BourdevL,MalikJ.Poselets:Bodypartdetectorstrainedusing3Dhumanposeannotations[C]//IEEE,InternationalConferenceonComputerVision.IEEE,2009,1365-1372.余凯,贾磊,陈雨强,等.深度学习的昨天,今天和明天[J].计算机研究与发展,2013,50(9):1799-1804.BengioY,DelalleauO.Ontheexpressivepowerofdeeparchitectures[C].AlgorithmicLeamingTheory.SpringerBerlinHeidelberg,2011:18-36.DalalN,TriggsB.HistogramsofOrientedGradientsforHumanDetection[C]//ComputerVisionandPatternRecognition,2005.CVPR2005.IEEEComputerSocietyConferenceon.IEEE,2005,886-893.LecunY,BoserB,DenkerJS,etal.Backpropagationappliedtohandwrittenzipcoderecgonition[J].NeuralComputation.2014,1(4):541-551.ViolaP,JonesM.Rapidobjectdetectionusingaboostedcascadeofsimplefeatures[C]//ComputerVisionandPatternRecognition,2001.CVPR2001.Proceedingsofthe2001IEEEComputerSocietyConferenceon.IEEE,2001,1:I-I.RedmonJ,DivvalaS,GirshickR,etal.Youonlylookonce:Unified,real-timeobjectdetection[C]//ProceedingsoftheIEEEConferenceonComputerVisionandPatternRecognition,2016,779-788.LiuW,AnguelovD,ErhanD,etal.SSD:Singleshotmultiboxdetector[C]//EuropeanConferenceonComputerVision.Springer,Cham,2016,21-37.Objectrecognitionfromlocalscale-invariantfeatures[C]//ComputerVision,1999.TheProceedingsoftheSeventhIEEEInternationalConferenceon.IEEE,1999,1150-1157.SchapireR.ABriefIntroductiontoBoosting[C]//SixteenthInternationalJointConferenceonArtificialIntelligence,1999,1401-1406.FreundY,SchapireR.Adecision-theoreticgeneralizationofon-linelearningandanapplicationtoboosting[C]//EuropeanConferenceonComputationalLearningTheory,1995,23-37.GirshickR,DonahueJ,DarrellT,etal.Richfeaturehierarchiesforaccurateobjectdetectionandsemanticsegmentation[C]//ProceedingsoftheIEEEConferenceonComputerVisionandPatternRecognition,2014,580-587.HeK,ZhangX,RenS,etal.Spatialpyramidpoolingindeepconvolutionalnetworksforvisualrecognition[C]//EuropeanConferenceonComputerVision.Springer,Cham,2014,346-361.GirshickR.FastR-CNN[C]//IEEEInternationalConferenceonComputerVision.IEEEComputerSociety,2015,1440-1448.RenS,HeK,GirshickR,etal.Fasterr-cnn:Towardsreal-timeobjectdetectionwithregionproposalnetworks[C]//AdvancesinNeuralInformationProcessingSystems,2015,91-99.XiaolongL,ZhidongD,YuhanY.Recentprogressinsemanticimagesegmentation[J].ArtificialIntelligenceReview,2018.PinheiroPO,CollobertR,DollarP.LearningtoSegmentObjectCandidates[J].2015.DaiJ,HeK,SunJ.Instance-awareSemanticSegmentationviaMulti-taskNetworkCascades[J].2015.HeK,GkioxariG,DollarP,etal.MaskR-CNN.[J].IEEETransactionsonPatternAnalysis&MachineIntelligence,2017,PP(99):1-1.JRedmon,AFarhandi.YOLO9009:better,faster,stronger[J].ComputerVisionandPatternRecognition(CVPR),2017:6517-6525.张铮,王艳平,薛桂香.数字图像处理与机器视觉[J].2010.谢宝剑.基于卷积神经网络的图像分类方法研究[D].合肥工业大学,2015.何鹏程.改进的卷积神经网络模型及其应用研究[D].大连理工大学,2015.黄咨.基于卷积神经网络的目标检测模型的研究[D].王雪光,郭艳兵,齐占庆.激活函数对BP网络性能的影响及其仿真研究[J].自动化技术与应用,2002(04):15-17.蒋昂波,王维维.ReLU激活函数优化研究[J].传感器与微系统,2018.JangE,GuS,PooleB.CategoricalReparameterizationwithGumbel-Softmax[J].2016.向陶然,叶笑春,李文明,etal.基于细粒度数据流架构的稀疏神经网络全连接层加速[J].计算机研究与发展,2019,56(6):1192-1204.KollerO,NeyH,BowdenR.DeepHand:HowtoTrainaCNNon1MillionHandImagesWhenYourDataisContinuousandWeaklyLabelled[C]//2016.VovkV.Thefundamentalnatureoftheloglossfunction[M]//FieldsofLogicandComputationII.2015.BottouL.(2012)StochasticGradientDescentTricks.In:MontavonG.,OrrG.B.,MüllerKR.(eds)NeuralNetworks:TricksoftheTrade.LectureNotesinComputerScience,vol7700.Springer,Berlin,HeidelbergLecunY,BottouL,BengioY,etal.Gradient-basedlearningappliedtodocumentrecognition[J].ProceedingsoftheIEEE,1998,86(11):2278-2324.Xiao-HuYu,Guo-AnChen,Shi-XinCheng.Dynamiclearningrateoptimizationofthebackpropagationalgorithm[J].IEEETransactionsonNeuralNetworks,1995,6(3):669-677.Yin,Zhijian,Wan,Boyang,Yuan,Feiniu,etal.ADeepNormalizationandConvolutionalNeuralNetworkforImageSmokeDetection[J].IEEEAccess,5:18429-18438.IoffeS,SzegedyC.BatchNormalization:AcceleratingDeepNetworkTrainingbyReducingInternalCovariateShift[J].2015.KrizhevskyA,SutskeverI,HintonG.ImageNetClassificationwithDeepConvolutionalNeuralNetworks[C]//NIPS.CurranAssociatesInc.2012.HanX,ZhongY,CaoL,etal.Pre-TrainedAlexNetArchitecturewithPyramidPoolingandSupervisionforHighSpatialResolutionRemoteSensingImageSceneClassification[J].RemoteSensing,2017,9(8):848.NitishSrivastava,GeoffreyHinton,AlexKrizhevsky,etal.Dropout:ASimpleWaytoPreventNeuralNetworksfromOverfitting[J].JournalofMachineLearningResearch15(2014)1929-1958ZeilerMD,FergusR.VisualizingandUnderstandingConvolutionalNetworks[J].2013.SimonyanK,ZissermanA.Verydeepconvolutionalnetworksforlarge-scaleimagerecognition[C].ICLR,2015.SzegedyC,LiuW,JiaY,etal.GoingDeeperwithConvolutions[J].2014.FengZH,KittlerJ,AwaisM,etal.WingLossforRobustFacialLandmarkLocalisationwithConvolutionalNeuralNetworks[C]//IEEEConferenceonComputerVisionandPatternRecognition.IEEE,2018.GoyalP,Dollár,Piotr,GirshickR,etal.Accurate,LargeMinibatchSGD:TrainingImageNetin1Hour[J].2017.KingmaDP,BaJ.Adam:AMethodforStochasticOptimization[J].arXiv,2014.KetkarN.IntroductiontoPyTorch[M].DeepLearningwithPython.2017.WangB,TangS,ZhaoR,etal.PedestriandetectionbasedonRegionProposalFusion[C]//IEEEInternationalWorkshoponMultimediaSignalProcessing.IEEE,2015.TurnerJ,GuptaK,MorrisB,etal.KeypointDensity-basedRegionProposalforFine-GrainedObjectDetectionandClassificationusingRegionswithConvolutionalNeuralNetworkFeatures[J].2016.LempitskyV,KohliP,RotherC,etal.ImageSegmentationwithABoundingBoxPrior[C]//IEEEInternationalConferenceonComputerVision.IEEE,2009.SunL,ZhaoS,LiG,etal.Highaccuracyobjectdetectionviaboundingboxregressionnetwork[J].FrontiersofOptoelectronics,2019(2).施泽浩.基于特征金字塔网络的目标检测算法[J].现代计算机(专业版),2018(3).王冠皓,徐军.基于多级金字塔卷积神经网络的快速特征表示方法[J].计算机应用研究,2015(08):258-261.ZhouX,LanX,ZhangH,etal.FullyConvolutionalGraspDetectionNetworkwithOrientedAnchorBox[J].2018.翟永杰,李海森,吴童桐,etal.基于改进区域候选网络的航拍图像中绝缘子目标识别方法[J].浙江电力,2018,37(12):77-84.NeubeckA,GoolLJV.EfficientNon-MaximumSuppression[C]//18thInternationalConferenceonPatternRecognition(ICPR2006),20-24August2006,HongKong,China.IEEEComputerSociety,2006.张强,张陈斌,陈宗海.一种改进约束条件的简化非极大值抑制[J].中国科学技术大学学报,2016,046(001):6-11.张华博.基于深度学习的图像分割研究与应用[D].LiB,WuT,ZhangL,etal.Auto-ContextR-CNN[J].2018.CuiZ,LuN.FastDynamicConvolutionalNeuralNetworksforVisualTracking[J].2018.XuC,LuC,LiangX,etal.Multi-lossRegularizedDeepNeuralNetwork[J].Circuits&SystemsforVideoTechnologyIEEETransactionson,2016,26(12):2273-2283.HuG,DengF.Multi-outputsupportvectorregressionwithpiecewiselo
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 别墅施工组织设计方案
- 木材腐朽防治专项施工方案
- 2026宣传活动面试题目及答案
- 2026药研运营面试题及答案
- 2026邮件客服面试题及答案
- 2026能源设备制造业市场分析与发展策略研究
- 2026中国无人驾驶汽车市场现状及投资风险评估报告
- 2025年医院卫生院信息安全管理制度-1
- 2026叶黄素酯与其他抗氧化剂复配效果比较研究
- 赣州市瑞金市2027届数学三上期末考试模拟试题含解析
- 医疗护理员试题含答案
- 2025年江苏省档案职称考试(新时代档案工作理论与实践)历年参考题库含答案详解(5套)
- 2025年高级经济师知识产权考试历年真题及答案
- 矿场股权融资方案(3篇)
- 学校用品配送管理办法
- T-CIAPS0002-2017 锂离子电池企业安全生产规范
- 货车驾驶员安全驾驶培训
- 食品行业停水、停电、停汽时应急预案
- 化工厂设备技术员工作总结报告
- 小儿喘息性支气管炎课件
- 文学类文本赵树理《套不住的手》阅读练习及答案
评论
0/150
提交评论