版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
基于卷积神级网络的目标检测研究国内外文献综述神经网络的诞生是科学家借鉴了生物体大脑神经元和感受野等相关工作思想的产物,首个多层感知机[4]出现在1958年,将其视为神经网络最初模型的原因,在于其可以对单个神经元训练。。Fukushima在1980年的一篇论文中提到一种模型,该模型包含了卷积和池化层,作者将其命名为认知机。随后误差反向传播算法[5]被Rumelhart等人提出,后成为熟知且广泛使用的算法BP(BackPropagation),在模型工作进程占据着举足轻重的地位。LeNet-5网络模型在1998年由LeCun等人[6]提出了,被看做卷积神经网络的最初的样子,改模型应用到了手写体的识别工作中。不过此后的一段时间内,卷积神经网络的发展停滞不前,一是因为相应的关键问题还没有解决,如梯度的爆炸和消失问题等理论问题,还有模型训练所需的数据量不足等问题;二是因为当时的计算机硬件水平,不足以支持网络模型计算的较大需求。2012年的AlexNet[7]的出现,打破了卷积神经网络技术沉寂多年的停滞状态,该模型首次实现了网络深度的大量增加,构建了包含5个卷积层和3个全连接层(FullConnected,FC)的复杂网络,更重要的是作者在其中使用了线性整流函数(RectifiedLinearUnit,ReLU)和dropout手段,ReLU作为激活函数后期出现了众多变体,也是网络模型构建中的基础一环。此时计算机的性能已经出现较大的改观,虽然AlexNet的参数量和计算量的激增,但是作者将模型的训练放置在了两个GPU上完成,提高了硬件的使用效率和降低了模型的训练难度。AlexNet在ImageNetLSVRC-2010挑战赛中以远超亚军的优异性能夺得冠军席位,卷积神经网络的巨大性能优势也重新吸引了研究人员的注意力。2013年ZFNet[8]在AlexNet基础上改进,探讨了卷积神经网络的有效性和问题,同年的OverFeat[9]是集分类、定位和检测多任务于一体的网络模型,充分挖掘了卷积神经网络的特征提取和表达能力。Lin[10]等人改变了传统卷积神经网络的结构,设计了采用多层感知机加卷积层的设计模式,并且使用全局池化和1×1卷积替换全连接层,为模型的设计提供了新思路。2014年的ImageNet挑战赛中出现了双雄并立的局面:GoogLeNet[11]和VGG[12],GoogLeNet设计了Inception模块作为整个模型的基础,Inception采用了多尺度卷积核而非单一尺寸卷积核来执行卷积操作,能够获得不同尺寸感受野,将通过不同大小卷积后的特征进行了融合,增强了特征的获取能力也获取了更多的稀疏性,此外借鉴了NIN中1×1卷积思想降维,减少5×5大尺寸卷积核带来的大计算量。VGGNet由牛津大学提出,模型由3×3小卷积核堆叠而成。GoogLenet和VGG都达到很深的层次,而模型的性能都进步了不少。2015年ResNet[13]诞生,其中的残差连接思想有效地帮助梯度的反向传播,得益于这种设计方式网络的深度达到了前所未有的地步,模型的性能也是大幅度提升。2017年DenseNet[14]为模型在性能提升的道路上开辟了新思路,不同于ResNet中加深和GoogLeNet中的加宽策略,DenseNet探索了特征复用的极限。同年的ResNeXt[15]在ResNet的基础上,借鉴了Inception的思想,使用多路卷积和分组卷积的手段,在同样参数量的情况下取得更好的效果。Xception[16]是在Inceptionv3的基础上进行的改进,使用了深度可分离卷积的手段,一定程度上减少了参数量。以卷积神经网络为基础的目标检测模型的大规模使用前,一直占据主导地位的传统的方法。检测时首先对输入做预处理,比如色彩变化、图像增强等;然后使用滑动窗的方法,滑动选取若干张候选区域[17];之后使用相应的算法进行特征的提取,常见的特征提取器有Haar、SIFT等,最后将获取的相关特征送入分类器如SVM、AdaBoost实现分类。传统检测模型的缺点在于特征提取器的设计繁琐,且模型的泛化能力不强,需要有针对性地设计或改动检测模型,且从整个检测过程时间成本高,冗余计算量大,不能满足实际需求。以卷积神经网络为基础纯粹构建目标检测模型,R-CNN[18]是其中的先驱。2014年R-CNN提出时,虽然采用传统的选择性搜索算法、SVM等手段,虽然存在检测速度慢,占用内存等问题,但是做出了将CNN用作特征提取的第一步。SPPNet[19]解决了因为图像的形变而造成的信息丢失问题,使得卷积神经网络可以接受任意尺寸的输入。其后的FastR-CNN[20]在此基础上做出改动,变为了对输入整张图像的卷积而非单独对每个候选区域卷积,同时使用了ROI池化,模型的分类和回归都集中在了一个神经网络中,解决了R-CNN训练和检测速度的缓慢问题。FasterR-CNN[21]是R-CNN系列更进一步的发展,在FastR-CNN的基础上,创造性地设计了一个名为区域提名网络(regionproposalnetworks,RPN)的结构,对选择性搜索算法进行了高效地置换,有效地提高了候选区域的质量,并且RPN和用来提取特征的CNN集成在了同一个网络模型中,共享参数,进一步提高了效率。2016年特征金字塔[22](FeaturePyramidNetworks,FPN)的出现引起波澜,这种思路虽然简单,但是却对特征复用行之有效,在几乎不增加额外开销的情况下提高模型的性能。在2015的YOLO[23]不同于R-CNN系列,YOLO为目标检测模型的设计开辟了新思路,它将整张图像送入模型特征提取、分类和回归,并未使用选取预选框的方法,实现了较快的检测速度。YOLOv2[24]使用批归一化(BN)、锚框、联合训练等手段,YOLOv3[25]使用了效果更好的骨干网络进行特征提取,同时也借鉴了ResNet和FPN的优点,使用多尺度预测等办法来提高模型的性能。2020年的YOLOv4[26]的作者将不同的优化手段和策略不断比较和融合做出的实验成果。SSD[27]是2016年提出的另一种检测模型,比YOLOv1稍晚,但是检测的流程和策略相对较为完善,以VGG16为骨干网络,借鉴FasterRCNN的anchor思想,同时采用多尺度预测的办法,将此类检测模型的性能定格了下来。RetinaNet[28]在2017年提出,作者提出了FocalLoss函数来解决模型的分类损失的不平衡问题,并且设计了RetinaNet验证模型的性能。2018年Law等人提出了CornerNet[29],开辟了检测模型设计的新思路,即是免除锚框的设计策略。CornerNet提出使用一对关键点而非矩形框来确定目标的位置。2019年提出的CenterNet[30]为了避免CornerNet中的关键点对边缘部分的过多关注,所以又添加了中心点坐标来平衡。ExtremeNet[31]则是采用上下左右四个最外点来确定目标的位置。FCOS[32]是基于像素点的预测,通过中心度预测分支来解决低质量的预测框,避免了关于锚框的超参数设计以及过多内存的占用。参考文献[1] 江金洪,鲍胜利,史文旭,等.基于YOLOv3算法改进的交通标志识别算法[J].计算机应用,2020,40(08):2472–2478.[2] 史瑞鹏,钱屹,蒋丹妮.一种基于卷积神经网络的疲劳驾驶检测方法[J].计算机应用研究,2020,37(11):3481–3486.[3] 郭杰,程远志.基于卷积神经网络的肺部结节检测方法研究[D].哈尔滨工业大学,2020.[4]GoodfellowI,BengioY,CourvilleA.DeepLearning[M].TheMITPress,2016.[5]RumelhartDE,HintonGE,WilliamsRJ.Learningrepresentationsbyback-propagatingerrors[J].Nature,1986,323(6088):533-536.[6]LecunY,BottouL.Gradient-basedlearningappliedtodocumentrecognition[J].ProceedingsoftheIEEE,1998,86(11):2278–2324.[7]KrizhevskyA,SutskeverI,HintonGE.ImageNetClassificationwithDeepConvolutionalNeuralNetworks[J].NeuralInformationProcessingSystems,2012,25:1097-1105.[8] ZeilerMD,FergusR.VisualizingandUnderstandingConvolutionalNetworks[C]//EuropeanConferenceonComputerVision.Springer,Cham,2014:818-833.[9] SermanetP,EigenD,ZhangX,etal.OverFeat:IntegratedRecognition,LocalizationandDetectionusingConvolutionalNetworks[J].arXivpreprintarXiv:1312.6229,2013.[10] LinM,ChenQ,YanS.Networkinnetwork[J].arXivpreprintarXiv:1312.4400,2013.[11] SzegedyC,LiuW,JiaY,etal.Goingdeeperwithconvolutions[C]//ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition.2015:1-9.[12] SimonyanK,ZissermanA.VeryDeepConvolutionalNetworksforLarge-ScaleImageRecognition[J].arXivpreprintarXiv:1409.1556,2014.[13] HeK,ZhangX,RenS,etal.DeepResidualLearningforImageRecognition[C]//ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition.2016:770-778.[14] HuangG,LiuZ,VanDerMaatenL,etal.DenselyConnectedConvolutionalNetworks[C]//ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition.2017:4700-4708.[15] XieS,GirshickR,DollárP,etal.Aggregatedresidualtransformationsfordeepneuralnetworks[C]//ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition.2017:1492-1500.[16] CholletF.Xception:Deeplearningwithdepthwiseseparableconvolutions[C]//ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition.2017:1251-1258.[17] 王慧玲,綦小龙,武港山.基于深度卷积神经网络的目标检测技术的研究进展[J].计算机科学,2018,45(09):11–19.[18] GirshickR,DonahueJ,DarrellT,etal.Richfeaturehierarchiesforaccurateobjectdetectionandsemanticsegmentation[C]//ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition.2014:580-587.[19] HeK,ZhangX,RenS,etal.Spatialpyramidpoolingindeepconvolutionalnetworksforvisualrecognition[J].IEEEtransactionsonpatternanalysisandmachineintelligence,2015,37(9):1904–1916.[20] GirshickR.Fastr-cnn[C]//ProceedingsoftheIEEEinternationalconferenceoncomputervision.2015:1440-1448..[21] RenS,HeK,GirshickR,etal.FasterR-CNN:TowardsReal-TimeObjectDetectionwithRegionProposalNetworks[J].IEEETransactionsonPatternAnalysisandMachineIntelligence,2016,39(6):1137-1149.[22] LinTY,DollárP,GirshickR,etal.Featurepyramidnetworksforobjectdetection[C]//ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition.2017:2117-2125.[23] RedmonJ,DivvalaS,GirshickR,etal.Youonlylookonce:Unified,real-timeobjectdetection[C]//ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition.2016:779-788.[24] Redmo
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年镇雄县医疗事业单位人员招聘笔试模拟试题及答案解析
- 2026年景谷傣族彝族自治县医疗事业单位人员招聘笔试模拟试题及答案解析
- 2026年砚山县带编教师招聘笔试备考题库及答案解析
- 2026年泾县医疗事业单位人员招聘考试备考试题及答案解析
- 2026年伊川县社区工作者招聘考试模拟试题及答案解析
- 2026年信丰县医疗事业单位人员招聘考试参考题库及答案解析
- 2026年襄城县医疗事业单位人员招聘笔试备考题库及答案解析
- 2026年化隆回族自治县医疗事业单位人员招聘考试备考试题及答案解析
- 2026年武胜县医疗事业单位人员招聘考试模拟试题及答案解析
- 2026年天镇县带编教师招聘笔试备考试题及答案解析
- 烙铁焊接知识培训课件
- 汽车营地行业分析报告
- 海洋工程装备与电子信息:助力海洋开发技术革新
- 医院医疗辅助服务投标方案(技术标)
- 2025-2026学年人教版三年级美术上册全册教案
- 2025-2026学年北师大版八年级生物上册全册教案
- 屋面木结构框架施工方案
- 家装工程质量监理验收表模板
- 餐饮厨房标准操作流程SOP范本
- 老兵退伍茶话会课件
- 索尼摄像机HXR-MC2500说明书
评论
0/150
提交评论