【基于机器视觉的目标检测方法综述5400字】_第1页
【基于机器视觉的目标检测方法综述5400字】_第2页
【基于机器视觉的目标检测方法综述5400字】_第3页
【基于机器视觉的目标检测方法综述5400字】_第4页
【基于机器视觉的目标检测方法综述5400字】_第5页
已阅读5页,还剩6页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

[20]提出之后,就被广泛应用到了各种卷积神经网络结构中。批标准化,简而言之,就是对于每一层网络的输出,对其做一个归一化,使其服从标准的正态分布,这样后一层网络的输入也是一个标准的正态分布,所以能够比较好的进行训练,加快收敛速度。1.2图像分类网络图像分类是计算机视觉中最基础的任务之一,也是几乎所有的基准模型进行比较的任务。图像分类是一个模式分类问题,其目的是将不同的图像划分到不同的类别,实现最小的分类误差。图像分类任务能衡量网络模型的特征提取能力,目标检测网络一般是在图像分类网络的结构基础上,结合检测策略来实现的,因此模型特征提取的好坏决定了目标检测网络的检测准确度和精度。本节将重点介绍两个在图像分类领域影响深远的网络模型——Alexnet和VGGnet。1.1.1AlexnetAlexnet是2012年Imagenet比赛冠军的神经网络模型,它首先证明了卷积神经网络在复杂模型下的有效性,而且GPU的加速实现使得训练在可接受的时间范围内得到结果,Alexnet对之后的卷积神经网络模型的发展具有里程碑意义。如图1.7为Alexnet的网络结构图。Alexnet网络结构一共有8层,由5层卷积层和3层全连接层组成,最后一个全连接层的输出传递给一个1000路的softmax层,对应Imagenet的1000个分类类别。由于Alexnet采用了两个GPU进行训练,因此将网络结构图分成上下两个部分:一个GPU负责训练图上方的层,另一个GPU训练图下方的层。两个GPU只在第三层卷积层和三个全连接层之间进行通信。Alexnet在算法上激活函数选用RELU函数,且使用了多个GPU提高训练速度。并且采用了数据增强和Dropout的手段来减少过拟合。为之后出现的各种卷积神经网络模型的训练提供了优化思路。1.1.2VGGNetVGGNet由5层卷积层,3层全连接层和softmax输出层构成,层与层之间使用最大池化分开,所有的激活函数都采用RELU函数。VGG与Alexnet的网络结构类似,最大的不同在于VGGNet没有采用Alexnet中7*7和11*11这种比较大的卷积核尺寸,而是通过降低卷积核的大小到3*3,并增加卷积的子层数,也就是每层滤波器的个数来达到同样的性能。选择小卷积核的原因在于,采用多个小卷积核不仅可以增加非线性映射,也能很好的减少参数。例如3个3*3卷积的堆叠获取到的感受野相当于一个7*7的卷积,但是7*7卷积核需要的参数是49个,而3个3*3的卷积核只需要27个参数。VGGNet的成功证明了通过增加深度能有效地提升神经网络理解图像的能力,而且VGGNet模型中采用的3*3卷积和2*2池化也作为卷积神经网络设计的一种规范,沿用至今。1.3目标检测网络目标检测是指在图像中定位出目标所在的位置[39],同时输出目标的类别,是图像识别领域的一种重要分支,如何做到精准的定位和快速的计算也是当前该领域的一大难点。由于卷积神经网络对图像优秀的理解力,而且识别出目标类别本身就是目标检测任务的一部分,所以很多目标检测网络都是在表现优异的图像分类网络的基础上增加额外算法构成的。当前目标检测算法主要分两类,以RCNN为代表的“two-stage”的方法和以YOLO,SSD为代表的“one-stage”的方法。1.3.1FasterRCNN区域卷积神经网络(RCNN)是经典的目标检测网络之一,算法的流程基本是:首先通过选择性搜索(SS)算法遍历图像并生成一系列候选框,再通过神经网络对所提出的候选框进行分类,最后采用非极大值抑制(NonMaximumSuppression,NMS)算法得到最终的检测结果。由于算法需要利用SS算法产生候选区域,这非常耗时而且SS算法提供的候选区域的质量并不好,也就是说会产生很多徒劳的工作量,这些都让RCNN算法的运行速度和检测精度不尽如人意。但是RCNN算法作为目标检测领域的开山之作,给后续很多网络的产生提供了思路。FastRCNN在RCNN的基础上引入了感兴趣池化层(ROI)进行特征提取,并把边框回归引入到网络中,与分类任务合并。而FasterRCNN算法则在FastRCNN算法的基础上引入区域建议网络(RPN)来进行候选框提取,将特征提取,候选框提取和Boundingbox回归以及图像分类都整合在了一个网络中,使得综合性能大大提高。FasterR-CNN算法流程图FasterRCNN算法流程如图1.9所示,先用VGG网络对原图进行特征提取,得到的特征图被共享用于后续的RPN层和全连接层[40]。RPN层用于生成可能包含目标的若干个regionproposals,并将这些信息传给ROI层。ROI层综合regionproposals信息和特征图提取推荐区域的特征图,最后将这些信息输入全连接层判定目标类别。1.3.2YOLOYOLO算法的大致流程是首先把输入图像划分成S*S个网格,然后对每个网格单元都预测B个Boundingboxes,每个Boundingbox都包含5个预测值:x、y、w、h和置信度。x和y是Boundingbox相当于当前网格的偏移值,范围在0到1之间,w和h是Boundingbox相当于原图像宽高的占比,范围也在0到1,置信度表示当前Boundingbox中有目标的概率。每个格子除了需要预测出B个Boundingbox外还要预测出Boundingbox中的物体类别,也就是C个类别,每个类别分别占的比例。图1.10为YOLO的网络结构示意图,输入图片大小是448**448*3,网络的特征提取部分采用GoogLenet,卷积层主要用来提取特征,全连接层用来预测Boundingbox坐标和属于各个类别的概率。最后网络的输出是7*7*30。7*7代表将原图划分成7*7个格子,每个格子预测2个Boundingbox,该网络在VOC数据集上测试,VOC数据集一共有20个物体类别,这样输出的张量大小就是7*7*(5+5+20),也就是7*7*30。YOLO算法使用单个激活映射来预测类和边界框,其特点是速度非常快,而且YOLO算法是基于图像的全局信息进行预测的,这使得YOLO在误检率上比RCNN系列算法上降低了不少,而且训练出的模型泛化能力强。1.3.3SSDSSD网络结构如图所示,采用VGG16做基础模型,将原始VGG16的全连接层fc6和fc7转换成3*3卷积层conv6和1*1卷积层conv7,然后移除dropout层和fc8层,并新增一系列卷积层,对于VGG中的conv4_3层和新增的每一个卷积层得到的特征图,一共6个特征图都用于检测,它们的大小分别是(38,38),(19,19),(10,10),(5,5),(3,3),(1,1)。得到特征图之后需要对特征图进行卷积操作,得到各种类别的边框回归和置信度。SSD

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论