版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
Mask-RCNN简介与原理概述目录TOC\o"1-3"\h\u12904Mask-RCNN简介与原理概述 1290051.1Mask-RCNN基本原理 133161.2ROIAlign操作 3116891.3特征金字塔网络(FPN) 4149741.4损失函数 6105831.5区域提议网络(RPN) 6138771.6掩码分割 72014年RCNN是CNN在物体检测中的早期应用,RCNN的目标是接收图像,和用一个矩形框成功识别图像里的物体和物体所在方位。RCNN效果很好,但它需要CNN(AlexNet)的正向传递,用于每个单个图像的每个区域建议和必须分别训练三个不同的模型用于生成图像特征的CNN,用于预测类的分类器,以及用于收紧边界框的回归模型这些问题。在2015年,出现Fast-RCNN算法。在Fast-RCNN算法的ROIPooling中,创建图像的完整前向传递,并从所得到的前向传递中提取每个感兴趣区域的conv特征并将所有模型组合到一个网络中。由于Fast-RCNN利用在大范围中挑选并寻找自己所需的新创建的图像特征提取框时间长,所以在经历数月之后,微软研究院团队对其进行优化升级出现了Faster-RCNN的网络结构。将这个漫长的过程取消,用添加完全卷积网络来创建区域建议网络的方法来代替这个操作。新的区域建议网络的运作流程是利用滑动滤波器对卷积神经网络中的图像进行特征提取,一个滑动滤波器输出多个边界框,来评估这些边界框包含对象的可能性,但Faster-RCNN定位到每个对象的精确像素仅限于边框。为了解决这个问题出现了Mask-RCNN,Mask-RCNN在生成mask后,将它们与Faster-RCNN输出层的对象类别和边界框组合起来,产生精确的分割。1.1Mask-RCNN基本原理Mask-RCNN是何凯明等人以Faster-RCNN为基础上结合了FCN和FPN思想的一种多任务深度神经网络,能同时实现对多目标分类、目标框检测和掩模分割[20-21]。这个网络模型可以在经过不断地训练学习后准确的将输入图像中的物体找到,而且可以把输入图像中检测所需要的物体与其他背景或物体分割开来。Mask-RCNN网络框架如图1.1所示,在图中可以看到Mask-RCNN是从输入图像中利用由许多点所形成的闭合框将所需要的物体框选分割出来后,经过ROIAlign池化,再经过卷积训练提取物体特征,最后输出结果。其中,ROIAlign是Mask-RCNN优化Faster-RCNN的ROIPooling后所得,这是两个模型间不同之处之一;另一个不同之处在,Mask-RCNN在拥有分类预测的同时还增加了掩码预测,分类预测是指对池化做出预测而形成的物体特征标签和选取物体大小的矩形框,掩码预测是指将小型全卷积网络添加到各个池化上后能分割和预测出输入图像每个像素的种类,而不是对不同物体种类的分类。Mask-RCNN为提高模型性能通过在每一次分类预测时都另外在进行掩码预测。图1.1Mask-RCNN结构图整个的网络结构包含两部分,一部分是backbone用来提取特征,另一部分是head用来对每一个ROI进行分类、框回归和掩码预测。如图1.2对于左边的架构,我们的backbone使用的是预训练好的ResNet,输入图像经过池化后得到特征图,特征图大小为7×7×1024,之后经过5层卷积层后得到7×7×2048大小的特征图,再分为分类预测和掩码预测这两类。对于分类预测,它的作用是对特征图进行分类和回归;对于掩码预测,在经过了池化和5次卷积减少了图片的分辨率后,运用反卷积将特征图的分辨率变高,变为14×14×256的大小,再减少输出通道数量后输出14×14×80的掩码模板。而右边使用到的backbone是FPN网络,这是一个新的网络,通过输入单一尺度的图片,最后可以对应的特征金字塔,特征金字塔网络因为能自己图片检测准确度而被很多地方使用。特征金字塔网络自身可以经过五次卷积,所以可以减少滤波器的使用,减少训练步骤和训练时间。图中分为上下两支,上面一支经过池化得到7×7×256大小的特征图后实现左图同样的作用。下面一支也经过池化获得14×14×256大小的特征图后进行五次相同卷积,对所得特征图反操作输出28×28×80的精确的掩码模板。右边过程比左边过程更加简洁,所获得的掩码模板也更加精准。图1.2HeadArchitecture1.2ROIAlign操作在对大型物体进行目标检测时,Faster-RCNN中的ROIPooling也能对物体检测不受影响,但是当有较多对小型物体目标检测时,ROIPooling因为经过两次量化取整的过程产生了巨大误差而不能精确检测到。这两次量化取整分别为把预测框从输入图片中转移到坐标中的取整和为了把不同尺寸的特征经均匀分配量化后变为相同分辨率的特征图的取整这两种。池化误差越大对网络模型接下去的训练影响也越大,池化作为将各个不同大小的特征图变为尺寸一样的第一步处理,有着至关重要的作用,否则会因为不起眼的量变不断积累变为质变,影响到检测精度。为了解决这个量化取整误差,Mask-RCNN中就提出了ROIAlign。ROIAlign和ROIPooling相比不同的是,它用重新选择和设计坐标点取代了两次取整量化的过程。做到原始图像的像素点与经过池化操作后所得到的特征图中像素点一一对齐,让从图片中的提取特征尽可能还原现实中的样子,从而将对图片目标检测和对图像中所需物体分割能力提高。ROIAlign在获取相应的输入图像像素点坐标数值时,运用了双线性插值法[22-23]。ROIAlign的运作步骤是:不改变图像中建议区域的回归坐标和浮点数坐标后,将建议区域均匀分配为多个单元,不去除各个单元的边框,之后,用双线性插值法经过运算得到已经确定的四个位置的坐标值,再用最大池化选出最大的值,让这个值成为这个单元的像素值。图1.3是ROIAlign的具体运用举例,图中5×5的虚线框代表的是从图片中提取的特征图,黑色实线框代表的是池化,我们把池化框均匀分配为四个2×2的单元格,并且在池化框中任意选择四个采样点,还在距离四个采样点最近的地方找到四个特征点(黑色方格的各个顶点),运用双线性插值法和最大池化后选出每个单元格中最大的像素值组成新的2×2特征图。图1.3ROIAlign原理图1.3特征金字塔网络(FPN)特征金字塔网络(FeaturePyramidNetwork,FPN)是以金字塔结构为参考的一种能在多种尺寸和许多特征层相连的在卷积神经网络下提取输入图片特征的网络。特征金字塔网络由于复杂的特征层的存在,从而在不加大卷积运算量的基础上提升卷积神经网络对不同的小型物体的识别能力和对其特征检测的精确度和检测速度,同样也可以对不同大小的图片特征进行猜测。特征金字塔网络在传输过程中有许多层,这些层是为了最好的和特征图相结合。特征金字塔网络为了得到最好的图像分辨率,利用从上而下的侧向连接使不一样大小的图像特征相互结合后,运用3×3的卷积方式消除由于过多成熟而造成的混合重叠图片特征问题的过程不断循环至最后方法可以完成[23]。从目标检测这一方面来看,将输入图像经过特征金字塔网络处理的过程是解决多种目标检测的常用解决办法。其中,能消除目标漏检问题的方法是在一定条件下(金字塔网络每一层的大小固定不变),未参与检测的目标在不一样的层级上离开原来的地方进行转移。如图1.4表达了四种提取图片特征的网络结构,分别是传统图像金字塔、原始卷积神经网络、金字塔型特征层级和特征金字塔网络,其中,传统图像金字塔在每张输入图像上都进行独立的特征提取及分别预测输出,这些输入图像的预测输出不能相互交叉结合,使网络模型变得复杂且内容巨大,对高效的要求变得难以达到。原始卷积神经网络通过对输入图像进行初次提取得到第一次特征再对其进行卷积池化等操作,最后输出预测结果。原始卷积神经网络只对图像进行了初步的提取并没有重复优化的过程,使最后结果的精度也有所降低。金字塔型特征层级对图像不断进行特征提取优化,并且在每次提取时进行预测输出,但由于提取不完全导致输出结果的同时输出了部分初步图像特征,使图片特征提取精度降低。特征金字塔网络,通过直接将初步提取的图片特征传递到进一步提取的网络层,再对其进行预测输出的方法,可以增加对提取图片特征的能力和减少底层语义对结果精度的影响[24]。图1.4(a)传统图像金字塔(b)原始卷积神经网络(c)金字塔型特征层级(d)特征金字塔网络1.4损失函数根据以上内容可以得到Mask-RCNN的损失函数为:L=Lcls+其中,新采用的Lmask为平均二元交叉熵损失函数,Lcls和Lbox与Fast-RCNN中定义的分类和回归损失一致,对于每一个ROI,mask分支定义一个k×m²维的矩阵表示k个不同的分类对于每一个m×m的区域,对于每一个类都有一个。对于每一个像素,都是用Sigmoid函数进行求相对熵,得到平均相对熵误差Lmask。不管是对任何一个ROI,不管检测到的ROI是属于任何一个分类,都只能使用与之对应的分支的相对熵误差作为误差值进行计算。一个像素级激活函数和一个二元损失值,不一样的掩码与掩码之间是独立的,不会相互影响的,1.5区域提议网络(RPN)区域提议网络(RPN)是指在骨干特征图上,以锚框机制为基础对特征图用事先规定好长宽比和区域面积的锚框进行像素点的滑动扫描并输出网络结果的一种相对独立的神经网络。锚点是规定所要预测图像物体范围的一个矩形框,这个矩形框是为了有能通过结合原有大小范围数据制定出大量的不同大小、不同长宽的框来大约估计物体方位的作用。锚点机制则是区域提议网络能找到需要检测物体出现概率较大区域的关键。对于区域提议网络输出的结果有两类,一类是正锚与负锚的种类区分,另一类是边界框的细化由于正锚无法与检测对象的特征对齐,因此添加一个辅助量来帮助矩形框更好的识别到物体所在位置。区域提议网络的扫描时间很短,而且在其卷积特点的帮助下可以让它并行扫描全部区域。以16×16的矩形框为基础的Mask-RCNN,可以拥有多种不同大小的锚点,分别是通过对三种缩放倍数(8倍、16倍、32倍)和三种长宽比例(2:1、1:1、1:2)进行组合[25-26]。在Mask-RCNN内使用区域提议网络要尽可能选用具有最高正类数值的锚点舍弃其余锚点,这样
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 物流配送项目进度调整说明(3篇范文)
- 跨境电商合作扩展邀请函6篇
- 2026全球与中国竞争对手企业行业市场发展分析及发展前景预测研究报告
- 2026生物医药行业临床研究深度解析及创新药物与市场前景分析报告
- 2026中国智能水利行业市场调研分析水资源管理论
- 《大数据导论》题库及答案 Chap5 题库
- 2026能源管道工程市场供需现状与资本运作部署规划分析
- 2026智能机器人运动控制芯片实时性要求与架构设计趋势
- 2026日本汽车制造行业现状供需分析及行业投资发展趋势规划研究文献
- 2026能源设备行业市场供需动态投资评估规划策略分析研究报告
- 2026年安徽省合肥社区工作者考试题库及答案
- 2027届广州中考英语听说考试专项训练
- 2026年农机驾驶考试题及答案
- DB11-T 383-2023 建筑工程施工现场安全资料管理规程
- 2026中国文旅新玩法报告
- 工业互联网基础知识
- 2026年中医药法知识竞赛试题及答案
- JJF 2309-2025 重点排放单位碳计量审查规范
- 消防设施工程公司绩效管理办法
- 急性心梗合并急性心衰护理
- 高血压危险分层、治疗与特殊类型管理
评论
0/150
提交评论