3深度学习-第三章 卷积神经网络_第1页
3深度学习-第三章 卷积神经网络_第2页
3深度学习-第三章 卷积神经网络_第3页
3深度学习-第三章 卷积神经网络_第4页
3深度学习-第三章 卷积神经网络_第5页
已阅读5页,还剩44页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第三章

卷积网络第一节卷积层《深度学习》张敬林山东大学

控制科学与工程学院从全连接到卷积全连接网络适合处理表格数据,其中行对应样本,列对应特征表格数据更适合建模特征之间的交互当数据中有先验结构时,全连接网络可能不适合示例:图像数据由二维像素网格组成,将图像数据展平成一维向量,再将数据送入一个全连接网络忽略了每个图像的空间结构信息,即左右相邻像素之间的相关性卷积网络是一种专门用来处理具有类似网格结构的数据的神经网络能够更好地处理数据中的空间结构示例:图像卷积神经网络的核心思想是利用卷积操作来提取输入数据的特征,它由多个卷积层、池化层和全连接层组成3.1卷积层卷积运算示例输入数据为4×4大小的矩阵,卷积核为2×2大小的矩阵,输出为2×2大小的矩阵。一般使用(宽度,高度)表示输入数据、卷积核和输出数据的大小。在本示例中,输入特征图大小为(4,4),卷积核和输出特征图大小为(2,2)。3.1.1

卷积运算下图为步幅等于1的卷积运算结果,其中卷积核大小为2×2,输入特征图大小为5×5,输出特征图大小为4×4,输出特征图左上角元素0为输入特征图左上角2×2区域的四个元素(0,0,0,0)与卷积核的卷积运算结果;将窗口向右移动一个元素,得到由元素(0,0,0,1)构成的2×2区域,与卷积核做卷积运算,即0×0+0×1+0×2+1×3,得到输出特征图第一行第二列的元素为3,以此类推,可以得到输出特征图的其它元素。步幅大小影响输出特征图的大小,一般而言,步幅越大,输出特征图越小。3.1.1

卷积运算步幅=1的卷积计算过程

3.1.1

卷积运算3.1.1

卷积网络:PyTorch实现importtorchimporttorch.nnasnnm=nn.Conv2d(16,33,3,stride=2)m=nn.Conv2d(16,33,(3,5),stride=(2,1),padding=(4,2))m=nn.Conv2d(16,33,(3,5),stride=(2,1),padding=(4,2),dilation=(3,1))input=torch.randn(20,16,50,100)output=m(input)in_channels:输入通道数;out_channels:输出通道数;kernel_size:卷积核大小,例如kernel_size=3表示3×3大小的卷积核,kernel_size=(3,5)表示3×5大小的卷积核;

stride:步幅,默认为1;padding:填充,填充位置包括图像的上下左右,例如padding=1使得32×32大小的图像填充为34×34,即上下各填充一行,左右各填充一列。默认设置为0,表示不填充;

dilation:卷积核中一个元素到相邻元素需要走过的距离,默认为1,大于1时表示使用空洞卷积,空洞卷积将在第3.2.2节介绍;groups:分组卷积中的组数,将在第3.2.3节介绍;bias:偏置,默认设置下使用偏置;padding_mode、device、dtype:使用默认设置即可。torch.nn.Conv2d(in_channels,out_channels,kernel_size,stride=1,padding=0,dilation=1,

groups=1,bias=True,padding_mode='zeros',device=None,dtype=None)卷积的三个重要思想局部连接权重共享平移不变性3.1.2

卷积的特点每个输出神经元只与输入数据的一个小区域相关,而不是与整个输入数据相关,即每个输出神经元只与部分输入神经元相连接,我们称该特性为局部连接。当卷积核远小于输入时,输出和输入之间的连接是稀疏的与全连接网络的全连接层相比,局部连接可以大幅减少网络的参数量,从而降低模型的训练难度,提高模型的泛化能力全连接

卷积3.1.2

卷积的特点-局部连接直观解释:当处理图像时,输入的图像可能有百万个像素点,但我们可以通过很小的卷积核来探测一些小的有意义的局部特征人脸识别,眼睛、鼻子、嘴巴等局部特征例如识别一张图像中是否包含一只鸟,我们往往会寻找图像中是否包含鸟嘴、鸟爪等显著特征,即重点关注图像的局部区域。卷积网络中,输出与输入之间的卷积映射对所有输出共享相同的参数,即每一层只使用一个卷积核以识别图像中的鸟为例,可以将卷积核看作是过滤器,使用该过滤器扫描图像的每个区域,检测是否有鸟嘴、鸟爪等显著特征。过滤器的参数不随扫描区域的变化而变化权重共享减少网络的参数量降低网络的训练难度降低模型复杂度,防止过拟合,提高模型泛化能力3.1.2

卷积的特点-权重共享平移不变性是指当输入数据发生移动时,卷积操作的输出也会相应地移动等变表示:先卷积,再移动=先移动,再卷积当图像发生平移变换,卷积后的特征图也发生对应的平移变换以识别图像中的鸟为例,鸟嘴可能位于图像的不同位置,但不管位于什么位置,我们都希望卷积核可以对其正确识别3.1.2

卷积的特点-平移不变性在数学中,两个函数之间的“卷积”被定义为一种积分变换卷积运算通常用星号表示在卷积神经网络的术语中,第一个参数(在这个例子中,函数f)叫做输入,第二个参数(函数w)叫做卷积核,输出有时被称作特征映射表示函数f和g的“叠加”程度在深度学习中,我们通常使用离散卷积而不是连续卷积作为一种强大的数学工具,卷积在深度学习领域具有广泛应用,它可以帮助我们从数据中提取有用的特征,并减少计算量3.1.2卷积的数学性第三章

卷积网络第二节其它卷积类型《深度学习》张敬林山东大学

控制科学与工程学院上一节主要介绍了基本卷积运算,除此之外,针对不同任务会有其它类型的卷积相匹配。本小节将介绍几种典型的卷积:转置卷积空洞卷积分组卷积可分离卷积3.2其他卷积类型转置卷积定义:转置卷积,又称反卷积或上采样卷积,通常用于将特征图恢复到原始输入大小,或者将特征图从低分辨率映射到高分辨率,后者称为上采样。转置卷积运算示意图转置卷积工作原理:与标准卷积类似,但在进行卷积操作之前需要对输入数据进行填充。如图所示,原始输入特征图大小为2×2,填充之后,将特征图扩大到6×6,然后与3×3大小的卷积核进行卷积运算,其中步幅设置为1,得到4×4大小的输出特征图。因此,转置卷积将2×2大小的输入特征图转化为4×4大小的输出特征图,从而完成上采样。在与卷积核进行卷积运算时,转置卷积首先需要对卷积核进行转置,即翻转180度,转置卷积中的卷积核一般是上一层中进行标准卷积运算的卷积核。转置卷积应用场景:图像处理任务:对特征图进行上采样,如图像分割、图像生成图像分割任务:实现像素级的分类或高精度的分割任务图像生成任务:将低分辨率的特征图上采样至高分辨率的特征图,以帮助生成更加真实且富含细节的图像上采样图像分割转置卷积:PyTorch实现定义:空洞卷积通过在卷积核中插入空洞或在输入特征图中加入跳跃的采样间隔来扩展卷积操作的感受野,而无需增加额外的参数量。感受野可以理解为卷积核能够覆盖的区域范围。常规感受野示例空洞卷积示例3.2.1空洞卷积空洞卷积的优缺点空洞卷积的优势:扩大感受野,在不显著增加参数量和计算负担的前提下,使得卷积核可以覆盖更大的输入区域。卷积核大小为3,空洞率为2的空洞卷积感受野示例空洞卷积的缺陷:1、空洞卷积通过在卷积核中插入空洞来扩大感受野范围,但这会导致卷积运算时跳过一些输入特征图的像素。这种跳跃可能丢失细节信息。2、可能导致网格效应,即由于跳过输入像素从而在输出特征图上形成网格状的伪影,这种效应会影响特征图的平滑性和一致性,进而影响模型的性能。空洞卷积:PyTorch实现定义:分组卷积是指将输入特征图按通道分成若干个组,每一组执行常规的卷积操作,最后将各组的结果合并,形成最终的输出特征图。如果输入特征图的通道数为C,分成G组,那么每一组含有C/G个通道。分组卷积示例,G=23.2.3分组卷积分组卷积的特点分组卷积减少模型参数量,一般来说,当分为G个组时,模型参数量可以减少到不分组时的1/G。节省计算资源,加快模型训练速度。分组卷积的应用场景广泛应用于各种轻量化模型:如手机等移动设备中的深度模型,用于在资源受限的情况下减少运算量和参数量。提取多种不同特征表示:每个小组内的卷积操作可以学习到不同的特征,从而增加网络的表征能力和对不同特征的感知能力。分组卷积:PyTorch实现定义:空间可分离卷积在宽度和高度两个维度对卷积运算进行简化。具体来说,该方法将二维卷积分解成两个一维卷积操作,分别在水平方向和垂直方向进行卷积运算。3.2.4可分离卷积(a)标准卷积(b)空间可分离卷积

3.2.4可分离卷积(a)分组卷积(b)1×1卷积可分离卷积:PyTorch实现第三章

卷积网络第三节池化层《深度学习》张敬林山东大学

控制科学与工程学院池化(pooling)层(也叫汇聚层):使用某一位置的相邻元素的总体统计特征来作为该位置的输出最大池化(maxpooling):输出相邻矩形区域内的最大值平均池化(averagepooling):输出相邻矩形区域内的平均值与卷积层类似,池化层也是作用于输入的局部区域(局部连接)与卷积层不同的是,池化层不包含参数,不需要学习3.3池化层示例:池化窗口为(2,2),步幅为(2,2)默认情况下,池化层的步幅与池化窗口的大小相同。因此,如果使用大小为(2,2)的池化窗口,那么默认情况下,我们得到的步幅为(2,2),保证相邻的池化窗口没有交集,每个输入元素只作用一次池化操作最大池化

平均池化

3.3池化层定义:平均池化对池化区域内的元素值计算平均值。大小为2×2的池化核,将池化核以长度为2的步幅在输入特征图上滑动,滑动过程中覆盖到的输入区域即为池化区域,对每个池化区域内的元素值计算平均作为该区域的输出。3.3.1平均池化平均池化特点:减少模型参数量池化操作会缩小特征图的大小,从而减少后续卷积层的参数量和计算量,提高模型的效率和运行速度。提取平均特征平均池化操作提取了每个区域的平均特征值,有助于保留图像的整体结构信息,同时减小噪声的影响。降低过拟合风险平均池化操作可以减少模型的参数量,降低模型的复杂度,因此能够降低过拟合的风险。定义:将平均池化操作中对池化区域内的元素值计算最大值。大小为2×2的池化核,将池化核以长度为2的步幅在输入特征图上滑动,滑动过程中覆盖到的输入区域即为池化区域,对每个池化区域内的元素值计算最大值作为该区域的输出。3.3.2

最大池化最大池化特点:减少模型参数量与平均池化类似,最大池化也可以减少模型的参数量和计算量。提取显著特征最大池化操作通过计算最大值提取了每个池化区域内的最显著特征,利用这些特征对图像分类、使目标检测等任务具有重要意义。平移不变性最大池化中的计算最大值操作对输入的平移等变换具备一定的不变性。降低过拟合风险最大池化应用场景特点特征突出性要求高平移不变性要求高轻量级模型设计平均池化应用场景特点特征平滑性要求高

轻量级模型设计3.3.3最大池化和平均池化的区别平均池化和最大池化:PyTorch实现连接密集度:全连接层构成一个密集连接结构,卷积层构成稀疏连接结构参数共享情况:全连接层中的每条边都有自己的连接权重,而卷积层的卷积核处理不同输入区域时使用相同的权重。模型复杂度:卷积层的参数量远小于全连接层,从而使得卷积层的复杂度更低。特征提取能力:卷积操作能够更好地提取输入数据中的空间信息、局部特征以及不同层次的特征。而全连接层侧重于提取全局特征。输出形状:卷积层的输出通常是一个或者多个特征图,而全连接层的输出是一个一维向量。卷积层与全连接层比较第三章

卷积网络第四节经典网络结构《深度学习》张敬林山东大学

控制科学与工程学院LeNet:最早发布的卷积神经网络之一,由YannLeCun提出,目的是识别图像中的手写数字两个卷积块和三个全连接层每个卷积块包含一个卷积层,一个sigmoid激活函数(ReLU在那时还没出现),和一个平均池化层每一层的高度和宽度在减小,通道数在增加6个通道28*28输入5*5卷积核上下左右每侧填充228*28输出6个通道28*28输入2*2平均池化2*2步幅14*14输出16个通道14*14输入5*5卷积核无填充10*10输出16个通道10*10输入2*2平均池化2*2步幅5*5输出将5*5*16维张量拉成400维向量120*8484*103.4.1经典卷积网络结构:LeNetLeNet特点卷积和池化结构

LeNet首次将卷积和池化操作应用于图像识别任务中,这种结构有助于提取图像的局部特征,从而降低网络的参数数量激活函数

LeNet使用Sigmoid作为激活函数。Sigmoid是当时流行的激活函数,但相较于现在常用的ReLU激活函数,Sigmoid激活函数会导致梯度消失,使得模型训练缓慢全连接LeNet也包含全连接层,用于将卷积层提取的特征信息映射到类别空间,实现分类3.4.1经典卷积网络结构:LeNetAlexNet由AlexKrizhevsky、IlyaSutskever和图灵奖得主GeoffreyHinton于2012年提出在ImageNet挑战赛上以巨大优势获得冠军,标志着深度学习时代的来临AlexNet由5个卷积层、3个池化层和3个全连接层组成3.4.2经典卷积网络结构:AlexNetAlexNet特点更深的网络结构ReLU激活函数局部响应归一化Dropout数据增强使用GPUVGG由英国牛津大学的计算机视觉几何组提出,在2014年的大型视觉识别挑战赛中取得了优异的成绩VGG网络中的每个卷积层都使用了3×3的小卷积核,步幅为1,填充为1,从而使得输入特征图和输出特征图的大小保持一致。在卷积层之后使用窗口大小为2×2、步幅为2的最大池化层,以缩小特征图大小。最后,使用全连接层将前面各层提取的特征信息映射到类别空间,进行分类。3.4.3经典卷积网络结构:VGGVGG网络结构VGG网络结构特点:更深的网络结构:VGG网络非常深,VGG16有16层,VGG19有19层,更深的网络结构有助于提取更加丰富和复杂的特征。小尺寸的卷积核:VGG网络采用了3×3小尺寸卷积核,网络结构非常规整,并且可以通过多层卷积来模拟更大范围的感受野,提高网络的表征能力。重复堆叠:VGG网络使用了大量的重复结构,每个重复的VGG块都由连续的几个卷积层和一个池化层组成,这种设计简单而有效,易于理解和复现。3.4.3经典卷积网络结构:VGGGoogleNet,也叫作InceptionV1网络,由GoogleResearch团队于2014年提出,包

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论