版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
01卷积神经网络基础2026/10/11BTBU-CIE2本节提要传统人工神网络在图像处理上的问题描述卷积神经网络的特点与基本架构2026/10/113前景回顾:传统神经网络前端输入层:一个单向量的数据表示中间隐含层:一系列神经元组成,将前层输出转换至另一向量空间
神经元全连接、各连接独立不共享末端输出层:在图像分类任务表达为各类别的分数2026/10/114问题:当神经网络遇见图像数据?飞机汽车小鸟猫鹿狗狐狸马轮船卡车图像数据示例CIFAR-10Dataset6000032x32colorimagesin10classes6000imagesperclass50000trainingimages/10000testimages.
Meet2026/10/115问题:当神经网络遇见图像数据?总共有多少连接?多少待训练参数?这些多重连接是否有冗余?是否可被共享?如何降低神经网络模型的参数?使模型变“小”?一个全连接人工神经网络模型:输入层隐藏层×3输出层2026/10/116问题:当神经网络遇见图像数据?传统人工神经网络面对图像数据的表现:面对32×32×3的输入图像数据,单个全连接神经元有3072个权重待训练。若输入图像维度增加或神经元数目增加,则待训练参数呈高数量级快速上升。引起训练负担+过拟合风险不适用于图像数据的处理!2026/10/117传统神经网络vs卷积神经网络采用三维的形式(width×height×depth)神经元局部区域连接(局部感知),非全局连接神经元共享参数,非完全独立输出端的维度可相应地匹配输入的任务卷积神经元特点:卷积神经网络传统神经网络2026/10/118传统神经网络vs卷积神经网络嘴部探测器detectorCanrepresentasmallregionwithfewerparameters卷积神经元特点之一:局部感知在图像理解任务中,一些重要模式的尺寸往往小于整个图像,采用对图像局部进行神经元映射2026/10/119传统神经网络vs卷积神经网络左上部嘴探测器
detector中间部位嘴探测器不同空间位置的同类特征可共享同样的感知神经元卷积神经元特点之二:参数共享2026/10/1110卷积神经网络的基本架构由三种类型的功能层组成:卷积层(convolutionallayer)、池化层(poolinglayer)、全连接层(fully-connectedlayer)2026/10/1111卷积神经网络的基本功能层输入层—卷积层—激活函数—池化层—全连接层—输出层输入层:匹配原始图像的维度[32×32×5];卷积层:面向局部图像的神经元映射;激励层:神经元级的非线性激活映射;池化层:在二维空间维度(长、宽)上进行下采样;全连接层:映射至类别的分数,维度可适应类别数目。2026/10/1112卷积神经网络的基本功能层全局分析:卷积神经网络将输入原始像素经由多功能层映射为最终的类别分数。可训参数:卷积层和全连接层(含);激活层和池化层(不含)超参数:卷积/全连接/池化(含);激活层(不含)2026/10/1113卷积神经网络的基本功能层卷积神经网络基本架构运行总览:2026/10/1114卷积神经网络的基本功能层卷积神经网络基本架构运行总览:小结1、卷积神经网络的引入:图像数据2、卷积神经网络对比传统神经网络的特点3、卷积神经网络的基本架构2026/10/11BTBU-CIE15致谢本课程所引用的一些素材来源于多种媒体及同事和同行的交流,难以一一注明出处,特此说明并表示感谢!
2026/10/11BTBU-CIE16
卷积神经网络:卷积层主讲人:张洁北京工商大学计算机与信息工程学院2026/10/11BTBU-CIE18本节提要卷积层功能概述卷积映射与传统人工神经元的类比分析卷积层基本CNN滤波器(卷积核)输入图像3通道输入图像输出结果滑动的卷积核2026/10/1120卷积层卷积核:待训练的滤波器(filters),各滤波器维度在空间上适应输入图像数据。滤波器(卷积核)输入图像3通道20卷积:卷积核与局部图像区域的点乘运算e.g.5×5×3维度的点乘+1偏置62828卷积操作:以滑动的方式在图像的空间维度上进行,计算滤波器和图像邻域的点乘之和。输出结果:三维的空间矩阵,包含多个激活映射图(map),每个图是卷积层在图像各位置的响应。2026/10/1121卷积操作每个不同的滤波器均可卷积出一个激活映射图2个5×5×3的滤波器卷积出2个激活映射图2026/10/1122卷积操作假设采用6个5×5的滤波器,输出6个单独的激活映射图累积所有的激活映射图,即为维度28×28×6的新图像6个5×5的滤波器2026/10/1123卷积操作卷积计算后跟随非线性激活函数,增强映射能力非线性激活2026/10/1124卷积计算的神经元类比分析每个输出的三维立体神经元均为局部输入图像的转换映射各三维立体神经元与输入层的局部区域发生连接各三维立体神经元之间共享滤波器参数2026/10/1125卷积计算的神经元类比分析卷积计算的感受野当处理高维度输入数据时,采用局部连接的方式。该种局部连接的空间维度是CNN的一个超参数——感受野(ReceptiveField),实质为滤波器的尺寸Note:感受野只是在长与宽的维度上,深度上保持和输入数据相通。ForExample:输入为[32323]维度的图像,感受野维度为5×5,则卷积层的各神经元的权重为5×5×3,共75个可训练参数+1个偏置参数。2026/10/1126卷积计算的神经元类比分析卷积计算的权值共享科学假设:一个滤波器在空间某个位置的滤波结果,在其他位置应同样适用图像意义:检测图像中的水平边缘所使用的滤波器应在图像各位置都使用图.同一水平边缘滤波器(探测器)在图像上多个局部区域的作用结果2026/10/1127卷积计算的神经元类比分析卷积计算的权值共享作用:控制卷积神经网络的待训练参数的数量,减小训练负担,减小模型过拟合风险。共享方式:在同一深度切片depthslice内共享滤波器的参数。深度内涵:正因为权值共享,各深度切片才以卷积核在输入图像数据上滑动(卷积)的计算形式进行。2026/10/1128卷积操作的几种类型扩张卷积(DilatedConvolution)一般卷积(GeneralConvolution)反卷积(TransposedConvolutions)2026/10/1129卷积操作Demo蓝色为输入层红色为卷积层绿色为输出层2026/10/1130多层卷积操作在图像识别上可视化2026/10/11BTBU-CIE31小结卷积层的功能卷积操作的过程卷积操作在神经元角度的类比分析致谢本课程所引用的一些素材来源于多种媒体及同事和同行的交流,难以一一注明出处,特此说明并表示感谢!
2026/10/11BTBU-CIE32
卷积神经网络:池化层与全连接层主讲人:张洁北京工商大学计算机与信息工程学院2026/10/11BTBU-CIE34本节提要池化层功能详解全连接层功能详解全连接层与卷积层的联系与转换2026/10/1135池化层和全连接层
LeNet卷积神经网络池化层全连接层AlexNet卷积神经网络2026/10/1136池化层(Pooling)作用:连接在卷积层后,减少模型参数,减小训练负担,控制过拟合问题。操作:在各深度的特征映射图上独立进行,空间缩减分辨率,缩减方式为有多种:max,average,L2-norm等。2026/10/1137池化层(Pooling)超参数:空间覆盖度SpatialExtent、步长Stride输入:三维数据(W1,H1,D1)输出:三维数据(W2,H2,D2)W2=(W1-F)/S+1H2=(H1-F)/S+1D2=D1空间窗口尺寸F=2,步长S=22026/10/1138全连接层(Fully-connected)该层各神经元与前层所有神经元均相连接一个权重向量w和同维度输入数据的点乘结果2026/10/1139全连接层和卷积层的转换主要区别:卷积层:局部连接/共享参数全连接层:整体连接/参数独立共同点:点乘计算,功能形式相同含全连接层全卷积层1×12026/10/1140全连接层和卷积层的转换1×1含全连接层全卷积层可通过滑动的形式在一次正向传播中计算输出参数量没有改变计算方式没有改变将全连接层的权重矩阵改变为卷积层滤波器2026/10/1141全连接层和卷积层的转换转换的优势:面对更大尺寸的输入图像数据时全连接层需要将输入图像在网络中前向传播N次全卷积网络仅需一次前向传播,提升了效率2026/10/1142全连接层和卷积层的转换全卷积神经网络(FCN)适应任何尺寸的输入图像数据可用于更精细的像素级的图像识别任务(图像分割)2026/10/1143功能层在案例中的解析LeNet:早期卷积神经网络模型,用于字符识别:卷积神经网络基本架构使用三个层作为一个系列:卷积,池化,非线性激活卷积层提取空间特征(CONV)池化层进行空间下采样(POOL)多个全链接层作为最后的分类器(FC)LeNet提供了利用卷积层堆叠进行特征提取的框架,奠定了深度卷积神经网络的重要基础。2026/10/1144功能层在案例中的解析LeNet中的卷积层可视化解析可训练参数:(5*5+1)*6(每个滤波器5*5=25个unit参数和一个bias参数,共6个滤波器)连接数:(5*5+1)*6*28*28=122304个连接超参数:输入图片:32*32卷积核大小:5*5卷积核种类:6输出featuremap大小:(32-5+1)=28*28神经元数量:28*28*62026/10/1145功能层在案例中的解析输入:28*28;采样区域:2*2;采样种类:6采样方式:4个输入相加,乘以一个可训练参数,再加上一个可训练偏置。结果通过sigmoid函数输出FeatureMap大小:14*14(28/2)神经元数量:14*14*6可训练参数:2*6(加和的权重+偏置)连接数:(2*2+1)*6*14*14可视化解析LeNet中的池化层2026/10/1146功能层在案例中的解析LeNet中的全连接层输入:C5层120维向量计算方式:计算输入向量和权重向量之间的点积,再加上一个偏置,结果通过sigmoid函数可训练参数:84×(120+1)=10164可视化解析2026/10/11BTBU-CIE47小结池化层和全连接层操作全连接层和卷积层的转换各功能层的案例分析致谢本课程所引用的一些素材来源于多种媒体及同事和同行的交流,难以一一注明出处,特此说明并表示感谢!
2026/10/11BTBU-CIE48
卷积神经网络的应用之视觉目标检测主讲人:张洁北京工商大学计算机与信息工程学院2026/10/11BTBU-CIE50本节提要目标检测应用概述目标检测的应用案例Region-CNN2026/10/1151卷积神经网络的应用背景概述计算机视觉领域的任务2026/10/1152卷积神经网络的应用背景概述端到端的应用特点End-to-End输入端:图像或视频输出端:识别结果神经网络映射2026/10/1153CNN在视觉目标检测的应用目标检测的任务解析:car:
1.000dog:
0.997person:
0.992person:
0.979horse:
0.993定位
Where?识别
What?2026/10/1154CNN在视觉目标检测的应用目标检测任务的发展背景:
PASCALVOC挑战赛(2005年—2012年)http://host.robots.ox.ac.uk/pascal/VOC/2026/10/1155目标检测评价指标Evaluationmetrics物体检测:定位出物体的boundingbox+识别出boundingbox里的物体是车辆;boundingbox的定位精度指标——重叠面积IOU;矩形框A、B的IOU计算公式为:IOU=(A∩B)/(A∪B)如果算法百分百跟人工标注的数据完全匹配,则IOU=12026/10/1156Region-CNN总体框架:总个过程分为三个程序:a、找出候选框;b、候选框的标注;c、利用CNN提取特征向量并分类Step1:输入一张图片,先定位出2000个物体候选框;Step2:根据重叠区域对候选框属于正负样本的属性进行定义;Step3:采用CNN提取每个候选框中图片的特征向量,特征向量的维度为4096维;采用分类器或概率映射对各个候选框中的物体进行分类识别。[1]Ross
Girshick,
Jeff
Ronahue,
etc.Richfeaturehierarchies
for
AccurateObjectDetectionandSegmentation,CVPR,20142026/10/1157Region-CNNStep1:候选框搜索阶段通过searchforobjectrecognition算法搜索出2000个候选框;搜出的候选框是矩形的,且大小各不相同。然而CNN对输入图片的大小有固定要求,需对候选框尺寸进行统一缩放;假设下一阶段CNN所需要的输入图片大小是个正方形图片227*227。2026/10/1158Region-CNNStep1:候选框搜索阶段通过searchforobjectrecognition算法搜索出2000个候选框;搜出的候选框是矩形的,且大小各不相同。然而CNN对输入图片的大小有固定要求,需对候选框尺寸进行统一缩放;假设下一阶段CNN所需要的输入图片大小是个正方形图片227*227。2026/10/1159Region-CNNStep2:候选框的标注意义:用缩放后的2000个候选框图片训练CNN前,需确定哪些图片是正样本,哪些是负样本。问题:人工标注的数据图片中只标注了正确的boundingbox,搜索出来的2000个矩形框不可能会出现一个与人工标注完全匹配的候选框。怎么办?
IOU2026/10/1160Region-CNN正样本:用selective
search挑选出的候选框与物体的人工标注矩形框的重叠区域IoU大于0.5,把这个候选框标注成物体类别;负样本:IOU小于0.5,把它当做背景类别。Step2:候选框的标注2026/10/1161Region-CNNStep3:CNN特征提取与分类网络有监督预训练阶段参数初始化部分(fine-tuning):物体检测的一个难点在于,物体标签训练数据少,如果要直接采用随机初始化CNN参数的方法,目前的训练数据量是远远不够的。怎么办???Fine-tuning2026/10/1162Region-CNNStep3:CNN特征提取与分类重要概念:Fine-tuning假设要检测的物体类别有N类,需要把上面预训练阶段的CNN模型的最后一层给替换掉,替换成N+1个输出的神经元(加1,表示还有一个背景)被替换的一层直接采用参数随机初始化的方法,其它网络层的参数不变;接着开始继续SGD训练。SGD学习率选择0.001,在每次训练的时候,我们batch
size大小选择128,其中32个正样本、96个负样本2026/10/1163Region-CNNStep3:特征分类,确定目标类型分类方法:-概率映射函数-结合其他单独的分类器,例如SVM等2026/10/11BTBU-CIE64小结CNN的应用背景概述视觉目标检测应用案例Region-CNN致谢本课程所引用的一些素材来源于多种媒体及同事和同行的交流,难以一一注明出处,特此说明并表示感谢!
2026/10/11BTBU-CIE65
卷积神经网络的性能分析
之网络退化问题主讲人:张洁北京工商大学计算机与信息工程学院2026/10/11BTBU-CIE67本节概要深度神经网络的网络退化问题描述解决网络退化问题——ResNet2026/10/1168神经网络的深度DeepLearningGetsWayDeeper*-----KaimingHe(何恺明)@FAIR,
CA*K.He,X.Zhang,S.Ren,andJ.Sun.Deepresiduallearningforimagerecognition.InCVPR,2016.
网络深度的作用和意义在何处?为了提取更强的特征,可否直接增加网络层数?2026/10/1169神经网络的深度网络深度的作用?CNN能够提取low-level/mid-level/high-level的特征;网络的层数越多,意味着能够提取到不同level的特征越丰富;越深的网络提取的特征越抽象,越具有语义信息。为了提取更强的特征,为什么不能简单地增加网络层数?网络退化问题高层低层中层2026/10/1170网络退化问题随着网络的加深,出现了训练集准确率下降的现象,可以确定这不是由于Overfit过拟合造成的(过拟合时训练集准确率很高)注:上图及后续多图引用自K.He,X.Zhang,S.Ren,andJ.Sun.Deepresiduallearningforimagerecognition.InCVPR,2016.
2026/10/1171深度残差网络(ResNet)---解决网络退化什么是残差?映射:y
=
残差映射F(x)+恒等映射x残差学习模块Shortcut---“抄近道”XIdentity恒等映射F(x)Residual残差映射残差学习模块的作用:若网络已达最优,继续加深网络,residualmapping被学习为0,仅剩identitymapping。这样理论上网络一直处于最优状态,网络的性能不会随深度增加而降低。2026/10/1172深度残差网络(ResNet)---解决网络退化冗余层
恒等映射
浅层网络目标:学习恒等映射函数y=xShortcut---“抄近道”XIdentity恒等映射F(x)Residual残差映射2026/10/1173深度残差网络(ResNet)---解决网络退化问题:直接拟合潜在的恒等映射函数y=x较困难,这是深层网络难以训练的原因。解决方案:如果把网络设计为y=F(x)+x,可以转换为学习一个残差函数F(x)=y-x.只要F(x)=0,就构成了一个恒等映射y=x.拟合残差为0较拟合恒等映射更加容易。Shortcut---“抄近道”XIdentity恒等映射F(x)Residual残差映射2026/10/1174深度残差网络(ResNet)---解决网络退化残差模块的种类整个残差模块结构称为一个“buildingblock”右图又称为”bottleneckdesign”降低维数,减少计算量常规Residual:用于浅层网络中(ResNet34)Bottleneckdesign:用于深层网络中(ResNet50/101/152)2026/10/1175深度残差网络(ResNet)---解决网络退化Bottleneckdesign降参作用分析第一个1x1的卷积把256维channel降到64维,在最后通过1x1卷积恢复;Bottleneckdesign参数数目:1x1x256x64+3x3x64x64+1x1x64x256=69632;不使用bottleneck即为两个3x3x256的卷积,参数数目:3x3x256x256x2=1179648,差16.94倍Bottleneckdesign:用于深层网络中(ResNet50/101/152)常规Residual:用于浅层网络中(ResNet34)256-d2562562026/10/1176深度残差网络(ResNet)---解决网络退化映射的维度相加问题:F(x)和x按照channel维度相加,若维度不同,如何相加?
两种情况:“实线”连接“虚线”连接实线Connection部分(“第一个粉色矩形和第三个粉色矩形”)都是执行3x3x64的卷积,他们的channel个数一致采用计算方式:y=F(x)+x2026/10/1177深度残差网络(ResNet)---解决网络退化两种情况:“实线”连接“虚线”连接虚线Connection部分(“第一个绿色矩形和第三个绿色矩形”)分别是3x3x64和3x3x128的卷积操作,他们的channel个数不同(64和128)采用计算方式:y=F(x)+Wx其中W是卷积操作,用来调整x的channel维度的;映射的维度相加问题:F(x)和x按照channel维度相加,若维度不同,如何相加?
2026/10/1178深度残差网络(ResNet)---解决网络退化增加层(可能有冗余层)2026/10/1179深度残差网络(ResNet)---解决网络退化18层神经网络
vs.34层神经网络
vs.34层残差神经网络性能表现:图细曲线表示训练误差,加粗曲线为验证误差2026/10/1180深度残差网络(ResNet)---解决网络退化各种DNN训练结果对比:4.4919.382026/10/1181小结加深网络,提取更深层的特征网络出现退化(训练误差增大)哪些层有用?哪些层冗余?所以什么结构可达最优网络?自动学习残差映射深度残差神经网络自动构建结构最优的神经网络排除冗余层的训练负担避免冗余层的训练误差不再惧怕网络深度的加深DeepResidualNetworks——DeepLearningGetsWayDeeper2026/10/11BTBU-CIE82小结深度神经网络的网络退化问题面向网络退化问题的DNN——深度残差网络ResNet致谢参考文献:[1]K.He,X.Zhang,S.Ren,andJ.Sun.Deepresiduallearningforimagerecognition.InCVPR,2016.[2]K.He,X.Zhang,S.Ren,andJ.Sun.Identitymappingsindeepresidualnetworks.InECCV,2016.本课程所引用的一些素材来源于多种媒体及同事和同行的交流,难以一一注明出处,特此说明并表示感谢!
2026/10/11BTBU-CIE83
卷积神经网络的性能分析
之过拟合与欠拟合主讲人:张洁北京工商大学计算机与信息工程学院2026/10/11BTBU-CIE85本节概要深度神经网络的性能评价过拟合与欠拟合问题描述过与欠拟合问题解决方案2026/10/1186深度神经网络的超参数三类超参数:数据相关:丰富数据库、数据泛化处理训练相关:训练动量、学习率、衰减函数、正则化方法网络相关:层数、节点数、滤波器数,分类器种类2026/10/11BTBU-CIE87深度神经网络的性能评价数据集通常分为三类:训练集、验证集、测试集训练模式:多倍交叉验证(cross-validation,cv)数据集2026/10/11BTBU-CIE88深度神经网络的性能评价评价标准:三个误差训练误差:训练集数据的学习误差交叉验证误差:学习模型在验证集上的平均预测误差测试误差:学习模型在完全独立的测试集上的平均预测误差训练误差测试误差2026/10/11BTBU-CIE89过拟合和欠拟合的判断方法误差vs训练集大小左端处于过拟合,右端处于欠拟合误差vs模型复杂度:A点处于欠拟合,B点最优,C点处于过拟合方法一:方法二:当Jcv≫Jtrain且Jtrain较小时(右侧)模型可能存在过拟合ABC2026/10/11BTBU-CIE90过拟合和欠拟合过拟合现象的表现:随着训练过程的进行,在trainingdata上的trainingerror渐渐减小,可在验证集上evaluationerror却反而渐渐增大过拟合问题的本质解释:由于训练出来的网络过拟合了训练集,对训练集以外的数据却不适用2026/10/11BTBU-CIE91过拟合和欠拟合问题欠拟合现象的表现:随着训练过程的进行,在trainingdata上的t
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年陕西供销企业集团有限公司人员招聘笔试参考试题及答案详解
- 2026年油墨及类似产品制造行业投资策略研究报告及未来五至十年蓝海开拓与红海突围
- 2026年道路运输行业消费行为研究报告及未来五至十年降本增效与利润率修复
- 2026年北京长城电子装备有限责任公司人员招聘考试备考试题及答案详解
- 2026年其他专用化学产品制造行业供需格局研究报告及未来五至十年自主创新与安全可控
- 2027年度江西铜业加工事业部校园招聘15人考试备考题库及答案解析
- 2026年金属废料和碎屑加工处理行业趋势洞察报告及未来五至十年可持续发展与长期价值评估
- 2026年中国石油北京销售分公司人员招聘笔试参考题库及答案详解
- 2026年张家口市烟草专卖局人员招聘考试参考试题及答案详解
- 2026年山东省滕州市高二生物上册期末考试检测卷附参考答案(完整版)
- 安徽 马钢股份招聘考试 需招聘 26 人
- 铁路外包施工人员安全准入考试题库
- 第二十六章 二次函数 单元测试卷(含答案) 2026-2027学年人教版九年级数学上册
- 2025年遗体火化师题库及答案
- UG练习图纸大全-65张-绝对受用
- 高空作业清洁合同范本
- 《EPDM应用技术规程》
- (正式版)DB15∕T 1932-2020 《公路抗凝冰沥青混合料设计与施工技术规范》
- 中行职称管理办法
- GB/T 34110-2025信息与文献文件(档案)管理核心概念与术语
- 机械制图习题集-附带答案
评论
0/150
提交评论