机器模式识别 6_第1页
机器模式识别 6_第2页
机器模式识别 6_第3页
机器模式识别 6_第4页
机器模式识别 6_第5页
已阅读5页,还剩66页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

机器学习与模式识别第五章深度学习第五章

深度学习定义:人工智能领域革命性技术,模拟人脑神经网络结构,从大量数据中自动提取特征与模式核心能力:为复杂任务提供解决方案,覆盖图像识别、自然语言处理、时间序列数据处理等领域典型应用计算机视觉自然语言处理医疗领域2第五章

深度学习3第五章

深度学习

5.1卷积神经网络

5.2循环神经网络

5.3深度强化学习45.1.1卷积神经网络简介卷积神经网络(ConvolutionalNeuralNetwork,CNN)是近几年发展起来并引起人们广泛重视的一种高效识别方法。定义:深度前馈人工神经网络,人工神经元可响应周围单元,适用于大型图像处理一种层次模型,每层数据的形式都是一个三维张量(Tensor)。基本逻辑:前馈运算(逐层抽取高层语义信息)→反向传播(更新参数)→网络收敛优势:避免图像复杂前期预处理,直接输入原始图像,在模式分类领域应用广泛分类:一维(序列数据)、二维(图像文本识别)、三维(医学图像、视频识别)55.1卷积神经网络卷积神经网络与普通神经网络6(a)传统神经网络(b)把神经元设计成3个维度(c)卷积神经网络CNN神经元为3个维度(width、height、depth),适配图像输入CNN的基本体系结构通常由三种层构成,分别是卷积层(ConvolutionalLayer)、池化层(PoolingLayer)和全连接层(Fully-ConnectedLayer)。5.1卷积神经网络7图5-1-2CNN概念示范图核心层:卷积层、池化层、全连接层,卷积层与池化层组成卷积组逐层提取特征,全连接层完成分类参数优化:通过权值共享与局部感知减少模型的复杂度,提升训练效率5.1.2卷积层

5.1.2.1卷积层介绍卷积层是卷积神经网络中的基础操作,甚至在网络最后起分类作用的全连接层在工程实现时也是由卷积操作替代的。主要作用:抽取特征,使网络具有转移不变性,兼具降维作用主要参数:卷积窗口(常用3×3、5×5)、步长、padding(非padding、zero-padding、mean-padding)激活函数:常用ReLU激活函数卷

的,也

的。多通道卷积即每个通道对应一个卷积核,结果相加后经激活函数处理。85.1.2.1卷积层介绍运算流程:①选择(x,y)坐标→②核中心对齐坐标→③核与输入对应位置乘积求和(核输出)→④存储核输出→⑤按步长滑动计算9(a)卷积过程(b)卷积计算图5-1-3卷积操作以3×3卷积核在5×5图像上的运算为例5.1.2.1卷积层介绍1.局部感知:每个神经元仅感知局部区域,如1000×1000图像中神经元连接10×10像素,参数减少至原来的万分之一10图5-1-4(b)

局部连接卷积层的神经元是三维的,也具有深度。卷积层的参数包含一系列过滤器(Filter,也叫卷积核),每个过滤器都训练一个深度,有几个过滤器,输出单元就具有多少深度。图5-1-5过滤器(卷积核)5.1.2.1卷积层介绍1.局部感知:用以下公式计算一个维度(宽或高)内一个输出单元里可以有几个隐藏单元:(W=输入大小,F=感受野,P=补零数量,S=步幅)11图5-1-7隐藏单元输出大小举例5.1.2.1卷积层介绍2.权值共享:为了进一步减少参数,将同一卷积核应用于全图(相当于对图像做一个全图滤波),提取特征与位置无关12如图5-1-8所示,展示了一个3×3的卷积核在5×5的图像上做卷积的过程。每个卷积都是一种特征提取方式,就像一个筛子,将图像中符合条件的部分筛选出来。得到的图像大小为5-3+1=3,即3×3的图像。5.1.2.1卷积层介绍3.多个卷积核:添加多个卷积核(如32个)学习多种特征,提升特征表达能力13图5-1-9多个卷积核5.1.2.1卷积层介绍3.多个卷积核:图5-1-10展示了在4个通道上的卷积操作,有两个卷积核,生成两个通道。计算公式如下:14图5-1-10多卷积核操作5.1.2.1卷积层介绍3.多个卷积核15图5-1-11卷积过程5.1.2.2激活函数核心作用:引入非线性因素,解决线性模型表达力不足问题,使网络能处理非线性可分样本关键性质:需满足非线性、连续可微、范围不饱和、单调性、原点附近近似线性等常用激活函数sigmoid函数:已被淘汰,缺点为饱和时梯度小(梯度耗散)、输出不以0为中心tanh函数:仍存在饱和问题165.1.2.2激活函数常用激活函数ReLU函数:优势为x>0时梯度恒为1(无梯度耗散)、增大网络稀疏性、运算量小,缺点为可能出现“死亡神经元”LeakyReLU函数:改善了ReLU的死亡特性但损失稀疏性Maxout函数:Maxout泛化ReLU和LeakyReLU的死亡特性,但损失稀疏性,且参数翻倍175.1.2.2激活函数激活函数选择:保证数据的输入与输出也是可微的,运算特征是不断进行循环计算的主流选择:ReLU函数(需合理设置学习率,避免死亡神经元)归一化要求:sigmoid函数、tanh函数需输入归一化,ReLU函数无需场景适配:特征差异明显用tanh函数,需细微分类用sigmoid函数185.1.3池化层

核心作用:降低卷积层输出的特征维度,改善过拟合,实现空间不变性(旋转、平移、伸缩)

辅助作用:减少参数与计算量,提升模型泛化能力

常用的池化有平均池化(Mean-pooling)、最大池化(Max-pooling)和随机池化(Stochastic-pooling)3种。19图5-1-12最大池化5.1.3池化层平均池化:计算区域平均值,擅长保留背景信息最大池化:选取区域最大值,擅长提取纹理特征随机池化:按元素值概率随机选择,平衡特征提取效果20池化层位于两个卷积层之间,特征图数量与前一卷积层一致平均池化减小邻域受限导致的方差误差,最大池化减小卷积参数误差导致的均值偏移5.1.4全连接层连接方式:将前一层所有的神经元与当前层的每个神经元相连接,即每层节点与上一层所有节点相连,且不保存空间信息核心角色:分类器,综合前层提取的特征,将分布式特征映射到样本标记空间21图5-1-13全连接图5.1.4全连接层计算原理:由于需要对W和b进行更新,还要向前传递梯度,所以我们需要计算如下3个偏导数:对上一层的输出(当前层的输入)求导

若我们一次训练16张图片,即batch_size=16,则我们可以把计算转换为如下图的矩阵形式。22图5-1-16反向传播计算转换示意图5.1.4全连接层计算原理:由于需要对W和b进行更新,还要向前传递梯度,所以我们需要计算如下3个偏导数:对权重系数W求导对偏置系数b求导23图5-1-17权重求导计算示意图图5-1-18偏置求导计算示意图5.1.4全连接层在实际使用中,全连接层可由卷积操作实现:前层是全连接层的全连接层可以转换为卷积核为1×1的卷积;前层是卷积层的全连接层可以转换为卷积核为h×w的全局卷积,h和w分别为前层卷积结果的高和宽。一些性能优异的网络模型(如SesNet和GoogLeNet等)均用全局平均池化取代FC来融合学到的深度特征,提升预测性能245.1.5经典CNN模型

5.1.5.1AlexNet背景:2012年由亚里克斯提出,LeNet加宽版,首次用GPU加速创新核心:ReLU作为激活函数使用Dropout随机忽略一部分神经元,防过拟合重叠最大池化LRN层数据增强25AlexNet的主要特点5.1.5.1AlexNet结构:65万个神经元、5个卷积层(3个后接池化层)、3个全连接层26图5-1-19AlexNet结构模型图5.1.5.2VGGNet核心特点:反复堆叠3×3卷积核与2×2最大池化,构建16~19层网络,VGG16包含16层,VGG19包含19层。优势:扩展性强,迁移泛化效果好;使用多个小卷积核替代大卷积核,减少参数且增加非线性映射27图5-1-20VGGNet模型的结构图5.1.5.3GoogLeNet核心创新:Inception模块:Inception结构一分为四,做一些不同大小的多尺度卷积,之后再池化堆叠特征图。全局平均池化替代全连接层增加辅助softmax,防梯度消失28图5-1-22GoogLeNet的Inception结构5.1.5.3GoogLeNet优势:GoogLeNet做了更加大胆的网络结构尝试,虽然深度有22层,但却比AlexNet和VGGNet小很多,GoogLeNet的参数为500万个,AlexNet的参数个数是GoogLeNet的12倍,VGGNet的参数个数又是AlexNet的3倍,因此在内存或计算资源有限时,GoogLeNet是比较好的选择;从模型结果来看,GoogLeNet的性能更加优越。29参数少、性能优,适配资源有限场景5.1.5.4ResNet核心解决:深层网络训练集准确率下降问题(不是由于过拟合造成的)创新结构:残差单元(identitymapping和residualmapping)、shortcut连接,使原始输入信息直接连接直接至后续层,使得网络后面的层也可以学习残差规模:最深达152层,通过残差学习发挥深度优势30图5-1-23ResNet结构图5.1.5.4ResNet31图5-1-24各类CNN模型图5.2循环神经网络

5.2.1简单循环网络简单循环网络(SimpleRecurrentNetwork,SRN)是最简单的一种循环神经网络,它的基本结构如图5-2-1所示(黑色方块表示一个延时器)基本结构:多层感知器隐含层增加反馈连接,含延时器,可视为时间维度权值共享的前向神经网络32图5-2-1简单循环网络5.2.1.1简单循环网络的前向传播过程简单循环网络在自然语言处理领域的应用十分广泛,下面以机器翻译为例介绍简单循环网络的使用过程。前向传播过程中核心公式如下:其中W为是状态-状态权重矩阵,U是状态-输入权重矩阵f为激活函数(通常选择tanh函数),V为输出-状态权重矩阵,g为输出层激活函数(一般采用softmax函数)33隐含层值ht依赖xt与ht-1过程特点:t时刻输出受前面所有输入影响,可建模时序关系5.2.1.2简单循环网络的训练过程假定使用交叉煽损失函数,在t时刻的损失函数和总损失分别如下:优化算法:梯度下降法,权值矩阵更新34图5-2-3按时间维度展开的前向神经网络5.2.1.2简单循环网络的训练过程梯度计算采用随时间反向传播(BPTT)算法,分成以下三步:前向计算t时刻隐含层的值ht、输出值

和损失函数值Lt。反向计算在t时刻的损失函数Lt关于k(k≤t)时刻的加权输入zk的偏导值,称为误差项值δt,k。计算损失函数关于每个权值矩阵的梯度。355.2.1.3简单循环网络的长期依赖问题问题表现:过“深”的结构使模型丧失了“记忆”之前信息的能力,使优化变得极其困难。外在表现为序列较长时,训练易出现梯度消失或梯度爆炸临时解决方案:合理初始化权值:避免手动调参,最简单的方法是令权值矩阵W=I,同时令f'(zi)=I,即为了能建模非线性关系,更换策略为36对于记忆容量的问题,一个解决方案是选择性遗忘和更新,如引入门机制来控制信息的累积速度。5.2.2长短期记忆网络一种采用机制缓解梯度消失和梯度爆炸问题的典型循环神经网络。37图5-2-4LSTM的门机制通过门机制与长期状态实现长时记忆5.2.2.1门机制LSTM网络里的“门”是一种软(Soft)“门”,取值是在[0,1]内部连续的值,表示允许部分信息通过。为了控制信息传递,LSTM使用了三个门:遗忘门,控制上一时刻的内部单元ct-1

有多少信息传到了当前时刻的内部单元ct;输入门,负责控制把当前单元状态的候选状态

输入长期状态ct输出门,负责控制是否把长期状态ct输出到当前时刻隐含层的值ht385.2.2.2长短期记忆网络的前向传播过程39图5-2-5LSTM在t时刻的总体结构5.2.2.2长短期记忆网络的前向传播过程计算遗忘门ft,控制ct-1的保留比例计算输入门it:计算候选状态

:计算单元状态ct:计算输出门ot:隐含层的值ht:405.2.2.3长短期记忆网络的训练过程定义损失函数:总损失定义如下,其中Lt为t时刻交叉熵损失使用梯度下降算法优化权重使损失函数最小化,梯度更新公式如下LSTM网络使用BPTT算法计算梯度,需优化8个权重参数,分别是:遗忘门、输入门、输出门、候选状态的权重矩阵与偏置415.2.2.3长短期记忆网络的训练过程

通过BPTT算法计算L关于各个权重参数的梯度,主要有以下3步前向计算每个时刻的每个单元的输出值反向计算总误差项值δt,k,根据误差项来计算每个权重参数的梯度425.2.2.4长短期记忆网络的变体门控制循环单元(GatedRecurrentUnit,GRU)网络是一种比LSTM更加简单和有效的循环神经网络GRU将输入门和遗忘门合并成一个门—更新门zt,同时完成遗忘和输入任务;引入了重置门rt,用来控制当前时刻隐含层的值ht与上一时刻的值ht-1的线性依赖关系435.2.2.4长短期记忆网络的变体候选状态定义为隐含层输出44图5-2-6GRU基本结构参数更少,训练效率更高5.2.3双向循环网络和多层循环网络

5.2.3.1双向循环网络结构:两层循环神经网络组成,它们的输入相同,只是信息传递的方向不同(正向、反向)45图5-2-7按时间展开的双向循环神经网络适用场景:需结合上下文的任务(如文本补全、语义分析)5.2.3双向循环网络和多层循环网络

5.2.3.1双向循环网络隐含层值计算:

(正向)

(反向)最终465.2.3双向循环网络和多层循环网络

5.2.3.2多层循环网络结构:多个循环网络堆叠,第l层输入为第l-1层输出47图5-2-8按时间展开的堆叠循环神经网络适配复杂时序任务5.2.3双向循环网络和多层循环网络

5.2.3.2多层循环网络隐含层值计算:l=1时,

485.3深度强化学习又称增强学习,是指一类在与环境(Environment)的不断交互中学习从状态(State)到行为的映射的方法。在训练过程中,智能体(Agent)根据环境反馈(Reward)的奖励学习出一组行为策略,以最大化其所获得的奖励总值。495.3.1强化学习定义智能体主要进行学习和决策环境受智能体动作的影响,反馈相应的奖励或惩罚50图5-3-1智能体与环境的交互示意强化学习是一种通用的学习框架,能用于解决通用人工智能问题。5.3.1强化学习定义强化学习包括以下5个基本要素:状态S是智能体所处的环境信息动作A是智能体的动作空间,a是智能体采取的行为策略

是状态s到动作a的映射状态转移概率

,是智能体根据当前状态st做出一个动作at

之后,环境在下一个时刻转变为状态st+1的概率。即时奖励

,环境反馈智能体的一个奖励,与下一时刻的状态st+1有关515.3.1强化学习定义智能体的目标就是学习一种策略,使预期回报最大化。智能体的策略通常分为确定性策略(DeterministicPolicy)和随机性策略(Stoc-hasticPolicy)。确定性策略是指从状态空间到动作空间的映射函数π:S→A,是确定的。随机性策略表示在给定环境状态时,智能体的动作选择是一种概率分布。为了形式化强化学习问题,介绍马尔可夫过程(MarkovProcess)和马尔可夫决策过程(MarkovDecisionProcess,MDP)。525.3.1强化学习定义马尔可夫性质:随机变量序列下一时刻的状态st+1

只取决于当前状态st,而与t-1及t-1之前的状态都没有关联性,即马尔可夫决策过程是在马尔可夫过程中加入动作a,即下一时刻的状态st+1和当前时刻的状态st以及动作at相关:智能体从初始环境s0选择动作a0并执行,就到达下一个状态s1,并反馈智能体一个即时奖励r1,然后智能体又根据状态s1

选择动作a1,到达下一个状态s2,并反馈奖励r2。依此类推535.3.1强化学习定义给定策略π(a|s),智

报(Return),即如果环境中没有终止状态(如终身学习的机器人),即T=+∞,则称为持续性的任务,通过折扣率来降低远期回报的权重。折扣回报(DiscountedReturn)定义为545.3.1.1目标函数一个策略πθ(a|s)的期望回报(ExpectedReturn)为

强化学习的目标就是学习到一个策略πθ(a|s)来最大化期望回报,其中,θ是策略函数的参数。55优化目标函数的过程中会涉及几个概念,如状态值函数、状态-动作值函数等5.3.1.2值函数根据输入不同,值函数(ValueFunction)可分为状态值函数和状态

动作值函数。状态值函数用于评估智能体在给定状态下的好坏程度,定义如下:565.3.1.3Q函数状态-动作值函数(State-ActionValueFunction)也常被称为Q函数(Q-Function),指当智能体执行到某一步时,估计在当前状态下执行该动作的好坏程度。这是关于Q函数的贝尔曼方程。状态值函数和Q函数都可以用贝尔曼方程来表示。57事实上,状态值函数和Q函数相类似,区别在于Q函数多考虑了当前时刻下执行动作所带来的影响。5.3.2强化学习求解方法求解强化学习等同于优化贝尔曼方程。无论采用何种方法来求解强化学习任务,其核心都是计算最优值函数或最优策略。而值函数则是对最优策略的表达,即最优策略就是使值函数最大的策略。随机初始化一个策略并计算该策略的值函数,根据值函数来设置新的策略;反复迭代,直到收敛。动态规划(DynamicProgramming,DP)法蒙特卡罗法(MonteCarloMethod)时序差分学习法(Temporal-differenceLearningMethod)585.3.2强化学习求解方法动态规划(DynamicProgramming,DP)法适合求解马尔可夫决策过程已知的强化学习任务。核心思想:使用值函数来组织和构建对较优策略的搜索。主要有:59策略迭代:由策略评估和策略改进相互组合而成。策略评估,用贝尔曼方程迭代计算Vπ(s)。策略改进,根据值函数来更新策略5.3.2强化学习求解方法动态规划(DynamicProgramming,DP)法值迭代:将策略评估和策略改进这两个过程合并,直接计算出最优策略。

假设最优策略π*对应的值函数称为最优值函数,那直接用贝尔曼最优方程迭代计算最优值函数605.3.2强化学习求解方法蒙特卡罗法(MonteCarloMethod)适用场景:模型未知,基于采样学习,即模型无关强化学习首先从初始状态到终止状态进行完整的数据采样,得到N个轨迹

随后通过大量的反馈,近似估计Q函数为进行策略改进,然后在新的策略下重新通过采样来估计Q函数,并不断重复,直至收敛。61需要大量计算资源和存储资源5.3.2强化学习求解方法时序差分学习法(Temporal-differenceLearningMethod)融合动态规划与蒙特卡罗的优点,是目前强化学习求解的主要方法通过模拟一段轨迹,每行动一步或者几步,就利用贝尔曼方程来评估行动前状态的价值。当时序差分学习法中每次更新的动作数为最大步数时,就等价于蒙特卡罗法。分为两种:固定策略(以SARSA算法为代表)、非固定策略(以Q学习算法为代表)。625.3.2强化学习求解方法时序差分学习法(Temporal-differenceLearningMethod)固定策略(以SARSA算法为代表)Q函数更新公式采样与优化策略均为ε-贪心算法63时序差分学习法只需要一步,其总回报依赖马尔可夫性质来进行近似估计。5.3.2强化学习求解方法时序差分学习法(Temporal-differenceLearningMethod)

非固定策略(以Q学习算法为代表)其思想是从当前状态开始的所有后续步骤中以最大化总奖励的期望值为目标来寻找最优策略。Q代表智能体在给定状态下所采取动作的“质量”。Q函数的估计方法为直接估计最优状态值函数Q*(s,a)645.3.3深度Q网络以用一个复杂的函数(如深度神经网络)来拟合策略函数或者值函数,如图5-3-2所示的深度强化学习,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论