【《典型深度学习网络概述》3900字】_第1页
【《典型深度学习网络概述》3900字】_第2页
【《典型深度学习网络概述》3900字】_第3页
【《典型深度学习网络概述》3900字】_第4页
【《典型深度学习网络概述》3900字】_第5页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

典型深度学习网络概述目录TOC\o"1-3"\h\u2068典型深度学习网络概述 1290521.1深度学习的基础原理 1126731.2激活函数 158001.3代价函数 2270721.4四种典型的深度神经网络 31.1深度学习的基础原理图2-1是基础的神经网络结构,由输入层、隐藏层、输出层组成。网络的每一层由多个神经元共同连接组成,每层的各个神经元与上一层的其他神经元和下一层的其他神经元相互连接,每个神经元接受上一层的信息输入,以一定的计算法则求和输出,并使用激活函数将输入信号激活为输出函数,继续新的信息输出。如果不使用激活函数,那么神经网络处理非线性模型能力将大大减弱,所以引入激活函数能够让神经网络的功能更强大。图2-1DNN的结构1.2激活函数在人工神经网络中,节点的激活函数定义了给定输入或输入集合时该节点的输出。一个标准集成电路可以被看作是一个激活函数的数字网络,根据输入可以是开(1)或关(0)。这类似于神经网络中的线性感知器的行为。然而,只有非线性激活函数允许这样的网络使用少量节点来计算非平凡问题,这样的函数具有非线性。常用的激活函数的主要类型有sigmoid函数、tanh函数、ReLU函数:1.sigmoid函数:S它能够将一个输入的连续真实值转化成0和1之间的输出,尤其当一个输入的真实值是非常大的一个负数时,输出可以转化成0;若它是非常大的一个正数,其输出将会是1.sigmoid函数的缺点是:1.在一个深度的神经网络中,当梯度逆向传播时会导致一个梯度的爆炸和另一个梯度的消失,其中一个梯度爆炸事件发生的可能性和概率是极为微小,而另一个梯度的消失事件发生的可能性和概率是比较大的;2.sigmoid的输出不是零均值(zero-centered)。这种新的情况是不容易被广泛采用的,因为它可能会直接导致后一层信号神经元把从上一层信号输出的非零均值的数字信号转换成下一层的信号输入;3.其解析式中包括了一个幂运算,在使用计算机程序求解幂的过程中运算相对来说比较费工。对于一些规模比较大的深度网络结构,这样就可能会较大程度地增加了深度神经网络训练的时间。2.tanh函数:S它与sigmoid函数有非常相似的函数曲线,可以通过平移运算实现相互之间的变换。不过tanh函数另外有两个优势:零均值,且在原点附近更接近恒等函数的形式。均值不为0就意味着自带了一个偏移值,在计算时是额外的负担,这会使得收敛变得更慢;更接近恒等函数意味着在几何变换运算中更具有优势,比如在激活值较低时可以利用恒等函数的某些性质,直接进行矩阵运算。所以在具体应用场景中,tanh函数比sigmoid函数更优越,训练相对容易。但是tanh函数和sigmoid函数具有相同的缺点,在其饱和区接近于0,都容易产生后续梯度消失、计算量大的问题。3.ReLU函数SReLU函数其实就是一个取最大值函数,它的计算速度非常快,只需要判断输入是否大于0,并且它在大型网络的训练中,收敛速度远快于sigmoid和tanh。但是ReLU函数输出不是零均值,而且当输入非常大或者非常小时,大部分的神经元都会出现饱和状态,失去梯度因而无法学习。1.3代价函数为了找到合适的权重和偏置值,使得对于所有的输入值,输出值都能近似等于真实值,我们定义一个代价函数来评估当前网络结构的优劣,代价函数的定义是所有样本误差值的平均,常用的代价函数有二次代价函数、交叉熵代价函数等,令C表示代价函数,x表示样本,y表示实际值,a表示输出值,n表示样本数。分别介绍如下:二次代价函数:C=交叉熵代价函数:C=−在神经网络中,若输出神经元是线性函数,代价函数应当选用二次代价函数;若输出神经元是Sigmoid函数,应当选用交叉熵代价函数。优化网络的一个基本原则就是最小化代价函数。常用的运算方式有梯度下降法(gradientdescent)、LS、牛顿法和拟牛顿法等方式,梯度下降法和最小二乘法相比,前者在计算时需要先选择一定的步长,而LS不需要。梯度下降方法主要是迭代求解,最小二乘法则主要是对其进行计算解析。当样品数量不太多且存在解析解时,最小二乘法相对于梯度下降方法来说更加具有优势,计算的速度也更快。但当样本数量很大时,用LS法会涉及到求解一个超级大的可逆矩阵,这时我们求解解析解的过程会很难或者非常缓慢,所以使用迭代的梯度下降方法来求解。梯度下降法和牛顿法都是采取了迭代求解的方式,不过梯度下降法是梯度求解,而牛顿法/拟牛顿法是通过二阶的海森矩阵的逆矩阵或伪逆矩阵求解。比较两者而言,使用牛顿法/拟牛顿法能够更快地收敛结果,但是每次完整迭代的时间比梯度下降法长。当损失值减小到一定程度时,可以认为此时的神经网络的参数值较理想;但是高精度伴随着低效率,为了提高精度,需要经过多次的迭代训练,训练时间增加,因此实际训练时需要考虑综合的效率。1.4四种典型的深度神经网络经典深度神经网络可被大致划分为四种网:卷积神经网络(CNN);生成对抗网络(GAN);深度强化学习(RL);循环神经网络(RNN)。下面对它们依次进行简要的介绍:1.卷积神经网络:CNN主要用于处理图像以及视频内容,它具有两大特点:可以将包含大数据量的图片降维成小数据量,即高像素降维成低像素;即使图像经过旋转、翻折等处理,也能够保留图片的有效特征。CNN目前被广泛用于人脸识别、自动驾驶、图片美化等多个领域。经典的CNN结构一般有三个部分:卷积层、池化层、全连接层。卷积层的主要功能是,提取图像中的局部特征;池化层通过给数据降维,避免发生过拟合;全连接层与传统神经网络的部分相似,用来输出想要的结果。CNN的构建是基于人类对视觉原理的研究,通过模仿人类大脑的可视皮层对图像的分级处理,构造多层网络结构,底层的结构识别图片的基础特征,通过多个层级的相互组合,在最顶层实现分类的功能。2.生成对抗网络:GAN是一种非监督性深度学习的方法,通过允许两个神经网络之间相互竞争的形式来进行深度学习:一个生成器是通过计算机生成的数据(绝大多数情况下都是图片),目的主要是为了骗过判别器;判别器判断此张图片是真正存在的还是机器生成的,目的主要是为了找出生成器所做的虚假数据。生成器从潜在的空间中随机地取样数据作为输入,所得到的结果尽量与模拟训练集中的现实数据相同;而判别器的输入则为真实的数据或者生成器的输出,目标就是尽可能多地判断每一个生成器的输入都是否真实,而且每一个生成器都需要尽可能多地迷惑于判别器。两个网络之间相互抵制、不断地调整各自的参数,最终目标就是使得判别网络无法判断出每一个生成网络的输出结果是否真实。GAN的主要技术优点如下:它具有强大的数据建模和分析能力;可以用来训练任意一种类型的生成器网络,而其它框架则是所需要的生成器网络必须具有一个指定的函数形式;不必再通过马尔科夫链进行反复采样。GAN的缺点就是:由于训练的过程困难而且不稳定,需要在生成器和判别仪之间建立良好的同步,特别是在实际的训练中容易导致造成判别器收敛、生成器却发散的局面;模式缺失:GAN的学习和训练处理过程中很容易导致发生模式缺失,生成器退化。GAN目前主要应用在生成图片、转换图片风格、编辑照片等领域。3.强化学习:RL、监督学习、非监督学习三种学习方法共同组了成机器学习这个领域,与两者不同的地方就是,无需使用带标签的输入以及最优解输出,并且也不必再精确地纠正非最优解,通过直接接受到学习环境给予输出的奖励或者是反馈来获取学习的信息,然后进行模型的参数更新。目前RL主要用于游戏、机器人等领域。主流强化学习算法大概可被分为两类:有模型(Model-Based)学习和免模型(Model-Free)学习:有模型强化学习(model-based)依赖于对环境的一个提前感觉和认知,可以通过提前考虑来进行规划,但劣势之处就是如果强化模型与真实的世界不相符,那么它们在实际应用的场景下就会显得表现出来的不好;免模型强化学习虽然放弃了传统的模型学习,在效率上远远不如前者,但是这种学习方式的设计可实现性较强,也比较容易在真实的场景下进行调整达到很好的状态,所以免模型学习的方法越来越受到人们的欢迎,得到了更加广泛的研究开发和应用测试。有模型学习的常见算法主要有纯规划等,免模型学习的常见算法主要有Q-learning、策略优化等。4.循环神经网络:RNN适用于解决一些相互依赖的数据流,例如文本生成、语音识别、机器翻译等。它跟传统网络的最大不同是每次都会把前一次的输出结果,输入下一次的隐藏层里,进入新的训练进程。RNN的组成部分有编码器、解码器。RNN的缺陷主要有:训练需要投入大量成本和时间;难以对较长时间内的输入顺序进行处理,因为短期记忆对RNN的影响程度较深。比较常用的RNN的优化算法有:1.长短期记忆网络(LSTM):由于RNN有一套固定不变的逻辑,即输入越晚,对网络的影响越大,输入越早,对网络影响越小。这导致RNN难以处理长期时间关联,而LSTM改变了这个规则,省略不重要的信息,保留较长序列数据中重要的信息。2.门控循环单元网络(GRU):GRU是LSTM的一个变体,同意具有LSTM记住重点、省略不重要信息的特点,而且在长时期处理的时候也不会丢失重要信息。5.深度网络的特点:归纳来看,深度学习有如下的优点:1.学习能力强,应用范围广:由于网络结构复杂,在理论上可以映射得到任何一个函数,可以处理非常复杂的实际问题;2.由于深度学习是由数据驱动,上限高:当输入的信息越多,表现就会变得更好,而且这种表现的上限可以通过调整参数进一步提高;3.具有良好的可移植性:许多平台具有专业的基于深度学习处理的框架,可以直接进行调用,而且它们还可以与很多平台兼容。但是,深度学习也有一些不可避免的缺陷:1.计算量大,便携性差:分析和处理数据时就需要大量的计算能力,需要

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论