激活函数和损失_第1页
激活函数和损失_第2页
免费预览已结束,剩余2页可下载查看

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、最为接近生物神经元。此外,(0,1)的输出还可以被表示作概率,或用于输入的最为接近生物神经元。此外,(0,1)的输出还可以被表示作概率,或用于输入的归一化,代表性的如Sigmoid 交叉熵损失函数。激活函数和损失函御关2017.12.2817:46字数 2059阅读5040喜欢关于激活函数,首先要搞清楚 是,激活函数是什么, 用?不用激活函数可不可以? 是不可以。激活函数的主要作用是提供网络的非线性建模能力。如果没有激活函数,那么该网络仅能够表达线性 ,此时即便有再多的隐活函数之后,深度神经网络才具备了分层的非线性 学习能力。输出值的范围: 当激活函数输出值是 有限 的时候,基于梯度的优化方

2、更加 稳定,因为特征的表示受有限权值的影响更显著;当激活函数的输出是 无限的时候,模型的训练会更加高效,不过在这种情况小,一般需要更小的 learning 到,当x0时,则不存在饱和问题。所以,ReLU能够在x0 时保持梯度不衰减,从而缓解梯度其收敛速度要比sigmoid 快,减少迭代次数。然而,从途中可以看出,tanh 一样具有软饱和性,从而造成梯度 。3.1.3ReLU,P-ReLU,Leaky-ReLU 两侧导数逐渐趋近于 0与软饱和对应的是硬饱和, 即f(x)=0,当|x|c,其中c下传导的梯度包含了一个f(x)因子(sigmoid关于输入的导数),因此一旦输入sigmoid 网络在

3、5 层之内就会产生梯度这会导致后一层的神经元将得到上一层输出的非 0 均值的信号作为输入。3.1.2 tanh 融合了sigmoid和ReLU,左侧具有软饱和性,右侧无饱和性。右侧线性部分使得ELU 能融合了sigmoid和ReLU,左侧具有软饱和性,右侧无饱和性。右侧线性部分使得ELU 能够缓解梯度,而左侧软饱能够让ELU对输入变化或噪声更鲁棒。 ELU 的输出均值接近于零,所以收敛速度更快。在 ImageNet 上,不加 Batch Normalization 30 层以上的 ReLU 网络会无法收敛,PReLU 网络在MSRA 的 Fan-in (caffe )初始化下会发散,而 ELU

4、 网络在Fan-in/Fan-out下都能收敛3.1.5 Maxout 在我看来,这个激活函数有点 的感觉,因为 maxout网络能够近似任意连w2,b2,wn,bn0时, 为 ReLU。Maxout能够缓解梯度消失,同时又规避了 ReLU 神经元 的缺点,但增加了参数和计算量。3.2 在之前的内容中, 其中y是 期望的输出,a为神经元的实际输出(a=(Wx+b)。也就是说,当神经元的实际输出与 的期望输出差距越大,代价就越高。想法非常的好,然而在实际应用中, 知道参数的修正是与CW 和Cb 成正比的,而根据这就是Leaky-ReLU, 而P-ReLU认为,也可以作为一个参数来学习,原文献建议初始化a 为 0.25,不采用正则。3.1.4 ELU 种现象被称为“神经元 ”。与sigmoid类似,ReLU0,偏移现象和 神经元 会共同影响网络的收敛性。针对在x0的硬饱和问题, ReLU发现其中都有(a)这一项。因为sigmoid 函数的性质,导致(z)在z 取大算得的a 值

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论