【《循环神经网络基础概述》3000字】_第1页
【《循环神经网络基础概述》3000字】_第2页
【《循环神经网络基础概述》3000字】_第3页
【《循环神经网络基础概述》3000字】_第4页
【《循环神经网络基础概述》3000字】_第5页
已阅读5页,还剩1页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

循环神经网络基础概述目录TOC\o"1-3"\h\u4761循环神经网络基础概述 149881.1循环神经网络概述 1268181.2循环神经网络的优缺点 2131381.3RNN神经网络的局限性 2158481.4循环神经网络模型 21.1循环神经网络概述早在1980年代,包含RNN的霍普菲尔德网络就被SarathaSathasivam提出,RNN网络是前馈神经网络的衍生物,它的结构并不是单一的循环结构,它仅仅在输入和输出在连续时间节点上的循环(Timestep),它同时输入了并不是最初的输入值,也就是将后续重新算出的数值进行输入。这也意味着“当下的输入与前面的输入息息相关”。在这种情况下,隐藏层摆脱了相互独立的局面,而形成了相互有链接的关系。RNN的提出始于上一世纪八十年代,而在跨过千禧年后则达到了更进一步的拓宽发展,其中Bi-RNN以及LSTM被人们广为推崇。由于该算法的完成并不简单,故而在当时并没有被得以很好的应用,以至于在1986年之后便全连接神经网络还有被许多老旧的学习算法所替代了。然而以上两种算法均存在很大的不足之处,老旧的学习算法离开人工无法正常高效的进行运作,这也造成了在这基础上的一些其它高级功能的发展无法更进一步,比如照片与声音的识别等;而全连接神经网络也暴露出了参数冗杂、数据中的时间序列信息无法发挥作用等弊端。以上均为不是对动态数据的处理,这意味着我们运用以上算法所处理样本均是单词的且彼此相互独立,而这对人工智能的功能运作需求来说是远远不够的,除此之外他还需要记忆这一与人类较为相似的特征。RNN拥有记忆力这一特征以及善于从具有一定顺序意义的样本与样本间学习规律,使得它尤为适合被用来面对连续序列的解决处理。RNN主要在数据的处理和预测上发挥作用。如果将以往的前馈神经网络看作一个由很多层组成的网络,那么信号传输在每一层网络上的传递是依次排列的,每一层的节点仅仅与同一层的节点互相作用,且无法波及到其他层的信号节点。但是我们需要注意到是的,我们面对的时间序列信号是需要进行前后联系的,那么接下来我们就要考虑,如果要预测句子的下一个单词是什么,一般需要用到当前单词以及前面的单词,因为句子中前后单词并不是独立的。举例来说,第一个单词是“我”,第二个是“爱”,那么最后一个则有90%的概率出现“你”。RNN的出现就是用来描述一个序列前后的信息链接关系可以通过RNN来进行刻画。在RNN中,每个节点的都可以接受前面的节点按顺序连接出现的信息,与旧的节点一样,它也会在输入和输出上发生改变,但在此基础上,RNN前面节点的所产生的信息会与稍后出现的信息节点有所关联,因此RNN在后面的信息输入和输出就可以做到反馈前面的所有输入数据对网络的影响,从而形成了反馈网络结构。1.2循环神经网络的优缺点(1)优势:模型具有记忆性。(2)劣势:由于梯度会出现爆炸或者缺失,故而无法留存前后过久的东西。1.3RNN神经网络的局限性如果在训练的过程中发生了梯度消失的问题,会导致我们的权重无法被更新,结果只能是训练无法成功。一旦梯度过大出现爆炸这种情况,则会出现网络参数在很大程度进行更新引起不稳定的状况。如果考虑最坏的情况的话,权重的值变得特别大,以至于结果会溢出。网络链条的长度会随着时间变得越来越长,而梯度消失和爆炸的发生在进行不同方向的传递时是必不可少的。这就意味着在RNN网络中,在面对需用用较为靠前的信息进行推测的时候,也会出现同样的情况。那么,因此我们该如何着手解决这一难题呢?我们可以考虑将控制信息的累积快慢加入门控机制,比如根据使用频率取舍常用和不常用的信息,如此处理信号所形成的新型系统即为门控循环神经网络,而LSTM和GRU较为人们所接受。1.4循环神经网络模型众所周知的是,梯度过大引起的衰减和爆炸在RNN计算时是无法避免的,即使用衰减来应对部分爆炸的情况,依然无法很好的解决梯度衰减问题。通常由于这个原因,RNN在实际中比较难以捕捉到数据之间长距离的依赖关系。本文用到的是GRU模型。1.4.1GRU概念在本文中,我们将为大家讲解神经网络模型:门控循环单元(GRU)。GRU适用范围是来处理标准RNN中出现的梯度消失的状况。GRU在一定程度上就是LSTM的缩影,因为在基本概念上,有很多相似点,且在某些领域的完成度都是一样高。上文提到,GRU在一定程度上相当于LSTM变体,怎么个相当于呢?也就是对此刻时间进行预测,预测方法就是门控机制来控制输入、记忆等来实现。这里就不得不讲一下GRU的两个门:重置门和更新门。简单而言,重置门主要是将新进信息和原有信息进行有机整合,而更新门则是把原有信息保存到现在的一个量。简单来说,重置门总是快更新一步。标准RNN模型也是这样得出的。如果考虑时间和成本的话优先选择GRU。RNN的梯度消失难题,GRU的更新门与重置门是用来解决他的最好办法。以下展示了单个门控循环单元的具体结构。(j表示一个向量的第j个元素。)1.重置门:和更新门有异曲同工之妙,只是着重点不同。重置门主要是解决上刻隐藏状态需被遗忘的信息量。表现方式为值越小,则遗忘率高,当值=0时,就代表彻底被遗忘;当值=1,就代表当前信息将保存。1.更新门:与LSTM中忘记门和输入门的操作一样,找到此刻输入和前刻隐藏层,把这两个值分别乘以权重矩阵,通过计算得到的两个值后纳入sigmoid激活函数中,通过一系列计算将结果用0-1来表示,其表达效果和重置门也相似。更新门主要是解决上刻隐藏状态需传递到此刻隐藏状态的信息量。同理可得,值越小,被遗忘率就越高,值越大,继续保留的可能性就越大。值=0时,就代表彻底被遗忘;当值=1,就代表当前信息将保存。其作用较为广泛,因为模型能决定从过去复制所有的信息以减少梯度消失的风险。1.4.2GRU模型结构(1)输入输出结构与RNN运行原理相同,存在正在输入的xt和前一时刻的隐藏状态ht-1,再配合GRU即可算出此刻输出yt未来时刻隐藏状态ht,详情见图2-1:图2-1GRU输入输出结构GRU内部结构,如图2-2所示:图2-2GRU内部结构公式(2-1)左边的Rt代表重置门,公式(2-2)Zt代表更新门,右边相当于一个全连接层,经过线性组合之后输入到δ函数中。

RZtδ函数,如图2-3,它的值域在(0,1)区间,所以重置门和更新门的值域也在(0,1)区间。由于神经网络对0~1的数据模型收敛比较好,所以把所有数据归一化到(0,1)区间内。图2-3sigmoid函数值域(3)候选隐藏状态Ht从图2-4可看出,我们需要借助重置门和上刻隐藏状态并运用按元素乘法来算出候选隐藏状态,假设重置门Rt值=0,那么通过按元素乘法,上一时刻的隐藏状态ht-1将会被删去,假设重置门Rt值=1,即可留下来。按元素乘法从而得到结果,并和正在输入xt进行有机合成从而转出至tanh函数中,候选隐藏状态Ht的公式详见公式(2-3)。得出tanh函数的适用范围,如图2-5所示,在(-1,1)区间,所以候选隐藏状态HHt图2-4候选隐藏状态H图2-5tanh函数(4)隐藏状态Ht:详见图2-6,通过更新门Zt可以了解上一时刻的隐藏状态Ht-1和此刻候选隐藏状态Ht的详情,当Zt=1时,此刻候选隐藏状态被移除数据库,结果就是Ht=Ht-1,即上一时刻隐藏状态经过时间控制传递到此时此刻,此过程还可以进行延伸到其他领域,即呈阶梯状递减的的循环神经网络上,它能更高的完成其任务。隐藏状态HtHt图2-6隐藏状态Ht总结:将重置门Rt

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论