版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
课堂设计一、基本信息课次第7讲课次学时数2学时主题循环神经网络二、设计方案课堂目标知识目标能简述时间序列建模的适用问题和特点;能描述循环神经网络基本结构;能列举典型记忆单元。(二)能力目标能读懂相对简单的循环神经网络模型结构;能比较循环神经网络和卷积神经网络的区别;能针对不同任务正确选择循环神经网络。(三)素质目标能通过理解RNN的时序关系建模思想,提升解决问题的前瞻性和预见性。教学重难点(一)教学重点时间序列分析的建模思想和特点、循环神经网络的结构和典型应用。(二)教学难点循环神经网络的结构和典型记忆单元。教学设计思路(一)教学内容组织1.时间序列分析。2.循环神经网络的概念与基本结构。3.循环神经网络的发展。4.循环神经网络的典型应用。(二)教学方法策略1.教学思路与方法采用问题驱动,以“如何让神经网络拥有记忆功能,能够记住前一时刻的信息?”、“如何模拟人的遗忘”等问题引出时间序列和循环神经网络RNN等授课内容,并结合实际任务,让学生思考RNN模型的特点和应用,并扩展介绍LSTM、Transformer为代表的循环神经网络模型。2.课程思政设计培养学员创新意识:介绍循环神经网络尤其是基于LSTM网络模型的发展演变过程,培养学员敢于突破常规惯性思维的创新意识。3.军事特色思考循环神经网络技术在军事上有何价值和用途。教学资源1.头歌(EduCoder)平台在线资源2.《人工智能技术及其军事应用》在线课程审签新上课教员£上新课教员£——内容备注课堂导入在传统神经网络中,模型不会关注上一时刻的处理会有什么信息可以用于下一时刻,每一次都只会关注当前时刻的处理。但是我们经常遇到很多任务需要知道不同时刻的事件。例如,气象观察:观察连续几天的天气,阴、晴、阴、阴,那么后面一天的天气怎样呢?观察一整年的天气,有没有发生厄尔尼诺现象?观察连续几年的天气,地球有没有整体变暖呢?人机对话:向文心一言提问一句话,它会回答出什么答案呢?给计算机输入一篇文章的原文(长文本),计算机能输出对原文的精简概述(短文本)吗?我们日常的语言、视频处理更是如此。比如,我们想对一部影片中出现的事件进行分类,如果我们知道电影前面的事件信息,那么对当前时刻事件的分类就会非常容易。实际上,针对时间序列的处理任务非常重要,也很多见。这些任务不同于我们已经研究的传统神经网络。因为传统神经网络没有记忆功能,所以它对每一刻出现的事件进行分析时不会用到已经出现的信息。而我们要分析的信息恰恰就包含在出现的上下文中。那么有什么方法可以让神经网络能够记住这些信息呢?我们今天就一起来研究一下时间序列分析,以及用于解决时间序列分析的典型神经网络RecurrentNeuralNetworks(RNNs)循环神经网络。理论讲授一、时间序列分析1.1时间序列建模1.什么是时间序列确定时间序列:各个时刻出现的事件均是确定的序列。例如太阳东升西落随机时间序列:各个时刻出现的事件是随机的序列。例如,今天下雨,打牌摸全四个鬼随机过程:我们用随机过程来描述随机时间序列。其中随机过程是由一族随机变量组成的序列。例如,多次掷色子时出现的点数146211345214563122掷色子时每次出现的点数之间都是相互独立的,但每天的天气变化之间却是有关联的。马尔科夫过程(Markov,1906)在已知目前状态(现在)的条件下,未来的演变(将来)不依赖于以往的演变(过去)。这个模型的每个状态都只依赖于之前的状态(马尔科夫假设)马尔科夫链日常生活中有很多现象都可以用马尔科夫过程描述,例如液体中微粒所作的布朗运动,传染病受感染的人数,车站的候车人数,未来的天气,人类对话,文本翻译,股票价格。那么怎么让计算机来计算这些过程呢?我们可以对时间、事件进行离散化处理。这样,时间和事件都是离散的马尔科夫过程称为马尔科夫链。此时,在一个有限的状态空间中,马尔科夫链的每个状态都有一个给定的概率转移到其他状态。这种转移过程是独立的。马尔科夫链可以用数学模型完整刻画,其要素包括状态空间、初始概率和转移概率等。其中状态空间是有限或有限可数的状态集合,初始概率是每个状态开始时的概率分布,转移概率是一个状态到另一个状态的概率。利用马尔科夫链,可以不同时刻状态间的转换概率、不同状态序列出现的概率等,因此可以用于预测、识别等任务。例如,可以用状态转移图来表示不同天气的变化概率,并计算在“晴天”的条件下,出现“多云”、“晴天”、“雨天”的概率为:P(雨天|晴天)P(晴天|多云)P(多云|晴天)=0.3×0.5×0.1=0.015也可以利用类似的状态转移图,来分析出现“你现在在干什么”的出现概率。1.2时间序列分析特点1.时间序列数据的特点时间依赖性:数据点之间有时间序列上的关联性。趋势性与周期性:数据可能包含长期趋势(例如人口增长)或季节性波动(例如销售旺季)。高噪声与不确定性:实际时序数据通常包含噪声(例如传感器误差)或随机性。异质性:不同时间序列可能表现出不同的分布或特性,难以用一个通用模型刻画。时间序列分析的难点多变量建模:不同变量之间可能存在复杂的交互关系。缺失值与异常检测:实际时序数据常有缺失或异常值,对建模提出额外要求。捕获长期依赖性:对长时间跨度内的依赖关系进行建模是一大挑战。实时性与效率:一些任务要求在短时间内完成预测(例如股市交易中的高频交易)。循环神经网络传统的前馈神经网络具有很强的学习能力,能够学到复杂的非线性映射关系,但输入和输出的维数都是固定的,不能任意改变,因此无法处理变长的序列数据。同时各个节点无法对时间序列中不同位置的对象进行建模。没有处理不同时刻数据的能力。那么如何改造网络结构,使其能够具有记忆能力,能在处理数据时使用以前时刻网络获得的信息呢?2.1循环神经网络定义能不能神经网络的节点处理不同时刻的输入?假设时刻t时,输入为xt,隐层状态(隐层神经元活性)为ht。ht不仅和当前时刻的输入相关,也和上一个时刻的隐层状态相关。使用如下函数:ht=f(Uht−1+Wxt+b)yt=softmax(W(S)ht)来刻画不同节点间的映射关系。其中f是非线性函数,通常为sigmod函数或tanh函数。在此基础上,我们可以将神经网络节点化简为如下结构,这个节点与传统神经网络节点不同,它带有一个指向自身的环,用来表示它可以传递当前时刻处理的信息给下一时刻使用,结构如下:其中,Xt为输入,A为模型处理部分,ht为输出。我们称具有这种结构节点的神经网络叫循环神经网络(RecurrentNeuralNetwork,RNN),也叫递归神经网络。这个节点等价于展开后的结构:这样的一条链状神经网络代表了一个循环神经网络,可以认为它是对相同神经网络的多重复制,每一时刻的神经网络会传递信息给下一时刻。如何理解它呢?假设有这样一个语言模型,我们要根据句子中已出现的词预测当前词是什么,循环神经网络的工作原理如下:其中,W为各类权重,x表示输入,y表示输出,h表示隐层处理状态。这种带自反馈(隐藏层)的神经元,能够处理任意长度的序列,比传统的前馈神经网络更加符合生物神经网络的结构。2.2循环神经网络与卷积神经网络1.循环神经网络:(1)循环连接的节点结构,将前一个时间步的输出作为下一个时间步的输入,从而实现对序列数据的动态建模,便于处理序列数据(2)参数在每个时间步骤都是不同的,没有参数共享(3)当网络在时间维度上非常深的时候,训练不稳定,因此梯度可能会消失或者发生爆炸问题2.卷积神经网络(1)卷积层结构,通过卷积操作提取数据的局部特征并进行池化,实现对数据的高效表示,便于处理网格结构的数据(2)具有参数共享的特性,即卷积核在输入数据上进行滑动来提取特征,并使用相同的权重对不同位置的特征进行处理,可以大大减少了网络参数的数量(3)训练较为容易,因为卷积和池化操作不具有时间上的累积效应三、循环神经网络的发展循环神经网络因为具有一定的记忆功能,可以被用来解决很多问题,例如:语音识别、语言模型、机器翻译等。但是它并不能很好地处理长时依赖问题。同时,人能够对时间序列中的某些特定现象进行关注,这种注意力机制能否在神经网络中实现呢?(1)长时依赖问题当预测点与依赖的相关信息距离比较远的时候,模型难以学到该相关信息。例如在句子“我出生在法国,……,我会说法语”中,若要预测末尾“法语”,我们需要用到上下文“法国”。理论上,循环神经网络是可以处理这样的问题的,但是实际上,常规的循环神经网络并不能很好地解决长时依赖。(2)注意力问题当网络输入较长的时间序列时,网络除了计算当前时刻的结果外,能够利用已经见过的“特定记忆”,关注某些需要注意的输入。例如,在情报自动分析的任务中,对时间、地点、装备等文字信息就需要格外关注。循环网络可以使用以前见过的信息,能否对这些见过的信息给与不同的关注呢?LSTM、多头自注意力机制、Transformer等模型发展了RNN,可以很好地解决上述问题。3.1长短时记忆网络LongShortTermMermorynetwork(LSTM)是一种特殊的RNNs,可以很好地解决长时依赖问题。那么它与常规神经网络有什么不同?所有的循环神经网络都是由重复神经网络模块构成的一条链,可以看到它的处理层非常简单,通常是一个单tanh层,通过当前输入及上一时刻的输出来得到当前输出。与神经网络相比,经过简单地改造,它已经可以利用上一时刻学习到的信息进行当前时刻的学习了。LSTM的结构与上面相似,不同的是它的重复模块会比较复杂一点,它有四层结构:其中,处理层出现的符号及表示意思如下:理解LSTMs的关键是被称为memoryblock(记忆块),主要包含了三个门(forgetgate、inputgate、outputgate)与一个记忆单元(cell)。方框内上方的那条水平线,被称为cellstate(单元状态),它就像一个传送带,可以控制信息传递给下一时刻。
这个矩形方框还可以表示为:这两个图可以对应起来看,下图中心的ct即cell,从下方输入(ht−1,xt)到输出ht的一条线即为cellstate,ft,it,ot分别为遗忘门、输入门、输出门,用sigmoid层表示。上图中的两个tanh层则分别对应cell的输入与输出。LSTM可以通过门控单元可以对cell添加和删除信息。通过门可以有选择地决定信息是否通过,它有一个sigmoid神经网络层和一个成对乘法操作组成,如下:该层的输出是一个介于0到1的数,表示允许信息通过的多少,0表示完全不允许通过,1表示允许完全通过。LSTM第一步是用来决定什么信息可以通过胞元状态(cellstate)。这个决定由遗忘门(forgetgate)层通过sigmoid来控制,它会根据上一时刻的输出ht−1和当前输入xt来产生一个0到1的ft值,来决定是否让上一时刻学到的信息Ct−1通过或部分通过。如下:举个例子,在之前的句子中学到了很多东西,一些东西对当前来讲是没用的,可以对它进行选择性地过滤。第二步是产生需要更新的新信息。这一步包含两部分,第一个是一个输入门(inputgate)层通过sigmoid来决定哪些值用来更新,第二个是一个tanh层用来生成新的候选值,它作为当前层产生的候选值可能会添加到cellstate中。我们会把这两部分产生的值结合来进行更新。
现在对老的cellstate进行更新,首先,将老的cellstate乘以ft来忘掉不需要的信息,然后再与it∗相加,得到了候选值。一二步结合起来就是丢掉不需要的信息,添加新信息的过程:举个例子,前面的句子中保存的是张三的信息,现在有了新的李四信息,需要把张三的信息丢弃掉,然后把李四的信息保存下来。最后一步是决定模型的输出,首先是通过sigmoid层来得到一个初始输出,然后使用tanh将Ct值缩放到-1到1间,再与sigmoid得到的输出逐对相乘,从而得到模型的输出。可以理解,首先sigmoid函数的输出是不考虑先前时刻学到的信息的输出,tanh函数是对先前学到信息的压缩处理,起到稳定数值的作用,两者的结合学习就是循环神经网络的学习思想。至于模型是如何学习的,那就是后向传播误差学习权重的一个过程了。上面是对LSTM一个典型结构的理解。其他模型也会有一些结构上的变形,但思想基本不变。例如门限循环单元GRU(GatedRecurrentUnit)比LSTM更加简化。由于LSTM中输入门和遗忘门是互补关系,因此同时用两个门比较冗余,GRU将LSTM中的输入门与和遗忘门合并成一个门:更新门(UpdateGate),同时还合并了记忆单元和隐藏神经元。3.2注意力机制序列中不同位置的输入作用不同,如何区别对待这些输入,使得模型更加关注更重要的部分?这就是注意力机制要解决的问题。注意力机制(Attention):指人们在工作时注意力往往会集中在整个场景中的某些焦点上。重要的部分更加注意,不重要的部分忽略。如何关注焦点呢?传统注意力机制一种直接的想法,解码输出的时候,每个时刻采用与输出最相关的上下文作为不同的输入,而不是固定的输入值。那么如何计算实现这种机制呢?这样就可以利用隐含的状态来计算得到不同的输入了。而通过输出端的前一个状态,计算输入端每一个的attention。已经提出了一些不同的attention打分方法,例如对每个输入的查询Q和已知的键值K,采用乘法打分模型、加法打分模型等。现在多用的是感知模型,即。在基于RNN的编码器-解码器中使用注意力机制,典型方案如下:在编码器和解码器之间的关系计算中引入注意力机制,处理系统专注于找到输入数据中与当前输出相关的显著有用信息,提高输出的质量优势:可以推理不同模态数据间难以解释、隐蔽性强的复杂映射关系如果能不需要监督信号,那么对于先验认知少的问题,更为有效自注意力机制(1)简要计算过程1.根据输入计算q,k和vq:query查询(与其他值匹配的值)k:key键值(待匹配的值)v:value值(待提取的信息)2.使用每个查询q去对每个键值k做注意力计算比例点乘注意力,如果向量q和k的维度是d,那么注意力是3.Softmax归一化注意力4.使用注意力计算输出(2)自注意力的优势A.可以并行计算B.可以复用注意力结构,进行多头扩展3.3Transformer1.特点:全Attention结构(AllinAttention)代替传统RNN模型多头注意力机制(Multi-HeadAttentionMechanism)逐位置前馈网络(Position-wiseFeed-backwardNetworks)模型结构编码器:N-Blocks多头注意力层(+残差链接+层归一化)逐位置前馈网络(+残差链接+层归一化)解码器:N-Blocks掩码多头注意力层(+残差链接+层归一化)交叉多头注意力层(+残差链接+层归一化)逐位置前馈网络(+残差链接+层归一化)线性映射解码层2.优点(1)和CNN相比,计算两个位置之间的关联所需的计算次数和距离无关(任意两个单词间的距离为1)(2)可以并行计算,突破了RNN模型的限制,特征抽取能力优于RNN模型(3)可处理长序列,能有效处理全局信息(4)可解释性强3.缺点(1)序列较长时,计算耗时严重计算复杂度是序列长度的平方(2)在某些任务中需要补充序列中元素的位置关系(绝对或相对位置)Transformer对位置信息的处理方式是其结构上的固有缺陷,(3)缺乏归纳偏置能力例如不具备CNN所具有的平移不变性,数据量不足时学到的模型泛化性可能不好(4)不具有提取局部特征的能力通常可以使用RNN+CNN+Transformer结构,以获得更好的效果四、典型应用4.1自然语言处理1.什么是自然语言处理自然语言处理(NaturalLanguageProcessing,NLP)研究实现人与计算机之间用自然语言进行有效通信的各种理论和方法。研究内容:由浅入深的四个层面分别是语法(形式)、语义(意思)、推理和语用(效用)词法(Lexical)学:研究词的词素(morphemes)构成、词性等。典型任务有形态(morphological)分析,未登录词(outofvocabularyword)识别,中文分词(segmentation),词性标注(POStagging)等。句法(Syntax)学:研究句子结构成分之间的相互关系和组成句子序列的规则例如:Isawagirlwithatelescope.语义(Semantics)学:研究如何从一个语句中词的意义,以及这些词在该语句的句法结构中的作用来推导出该语句的意义。例如:苹果和梨/苹果和华为火烧圆明园/驴肉火烧这些语句中“苹果”、“火烧”的含义有什么不同?语用(Pragmatics)学:研究在不同上下文中的语句的应用,以及上下文对语句理解所产生的影响。例如:Leedecidedtogotothestore.Hewalkedintothecarport,onlytofindhisbikehaveaflattire.Jacktookoutamatch.Helitacandle.在这些句子中,walked、lit的含义,它们表示了主语的什么动作,对结果有什么影响?自然语言处理中的关键问题(1)怎么用数学方法表示词?虽然可以利用字符方式记录自然语言,但如何转化成机器理解(计算)的符号,并利用数学模型进行计算呢?传统方法是采用独热(one-hot)编码:维度等于单词类别,只有一个1元素杭州杭州[0,0,0,0,0,0,0,1,0,……,0,0,0,0,0,0,0]上海[0,0,0,0,1,0,0,0,0,……,0,0,0,0,0,0,0]宁波[0,0,0,1,0,0,0,0,0,……,0,0,0,0,0,0,0]北京[0,0,0,0,0,0,0,0,0,……,1,0,0,0,0,0,0]但独热编码导致维数灾难,且向量之间相互独立,看不出关联关系。词向量可以将one-hot编码转化为低维度的连续值,也就是稠密向量,这样.词向量中语义上相近的词距离接近,语法上相近的词距离接近词向量可以用来计算相似度,在寻找相似词、信息检索查询扩展、知识推演等广泛使用,也可以作为文本分类、情感分析、文档主题判别等任务中的网络输入。(2)怎么用数学方法表示句子?已知词向量,如何获得一个句子的向量?一个好的句子向量要有哪些特性?词袋模型(Bag-of-words)(Kalchbrenner等,2014)直接进行简单的元素级相加实现嵌入表示,优点:操作简单;不需要额外的模型训练;得到的句子向量是定长的,其长度等于词向量的长度缺点:丢失了词汇之间的顺序信息池化(Tango等,2014;Vo和Zhang,2015)使用预训练的词嵌入表示,在传统分类器基础上提取显著特征可以使用最大池化、平均池化、最小池化,此时句子向量长度是词向量的3倍,也可以追加其他操作继续进行扩展CNN(Kim,2014),使用特征组合,经过CNN层处理,使用窗大小可变的卷积滤波器、多通道(1个静态+1个非静态)等处理后获得句子表示可以学习到词序信息(3)怎么对语句之间的关系进行数学建模?语言模型:一个用于建模自然语言(即人们日常使用的语言)的概率模型。在模型中,给定字符串w1,w2,...,wn,可以得到概率P(w1,w2,...,wn)。在马尔科夫假设下,通常可以简化为n元语言模型。可以利用RNN构建一个简单的神经网络语言模型,模型的计算过程如下:(1)首先根据训练集生成词典D;(2)对于语料中的任意词wt,获取其前面n-1个词,输入层将这前n-1个词的词向量C(wt-n+1),C(wt-n+2),……,C(wt-1)拼接起来;(3)隐藏层通过激励函数将输入信息进行转换;(4)输出层计算词wt的概率。
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 美容行业美发师顾客满意度与专业技能水平KPI考核表
- 友伴暑假热闹一夏
- 网页设计师UI设计从理论到实战指导书
- 化妆品品牌销售经理客户拓展与销售额绩效评定表
- 行政办公室环境管理考评表
- 智能建筑设计师绩效考评表
- 食品生产企业品质保障部产品质量与食品安全绩效衡量表
- 能源公司发电厂运行工程师工作绩效考评表
- 9.9(1)利用位似放缩图形 教学设计2024-2025学年鲁教版数学八年级下册
- 2025-2026学年迷你世界教学机械设计图
- 《DGTJ082467-2025超低能耗建筑设计标准居住建筑》
- 2026年昆明市石林国有资本投资集团有限公司及下属公司招聘(18人)笔试参考题库及答案详解
- 2026辅警人员考试题库及答案
- 贯彻落实《全国党员教育培训工作规划(2024-2028年)》中期评估的工作报告
- 2025年一级建造师铁路工程实务真题及答案解析
- 2026年注册城乡规划师资格考试(城乡规划相关知识)综合能力测试题及答案
- 2025-2026学年对数均值不等式的专题教学设计
- 2026-2030中国四氧化三铁行业投资前景研究及销售战略分析研究报告
- 2026年石油炼制催化剂行业分析报告及未来发展趋势报告
- 2026音乐流媒体服务商业模式创新需求分析用户行为研究竞争分析
- 2025年一级建造师考试《矿业工程》真题及答案
评论
0/150
提交评论