版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、摘要摘要图2-4表达的跳字模型(Skip-gram)2个。里面的CBOW模型使用关键句前后文相关词匹配的词向量当成训练进去,出来运用这个确切的词向量当成训练输出,就是CBOW机构是按照现今词前后文相关词的词向量猜想现今词的词向量;与CBOW模型的思路截然不同,Skip-gram机构就为取得特征词的词向量用做训练输入,取得特定词前后文相关词对应的词向量用做训练输出,就是Skip-gram机制是按照目前词的词向量预测现今词前后文相关词的词向量。Word2Vec应用2个模型训练生成词向量时,其核心的基础数学都是霍夫曼树。图2-3 Word2Vec的CBOW语言模型图2-4 Word2Vec的Skip
2、-gram语言模型2.3.2 ELMo模型在现实的文本中,词在不同的环境下往往具有不同的意义,而这前文提到的两个词向量模型在不同语句环境下的生成的向量并没有区别,缺少了对文本本身语境的考虑。针对word2vec缺少对语义进行考虑的问题,提出了ELMo27模型,且ELMo具有两个以下两个优势。能学习到单词用法的特性。能学习到词语用法在上下文的变化。ELMo经过了各种层的LSTM去训练词的应用方式,在进行各种层的输出能够得到不同层次的词法特征,例如对于词义的消歧,与词性、句法的需求,交由不同的层去进行处理。其次,ELMo通过预训练与微调相结合方式实现,先在公开的大容量文本预料上进行预训练,之后再在
3、实际应用的下游语料库上进行微调。 笔者在此于ELMo的2个相关方面开展研究,首先为其encoder模型Bi-LSTM,其次则为下游具体NLP任务的接口(迁移策略)。 此处的便为将下方具体NLP任务摆至预训练产生词向量之中,继而完成达到某个按照文本的差别不停改变的动态词向量。相关的方案就是是在使用下BiLSTM来实现,一开始的训练目标可以表现如公式(2-10)、(2-11)所示。(2-10)(2-11)2.3.3 BERT模型BERT模型的创建加快了词向量的运行传播的速度,其还加入了字级、词语级、句子级以及句间关系的思考的特征。它的设计思想类似于ELMo,但区别在于,BERT使用了Transfo
4、rmer来代替LSTM。Transformer对比于传统的循环神经网络,它能获得更长的上下文信息,提升了特征抽取能力,它具有更深的层数,提高了并行性。同时,BERT改进了双向语言模型,它使用了上下文融合语言模型,而不再只是简单的从左到右和从右到左将句子的编码进行拼接,如图2-5所示。图2-5 Transformer的编码如上图所示,输入的是一个token序列,首先对其进行嵌入工作,然后输出给神经网络层,输出的每个向量都具有相同索引的token。等待文本传输到BERT这段时间,所有的序列里面不定的掩盖(mask)句子中 百分之十五的token,继而把掩盖token处的得到的结果隐层向量加到Sof
5、tmax,目的是得出遮挡的 token。但是Transformer现如今在自然语言主要是协助行业热度高的网络结构,所有的单元被自注意力结构(self-Attention)与前馈神经网络(Feed Forward Network)形成,还在单元形成了连续重叠多层。下面从多头注意力机制,自注意力机制,位置编码几个角度介绍。多头注意力机制: 将一个词的vector切分成h个维度,求attention相似度时从每个h维度计算。由于单词以向量的形式映射在高维空间中,在在每一维空间都可以学到不同的特征,相邻空间之间所学结果更相似,相较于全体空间放到一起对应更加的合理。比如对于维度为512的词向量,取h=8
6、,每64个空间做一个 attention,学到结果更细化。自注意力系统:所有区域的词汇均能忽略方向与距离,可能会简单的与句子里的所有的词encoding。各个单词与一样的意思的别的单词互相包含这一条边当作内容,里面额颜色和它的关联性成正比,但是普通的模糊的词语所连的边都不浅。 位置编码:由于Transformer不但不存在RNN的循环还不存在CNN的卷积,然而序列顺序信息特别明显,比如语句: 你欠我100万明天要还。我欠你100万明天要还。 不同语序导致的意思截然的不容。Transformer求出token的地域数据此处于BERT里运用了正弦波,这样的仿造信号传播周期性改变。如此的循环函数能够
7、帮助很大的提升模型的泛化能力。如公式(2-12)、(2-13)所示。(2-12)(2-13)BERT通过训练位置特征直接保留位置信息,利用向量随机初始化每个位置,然后加入模型训练,最后得到包含位置信息的嵌入算法。最后,在位置特征和文本特征方面,Bert选择了直接拼接。 在语句级表示中,单独编写代码不足以完成任务。你需要捕捉一些句型。对此,BERT又引入了另一些工作来学习句子间的特征。1、句子级负采样 查询本文的连续性,指的是猜想加入到BERT,的文本两端的句子是不是连续的句子。在进行学习时,把系统的部分二输入其中,咋会把他随机分成两个部分,一部分选取所有训练集合离匹配的来进行检测,另一部分只是
8、会常规的选择第一部分的后面部分进行检测。就像是word2vec里面已经有了规定范本,其接下来的例句就是正例,和word2vec里面的正确词很相像,没有规定标准的选取某个句子作为参考接着在这个句子的类型上进划分,来判断当前的句子是噪声数据还是正确的下一句。 2、句子级表示 BERT 作为语句等级的语言系统,和ELMo系统在和接下来具象NLP 工作连接时一定得各个层次求出平均数再进行全局池化处理,BERT能够简单的得到没有删减的句子的仅仅一个的向量表示。BERT于所有的输入前行都添加与众不同的记号,继而让Transformer 为句子开始全面编码,因为Transformer能够忽略空间与距离的将全
9、局信息编码进所有区域里面的,且位于最高隐层和作为句子、句对的表示特征没有阻碍的和Softmax的输出层对接,所有它成为了梯度逆向扩散路径上的一大阻碍,能够领略全部输入层的上层特性。 2.4 深度学习方法在深度学习这个过程里,使用频率最高的3个网络结构分别是循环神经网络、卷积神经网络还有深度神经网络。这里面循环神经网络凭借其具备时间参数,所以应用范围大多是在自然语言的处理、智能翻译的语音识别等行业中。因此,本节主要介绍卷积神经网络、循环神经网络、Attention机制和Transformer模型相关知识。2.4.1 卷积神经网络卷积神经网络(Convolutional Neural Networ
10、k, CNN)属于前馈神经网络里的一类,最初是被作用在图像与计算机行业里的,随着其不断的发展,现在被使用到自然语言的处理行业中。卷积神经网络里第一重要的操作绝对是对输入卷积的向量实行卷积活动。如果他的卷积和与数据整理固定的步长进行运动,那么它此时正在进行卷积操作,所以全部的滑动输出只会形成一个构建出的矩阵,说明这里面的卷积核最后得到了一个地域特点。这个阶段里,卷积神经网络提出了两种方法减少了模型的参数,简化了模型,其中一种方法是局部连接。以文本为例,前后的数个词汇之间一般存在很大的关系,若是相隔的词组过多,那么他们的关系也自然而然减少,所以神经元里面大可不必实行全局输入,反之我们可以只是和上层
11、的某些神经元进行联系,所有的神经元只得到上层神经元的信息。还有一种方法是实行数据共享。考虑到数据在各个局部之间往往有共性特征,也就意味着我们在这一部分学习到的特征也 能应用到另一部分上。所以,CNN 让多个局部连接共享同一个卷积核。这两种方法有效地减少了模型的参数,增大了系统学习的有效率。卷积神经网络是由卷积层、池化层、全连接层与说softmax层构成的,这里面的卷积层绝对是其中最重要的一个环节。上面我们讲到卷积神经与局部窗口里面实施卷积运算,所有的特征映射里的神经元数据都是开放的,这个操作就让因特网里数据的多少很大程度的降低了,增大了系统学习的速度。假设有两个离散函数和,进行卷积的定义见式(
12、2-14)所示。 (2-14)卷积层通常包含多个卷积核,卷积层操作示意图如图2-6所示。图2-6 卷积层操作示意图把他的卷积核的参数矩阵为W,偏置项设成b,激活函数设成f,则多个卷积核的计算过程见公式(2-15)所示。 (2-15)池化层大多被用于对特征矩阵开始降维操作,降低参数。池化操作包括加权池化、最低池化和最高池化操作。平均池化操作是取子块中所有数据的平均值来代表该子块特征。最小池化操作是取子块中的最小数据来代表该子块特征。最常见的是最大池化操作,该操作取每个子块中最大的数据来表示该子块特征,达到降维的目的。如图2-7所示。 图2-7 最大池化操作示意图在笔者的数据里能够看出,池化层能够
13、把各种字数的句子改变至一样维度的向量,且可以留下显著的特性。 在2014年,Kim构建了textCNN模型28,把卷积神经网络第一次使用在文本归纳要求,使用各种不同规格的卷积核来寻找到句子的部分特征信息,精简句子里的关键2数据。网络结构如图2-8所示。 图2-8 textCNN网络结构图textCNN网络里首层的Embedding句子向量呈现为一个7*5的矩阵模式,行列是为词的向量所在之处,有五个维度。其次是卷积层,把矩阵一个一个的和size=2、3、4 的卷积核开始卷积运算,所有的size的卷积核包含两个输出。再接下来最大池化层,把各个长度的句子转化为定长的形式。最后一层为全连接层,让 So
14、ftmax 函数输出各个形式的概率。 2.4.2 循环神经网络普通的前馈神经网络只能单独处理当前输入,无法利用历史信息。但是,有些任务是需要考虑到序列信息的,也就是说后面的数据跟前面的数据是有关系的。比如当我们理解一句话的时候,需要考虑上下文语境,而不是单单理解组成这句话的每个词。让上面所述的问题得到改善,循环神经网络(Recurrent Neural Network,RNN)诞生了。 循环神经网络属于一类短期记忆神经网络,也称为递归神经网络。它具有层的神经元之间都具备权联系的特点,隐藏层节点不但从现在的输入层接收信息,而且还从前一个节点接收数据作为单独的输入源,这也让RNN网络匹配在处理诸如
15、音频,视频和文本之类的序列数据。 .在循环神经网络随时间扩展之后,可以将其视为具有相同层数和序列长度的多层前馈神经网络。结构如图2-9所示。图像中我们能够得到,隐藏层中的神经元也具有权重。随着序列的进行,前隐藏层会影响后隐藏层。其中,O是输出,u是从输入层至隐藏层的权重矩阵,V是从隐藏层状态到输出的权重矩阵,W是隐藏层的最后一个值作为输入权重。 .t表示t时刻的状态。图2-9 RNN结构图在图2-9的构型我们能够得到,RNN在t时刻获得了一个输入,隐藏层的状态值为,输出值为。这个时候,的值不但和输入值有关,而且被前面时刻的状态值所决定,从而实现了对历史输入的“记忆”。t时刻的输出见公式(2-1
16、6)所示,其中为激活函数。 (2-16)虽然RNN适合处理具有序列特征的数据,然而在现实生活中,RNN可能会发生梯度爆发或者是梯度失踪的现象。这是因为深层神经网络应用的主要算法是反向传播算法,最终对数据进行处理,RNN如果处于学习期间会把在隐藏层里面的梯度用乘法运算的方式流传,如果流传的长度达到标准范围,它的梯度不比一大,最后作乘法运算就会导致梯度消失的情况。但是如果梯度比一大的话。最后做乘法会得到梯度爆炸的情况。这使得RNN模型训练困难且无法解决长时间依赖的问题,也因此RNN被称为是一种短时记忆网络。 目的是让RNN的具有时效性很短的弊端被改善,长短时记忆网络(Long Short Term
17、 Memory Network, LSTM)在二十世纪九十年代被当作RNN的变体被Hochreiter 29等创建,LSTM 可以使用局域限制不大的前后文信息来归纳目前的数据,对梯度的爆发和梯度失踪这个弊端有很大的帮助,也是目前实际应用最广泛的RNN结构。因此,算法模型上利用双向LSTM结构对文本的上下文序列特征信息进行提取。双向LSTM结构通过改变输入文本的前后顺序,使得模型既可以学习下文对上文序列特征的影响,也可以学习上文对下文序列特征的影响。 LSTM 和RNN大致的构造特别相像,均包含了因为某个一直不改变的单元构成的的链式结构,不同的是,LSTM单元模块在内部增加了门结构来控制信息的流
18、向,继而让梯度爆发与梯度失踪的麻烦被根治。详细一点说,所有的LSTM节点都包含了3个门结构:输入门(Input Gate)、遗忘门(Forget Gate)与输出门(Output Gate),结构如图2-10所示。 图2-10 LSTM结构图图2-11 LSTM单元的门结构LSTM首先是要把输入信息与前面的隐藏状态经过遗忘门的sigmoid 单元来选择哪些数据是我们不需要的,哪些信息需要保留。该单元输出一个 0 到1 之间的向量,0 表示不保留,1表示保留,由此表示状态的信息该保留多少,更新状态。计算公式见式(2-17)所示。 (2-17)这里面的说的是权重矩阵,则为偏置,是把两个向量重新组合
19、。第二步利用输入门的输出来控制当前 t 时刻的必须进行记忆的数据。把输入信息与上一时刻的隐藏状态经过输入门,最后的到细胞状态里应该要保留的数据内容 ,下一步使用和通过一个 tanh 层获取新的候选细胞信息,那些数据很大概率要被更新到细胞里。计算公式见公式(2-18)和(2-19)所示。 (2-18)(2-19)第三步利用遗忘门和输入门将历史信息和当前信息合并。通过遗忘门选择丢弃的部分信息,通过输入门选择信息的一部分作为添加的信息,得到新的细胞信息。计算公式如式(2-20)所示。 (2-20)最后,把写进去的信息与上面步骤里隐藏状态在输出门sigmoid 作用下 来选择进行输出工作的状态特征,且
20、运用刚使用的细胞状态与t 时刻输出来更新隐层状态,计算公式如下的(2-21)和(2-22)。 (2-21)(2-22)2.4.3 Attention机制Attention机制可以定义成一种仿造人类的注意力的情感,首先是使用在图像方面,就好比我们观察一幅图画时,会把注意力集中在重点关注的目标区域,获得更多的目标细节并忽略其他无用的信息。理论上讲,Attention机制其实为很多组权重参数的合集,它能够做到使得模型侧重使用还有学习,发挥功能的范围没有限制,特别广。就像encoder-decoder机制,同样运用的为编码器-解码器,编码器要完成的任务是把写进去的序列编码成某个不变长度的向量,解码器要
21、完成的任务为这个向量解码至输出序列。这两者均能应用所有程度的学习模型,比如CNN、LSTM、RNN、GRU等等。在机器翻译应用方面,这种模型将输入X编码成向量C,会导致翻译出来的每一个字都平等地考虑了输入中的所有词。例如输入的句子是:“I love China”,翻译的目标是:“我爱中国”。原始模型认为“我”这个词的翻译受到了“I”、“love”、“China”三个词同等的影响。但实际上,“我”这个词应该受到“I”这个词的影响最大,而其它的输入影响较小。模型加入Attention机制后,这个问题得以解决,模型能够选择性关注输入序列的重要部分。于Attention算法里,中间的向量C已经不能局限
22、于某个固定的语义编码向量了,反之它被各种序列元素按照不同的权重参数最终形成的复合语义编码向量。如下图2-12所示。图2-12 加入Attention机制的seq2seq模型编码向量C是各个序列元素加权求和得到的。见公式(2-23)所示。 (2-23)其中,i 表示时刻,j 表示输入序列中的第j个元素,表示序列长度,表示对元素的编码,表示该元素的权重,计算公式见式(2-24)所示。(2-24)其中,表示待编码元素和其他元素之间的匹配度。匹配度和权重值ija成正比,证明了这个元素能够直接作用于输出。 总之,Attention机制就是给每一个输入序列分配一个权重系数,计算输入序列的加权和,使模型关注
23、重点部分,忽略其他部分,以此优化模型。文本在第四章针对长文本设计的基于序列特征的文体分类模型中,在生成长文本特征向量步骤加入了Attention机制,使模型能重点关注到一些长文本的总结句,提升文体分类效果。 2.4.4 Transformer模型Transformer是Google在2017年提出的一个基于Self-attention的Seq2seq模型,该模型摒弃了常用的CNN和RNN结构,整个模型架构是由Attention机制组成,使得模型有更好的并行性。Transformer结构也和Seq2seq构型相似,都是被Encoder-Decoder构成的,编码器的构成则是有赖于前馈神经网络与自
24、注意力系统,解码器的构建形成部分是前馈神经网络、注意力层与自注意力,如下图2-13表达。图2-13 Transformer模型编码器-解码器结构Transformer模型的编码部分是由如图2-13的6个相同结构Encoder组成,解码部分同样是由6个相同结构Decoder组成。在编码器部分,模型Embedding是一句话的词嵌入向量表示和每个字的位置向量表示,使得在进入Self-attention层之前,词嵌入表示已经融合了位置信息。实现位置向量表示有两种方法,一种是通过训练学习向量,另一种是使用公式来计算向量。一般采用第二种方法,因为不需要训练参数。Positional Embedding
25、的计算公式见式(2-25)、(2-26)所示。 (2-25)(2-26)上述式子里,pos是对其的位置参数的描述,2i 是对其向量的双数维度的,2i+1是对其单数维度的描述 之后输入到编码器的自注意力(Self-attention)层,这是Transformer模型最主要的模块,帮助编码器在编码每个词时关注输入句子的其他词信息。其核心思想是通过计算输入句子中的要编码的词与句中其他所有词的相互关系,利用这些相互关系来调整每个词的权重,再通过所有词的加权和来获得该词的向量表示。这种表达方法不仅具有该词本身的语义,还有其他词与这个词的关系,所以较一般的词向量来说具有很多的表达方式。Self-atte
26、ntio在进行计算时计算首先要帮助所有的输入词设计3个向量:。它们运用了写进X的词嵌入向量再一个一个的和3个权重向量 、 、 作乘法获得了,在 Attention 的运算方面有了很大的帮助。计算公式分别是式(2-27)、式(2-28)、式(2-29)所示。 (2-27)(2-28)(2-29)其次,把现在的Q向量和所有词语的作乘法运算,结果的当前词给输进去的所有句子都打分,这个分数也可以说明其与别的词汇的关联程度。第三步将该分数除以8,第四步从Softmax里整理归纳分数,接下来用上一个步骤得出的结果和所有的 V 向量作乘法,最后加权求和这些V向量,得到 Self-attention 的输出。计算公式见式(2-30)。 (2-30)式中,默认 =512 ,h =8 ,因此 默认为64。概而言之,自注意力层为一个把语句里全部的向量先求平均值再加在一起的机制,当成其中一个词汇的编码
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 第二单元第3课母亲河颂-《演唱 长江之歌》教学设计-2026-2027学年沪教版(新教材)初中音乐八年级上册
- 2026年南昌市青云谱区事业单位人员招聘笔试备考试题及答案详解
- 2026年宁波市镇海区公务员人员招聘笔试参考题库及答案详解
- 2025-2026学年何家桥说课稿
- 2026年广东省云浮市公务员人员招聘笔试模拟试题及答案详解
- 2025-2026学年国画4级说课稿
- 2026年安徽省亳州市公务员人员招聘考试备考试题及答案详解
- 2026年南京市玄武区公务员人员招聘考试模拟试题及答案详解
- 2027北京市定向选调和“优培计划”照片尺寸像素要求笔试参考题库及答案解析
- 2026年西安市新城区公务员人员招聘笔试模拟试题及答案详解
- T/TMAC 246-2025多参数水质分析仪
- 2026年注册安全工程师初级实务真题试卷附答案
- 2026秋初中《知识点总结》9年级上册(历史)背诵版
- 补充耕地质量鉴定技术规范
- 中级注册安全工程师《安全生产法律法规》2026年考点归纳
- 公路工程隐蔽验收监理实施细则
- XF846-2009 消防产品身份信息管理
- 《生活垃圾渗滤液浓缩液固化原地利用技术规程》编制说明
- 2025~2026学年河南省安阳一中、鹤壁一中、新乡一中三校高一上学期第一次联考化学试卷
- 湖南省定向选调考试真题2024
- 《神经内科临床路径》课件
评论
0/150
提交评论