《自然语言处理:基于预训练模型的方法》 课件04-神经网络基础_第1页
《自然语言处理:基于预训练模型的方法》 课件04-神经网络基础_第2页
《自然语言处理:基于预训练模型的方法》 课件04-神经网络基础_第3页
《自然语言处理:基于预训练模型的方法》 课件04-神经网络基础_第4页
《自然语言处理:基于预训练模型的方法》 课件04-神经网络基础_第5页
已阅读5页,还剩18页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

神经网络基础2HARBININSTITUTEOFTECHNOLOGY感知器模型

x4x1x2x33HARBININSTITUTEOFTECHNOLOGYLogistic回归模型

Sigmoid函数示意图4HARBININSTITUTEOFTECHNOLOGYSoftmax回归

5HARBININSTITUTEOFTECHNOLOGY多层感知器多层感知器(Multi-layerPerceptron,MLP)堆叠多层感知器(线性回归+非线性激活函数)可解决线性不可分问题使用MLP解决异或(XOR)问题6HARBININSTITUTEOFTECHNOLOGY多层感知器PyTorch实现引入PyTorch模块>>>fromtorchimportnn线性层激活函数>>>fromtorch.nnimportfunctionalasF7HARBININSTITUTEOFTECHNOLOGY多层感知器PyTorch实现自定义神经网络实现/drive/1EMJJffsmlSlqO3KwuG5WlP-IxyNVXTrK?usp=sharing

8HARBININSTITUTEOFTECHNOLOGY卷积神经网络全连接的多层感知器无法处理输入的偏移情况图像分类情感分类我喜欢自然语言处理。

vs.

我非常喜欢自然语言处理。解决方案使用小的全连接层抽取局部特征(又称卷积核或滤波器)如遍历文本中的N-gram等使用多个卷积核提取不同种类的特征使用池化层将特征进行聚合(最大、平均、求和等)/drive/1HaPOfEj8wrLkqeUDuirtS-cNKGxeRdY5?usp=sharing

9HARBININSTITUTEOFTECHNOLOGY循环神经网络卷积神经网络无法处理长距离的依赖循环神经网络的解决方案每个时刻的隐状态依赖于当前时刻的输入以及上一时刻的隐状态每个时刻的参数共享(“循环”的由来)每个时刻也可以有相应的输出(序列标注)10HARBININSTITUTEOFTECHNOLOGY长短时记忆网络(LSTM)

long

termshort

term11HARBININSTITUTEOFTECHNOLOGY循环神经网络的应用双向循环神经网络堆叠循环神经网络序列到序列模型也称“编码器—解码器”模型机器翻译等多种应用RayMooneyYoucan’tcramthemeaningofawhole%&!$ingsentenceintoasingle$&!*ingvector!12HARBININSTITUTEOFTECHNOLOGY注意力机制(AttentionMechanism)当前状态除和前一个状态及输入相关外,还应关注原序列的状态打分公式13HARBININSTITUTEOFTECHNOLOGY自注意力模型

14HARBININSTITUTEOFTECHNOLOGYTransformer

15HARBININSTITUTEOFTECHNOLOGY融入位置信息位置嵌入(PositionEmbeddings)类似词嵌入,每个绝对位置赋予一个连续、低维、稠密的向量表示向量参数参与模型学习位置编码(PositionEncodings)直接将一个整数(位置索引值)映射为一个向量输入向量=词向量+位置嵌入/编码16HARBININSTITUTEOFTECHNOLOGY赋予输入向量角色信息

KeyQueryValue17HARBININSTITUTEOFTECHNOLOGY多层自注意力原始自注意力模型仅考虑了任意两个向量之间的关系如何建模高阶关系?直接建模高阶关系导致模型复杂度过高堆叠多层自注意力模型(消息传播机制)增强模型的表示能力——增加非线性增加非线性的多层感知器模型(MLP)使模型更容易学习层归一化(LayerNormalization)残差连接(ResidualConnections)由于Softmax函数的性质,无法使得多个自注意力分数趋近于1使用多组自注意力模型产生多组不同的注意力结果设置多组输入映射矩阵类似使用多个卷积核提取不同的特征18HARBININSTITUTEOFTECHNOLOGY多头自注意力thecatwalksonthestreetx

=

v

=

y

=

1119HARBININSTITUTEOFTECHNOLOGYTransformer的优缺点优点直接建模更长距离的依赖关系更快的训练速度(与RNN相比)缺点参数量过大导致模型不容易训练需要基于大规模数据预训练20HARBININSTITUTEOFTECHNOLOGY神经网络模型的训练寻找一组优化的模型参数又叫做模型训练或学习损失函数(LossFunction)评估参数好坏的准则为什么不直接使用准确率等指标进行评估?两种常用的损失函数均方误差(MeanSquaredError,MSE)交叉熵(Cross-Entropy,CE)负对数似然损失NegativeLogLikelihood,NLL21HARBININSTITUTEOFTECHNOLOGY梯度下降梯度(Gradient)以向量的形式写出的对多元函数各个参数求得的偏导数是函数值增加最快的方向沿着梯度相反的方向,更加容易找到函数的极小值梯度下降算法(GradientDescent,GD)小批次梯度下降法(Mini-batchGradientDescent)

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论