大模型技术深度解析(微课版) 课件 1.1Transformer简介_第1页
大模型技术深度解析(微课版) 课件 1.1Transformer简介_第2页
大模型技术深度解析(微课版) 课件 1.1Transformer简介_第3页
大模型技术深度解析(微课版) 课件 1.1Transformer简介_第4页
大模型技术深度解析(微课版) 课件 1.1Transformer简介_第5页
已阅读5页,还剩12页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Transformer简介主要内容一、Transformer架构二、关键技术三、作用与影响一、Transformer架构Transformer的提出2017年,Vaswani等人提出Transformer架构,专为自然语言处理设计,摒弃传统循环神经网络,引入自注意力机制,开启NLP新纪元。Transformer的特点与传统的RNN和CNN模型不同,Transformer完全依赖自注意力机制(Self-Attention),能够并行处理输入序列中的所有词,从而显著提高训练效率。一、Transformer架构Transformer架构Transformer基于编码器-解码器架构。每个部分均由基础的Transformer块组成Transformer工作流程输入->Encoder(捕获上下文)->Decoder(结合上下文生成输出)一、Transformer架构Transformer块由多头注意力,Add&Norm,前馈网络等组成编码器与解码器差异编码器结构与基础TransformerBlock一致解码器增加额外的多头注意力层(处理Encoder输出),使用MaskedSelf-Attention(防止看到未来信息)二、关键技术关键技术--Embedding概念:将词汇等高维稀疏数据映射为低维密集向量。目的:让模型能处理和理解词语关系。机制:Embedding将词汇转化为模型可处理的向量表示,从而捕捉词与词之间的语义关系。输入到模型之前,通常会进行Embedding处理,使模型能够有效识别词汇间的相互联系。二、关键技术关键技术--Attention目的:让模型聚焦于输入中最相关的信息Transformer采用缩放点积注意力(ScaledDot-ProductAttention),其通过对查询(Q)、键(K)和值(V)进行加权求和,借助Softmax标准化来实现,如式(1.1)所示。二、关键技术关键技术--Attention自注意力机制中,Q、K、V均由同一输入向量x经过线性变换得到。在编码器-解码器注意力机制中,Q来自解码器的隐藏层信息,而K和V则由编码器提供的上下文信息构成。二、关键技术关键技术--Multi-HeadAttention概念:并行运行多个Attention"头"目的:从不同表示子空间学习信息,捕捉数据不同方面机制:原本执行一次注意力计算的过程被扩展为执行h次,其中每次计算的结果被缩放为原始输出的1/h,最终拼接得到与原始维度相同的输出。每个头使用不同的权重初始化Q、K、V,从而实现对数据不同方面的捕捉。二、关键技术关键技术--PositionalEncoding问题:Transformer本身不处理序列顺序描述:参考右图与attention公式,调换任意token位置,attention输出结果不变。二、关键技术关键技术--PositionalEncoding解决方案:在输入Embedding中加入位置编码向量。其中pos表示词的位置信息,i表示维度的位置信息,d表示向量维度二、关键技术关键技术--PositionalEncoding机制:对于一个n×d维的一个序列x,其中包含n个词元,每个词元对应d维的表示,则PE由相同维度大小的矩阵p构成,(pos,2i)表示矩阵的第pos行,第2i列,两者通过x+p构成加上了位置编码的输入。作用:让模型理解词语在序列中的位置二、关键技术关键技术--PositionalEncoding拓展:为什么PositionalEncoding对于奇偶位置使用的函数不同。动机:通过交替使用sin和cos,模型能够通过线性变换直接表示位置之间的相对偏移。例如,对于任意固定偏移量k,位置pos+k的编码可以表示为位置pos编码的线性组合。二、关键技术关键技术--Add&Norm残差连接(Add):通过将当前层的输入与经过处理后的输出相加,缓解了深层网络中的梯度消失或爆炸问题层归一化(Norm):层归一化对每一层的输出进行标准化,使得每个特征的均值为0,方差为1。与批量归一化不同,层归一化是在每层的所有神经元上进行归一化,避免了序列中存在padding的影响,从而提高了序列建模的效果二、关键技术关键技术--Feed-ForwardNetwork(FFN)结构:两个线性层+非线性激活(如ReLU)作用:对Attention输出进行进一步非线性变换和信息提取。三、作用与影响Transformer的作用与影响影响范围大:广泛应用于CV、语音识别等

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论