大模型核心技术与应用(微课视频版)课件 GPT1-4_第1页
大模型核心技术与应用(微课视频版)课件 GPT1-4_第2页
大模型核心技术与应用(微课视频版)课件 GPT1-4_第3页
大模型核心技术与应用(微课视频版)课件 GPT1-4_第4页
大模型核心技术与应用(微课视频版)课件 GPT1-4_第5页
已阅读5页,还剩22页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

GPT1-4GPT1动机:NLP每个任务都需要大量标注数据,模型不能复用。CV领域得益于imagenet数据集,预训练模型,下游任务微调。OPENAI:要做NLP领域的预训练模型GPT1NLP领域预训练模型难点:1.没有像ImageNet那样大量的标注数据。怎么训练?2.预训练模型架构轻微修改,可以应用到下游任务。模型架构怎么设计?GPT1没有标注数据用语言模型自回归的方式来训练模型。GPT1模型架构GPT1模型架构GPT112层DecoderOnly隐藏层76812heads1.17亿参数可学习的EmbeddingGELU激活函数GPT1预训练

语言模型似然函数:如何得到下一个词的概率:

GPT1微调GPT1训练数据BooksCorpusDataset用了7000本未发表的书。(800Mwords)上下文长度512BachSize:32BertGPT我爱吃苹果我爱吃苹果我爱吃苹果我爱吃苹果BERTGPT2动机:GPT1和Bert将预训练模型引入了NLP,但是下游任务仍然需要收集一部分数据,进行微调。GPT2希望通过预训练模型可以解决所有下游任务。GPT2

情感分类GPT1:<start>今天这家餐厅的服务真的很棒!<extract>GPT2:判断下边这个句子的情绪是正面还是负面的:今天这家餐厅的服务真的很棒!GPT2模型修改:1.将LayerNorm移动到每个block的输入位置。最后一个子层的自注意机制后加上了一个layernorm。2.残差层的初始化参数,随着层数增加而减小,除以根号下N。N是残差层的层数。3.扩大了词典到50257。4.模型参数达到15.42亿。GPT2训练修改:1.上下文长度从512,扩展到1024。2.BatchSize到512。3.用了Reddit里优质的网页,800万文本,40GB文字。GPT2GPT3GPT3动机:延续GPT2的思想,继续做大做强。人类在做一个语言任务时,只要给几个例子就可以。但是传统Bert,GPT1,还需要成千上万的下游任务的例子。能否通过在Prompt里给模型提供几个例子,提升模型性能。(Few-shot)GPT3GPT3模型修改和GPT2一样,引入了稀疏注意力机制。GPT3训练数据上下文长度2048,BatchSize320万GPT3结果:GPT4多模态,输入是文本和图片,输出是文本。GPT4GPT4GPT4模型的能力是在预训练的时候获得的,RLHF只是和人类意识对其。并不能提高

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论