大模型核心技术与应用(微课视频版)课件 Llama_第1页
大模型核心技术与应用(微课视频版)课件 Llama_第2页
大模型核心技术与应用(微课视频版)课件 Llama_第3页
大模型核心技术与应用(微课视频版)课件 Llama_第4页
大模型核心技术与应用(微课视频版)课件 Llama_第5页
已阅读5页,还剩22页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Llama1Llama的动机Open!Open!Open!AI完全开源数据媲美GPT3社区研究开源不能商用Llama110B50B模

失训练计算花费期望损失相同的计算预算,增加训练数据比扩大模型参数有效。ScalingLaw,计算预算下给出token和模型大小的建议。没有考虑推理代价,推理代价比训练代价更重要。原来10B模型,建议用200B的token训练。Meta7B模型,用1Ttoken,发现性能还一直增长。Llama1全部开源数据CommonCrawl2017-2020数据,去重,去除非英文数据。线性模型进行质量分类过滤。书和维基百科用了2个epoch,其他1个。总共1.4Ttoken。上下文长度2048,2048个A10080GGPU,用时21天。Llama1模型修改TransformerDecoder架构,做了以下修改:1.和GPT3一样将Normalization从每个子层的输出位置移动到了输入位置。2.将LayerNorm改为RMSNorm。3.采用旋转位置编码。4.采用silu激活函数。RMSNorm

silu

可以提升精度,计算指数函数,计算代价较高Llama2Open!可商用加大数据量ChatModelLlama270B模型训练了172万GPU小时相当于2048个GPU,训练35天。Llama2Llama22Ttoken仍然还有增长空间GQA(GroupQueryAttention)hiden_size:512w_q512*512w_k512*512w_v512*512qkvGQA(GroupQueryAttention)hiden_size:512w_q512*512w_k512*512w_v512*512qkvGQA(GroupQueryAttention)hiden_size:512w_q512*256w_k512*256w_v512*512qkvGQA(GroupQueryAttention)hiden_size:512w_q512*256w_k512*256w_v512*512qkvGQA(GroupQueryAttention)hiden_size:512w_q512*256w_k512*256w_v512*512qkvGQA(GroupQueryAttention)hiden_size:512w_q512*256w_k512*256w_v512*512qkvGQA(GroupQueryAttention)GQA(GroupQueryAttention)Llama2只在70B模型上应用GQAGQA(GroupQueryAttention)Llma3目标:最好的开源模型,可以与最好的商业大模型媲美。先发布8B和70B。后边还有其他模型:400B,多语言,多模态模型。Llma3表现:Llma3表现:BenchMarkLlama27BLlama213BLlama270BLlama38BLlama370BLlama3400BGPT-3.5GPT-4MMLU34.147.852.968.48286.17086.4GPQA21.722.321.034.239.54828.135.7HumanEval7.914.025.662.281.784.148.167GSM-8K25.777.457.579.69394.157.192MATH3.86.711.630.050.457.834.152.9Llma3模型架构:字典从3万2000个Token扩充4被,达到了12万8千。提高推理效率。原来一个中文被编码为多个token,现在只需要一个token。所有模型,包括8B模型也用GQA序列长度从4096到了8192。Llma3训练数据:15T的训练Token,全部来自公开数据。是Llama2的7倍大小。代码数据多了4倍。5%高质量非英语数据,涵盖30多种语言。对数据进行了清洗过滤,Llama2生成训练数据来帮助训练文本质量分类器。微调阶段除了开源数据集,还人工标注了1000万样本。Llma3训练技能:制定了一系列缩放定律,通过小模型表现可以在大模型训练前预测大模型的表现。根据之前ScalingLaw推算8B模型对应2000亿Token,但是Meta发现即使15万亿Token训练,性能还可以提升。在两个定制的24KGPU集群上训练。有效训练时间超过95%,

比Llama2提高了3倍。模型训练(GPU小时)GPULlama165B1.0MA100

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论