深度学习通识教程 课件 第九章第二讲 经典语言大模型_第1页
深度学习通识教程 课件 第九章第二讲 经典语言大模型_第2页
深度学习通识教程 课件 第九章第二讲 经典语言大模型_第3页
深度学习通识教程 课件 第九章第二讲 经典语言大模型_第4页
深度学习通识教程 课件 第九章第二讲 经典语言大模型_第5页
已阅读5页,还剩15页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

CHAPTER9经典语言大模型第二讲(共三讲)·经典语言大模型DeepSeek系列·AudioLM·PaLM系列·LLaMA系列多头潜在注意力MLA·DeepSeekMoE·声学/语义分词SwiGLU·RoPE·RMSNorm·GQA·RLHF《深度学习通识教程》第9章·第二讲(共三讲)章节STUDYGUIDE四条技术路线:开源低成本、音频、超大参数、开放高效02/20019.3.1DeepSeek系列模型深度求索研发的开源语言大模型,核心目标是通过技术创新实现高性能与低成本的平衡。重点剖析DeepSeekV3的两大核心技术:多头潜在注意力(MLA)与DeepSeekMoE。029.3.2AudioLM音频大模型谷歌开发的音频大模型,将语言建模的原理应用于音频生成:把输入音频映射为离散token,将音频生成视为一种语言建模任务。039.3.3PaLM系列语言大模型谷歌2022年推出的5400亿参数语言大模型,利用Pathways系统训练,对Transformer架构做出六项改进;PaLM2通过计算优化缩放实现更小、更高效。049.3.4LLaMA系列语言大模型MetaAI发布的开放且高效的语言模型,全部基于公开数据集训练,可被复现;LLaMA2-Chat经监督式精调与RLHF优化,面向对话场景。39.3.1DeepSeek系列模型DeepSeek:以技术创新实现高性能与低成本的平衡DeepSeek系列模型由中国杭州深度求索人工智能基础技术研究有限公司研发,是开源语言大模型。从早期的DeepSeekCoder、DeepSeekLLM、DeepSeekMoE,到DeepSeekV2、DeepSeekV3,再到新的DeepSeekR1,在模型架构、训练方法、数据集开发等方面持续创新,性能不断接近乃至在部分指标上超越顶尖模型。图9-10DeepSeek系列模型的发展历程03/2039.3.1DeepSeek系列模型五代模型的核心技术创新模型发布时间核心技术创新DeepSeekLLM2023年11月采用分组查询注意力(GQA)降低推理成本;多步学习率调度器替代传统余弦调度器;基于HAI-LLM框架重构训练基础设施;2万亿字符双语数据集预训练。67B性能超越LLaMA-2-70B,Chat版本优于GPT-3.5DeepSeekMoE2024年1月细粒度专家分割与共享专家隔离机制;专家级/设备级双维度平衡损失解决负载不均。16B可在单个40GB内存GPU上部署,监督微调后性能超过传统MoE架构及同类密集模型DeepSeekV22024年5月引入多头潜在注意力(MLA)机制;优化MoE路由算法;基于YaRN方法扩展上下文窗口;设计3种辅助损失并引入TokenDropping策略,多阶段训练流程提升性能DeepSeekV32024年12月无辅助损失的自主负载均衡方案;多Token联合预测架构;FP8混合精度训练框架;分布式高效通信协议;知识蒸馏提升推理性能。基础模型在开源领域领先,Chat版本达到闭源商业模型水平DeepSeekR12025年1月DeepSeek-R1-Zero无须监督微调就有卓越推理能力,与OpenAI-o1-0912在AIME上性能相当;多阶段训练+冷启动数据方案,推理性能对标OpenAI-o1-121704/2039.3.1DeepSeek系列模型DeepSeekV3:高性能、低成本、低能耗三重突破6710亿参数的动态稀疏激活设计在数学/代码任务上的性能超越GPT-4,保持优异性能推理速度提升至传统密集模型的3倍结合FP8混合精度训练与硬件协同技术,训练成本仅为同类模型的1/3基本构造多头潜在注意力(MLA)DeepSeekMoE均方根归一化(RMSNorm)凭借DeepSeekR1展现的零样本学习潜力,深度求索很可能在通用人工智能领域实现关键突破,成为全球人工智能竞赛中的重要参与者。图9-11DeepSeekV3的基本构造05/2039.3.1DeepSeek系列模型·核心技术MLA:对Key/Value低秩联合压缩,大幅减少KV缓存

06/2039.3.1DeepSeek系列模型·核心技术DeepSeekMoE:共享专家+路由专家

07/2039.3.2AudioLMAudioLM:把音频生成当作语言建模任务AudioLM由谷歌开发,可以理解和生成音频,例如通过接收到的音频生成后续音频。它将语言建模的原理应用于音频生成领域:将输入音频映射为一系列离散token,并将音频生成视为一种语言建模任务,类似于在文本中如何对待单词或标记。1输入和分词化过程对长度为T的单声道音频序列x,用分词器模型映射为序列h=enc(x),从有限词汇中产生T′个离散词(T′≪T),音频数据被压缩成更易于管理的形式。2使用词进行语言建模核心是一个Transformer解码器,通过训练以最大化条件概率∏p(h_t|h_{<t});推理期间模型自回归地预测词序列,每个词都基于之前的所有词预测。3将词解码为音频生成词序列ĥ后,解码器模型将词序列映射回音频,重建音频x̂=dec(ĥ)。AudioLM代表了在音频生成领域使用语言建模技术的创新成果,通过混合标记化方法调和了高质量音频重建和紧凑表示的需求。08/2039.3.2AudioLM两种分词方法:声学分词与语义分词声学分词由SoundStream编码器-解码器结构和残差向量量化(RVQ)实现,可用于高质量的音频合成声学词确保输出音频的高质量语义分词先导出由类似w2v-BERT的中间层模型生成的表示,再使用K-Means对表示聚类得到一组离散词,这些词捕获音频的长期结构语义词关注音频的长期一致性和结构两种词相互补充工作流程中首先生成语义词,然后在语义词的基础上生成声学词,以此确保最终音频的连贯性和质量图9-12AudioLM采用的两种分词方法语义标记捕获语言内容和结构、确保长期一致性;声学标记保留细微的声学细节,允许高质量音频合成。09/2039.3.2AudioLMAudioLM的应用与挑战主要应用音乐生成:生成音乐是AudioLM的主要应用之一语音合成:生成自然流畅的人类语音辅助技术:根据文本或其他类型的输入生成自然流畅的语音,为语音障碍患者提供帮助内容创作:帮助创建媒体、游戏或虚拟环境的音频内容,为声音设计师和创作者提供新的工具挑战与展望确保生成的音频保持高质量和连贯性是一个重大挑战:模型必须理解音频的基础知识以及使音频变得悦耳或引起情感共鸣的技巧与先进人工智能模型一样,AudioLM在训练和生成方面需要大量的计算资源,可能限制其可用性音频生成领域正在迅速发展,新的突破和应用不断涌现,未来可能会出现更多像AudioLM这样实用的应用音频生成:音乐、语音与内容创作10/2039.3.3PaLM系列语言大模型PaLM:5400亿参数,基于Pathways系统训练5400亿参数(谷歌,2022年)Pathways系统专为高效地在成千上万的加速器芯片上训练大型神经网络而设计允许PaLM跨越多个硬件单元进行训练,提高训练速度与处理复杂任务的能力跨设备的扩展性是进行多任务学习和处理大数据集的关键能力表现在多个自然语言处理、代码理解和数学推理任务中展现出色的少样本学习能力,取得突破性进展,具有广泛的应用潜力和灵活性在多个领域展现优异性能,能够有效融合和利用跨领域的知识——这对解决需要综合多种知识和技能的复杂问题至关重要PaLM使用改进后的Transformer架构,共六项改进,见下两页。谷歌TPU集群(Pathways训练基础设施)11/2039.3.3PaLM系列语言大模型·架构改进改进(一):SwiGLU激活函数与并行层①采用SwiGLU激活函数

②使用并行层

12/2039.3.3PaLM系列语言大模型·架构改进改进(二):Multi-Query、RoPE、共享嵌入、无偏置

⑤共享嵌入层策略输入序列和输出序列共享相同的嵌入层,让输入输出之间共享语义信息,表示更一致、关联性更强⑥不使用偏置项在密集内核或层归一化中都不使用偏置项,提高了大模型的训练稳定性PaLM2更新模型架构和训练目标,改进数据集混合方式,使用计算优化缩放技术:比PaLM更小但效率更高、整体性能更好,推理更快、服务参数更少、成本更低擅长高级推理任务:代码和数学、分类和问答、文本翻译、自然语言生成13/2039.3.4LLaMA系列语言大模型LLaMA:开放、高效、可复现基本信息MetaAI发布的一系列开放且高效的语言模型,包含70亿、130亿、330亿、650亿参数4个版本全部基于公开数据集训练,没有使用定制数据集,与开源社区兼容、可以被复现标记化处理后整个训练集约1.4万亿个标记:LLaMA-65B和LLaMA-33B在全部标记上训练,LLaMA-7B在1万亿个标记上训练性能LLaMA-13B在多数基准测试中超过GPT-3,且能在单个V100GPU上运行LLaMA-65B与谷歌Chinchilla-70B和PaLM-540B相媲美数据集样本比例Epochs大小CommonCrawl67.0%1.103.3TBC415.0%1.06783GBGithub4.5%0.64328GBBooks4.5%2.2385GBArXiv2.5%1.0692GBStackExchange2.0%1.0378GB表9-4LLaMA使用的数据集LLaMA基于自监督学习的训练方法,利用Transformer架构,并受到其他模型的启发进行了若干修改。LLaMA:70亿~650亿参数,基于公开数据集训练14/2039.3.4LLaMA系列语言大模型·架构修改三项修改:RMSNorm、SwiGLU、RoPE①预标准化(Pre-normalization):采用RMSNorm

②SwiGLU激活函数Transformer中标准的ReLU非线性激活函数被带门控机制的激活函数SwiGLU取代(同式9-24,与PaLM一致)。③RoPE旋转位置嵌入在网络的每一层中,绝对位置嵌入被旋转位置嵌入替代(同式9-27)。这些修改的组合创建了更强大和高效的Transformer架构,改进了LLaMA模型的整体性能。15/2039.3.4LLaMA系列语言大模型LLaMA2:更充分的预训练与GQALLaMA2(2023年7月开源)包含70亿、130亿、700亿参数3个版本,特别适合对话场景多个基准测试中性能超过开源聊天模型;基于人类评估的帮助性和安全性表现,可能成为闭源模型的可行替代品预训练阶段的改进进行更充分的数据清洗,使用新的数据混合策略预训练数据集总标记数量达到2万亿个上下文长度增加一倍模型结构与LLaMA基本相同,但70B模型使用了GQA

16/2039.3.4LLaMA系列语言大模型LLaMA2-Chat:监督式精调+RLHF的对话优化精调过程(指令调整+RLHF,需要大量计算和标注资源)监督式精调:使用人类标注的数据对模型进行初步的精调奖励模型:通过收集人类偏好数据,构建安全奖励模型和帮助性奖励模型强化学习:使用RLHF方法,结合拒绝采样和近端策略优化(PPO)迭代优化;累积迭代奖励建模数据与模型增强同步推进,维持奖励模型输出始终在训练数据分布范围内GhostAttention(GAtt):用于控制对话流在多个轮次中的连贯性LLaMA2-Chat通过自监督学习预训练,再经监督式精调和RLHF优化,旨在提供高质量的对话生成,解决语言模型在生成安全和有用内容方面的挑战,成为具有很强竞争力的开源模型。图9-13LLaMA2-Chat的训练过程17/2018第二讲·总结四大经典语言大模型横向对比模型研发方参数规模核心特点(据本章)DeepSeek系列深度求索V3达6710亿开源;高性能与低成本平衡;MLA减少KV缓存,DeepSeekMoE共享+路由专家,FP8混合精度训练,训练成本仅为同类模型1/3AudioLM谷歌—将语言建模应用于音频生成;声学+语义双分词互补,生成高质量、连贯且具长期一致性的音频PaLM/PaLM2谷歌5400亿Pathways系统训练;六项架构改进(SwiGLU、并行层、Multi-Query、RoPE、共享嵌入、无偏置);PaLM2更小更高效LLaMA/LLaMA2MetaAI7B—65B/7B—70B开放高效、公开数据集可复现;RMSNorm、SwiGLU、RoPE;70B使用GQA;LLaMA2-Chat经SFT+RLHF面向对话优化对比可见:语言大模型的竞争已从单纯扩大参数规模,转向架构效率(MLA、GQA、Multi-Query)、训练成本(FP8、并行层)与使用场景(音频生成、对话优化)的多维度创新。18/2019第二讲·总结跨模型复用的关键技术组件本章各模型虽独立发展,但多项关键技术被跨模型采用或一脉相承:技术组件本章中的采用情况SwiGLU激活函数PaLM(式9-24);LLaMA用以替代ReLURoPE旋转位置嵌入PaLM(式9-27);LLaMA替代绝对位置嵌入;DeepSee

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论