版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
《现代深度学习教程》第8章
大模型主讲:XXX时间:2026/9/21目录CONTENTS01大规模预训练模型03GPT05ChatGPT02大语言模型04BERT06OpenAI-o1AI8.1大规模预训练模型8.1大规模预训练模型近年来,随着深度学习、硬件算力和大规模数据集的发展,BERT、GPT等大规模预训练模型(Pre-TrainingModel,PTM)不断涌现。大规模预训练模型表现出大参数量、海量数据学习、较强的模型泛化性等特点,可以有效地从海量标记和未标记数据中捕获知识。2021年8月,美国斯坦福大学以人为本人工智能研究院将大规模预训练模型统一命名为“基础模型(FoundationModel)”。图8.1大语言模型的发展04/318.1大规模预训练模型大模型具有大量的参数和复杂的结构,通常在强大的算力支撑下利用海量数据集进行训练,表现出强大的通用性,在各领域展现出强大的生命力,具有以下两个特性。(1)涌现性涌现是指从微观到宏观的产生过程。大模型的行为是隐式诱导的,而不是显式构造的。对现有大语言模型涌现特征的研究发现,大语言模型呈现涌现特征。(2)同质性大模型的能力是人工智能的核心,大模型的任何一点改进会迅速惠及所有用户,但其缺陷也会被所有下游模型所继承。图8.2经典监督学习流程和“预训练-微调”学习流程对比05/318.1大规模预训练模型基础模型利用海量多模态数据进行训练,通过“适应”迁移到问答、情感分析、信息提取、图像字幕、目标识别、指令服从等多种下游任务。图8.3大模型的应用及其流程06/318.1.1大模型的发展历程自2012年以来,深度神经网络因其强大的表征能力被广泛应用。2017年Transformer架构的提出,使模型参数更容易突破1亿:BERT超过3亿,GPT-3超过千亿,鹏程盘古实现万亿。迁移学习分为预训练(存储知识)与微调(迁移到目标任务)两个阶段;自监督学习处理未标记数据,获得有助于下游任务的有用表示。语言领域:BERT3.4亿参数(2018)→T5110亿(2019)→GPT-31750亿(2020);视觉领域:Transformer引入后快速发展;跨模态领域:围绕视觉与自然语言任务构建。图8.4“预训练-微调”流程07/318.1.2大模型的优势大模型具有参数量巨大、需要强大计算能力、复杂任务处理能力、上下文理解能力等特点,能够处理更复杂、更大规模的任务。相对于普通模型,主要有三方面优势。01强大的泛化性参数量巨大、训练数据集大,在预训练过程中获取大量先验知识,面对新任务时表现更稳健。02降低训练研发成本具备自监督学习能力,不需要或很少需要人工标注数据,可直接使用海量未标注数据训练。03带来更优的效果海量数据的训练模式极大提升性能,GPT系列从大量文本数据中自动学习。08/318.1.3大模型的应用场景搜索引擎学习海量数据知识,理解用户意图,直接生成精准答案办公创作自动生成文本、语法纠错、文字润色,提高办公效率教育提供“启发式”教学模式,支持多轮对话引导提问者医疗辅助导诊、熟悉病情并提供解决方案;ChatCAD提供交互式解释与建议金融帮助金融从业者做出决策,便于风险管理其他华为云盘古CV大模型等,朝多应用场景发展图8.5ChatCAD交互示例09/31AI8.2大语言模型8.2大语言模型大语言模型是利用大量文本数据进行学习的深度神经网络模型,可以捕捉语言的通用知识和规律,从而提高自然语言处理的性能。NLP的发展经历了三个阶段。1.符号NLP20世纪50年代—20世纪90年代早期大多数自然语言处理系统基于复杂的手写规则集(如MARGIE、SAM、PAM等)。1950年,艾伦·图灵发表《计算机与智能》,提出图灵测试;世界上最早的聊天机器人ELIZA在这一时期诞生。2.统计NLP20世纪90年代—21世纪10年代机器学习算法(如决策树)被引入语言处理领域,核心是通过统计推理从大型真实文本中学习语言规律。1981年,罗洛·卡彭特研发了世界上第一个语音聊天机器人贾伯瓦基(Jabberwacky)。3.神经NLP21世纪10年代至今采用“预训练-微调”两步走:先在大规模无标签数据上预训练学习通用语言模式,再在下游任务上微调。参数规模快速增长(BERT3.4亿→GPT-31750亿);智能手机兴起使Siri、Alexa等语音助手广泛应用。11/31AI8.3GPT8.3GPTGPT系列模型由OpenAI提出,在NLP和CV领域相关任务中取得了令人惊艳的效果,可应用于文章生成、代码生成、机器翻译、视觉问答等任务。系列发展:2018年GPT-1→2019年GPT-2→2020年GPT-3→2023年GPT-4。表8.1GPT系列模型发展史模型发布时间参数量预训练数据集容量GPT-12018年6月1.17亿约5GBGPT-22019年2月15亿40GBGPT-32020年5月1750亿约46080GBGPT-42023年3月——13/318.3.1GPT系列介绍GPT-1:只使用Transformer的解码结构,仅使用掩码多头注意力机制,只利用上文信息;用无标注数据训练生成式语言模型,再针对下游任务微调。GPT-2:结构基本与GPT-1一致,仍使用单向Transformer,在最后一个自注意力块之后加了一层归一化操作。GPT-3:架构与GPT-2相同,共96层、每层96个注意力头,单词嵌入大小增加到12888维,上下文窗口扩大。GPT-4:多模态模型,支持图像和文本输入、输出文本;采用基于人类反馈的强化学习(RLHF);并推出GPT-4o和GPT-4omini版本。图8.6GPT-1的解码结构和微调任务14/318.3.2GPT的数据集及参数量GPT-1:使用BooksCorpus数据集(7000本未出版书籍),上下文依赖更长,能学到更长期的依赖关系。GPT-2:从Reddit高赞文章的出站链接中提取数据,生成WebText数据集,包含约800万篇文档。GPT-3:1750亿参数、45TB训练数据,在CommonCrawl、WebText2、Books1、Books2等5个语料库上按质量配比训练。GPT-4:参数量比GPT-3显著增加,语言复杂性处理、上下文理解与生成能力更强。表8.3GPT-2的不同模型参数量层数词向量长度1.17亿127683.45亿2410247.62亿36128015.42亿48160015/318.3.3GPT的预训练GPT-1:语言建模目标将语言建模任务作为训练目标,根据已知词预测未知词,以窗口长度为k的滑动方式无监督训练:条件概率的计算W_e:词嵌入矩阵;U:位置嵌入矩阵;L:解码器层数GPT-2:任务条件作用期望模型对不同任务的相同输入产生不同输出,多任务学习共享参数,零样本完成多任务:GPT-3:情境学习(ICL)不进行参数更新,只在输入中加入几个示例让模型学习。以MAML算法为例:将任务打包成批,每批分为支持集和查询集,用于学习可快速泛化的表征。16/318.3.4GPT的优势及局限性GPT-1在QNLI、MNLI、SNLI、SciTail、StoryCloze、RACE、CoLA、STSB、QQP共9个数据集上的表现超过专门训练的有监督先进模型。GPT-2使用大语料库WebText,验证了海量数据和大量参数训练的模型可迁移到其他任务而不需要额外训练;模型能力随规模提升。GPT-3超过绝大多数零样本或少样本先进方法,在数学加法、文章生成、代码编写等多种任务上取得优异效果。GPT-4吸引众多国际企业和新创公司关注应用;可处理图片和超过25000个单词的长文本,多模态能力突出。局限性GPT模型存在语义一致性欠缺、推理能力有限、偏见问题及伦理风险等局限;对训练数据的依赖较强,生成内容的可信度需要甄别。17/31AI8.4BERT8.4.1BERT的结构BERT是谷歌研究人员于2018年发布的预训练语言模型,当时成功在11项NLP任务中取得优异表现。相对于GPT,BERT凭借双向Transformer编码器,可以同时考虑输入左右两侧的上下文信息,从而更好地理解文本的含义和结构。图8.7BERT和GPT-1的差异19/318.4.1BERT的结构:编码与输出BERT的编码嵌入由三种编码求和而成:词向量编码(第一个单词为CLS标志,用于分类任务)、分割编码(区分句对)、位置编码。Transformer的输入和输出个数相等:C为类别标记[CLS]对应的输出,Ti代表其他词的输出。图8.8BERT的编码示例图8.9BERT的输入及输出示例输入:经过掩码处理的文本A和文本B,由词向量、分割、位置三种编码求和后输入模型。输出:与输入的每个词一一对应,可用于分类、标注等下游任务。20/318.4.2BERT的数据集及参数量BERT模型的训练数据集来源于大型语料库图书语料库(BooksCorpus)等。BERT具有两种架构类型,参数如下表所示。表8.4BERT参数架构类型Transformer层数隐藏层维数注意力头数参数量BERT-base12768121.1亿BERT-large241024163.4亿21/318.4.3BERT的预训练BERT利用大规模文本数据的自监督性质构建了两个预训练任务:掩码语言模型(MLM)和下一句预测(NextSentencePrediction,NSP)。1.掩码语言模型(MLM)通过屏蔽句子中的单词,迫使BERT利用被屏蔽单词两侧的词进行双向预测。以15%的概率用[MASK]随机替换训练序列中的标记,再预测[MASK]位置原有的单词。Ijustwantedtosendan[Mask],butthenetworkcrashed.2.下一句预测(NSP)MLM倾向于抽取词层面的表征,不能直接获取句子层次的表征。NSP通过预测给定句子是否遵循前一个句子的逻辑,帮助BERT理解句间关系。A(正确):Richardwenttotherestaurant./Heorderedahotpot.B(错误):Shegoestoworkbymotorcycle./Anewcoffeeshopopened.22/318.4.4BERT的微调针对不同任务的特定模型是BERT与一个额外的输出层结合在一起形成的,因此只需要学习少量的参数。23/318.4.5BERT的优势及局限性优势使用大规模数据集进行训练,采取“预训练+微调”的模式。结构建立在Transformer之上,拥有强大的语言表征能力和特征提取能力。允许进行双向编码,同时考虑输入左右两侧的上下文,更好地理解文本含义和结构。局限性MLM中被替换的[MASK]标记只在预训练阶段出现,微调与推理阶段并不存在,两个阶段存在差异。训练依赖大规模算力与数据资源,训练成本高。只使用Transformer编码结构,不适合直接处理生成类任务。24/31AI8.5ChatGPT8.5ChatGPT:基于人类反馈的强化学习ChatGPT比GPT-3的性能有显著提升,能以不同样式、不同目的生成文本,在准确度、叙述细节和上下文连贯性上表现更优,并支持连续多轮对话。ChatGPT使用了RLHF,学习过程包括三个步骤。图8.11ChatGPT的学习过程步骤1:收集数据,利用自监督方法对模型进行调整(SFT监督微调)。步骤2:收集对比数据,训练奖励模型(RM)。步骤3:利用强化学习(PPO)优化策略,使输出更符合人类偏好。26/31AI8.6OpenAI-o18.6OpenAI-o1概述2024年9月12日,OpenAI推出最强模型GPT-o1系列,包含三款模型:OpenAIo1、OpenAIo1-preview(早期推理版本)和OpenAIo1-mini。OpenAIo1在数学、物理、化学、生物、英语、法律、经济等各科目上都有显著改进,尤其是解决博士水平的物理问题时表现远超GPT-
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年11月04日 阳西县测评中心 科思创 高分子材料工程师 19人
- 2026慢性病患者秋冬季传染病防控专题培训课件
- 贵州省六盘水市盘州市2025-2026学年五年级上学期期末考试科学试卷(有答案)
- 2026-2027学年吉林省长春力旺实验初级中学九年级(上)开学自我检测物理试卷(含答案)
- 2026教师水痘的预防专题培训课件
- 2026高血压患者呼吸道传染病防控课件
- 2026新学期小学德育工作总结课件:主题教育月活动
- 2026新学期全体学生学习习惯养成教育课件
- 2025-2026年广东省湘教版初中生物第12课遗传与变异练习题
- 2025-2026年广东省西式糕点烘焙技能考核试卷
- 福建省地图含市县地图矢量分层地图行政区划市县概况课件模板
- 场(厂)内专用机动车辆 年度检查报告
- DB31/T 1128-2019再生骨料混凝土技术要求
- 过节福利采购合同协议
- 2025年杭州市商品房买卖合同备案管理暂行办法
- 2024年重庆客运员考试题库及答案详解
- 中等职业学校英语教学大纲附件五:词汇表
- (正式版)CB∕T 4548-2024 船舶行业企业相关方安全管理要求
- 金属非金属矿山重大事故隐患排查表
- 2024年电子变压器行业市场研究报告
- 深圳市中小学生流感疫苗接种知情同意书
评论
0/150
提交评论