大模基础应用 4_第1页
大模基础应用 4_第2页
大模基础应用 4_第3页
大模基础应用 4_第4页
大模基础应用 4_第5页
已阅读5页,还剩37页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

大模型训练技术

学习目标知识目标了解预训练数据的准备过程。掌握预训练的主流架构。理解分布式训练与优化技术。掌握全参数微调的基本原理。掌握参数高效微调的基本原理。技能目标能够配置并运行基于Transformer架构的预训练实验。能够使用LoRA、提示微调等方法对已有大模型进行轻量化适配。能够对不同微调方法的效果进行对比评估并选择合适方案。现实挑战:如何满足用户复杂的财务目标?在金融投资领域,智能资产配置工具已成为核心。然而,随着用户财富管理意识的觉醒,其财务规划需求日益复杂化、多元化,传统的资产配置系统往往难以灵活应对。多目标并存用户通常需要兼顾多重财务规划,例如:为购房准备的稳健资金、为子女教育准备的长期成长资金等。需求动态变化每个目标的时间周期长短不一,资金需求量级各异,且对风险的承受能力也存在显著的差异。传统系统局限难以动态权衡不同目标间的资源分配矛盾,也无法精准量化用户独特的风险偏好,导致配置建议缺乏针对性。💡核心痛点:传统系统缺乏对多目标复杂关系的建模能力,无法真正做到千人千面的个性化资产配置。解决方案:“预训练+微调”的技术路径目的:夯实模型的金融市场认知。方法:利用海量金融数据对通用大模型进行训练,构建坚实的专业底座。领域预训练目的:让模型学会精准理解用户意图,并生成符合行业规范的合规方案。方法:使用少量的优质业务样本对模型进行针对性的轻量化适配。参数高效微调使模型具备扎实、系统的专业金融知识库,并建立起对复杂市场逻辑的深度理解能力,为后续应用提供底层支撑。预训练效果在不改变模型主体结构和通用能力的前提下,将通用大模型的泛化能力高效聚焦于特定的金融服务任务,显著提升业务场景中的表现。微调效果最终成果:从“通用工具”到“专业顾问”通过“预训练+微调”的技术路径,系统能够实现从通用工具到专业顾问的转变,为用户提供更具价值的智能金融服务。深度理解系统能像专业顾问一样,深度理解用户的复杂意图和多目标间的权衡,真正做到“懂你所想”。智能决策能够实现多目标优化的推理,平衡收益与风险,提供兼顾安全与增值的个性化投资方案。能力核心这一切能力的背后,是大模型通过预训练获得的海量金融知识,以及通过高效微调获得的精准任务适配能力。💡核心启示:掌握大模型的预训练与微调技术,已成为构建下一代高效智能金融系统的关键。02微调01预训练预训练概述预训练是大模型学习通用知识的基石,它通过在海量无标注数据上进行自监督学习,为模型注入世界知识和语言能力。作为大模型开发的第一步,它的重要性不言而喻。通过自监督学习,在大规模未标注文本数据上预先训练模型,以学习通用语言表示的过程。让模型掌握语言的基本规律和特征,包括语法结构、语义关系、上下文依赖,以及内嵌于文本中的世界知识和常识,从而形成广泛、适用的语言理解能力。基于“复用通用知识”的理念,即先通过无监督方式利用海量文本进行通用学习,再将学到的知识迁移到具体任务中,从而显著降低对昂贵且稀缺的标注数据的依赖。概念目标核心理念预训练的流程(1)明确目标:为谁用、做什么、不做什么(设定风险边界)。(2)数据准备:多源采集→预处理(过滤、去重、隐私处理)→分词转词元序列。(3)模型设计:选架构(解码器/编码器等)、定规模(层数、维度等)、初始化参数。(4)系统搭建:分布式训练(数据+模型+流水线并行)+混合精度、梯度检查点。(5)训练调优:监控关键指标,动态调整学习率、批量大小等超参数。(6)评估归档:多维度评估(准确性、安全性等),通过后保存模型与相关文档。数据准备的流程数据准备旨在构建一个高质量、大规模的训练语料库。其流程可以进一步划分为数据收集、数据预处理和分词三个步骤。数据准备:数据收集数据收集的其核心任务是从多样化的来源中广泛获取原始、未标注的文本数据,为模型构建一个初始的、海量的原始素材库。根据数据来源,文本数据分为通用和专用两类。通用数据(如网页、书籍)规模大、易获取,是大模型的主要训练数据;专用数据(如代码、多语文本)则有助于提升模型在特定任务上的能力。数据收集并非简单的“数据堆砌”,而是一个需有序推进的系统性工程。制定数据策略与规划根据模型目标确定数据混合配比、来源、质量要求(时效性、语言分布、版权合规)。执行大规模数据获取通过分布式爬虫、API、公开数据集等方式高效采集,优先保障规模与多样性,覆盖多领域、文体与语言。数据初步整理与归档将HTML、PDF等原始格式解析为纯文本,记录来源、采集时间等元数据,形成便于后续处理的原始数据集。数据准备:数据预处理预训练数据的数量与质量对模型性能至关重要。增加数据量通常能提升模型表现效果,提高数据的质量则能使小模型实现与大模型相当甚至更优的性能。在进行模型训练前,应优先获取足够规模且高质量的数据。这就需要进行有效的数据预处理,以消除低质量、冗余以及存在潜在有害的数据。数据预处理包含过滤与筛选、隐私信息处理和去重等步骤。模型架构设计概述模型架构是构建大模型内部结构的核心过程,是模型的“蓝图”。它规定了信息在各层之间如何流动和转换,从根本上决定了模型的能力、学习效率和计算性能。什么是模型架构?Transformer架构是自然语言处理领域的里程碑,是当前所有主流大模型的共同基石。其核心为编码器-解码器结构,并基于注意力机制与多层堆叠的设计逻辑。主流架构基石:TransformerMoE概述随着模型参数量的爆炸式增长,计算成本过高与计算效率低下成为巨大挑战。传统的稠密模型在每次计算时都需要激活所有参数,这消耗了巨大数量的资源。于是,混合专家模型(MixtureofExperts,MoE)应运而生。MoE通过“按需激活、用时调用”的机制,在不显著增加单次计算成本的前提下,极大地扩展了模型的总参数量,实现了能力与效率的平衡。未来架构趋势趋势一:向多模态与混合架构演进未来的模型架构将不再局限于处理文本。目标是设计统一的架构,实现对文本、图像、音频、视频等多种信息类型的深度融合与协同推理,让模型具备更全面的感知和理解能力。趋势二:探索超越Transformer的新型架构尽管Transformer是当前主流,但其在长序列处理、内存消耗和计算效率方面仍存在理论瓶颈。学术界和工业界正积极研究非Transformer范式的替代方案,旨在寻求根本性突破,为下一代AI架构孕育可能。大模型训练面临的困境随着模型参数规模呈指数级增长,单台计算设备的算力、内存和通信带宽已无法满足超大规模模型的训练需求。模型规模更大的模型通常意味着更强的性能,但也带来了巨大的计算和存储压力,对基础设施提出极高要求。计算资源单设备的内存和算力是有限的,无法承载万亿级参数的模型,形成了难以逾越的物理瓶颈。训练效率训练时间必须在可接受的范围内,否则高昂的时间成本将使技术研究和快速迭代变得不可行。分布式训练已成为大模型训练的必备技术分布式训练的主流策略分布式训练通过“分而治之”的策略,将训练任务拆分到多个计算设备上协同完成,以此解决算力不足和训练效率低下的问题,是实现千亿、万亿参数大模型训练的必备基础技术。业界提出了多种分布式训练策略:数据并行数据并行通过将训练数据拆分到多台设备、同步更新参数来处理大规模数据。模型并行模型并行将超大模型的层或模块拆分到不同设备,解决单设备内存无法容纳完整模型的问题。流水线并行流水线并行进一步将模型按计算阶段拆分,让多设备按流水线方式交替执行计算与通信,提升硬件利用率。混合精度训练将数据并行、模型并行、流水线并行等多种策略按需组合,灵活配置,以平衡计算负载、内存占用和通信开销,最大化利用集群资源,实现最优的训练吞吐率。数据并行概述数据并行是指将训练数据集划分为多个子集,并将每个子集分配到一个计算设备上,每个设备独立维护一份完整的模型副本。本质上是在分布式训练中通过“分治数据、协同更新”提升效率。其完整流程可分为3个紧密衔接的阶段。数据与模型的初始化训练前需将大规模数据集拆分为若干等份的小批量数据,每个小批量数据被分配给一个独立的计算单元。所有工作节点必须加载完全一致的模型副本,这种初始一致性通常通过两种方式实现:所有节点使用相同的随机种子和初始化规则,独立生成完全相同的参数;由主节点完成参数初始化后,通过广播机制将参数同步到其他所有节点,确保训练启动时,每个工作节点的模型状态完全一致。局部梯度的并行计算在训练的每一轮迭代中,每个GPU都会基于分配到的小批量数据,独立执行完整的计算流程:先通过前向传播计算模型对这批数据的预测结果,再通过反向传播求解出每个参数的局部梯度。这一步充分利用了多工作节点的并行能力,让不同节点可以同时处理不同数据,大幅缩短单轮计算时间。梯度聚合与模型同步更新梯度聚合通常采用“求和取平均”的方式,让每个节点都获得相同的全局梯度。随后,所有工作节点会用这个全局梯度同步更新本地模型参数。由于初始参数一致,且每轮都基于相同的全局梯度更新,所有节点的模型参数能始终保持同步,循环此流程即可完成整个训练过程。模型并行概述

基本思想

适用场景当模型规模可被单个GPU容纳时,数据并行是提升训练速度的首选策略。然而,当模型的参数量超过单个设备显存容量时,数据并行便无能为力,因为每个设备仍需承载整个模型的副本。此时必须采用模型并行策略。模型并行采用“分而治之”的基本思想。它将一个庞大的完整模型按层或模块进行切分,并将不同的部分分配到多个计算设备上。每个设备只负责保存和计算该子模型参数,所有设备通过高速互联网络协同工作,共同完成一次训练迭代。

模型并行策略的适用场景与基本思想0201模型并行工作流程模型并行的工作流程包括模型拆分与协同计算两大阶段。将大型模型的结构拆解后,分配到多个GPU上,每个GPU负责模型的一部分计算任务;GPU之间通过通信链路传递计算过程中的中间结果,从而突破单GPU的内存限制。在模型并行的协同计算阶段,多GPU依次完成前向与反向传播。前向时,各GPU将中间结果依次传递至下一GPU;反向时,梯度从末端GPU逆向传回首端,各GPU同步更新本地参数,实现高效协同训练。模型拆分。协同计算朴素模型并行的流水线调度情况CPU设备t1t2t3t4t5t6t7t8GPU4

FB

GPU3

F

B

GPU2

F

B

GPU1F

B(1)时间步t1:只有GPU1执行前向传播操作,其余GPU均空闲。(2)时间步t2:只有GPU2执行前向传播操作,GPU1、GPU3、GPU4均空闲。(3)时间步t3:只有GPU3执行前向传播操作,GPU1、GPU2、GPU4均空闲。(4)时间步t4:只有GPU4执行前向传播操作,GPU1、GPU2、GPU3均空闲。(5)时间步t5:只有GPU4执行反向传播操作,GPU1、GPU2、GPU3均空闲。(6)时间步t6:只有GPU3执行反向传播操作,GPU1、GPU2、GPU4均空闲。(7)时间步t7:只有GPU2执行反向传播操作,GPU1、GPU3、GPU4均空闲。(8)时间步t8:只有GPU1执行反向传播操作,GPU2、GPU3、GPU4均空闲。Gpipe流水线调度的情况朴素模型并行的流水线调度存在GPU资源利用率低和内存占用过多等问题。GPipe提出了微批次流水线并行机制。其核心思想是将一个常规的小批量数据进一步划分为多个更小的微批量数据,各设备按时间错峰处理不同微批量数据的前向或反向传播计算,实现多设备并发运行,打破层间串行依赖。GPU设备t1tt2tt3tt4tt5tt6tt7tt8tt9t10t11t12t13t14GPU4

FF1FF2FF3FF4BB4BB3B2B1

GPU3

FF1FF2FF3FF4

BB4B3B2B1GPU2

FF1FF2FF3FF4

B4B3B2B1GPU1FF1FF2FF3FF4

B4B3B2B1混合精度训练概述混合精度训练的核心机制在于保留一份FP32精度的参数主副本,以确保优化过程的数值稳定性;同时在训练计算中使用更低精度的FP16,从而显著减小显存与带宽开销。由FP32精度参数生成FP16精度的模型副本,用于执行前向传播和反向传播。大部分激活与中间张量也可使用低精度存储,而对数值敏感的激活函数、层归一化等算子仍保持在FP32精度下计算。反向传播得到的梯度会被还原到FP32精度,用于更新FP32主副本。更新完成后,再将新的FP32精度参数同步转换成低精度副本供下一轮计算使用。关键技术总结核心思想:拆分数据,复制模型解决问题:训练数据量过大导致的训练缓慢主要优势:实现简单,通用性强,加速效果显著数据并行核心思想:拆分模型参数,多卡协同计算解决问题:单GPU显存不足,无法容纳超大参数量模型主要优势:支持千亿甚至万亿级参数的大模型训练模型并行核心思想:切分微批次+流水线式时间错峰计算解决问题:模型并行中,各计算节点存在等待的低效率问题主要优势:最大化提升GPU设备利用率,有效降低峰值内存占用流水线并行核心思想:FP16低精度计算+FP32高精度梯度更新解决问题:全精度计算带来的巨大显存压力和较慢计算速度主要优势:节省约一半显存,显著加速训练,同时不损失最终精度混合精度训练02微调01预训练微调概述微调是在已完成预训练的模型基础上,利用特定下游任务的数据进行进一步训练,以更好地适应目标任务的过程。在尽可能保留预训练阶段所学通用语言知识和世界知识的前提下,通过针对性优化,使模型适配新任务的数据分布、输入输出格式及语义需求。0102定义核心目标微调分类根据微调目标不同,大模型微调分为指令微调与对齐微调。指令微调使模型理解并遵循人类指令,完成分类、生成、问答等任务。对齐微调使模型输出符合人类价值观、安全与偏好,常用方法为基于人类反馈的强化学习RLHF。两者通常先进行指令微调,后进行对齐微调。根据参数更新范围不同,分为全参数微调与参数高效微调。全参数微调更新全部参数,适配性强但资源消耗高。参数高效微调仅调整少量参数,典型方法包括前缀微调、提示微调和低秩自适应LoRA,其计算与存储成本更低。全参数微调的核心思想与流程全参数微调的核心思想是,通过端到端优化所有参数,促使模型重构其内部表示,从而充分学习任务特有的特征与模式,实现模型在特定任务上的最佳性能。准备阶段微调前需完成三项准备:选好预训练模型如BERT或LLaMA,准备与任务匹配的标注数据集,加载模型全部权重初始化参数。模型调整微调时更新全部参数以保留预训练知识,并按需添加任务层。分类任务通常在末尾添加全连接层和Softmax层,生成任务如摘要、翻译则保持原结构不变。训练阶段训练通过迭代降低误差。流程为前向传播生成预测,计算损失,反向传播计算梯度并更新权重。多次重复并在每轮后监控验证集性能,直到模型收敛或达到预设步数。评估与部署在独立测试集上评估准确率、召回率等指标。若性能达标,将模型集成至应用服务用于生产环境的实时推理。全参数微调:优势与局限核心优势性能潜力大:能充分学习新任务数据,在数据充足时通常能达到最优性能上限。表示重构能力强:深度调整模型内部特征表示,能灵活适应复杂多变的下游任务。实现简单:无需引入额外模块,工程实现直接,开发与调试成本低。训练稳定:完整的梯度传播链条让训练过程更平稳,收敛效果通常更好。主要局限计算成本高昂:需更新所有模型参数,对GPU显存容量和计算算力要求极高。存储开销大:每个任务都需独立保存一整套完整的模型权重,占用大量存储空间。灾难性遗忘:微调过程中,模型可能会丢失预训练阶段学到的通用知识。部署与维护复杂:多任务模型仓库容易变得臃肿,版本管理与维护变得困难。大模型高效微调方法演进为解决传统提示学习的局限,提出了前缀微调这一参数高效微调方法。其核心是冻结模型全部原有参数,仅在输入序列前添加一段可学习的连续向量作为前缀,且支持为不同任务设计独立的前缀而共享同一个基础模型。前缀微调的改进思路全参数微调需要更新大模型全部参数,导致计算和存储成本极高。尤其在多任务场景下,为每个任务保存一个完整模型副本会造成巨大的资源冗余,难以扩展部署。全参数微调的资源困境为解决上述问题提出了提示学习,其理念是通过在输入中添加指令或示例来引导模型,而不改变模型参数。但该方法依赖人工设计或搜索最佳提示,表达能力有限且难以找到最优解。传统提示学习的局限性020103

大模型微调方法的演进与挑战前缀微调:工作原理前缀的插入位置:可训练的前缀向量不是只加在输入层,而是被拼接至每一层Transformer注意力机制的输入序列头部。注意力计算中的改动:在计算注意力时,查询向量Q的生成方式不变;但键向量K和值向量V的生成被改造——由原始输入生成的K、V与由前缀向量生成的专属前缀键PK和前缀值PV共同拼接而成。机制的作用与优势:这一设计使得每个真实词元都能“关注”到前缀向量,从而让模型输出受前缀中的任务信息动态调控。同时,由于前缀向量不参与Q的计算,仅参与K和V,既显著减小了训练开销,又能通过注意力机制隐式地引导模型行为。全参数微调:优势与局限核心优势存储高效:仅更新少量可训练前缀向量,显著减小存储开销,使同一基础模型可高效适配大量下游任务。小样本泛化强:在小样本场景下泛化能力强。多任务并行:可实现多任务并行处理,提升系统吞吐量。适用场景广:以极低成本实现模型多能,适用于资源受限、多任务或数据稀少的场景,是推动大模型实用化的重要技术。主要局限复杂任务性能略低:在复杂任务上性能可能略低于全参数微调。计算负担增加:前缀会增加序列长度,带来一定计算负担。前缀长度需调优:前缀长度需手动调优。训练不稳定:训练过程可能因直接优化高维向量而不稳定,常需用重参数化技术缓解。提示微调概述提示微调是一种面向大规模预训练语言模型的参数高效微调方法。

提出背景提示微调源于对微调技术“极致简化”与“理论验证”的双重探索。此前的前缀微调虽有效,但需要在模型每一层引入可训练参数,实现复杂度和部署成本较高。

理论基础基于一个核心假设:模型规模越大,其预训练蕴含的潜能和知识就越丰富。因此,无需修改模型内部结构,只需在输入端提供一个可学习的引导信号,就能“激发”模型执行任务的能力。

实现方法完全冻结预训练模型的所有参数,仅在输入序列前端引入一段连续的、可学习的软提示向量,训练过程中仅更新该提示向量的参数,而模型其余部分保持不变。提示微调:关键技术即确定软提示的初始参数值。常用策略包括随机均匀初始化、采样词汇初始化和类别标签初始化,其中优先推荐使用与任务相关的类别标签作为初始值,以增强语义相关性。提示的初始化设计提示向量长度即虚拟词元的数量。当长度达到约20时,性能增益趋于饱和,继续增加改进有限,呈现收益递减现象。在超大规模模型上,即使极短的提示也能取得较好效果。因此实际应用中通常将长度设置在20左右,无须追求过长结构。提示向量的长度设计传统预训练模型以完形填空为目标,而提示微调要求模型根据自然指令生成连贯回答,二者存在本质差异。为此,需在冻结模型主体参数的前提下,将预训练目标从填空转换为标准的语言建模任务即根据前文预测下一个词元,使模型从填空专家转变为具备指令理解与连贯生成能力的通用语言生成者。语言模型的适配处理提示微调:优势与局限核心优势参数效率极高:仅优化软提示的少量参数,冻结主干模型,训练和存储成本大幅降低。大模型性能优异:性能随模型规模扩大显著提升,在超大模型上可媲美甚至超越全模型微调。泛化能力强:主干参数冻结,在跨领域任务中表现更优。支持高效集成:通过共享模型集成多个提示,减小计算开销。部署简化:只需加载不同任务的微小提示,简化服务流程。主要局限依赖大模型:在小模型上性能明显落后。可解释性差:软提示为连续向量,缺乏可解释性。对超参数敏感:效果受初始化和提示长度等超参数影响,需仔细调优。需模型适配:若预训练目标与自然语言生成不匹配,需额外进行语言模型适配,否则性能会下降。LoRA:核心思想与理论基础动机:解决传统的前缀/提示微

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论