CN119473732A 基于分布式内存管理的大模型训练故障恢复方法和装置 (之江实验室)_第1页
CN119473732A 基于分布式内存管理的大模型训练故障恢复方法和装置 (之江实验室)_第2页
CN119473732A 基于分布式内存管理的大模型训练故障恢复方法和装置 (之江实验室)_第3页
CN119473732A 基于分布式内存管理的大模型训练故障恢复方法和装置 (之江实验室)_第4页
CN119473732A 基于分布式内存管理的大模型训练故障恢复方法和装置 (之江实验室)_第5页
已阅读5页,还剩20页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于分布式内存管理的大模型训练故障恢本发明公开一种基于分布式内存管理的大要进行检查点保存业务,获取当前时刻模型状步检查点保存包括数据分布式内存备份和数据内存中读取备份数据,可以显著减少因磁盘I/O数据操作而导致的训练暂停或效率下降,保持GPU或其他计算资源的高效利用,提高大规模模22.根据权利要求1所述的基于分布式内存管理的大模型训练故障恢复方法,其特征在排序,排序第一的节点为最优备份节点Bk,选择前n个节点组成最优备份节点组合Bk_(2)将本节点内存里的检查点数据分别传输至最优备份节点Bk或最优备份节点组合3.根据权利要求1所述的基于分布式内存管理的大模型训练故障恢复方法,其特征在4.根据权利要求2所述的基于分布式内存管理的大模型训练故障恢复方法,其特征在是节点5.根据权利要求4所述的基于分布式内存管理的大模型训练故障恢复方法,其特征在于,将本节点内存里的检查点数据分别传输至最优备份节点Bk或最优备份节点组合Bk_6.根据权利要求1所述的基于分布式内存管理的大模型训练故障恢复方法,其特征在S6_1:若本节点内存中检查点数据存在,使用本3S6_2:若本节点重启或本节点任务调度到其他节点,S6_3:若备份节点Bk或最优备份节点组合Bk_Group内7.根据权利要求1所述的基于分布式内存管理的大模型训练故障恢复方法,其特征在8.根据权利要求7所述的基于分布式内存管理的大模型训练故障恢复方法,其特征在S7_1:若任务已恢复正常训练并完成下一轮检查点数S7_2:若任务已恢复正常训练但未完成下一轮检查S7_3:若训练任务正常结束,删除上一轮Bk节点或Bk_G9.一种基于分布式内存管理的大模型训练故障恢复装个或多个处理器,用于实现权利要求1~8中任一项所述的基于分布式内存管理的大模型训使得所述电子设备实现如权利要求1~8中任一项所述的基于分布式内存管理的大模型训练4至数万亿标注的数据集上训练具有数千亿或数万亿参数的[0003]随着人工智能技术的快速发展,通用图形处理器(General_purposecomputing案是一种确保数据完整性和一致性的一种常见方案。该方案要求在模型训练的每个关键等,完整地写入到持久化存储中,如硬盘驱动器(HardDiskDrive,HDD)或固态硬盘点都必须成功地将数据写入上述非易失性存储系统,并且所有节点都能访问到这些数据,适用于那些对数据一致性要求极高,且对训练时间要求相对宽松的场景,如训练过程中断点较少,可以容忍因同步导致延迟的训练任务,因大模型训练任务对时效性和计算卡利用5[0006]以上2种存储方案checkpoint数据保存于非易失性存储中,如硬盘驱动器(HardDiskDrive,HDD)或固态硬盘(SolidStateDrive,SSD随着模型参数的不断增长,检查点数据传输至本节点磁盘中,传输完成后将本节点磁盘备份完成标志位FIN_D置为6是份节点组合Bk_Group内存中的检查点数据节点或Bk_Group内各节点内存中保存7[0019]图2是本发明实施例的基于分布式内存管理的大模型训练故障恢复方法的数据备[0020]图3是基于本发明实施例的方法的计算集群进行分布式内存存储checkpoint数据[0021]图4是本发明实施例的基于分布式内存管理的大模型训练故障恢复方法的故障恢[0022]图5是本发明另一实施例的基于分布式内存管理的大模型训练故障恢复装置的结技术人员通常理解的含义相同。本文中所使用的术语只是为了描述本发明实施例的目的,行训练可能会超出内存或显存的承载能力。使用batch可以有效地管理和利用有限的计算8以便在需要时恢复训练或用于模型评估和推理。如图1所示,为本领域一种常见的储的格式包括但不限于PyTorch的.pt格式、TensorFlow的.ckpt格式等。本实施例9w1=25%w3=20%4=10%5=10%6=15%点网络地址和checkpoint数据所点计算卡产生的checkpoint数据,第二行是其他节点传到本节点内存的checkpoint数据。比如节点A有4张计算卡产生的checkpoint数据会分成A_1~A_4这4块在本节点host内存保份节点组合Bk_Group内存中的checkpoint数据[0049]S6_3:若备份节点Bk或最优备份节点组合Bk__Group内某个节点内存中的Bk节点或Bk_Group内各节点内存中保存的checkp轮Bk节点或Bk_Group内各节点内存中保存的checkpoi保大模型训练任务可以持续可靠进行,避免故障导致训练长时间中断从而浪费GPU或其他发明还提供了一种基于分布式内存管理的大模型训练故障[0056]本发明一种基于分布式内存管理的大模型训练故障恢复装置的实施例可以应用[0057]上述装置中各个单元的功能和作用的实现过程具体详见上述方法中对应步骤的[0060]所述计算机可读存储介质可以是前述任一实施例所述的任意具备数据处理能力的设备的内部存储单元,例如硬盘或内存。所述计算机可读存储介质也可以是任意具备数据处理能力的设备的外部存储设备,例如所述设备上配备的插接式硬盘、智能存储卡述计算机可读存储介质用于存储所述计算机程序以及所述任意具

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论