CN119443311A 基于弹性联邦低秩适配微调的大语言模型训练方法及系统 (武汉大学)_第1页
CN119443311A 基于弹性联邦低秩适配微调的大语言模型训练方法及系统 (武汉大学)_第2页
CN119443311A 基于弹性联邦低秩适配微调的大语言模型训练方法及系统 (武汉大学)_第3页
CN119443311A 基于弹性联邦低秩适配微调的大语言模型训练方法及系统 (武汉大学)_第4页
CN119443311A 基于弹性联邦低秩适配微调的大语言模型训练方法及系统 (武汉大学)_第5页
已阅读5页,还剩22页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于弹性联邦低秩适配微调的大语言模型本发明公开了一种基于弹性联邦低秩适配异值分解(SVD)的联邦聚合,将客户端本地LoRA消除传统FedLoRA的聚合误差。本发明为每个权的平衡。为进一步减少通信开销并保持模型精2在第t轮训练开始时,参数服务器随机选择一部分客户端steN并将全局模型参数分发给这些客户端;其中,客户端集合N={ili=1,2,3,…,N],分别是对wt进行低秩分解后的结果;参数服务器接收所有客户端的低秩适配增量矩阵,通过基于奇异值分解的聚合算法,解awt+1=usvr并根据奇异值的重要性分配适当的秩,生成新的全局低秩适配矩阵行与前r列;参数服务器评估每个全局权重增量矩阵的训练稳定性,根据冻结阈值δ决定是否冻结2.根据权利要求1所述的基于弹性联邦低秩适配微调的大语言模型训练方法,其特征基于其本地低秩适配矩阵模块计算出对应的本地低秩适配增量矩阵AWX:参3.根据权利要求1所述的基于弹性联邦低秩适配微调的大语言模型训练方法,其特征34.一种基于弹性联邦低秩适配微调的大语言模型训练系用于在第t轮训练开始时,参数服务器随机选择一部分客户端steN并将全局模型参对wt进行低秩分解后的结果;本地更新的低秩适配增量矩阵Awf=[Bf,A⃞,并将其发送回参数服务器;法,将各客户端的低秩适配增量矩阵加权聚合为全局权重增量矩阵通过奇异值分解分解并根据奇异值的重要性分配适当的秩,生成新的全局低秩适配矩阵行与前r列;参数服务器评估每个全局权重增量矩阵的训练稳定性,根据冻结阈值δ决定是否冻结5.根据权利要求4所述的基于弹性联邦低秩适配微调的大语言模型训练系统,其特征矩阵进行加权平均,得到聚合后的全局权重增量矩阵并使用奇异值分中各个奇异值σ,找到最小的秩啦",使得前啦"个奇异值的平方和占总平方和的比例不小6.根据权利要求4所述的基于弹性联邦低秩适配微调的大语言模型训练系统,其特征更新评分来进行评估,其中M为历史轮数窗口大小,η为学习4重增量矩阵的类型;如果某个全局权重增量矩阵的更新评分Hf低存储装置,用于存储一个或多个程序,当所述一个或多个程序被8.一种基于弹性联邦低秩适配微调的大语言模型任一项所述的基于弹性联邦低秩适配微调的5[0001]本发明涉及计算机网络与人工智能领域,涉及一种大语具体涉及基于低秩适配(Low_RankAdaptation,LoRA)微调、跨客户端联邦学习(Cross_冻结(parameterfreezing)技术的在细粒度(如参数、向量)或粗粒度(Transformer层)上进行,没有充分考虑基于技术、奇异值分解(SingularValueDecomposition,SVD)、参数冻结(parameter[0006]在第t轮训练开始时,参数服务器随机选择一部分客户端s6本地更新的低秩适配增量矩阵Awf=[Bf,A$,并将其发送回法,将各客户端的低秩适配增量矩阵加权聚合为全局权重增量矩阵通过奇异值分解分解并根据奇异值的重要性分配适当的秩,生成新的全局行与前r列;[0012]参数服务器评估每个全局权重增量矩阵的训练稳定性,根据冻结阈值δ决定是否阵AWX:参数服务器对所有客户端本地的低秩适配增量矩阵进行加权平均,得到聚合后的秩啦",使得前啦"个奇异值的平方和占总平方和的比例不小于秩分配阈值θ;在确定秩[0017]用于在第t轮训练开始时,参数服务器随机选择一部分客户端stEN并将全局模分别是对wt进行低秩分解后的结果;7生成本地更新的低秩适配增量矩阵Awf=[Bf,A$,并将其发送回参数服务器;合算法,将各客户端的低秩适配增量矩阵加权聚合为全局权重增量矩阵通过奇异值分解分解并根据奇异值的重要性分配适当的秩,生成新的全局低秩适配的前r行与前r列;[0023]参数服务器评估每个全局权重增量矩阵的训练稳定性,根据冻结阈值δ决定是否WAfw计算出对应的本地低秩适配增量矩阵AWX:参数服务器对所有客户端本地的低秩适配增量矩阵进行加权平均,得到聚合后的全局低秩适配增量矩阵并使用奇8行所述的基于弹性联邦低秩适配微调的大语言模在联邦学习中结合奇异值分解(SVD)优化模型聚合与LoRA低秩适配,能够通过消除聚合误[0032](2)本发明的E2LoRA通过采用SVD优化的聚合过程,将客户端本地的LoRA增量矩[0043]客户端集合N={ili=1,2,3,…,N};9[0045]客户端的LoRA增量矩阵{Awfli=1,2,3,…,N}:flies:}:[0054]在第t轮训练开始时,参数服务器随机选择一部分客户端stEN并将全局模型参是对wt进行低秩分解后的结果;[0056]被选择的客户端接收全局模型参数后,利用本地数据进行E步随机梯度下降(SGD),生成本地更新的低秩适配(LoRA)增量矩阵并将其发送回参数服务解(SVD)的聚合算法,将各客户端的低秩适配(LoRA)增量矩阵加权聚合为全局权重增量矩阵Awt+1,通过奇异值分解(SVD)分解并根据奇异值的重要性分配适当的[0060]参数服务器评估每个全局权重增量矩阵的训练稳定性,根据冻结阈值δ决定是否后使用SVD对聚合后的增量矩阵进行分解并还原出LoRA模块B,A以作为下一轮次的可训练客户端i,服务器基于其本地LoRA模块计算出对应的本地权重断以及相乘还原出新的LoRA模块。结机制。首先,每个全局权重增量矩阵的训练稳定性通过计算其更新评分[0073]用于在第t轮训练开始时,参数服务器随机选择一部分客户端并将全局模分别是对wt进行低秩分解后的结果;[0075]用于被选择的客户端接收全局模型参数后,利用本地数据进行E步随机梯度下降(SGD),生成本地更新的低秩适配(LoRA)增量矩阵Awf=[Bf,A$,并将其发送回参数服务解(SVD)的聚合算法,将各客户端的低秩适配(LoRA)增量矩阵加权聚合为全局更新矩阵通过奇异值分解(SVD)分解并根据奇异值的重要性分配适当的秩,[0079]参数服务器评估每个全局权重增量矩阵的训练稳定性,根据冻结阈值δ决定是否[0080]本实施例还提供了一种基于弹性联邦低秩适配微调的大语言模型训练装置,包[0085]在实验环境设置上,本发明在配备256GB内存和六张NVIDIAGeForceRTX通过在NVIDIAJetsonAGXOrin和JetsonOrinNX上运行并采样得到的。本发明在每个[0086]在模型与数据集的选择上,本发明在20NEWS与AGNEWS这两个数据集上微调BERT_large与RoBERTa_large两个模型并进行文本分类任务,在SST_2数据集上微调DistilBERT[0088]在基

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论