CN119476451A 一种基于混合保留度的专家大模型训练方法 (浙江大学)_第1页
CN119476451A 一种基于混合保留度的专家大模型训练方法 (浙江大学)_第2页
CN119476451A 一种基于混合保留度的专家大模型训练方法 (浙江大学)_第3页
CN119476451A 一种基于混合保留度的专家大模型训练方法 (浙江大学)_第4页
CN119476451A 一种基于混合保留度的专家大模型训练方法 (浙江大学)_第5页
已阅读5页,还剩14页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于混合保留度的专家大模型训练方法本发明公开了一种基于混合保留度的专家M个专家组成,其中每个专家均具有预先设定的由的随机性;并通过设置策略来设置M个专家的2选择专家,通过高斯噪声向量增加路由的随机性;并通过设置策略来设置M个专家的参数;;。3;;;要求1_5任一项所述的基于混合保留度的执行时实现如权利要求1_5任一项所述的基于混合保留度的专4[0004]针对问题1本发明引入了一种高效的取幂操作来作为专家,将专家参数量降到(2)对专家大模型中的混合保留度层进行设置;所述混合保留度层由M个专家组5;;。;[0011]为实现上述目的,本发明还提供了一种基于混合保留度6[0017]在本发明使用的术语是仅仅出于描述特定实施例的目的,而非旨在限制本发含一个或多个相关联的列出项目的任何或所一种混合专家大模型(Mixture_of_Expert旨在通过最少的参数量代价来适配基础大模构为例,来说明MoP模型的技术原理。需要说明的是,它也同样适用于卷积神经网络7(ConvolutionalNeuralNetwZ;=sign(X)IXI不同的专家:R(x)=softmax(x8w,+e)[0028]M个专家的参数值由领域专家来设置,如下,给出本发明提供的若干种设置策略8负载均衡损失Load两个损失函数进行训练。路由到第i个专家的概率,M为专家的个数,ei表示第i个专家,Fi表示分配给第i个专家的[0041]本发明基于混合保留度的专家大模型训练装置的实施例可以应用在任意具备数据处理能力的设备上,该任意具备数据处理能力的设备可以为诸如计算机等设备或装置。将非易失性存储器中对应的计算机程序指令读取到内存中运行形成的。从硬件层面而言,如图2所示,为本发明基于混合保留度的专家大模型训练装置所在任意具备数据处理能力9[0042]上述装置中各个单元的功能和作用的实现过程具体详见上述方法中对应步骤的的专家大模型训练方法所在任意具备数据处理能力的设备的一种硬件结构图,除了图3所[0046]所述计算机可读存储介质可以是前述任一实施例所述的任意具备数据处理能力质用于存储所述计算机程序以及所述任意具备数据处理能力的设备所需的其他程序和数

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论