CN119443279A 一种基于混合专家模型的文本数据推理方法及装置 (中山大学)_第1页
CN119443279A 一种基于混合专家模型的文本数据推理方法及装置 (中山大学)_第2页
CN119443279A 一种基于混合专家模型的文本数据推理方法及装置 (中山大学)_第3页
CN119443279A 一种基于混合专家模型的文本数据推理方法及装置 (中山大学)_第4页
CN119443279A 一种基于混合专家模型的文本数据推理方法及装置 (中山大学)_第5页
已阅读5页,还剩34页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于混合专家模型的文本数据推理方本发明公开了一种基于混合专家模型的文合专家模型的推理过程导致推理效率低的技术异构内存空间中将预运行文本数据集输入至预预取热门专家数量、混合专家模块计算传输时2在所述多级异构内存空间中将所述预运行文本数据集输入至预置混合专家模型进行基于所述专家相关性表和预置预取热门专家数量,对所述预置混采用预置约束感知策划不等式根据所述预置预取热门专家数量在所述多级异构内存空间中,采用各所述目标混合专家模基于所述专家相关性表,确定预运行文本数据集中多个预运行文对各所述预运行文本数据对于各所述混合专家模块中的各个专家的专家选择频率进在各所述混合专家模块中的各所述专家中,选取前预置预将各所述热门专家对应的混合专家模块作为目标混将输入至所述目标混合专家模块的输入文本数据子集中的多个输入文本单元数据通过门控层进行权重计算,确定各个非热门专家对于各所述输入文本单元数据对应的权重对各所述非热门专家对于任一输入文本单元数据对应的权重值进行降对各所述输入文本单元数据对应的非热门激活专家进行统计,确定各对定各所述非热门激活专家对应的被激活频率进行降序排序,生采用预置预取热门专家数量的热门专家分别对所述输入文本数据子所述预置预取热门专家数量的热门专家对应的热门专家计将所述输入文本数据子集依次作为所述非热门激活专家数据处理排序结果对应的非对所述热门专家计算结果和各所述非热门激活专家计算结果进行通过注意力层采用预置注意力机制对所述合并专家计算结果进行计算3;预运行推理模块,用于在所述多级异构内存空间中将所述预识别模块,用于基于所述专家相关性表和预置预取热门专家数量确定批次数量模块,用于采用预置约束感知策划不等式根输出结果模块,用于在所述多级异构内存空间中,采用各所述目标4执行时实现如权利要求1_6任一项所述的基于混合专家模型的算机执行时,使所述计算机执行如权利要求1_6任一项所述的基于混合专家模型的文本数5不增加训练和推理成本的情况下进行模型的规模缩放,最近的工作引入了稀疏激活的混合[0004]现有的基于混合专家模型的推理过程大多将传统的密集模型直接应用于MoE模[0008]在所述多级异构内存空间中将所述预运行文本数据集输入至预置混合专家模型[0014]对各所述预运行文本数据对于各所述混合专家模块中的各个专家的专家选择频6[0018]将输入至所述目标混合专家模块的输入文本数据子集中的多个输入文本单元数选取前预置数量的权重值对应的非热门专家作为非热门[0022]采用预置预取热门专家数量的热门专家分别对所述输入输出所述预置预取热门专家数量的热门专家对应的热门专家[0023]将所述输入文本数据子集依次作为所述非热门激活专家数据处理排序结果对应;7[0030]其中,n为输入文本批次数量,n取满足预置约束感知策划不等式的最小整数;为注意力层计算时间;为门控层传输时间;lc为门控层计算时间;loe为计算机程序被执行时实现如上述任一项所述的基于混合专家模型的文本数据推理方法的8[0043]图1为本发明实施例一提供的一种基于混合专家模型的文本数据推理方法的步骤[0047]图5为本发明实施例二提供的基于混合专家模型的文本数据推理方法的流程示意[0049]图7为本发明实施例三提供的一种基于混合专家模型的文本数据推理装置的结构决现有的基于混合专家模型的推理过程导致推[0053]混合专家模型(Mixture_of_Experts,MoE混合专家模型使用MoE层替换9高的优先级占据CPU内存。因为MoE层面临的挑战在于每次请求的专家是由门控函数决定需要将所需的专家张量快速地传输到显存中。考虑到传输速率较快的CPU内存能够提供更[0064]值得一提的是,在CPU内存充足的情况下,本发明使用pin_memory以实现更快的CPUGPU传输。当CPU内存并不充足以至于需要使用硬盘时,为了减少GPU对硬盘资源的访[0065]步骤102、在多级异构内存空间中将预运行文本数据集输入至预置混合专家模型预运行过程中使用预置混合专家模型进行推理前,本发明基于该模型的不同层的shape、[0072]步骤S32、对各预运行文本数据对于各混合专家模块中的各个专家的专家选择频个token在当前层的专家选择倾向(专家选择频率然后聚合多batch中所有token的倾目标混合专家模块中的专家层包括一个热门专家和;[0083]其中,n为输入文本批次数量,n取满足预置约束感知策划不等式的最小整数;为注意力层计算时间;为门控层传输时间;lc为门控层计算时间;loe为权重共享。[0092]步骤S01、将输入至目标混合专家模块的输入文本数据子集中的多个输入文本单[0093]步骤S02、对各非热门专家对于任一输入文本单元数据对应的权重值进行降序排[0096]步骤S05、采用预置预取热门专家数量的热门专家分别对输入文本数据子集进行[0097]步骤S06、将输入文本数据子集依次作为非热门激活专家数据处理排序结果对应家实现了专家间的重叠(即层内重叠在热门专家完成计算后,得到热门专家结果,接着,按照非热门激活专家数据处理排序结果,即非热门激活专家按照该结果中处理输入数本数据的计算后,得到每个非热门专家对于各输入文本单元数据对应的权重值,对各非热门专家对于任一输入文本单元数据对应的权重值进行降序排序,并选取前两个的权重值对应的非热门专家作为非热门激活专家(非热门激活专家A、非热门激活专家B并作相应的门激活专家B的非热门激活专家数据处理排序结果为:非热门激活专家B_非热门激活专家A[0103]值得一提的是,假设预置混合专家模型的层数为24,即该模型包含有24个MoE发展,大模型在各个领域取得了显著的成果。为了在不增加训练和推理成本的情况下进行模型的规模缩放,最近的工作引入了稀疏激活的混合专家模型,即Mixture_of_Experts已经通过大量的实验证明了MoE结构的优越性,但MoE模型在推理阶段面临着比其他大模型况下尤为严重。速度普遍快于传输速度的物理条件限制,现有技术难以实现计算与通信之间的完全重叠,图6中:Transformer块结构和MoE块结构,基于Transformer的大模型和基于MoE的大模型[0112]在本发明实施例中,本发明提供了一种基于混合专家模着,在多级异构内存空间中将预运行文本数据集输入至预置混合专家模型进行预运行推存空间中,采用各目标混合专家模块根据输入文本批次数量对应的待推理文本数据子集,[0119]预运行推理模块702,用于在多级异构内存空间中将预运行文本数据集输入至预[0121]确定批次数量模块704,用于采用预置约束感知策划不等式根据预置预取热门专[0125]对各预运行文本数据对于各混合专家模块中的各个专家的专家选择频率进行降[0129]将输入至目标混合专家模块的输入文本数据子集中的多个输入文本单元数据通预置预取热门专家数量的热门专家对应的热门专家[0134]将输入文本数据子集依次作为非热门激活专家数据处理排序结果对应的非热门;[0141]其中,n为输入文本批次数量,n取满足预置约束感知策划不等式的最小整数;为注意力层计算时间;为门控层传输时间;lc为门控层计算时间;loe为计算机程序/指令被处理器执行时实现如上述实施例一的基于混合专家模型的文本数据推[0145]本发明实施例还提供了一种计算机程序产

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论