CN117194056B 大语言模型推理优化方法、装置、计算机设备及存储介质 (苏州元脑智能科技有限公司)_第1页
CN117194056B 大语言模型推理优化方法、装置、计算机设备及存储介质 (苏州元脑智能科技有限公司)_第2页
CN117194056B 大语言模型推理优化方法、装置、计算机设备及存储介质 (苏州元脑智能科技有限公司)_第3页
CN117194056B 大语言模型推理优化方法、装置、计算机设备及存储介质 (苏州元脑智能科技有限公司)_第4页
CN117194056B 大语言模型推理优化方法、装置、计算机设备及存储介质 (苏州元脑智能科技有限公司)_第5页
已阅读5页,还剩38页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

US2002156763A1,2002.10.24元进行预填充,得到基本信息单元对应的矩阵2基于所述大语言模型,对所述基本信息单元进行预填充,得到所基于所述缓存结果,对至少一个所述基本信息单元进行推理解将所述第一目标向量逐个经过目标个数的自注意力神经网络模响应于检测到所述第一数据值小于所述第一基于自注意力机制,构建初始大语言模型,所述大语言模型包括至少基于分词器,将所述用户输入请求转化为所述基本信息单元,并确3基于目标自注意力神经网络模块对所述第一目标向将所述第三输出结果逐个经过目标个数的自注意力神经网络模块,得到第四输出结基于注意力头的个数a,确定每个注意力头所需处理的当前位置以及历史位置对应的基于所述第二向量维度,利用第一预设函数对当前位置以及历K表示单个基本信息单元的向利用第四预设函数计算所述第二时间值,所述第四预设函数包括:苴4响应于检测到存储设备的存储空间小于第一预设值时,去除每条序列中A个基本信息将所述第五输出结果映射为预设词表中每个基本信息单元的概率11.一种应用于如权利要求1_10任一项所述大语言模型推理优化方法的大语言模型推动态缓存模块,用于根据动态矩阵值缓存机制,确定所被处理器执行时实现权利要求1至10中任一5算核心然后对于每个模型参数最多完成2*S次浮点运算后,完成当前token的解码过程,直至最后序列结束。个用户请求都会产生最长序列长度L个token,很多序列预先开辟的cache空间都有浪费掉际上模型加载模型参数的过程只有当前的token在做计算,而当KVcache很大时,加载6本信息单元对应的矩阵值包括:基于输入层,将s个所述基本信息单元转化为第一嵌入向[0011]可选的,所述将所述第一目标向量逐个经过目标个数的自注置以及历史位置对应的第一目标向量进行处理,所述第一预设函数包括:K表示单个基本信息单元7U表示理论峰值。[0016]可选的,所述第二时间值为单个基本信息单元由存储器×T289规范化)和一个跳跃连接(residualconnectionLLM推理的计算过程主要就是多次重复block中的子单元操作,为方便表述,transformerblock层组成的一些参数表示做如下说码可以确保当前token(基本信息单元)只关注历史数据;解码是指一条序列生成当前的score与V加权的计算量也与当前序列长度s相关为2*l*s*h,线性映射的计算量为2*l*h2+4*l*s*h,总的LLM计算量为l*(24*l*h2+4*l*s*htransformer模型总的参数量约为l*[0039]上述LLM推理的解码过程,在进行计算量评估时做了一个非常重要的假设就是KVtoken的cache方法,用存储换取计算,当序列长度较长、并发数量相对较大时使用器104可以用独立的服务器或者是多个服务器组成的服力神经网络模块,所述自注意力神经网络模块至少包括多头注意力模型和前馈神经网络,文本信息即一系列token的初始嵌入向量,encoder结构包含多层transformerblock(自注意力神经网络层每一个transformerblock包含一个多头注意力(MHA)和前馈神经网络入的嵌入向量和初始token,逐个生成下一个token,Decoder结构包含多层[0047]当前的LLM以transformerdecoder结构为主体,在transformerblock中去掉其中多层transformerblock使用语言模型的建模目标,训练得到一个transformer结构的LLM,本信息单元的向量维度,即一个token的向量维度,第一向量维度指的是由多个token组成语言模型基本参数,可以将所述第二嵌入向量转化为第一目标向量,所述第一目标向量至目标自注意力神经网络模块对所述第一目标向量进行处理,其中,此处的目标自注意力神当前位置以及历史位置对应的第一目标向量的第二向量维度为h/a,即每一个attention在处理token对应的向量时,会处理当前位置token和历史位置token的(h/a)维度的第一目标向量;基于所述第二向量维度,利用第一预设函数对当前位置以及历史位置对应的第K表示单个基本信息单元的向softmax时,会对QKT的结果进行mask(掩码防止当前位置的token能够看到未来位置的的粒度从之前的整条序列变为每个token,即每个token所占用的空间作为一个开辟单位,基于所述第一时间值和第二时间值,确定是否对所述基本信息单元对应的矩阵值进行缓[0065]具体的,基于预填充获得的token的KV值,将当前位置token变为嵌入向量(embedding即第三嵌入向量,并再添加位置编码后送入到trasformerblock,在重要准则就是计算换取存储,当内存不足以支撑推理做KVcache时,直接把token产生的而是可以与其它步骤或者其它步骤的子步骤或者阶段的至少一部分轮流或意力头的个数a,确定每个注意力头所需处理的当前位置以及历史位置对应的第一目标向K表示单个基本信息单元的向量softmax表示归一性映射,所述第二预设函数包括:MultiHead(Q,k,v)=concat(head1.…heada)xw",其包括:利用第三预设函数计算所述第一时间值,所述第三预设函数包括其于检测到存储设备的存储空间小于第一预设值时,去除每条序列中A个基本信息单元对应码信息后的第三嵌入向量逐个经过目标个数的自注意力神经网络模块,得到第五输出结[0085]关于大语言模型推理优化装置的具体限定可以参见上文中对于大语言模型推理数a,确定每个注意力头所需处理的当前位置以及历史位置对应的第一目标向量的第二向K表示单个基本信息单元结果。设备的存储空间小于第一预设值时,去除每条序列中A个基本信息单元对应的矩阵值,其个数a,确定每个注意力头所需处理的当前位置以及历史位置对应的第一目标向量的第二,其中,dK表示单个基本信息单元softmax表述第二预设函数包括:MultiHead(Q,k,v)=concat(heak,v)表示一次线性映射输出值,concat(.)表示拼接函数,输出结果。为单个基本信息单元由存储器加载到计算核心的时间,所述第二时间值的获取方法包括:通过计算机程序来指令相关的硬件来完成,所述的计算机程序可存储于

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论