CN118333167B 一种注意力机制计算方法、计算系统及存储介质 (上海交通大学)_第1页
CN118333167B 一种注意力机制计算方法、计算系统及存储介质 (上海交通大学)_第2页
CN118333167B 一种注意力机制计算方法、计算系统及存储介质 (上海交通大学)_第3页
CN118333167B 一种注意力机制计算方法、计算系统及存储介质 (上海交通大学)_第4页
CN118333167B 一种注意力机制计算方法、计算系统及存储介质 (上海交通大学)_第5页
已阅读5页,还剩11页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

该方法通过优化注意力计算的前向传播和反向23.根据权利要求1或2所述的一种注意力机;35.一种计算机可读存储介质,其特征在于令,计算机执行所述可执行指令时能够实现根据权利要求1_3中任一项所述的注意力机制4练和推理的耗时非常长,如何加速大语言模型的计算过程是关键。现有的大语言模型如Llama2,OPT,GPT的计算过程主要分为预填充(prefill)和解码(decode)两个阶段,在为19.5TFLOPS(每秒一万亿(=10^12)次的浮点运算),带宽为1935GB/s,计算访存比为如果将适用于计算访存比较低的GPU的优化技术应用于AMDGPU或其他厂商的计算访存比NVIDIAA100GPU上的利用率约为50但在AMDMI210GPU上的利用率只有30%。经过分56[0046]需要说明的是,以下实施例中所提供的图示仅以示意方式说明本发明的基本构了三种线性变换,将X从k1维度映射到k2维度,其中xeRK,WQ,WK,weRh均为映射7nk1+7nk2化,能够掩盖掉访存所带来的时间开销,减少计算访存比较小的GPU(例如部分AMDGPU芯(dP_YdY)将会导致dP重复调用,dQ=dS×K计算后立即进行dQ原子加这样的高同步开销操8

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论