CN118313458B 数据处理方法、数据处理器、电子设备、存储介质 (上海壁仞科技股份有限公司)_第1页
CN118313458B 数据处理方法、数据处理器、电子设备、存储介质 (上海壁仞科技股份有限公司)_第2页
CN118313458B 数据处理方法、数据处理器、电子设备、存储介质 (上海壁仞科技股份有限公司)_第3页
CN118313458B 数据处理方法、数据处理器、电子设备、存储介质 (上海壁仞科技股份有限公司)_第4页
CN118313458B 数据处理方法、数据处理器、电子设备、存储介质 (上海壁仞科技股份有限公司)_第5页
已阅读5页,还剩38页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

务对应的推理模型和用于推理任务的至少一个执行组接收不同的输入数据以利用推理模型执法提供了一种兼顾吞吐量和延迟的模型推理并执行组包括多个硬件计算单元,相比于使用1个硬件计算单元执行完整的模型推理可以兼顾模2获取推理任务对应的推理模型和用于所述推理任务的多个输入其中,所述推理模型包括至少一个计算图,所述至少一每个执行组包括的所述多个硬件计算单元配置为共同执行对输入所述执行组的输入根据所述执行组包括的硬件计算单元的数量P,将所述一个输入数据分成Q份子数据,将所述Q份子数据分别输入所述执行组包括的P个硬件计算单元中的Q个硬件计算单所述Q个硬件计算单元分别输出的Q个推理中根据所述执行组包括的硬件计算单元的数量P,将所述一个输入数据分成P份中间数36.根据权利要求5所述的数据处理方法,其中,利用多个执行组并行执行所述推理任为所述多个执行组分别创建对应的执行流,的多个算子分别对应的核函数按照所述多个算子之间的数据依赖关系以及执行顺序排列所述多个执行组的数量与对单个输入数据进行所述推理操作的最大延迟要所述执行模块包括M个硬件计算单元,所述M个硬件计算单元分成多所述获取模块配置为获取推理任务对应的推理模型和用于所述推理任务的多个输入所述执行模块配置为利用所述多个执行组并行执行所述推所述推理模型包括至少一个计算图,所述至少一个计算图表征所述推所述执行组配置为运行所述执行组对应的执行流,以计算图为单位其中,每个执行组对应的执行流为由所述推理模型包括4每个执行组包括的多个硬件计算单元配置为共同执行对输入所述执行组的输入数据其中,所述计算机可执行指令被所述处理器运行时实现根据权利要求1_9任一项所述所述计算机可执行指令被处理器执行时实现根据权利要求1_9任一项所述的数据处理5中的Q个硬件计算单元,以按照所述至少一个计算图之间的执行顺序关系顺序处理所述至6述推理模型包括的多个算子分别对应的核函数按照所述多个算子之间的数据依赖关系以所述多个执行组的数量与对单个输入数据进行所述推理操作的最大延迟要所需要的硬件计算单元的最小数量,以及根据所述最小数量确定所述多个执行组的数量,述获取模块配置为获取所述推理任务对应的推理模型和用于所述推理任务的至少一个输多个算子对应的核函数按照所述多个算子之间的数据依赖关系以及执行顺序排列而成的7所述处理器运行时实现根据本公开任一实施例所述的数8技术人员在无需创造性劳动的前提下所获得的所有其他实施例,都属于本公开保护的范类似的词语意指出现该词前面的元件或者物件涵盖出现在该词后面列举的元件或者物件系也可能相应地改变。为了保持本公开实施例的以下说明清楚且简明,本公开省略了部分已知功能和已知部件的详细说明。元的数量。硬件计算单元可以指通用图形处理器(General_purposecomputingongraphicsprocessingunits,GPGPU)中的流式处理器簇(StreamProcessorCluster,硬件计算单元对1个输入数据进行完整的推理操作,不同硬件计算单元处理不同的输入数9[0047]本公开至少一实施例提供的数据处理方法提供了一种兼顾吞吐量和延迟的模型[0049]图1为本公开至少一实施例提供的一种数据处理方法的示意性流程图。如图1所线程块分发模块(图1中未示出)将多个线程块中的多个线程束可以同时执行或分时执行。每个线程束中的多个线程会执行相同的指令。内存执行指令会被发射到计算单元中的共享缓存或进一步发射到中间级缓存或全局缓存[0058]例如,推理任务可以是指利用已经训练好的模型对新数据进行预测或分类的过入数据可以属于同一批输入数据(一次性输入到模型中进行处理的数据样本)或者不同批[0065]例如,多个执行组通过对执行推理任务的数据处理器包括的M个硬件计算单元进[0067]例如,多个执行组的数量与对单个输入数据进行推理操作的最大延迟要求相[0068]例如,在对M个硬件计算单元进行分组时,确定在对单个输入数据进行推理操作[0069]由于使用越多的硬件计算单元同时对一个输入数据进行推理操作所花费的延迟以根据推理任务1需要的最大延迟要求规定每个执行组包括两个硬件计算单元,在执行推理任务2时可以根据推理任务2需要的最大延迟要求规定每个执行组包括4个硬件计算单每个执行流为由推理模型包括的多个算子分别对应的核函数按照多个算子之间的数据依少一个计算图表征推理模型包括的多个算子之间的数据依赖关系以及要等计算图1中的算子C和计算图2中的算子E的输出结果准备完成后,才可开始执行计算,计算单元配置为处理当前执行的计算图中的一部个硬件计算单元,以按照至少一个计算图之间的执行顺序关系顺序处理至少一个计算图,应于每份中间数据的尺寸大于等于单个硬件计算单元的最小执行尺寸要求,确定P份中间据最小执行尺寸要求将输入数据分成Q份子数据,每份子数据的尺寸为该最小执行尺寸要[0104]本公开至少一实施例提供的兼顾延迟和吞吐量的模型推理策略可适用于不同批[0105]本公开至少一实施例提供的数据处理方法可以根据具体场景灵活配置执行组的输入数据5和输入数据6可以输入3个执行组并利用各个执行组内的硬件计算单元并行进行据8和输入数据9可以输入3个执行组并利用各个执行组内的硬件计算单元并行进行推理操[0117]本公开至少一实施例还提供一种数据处理器,图5为本公开至少一实施例提供的[0121]例如,多个执行组的组数与对单个输入数据进行推理操作的最大延迟要求相关于确定执行组的数量以及硬件计算单元的分组策略可以参考前述数据处理方法中的相[0123]获取模块101配置为获取推理任务对应的推理模型和用于推理任务的至少一个输[0124]关于推理模型和输入数据的相关描述可以参考前述数据处理方法中步骤S10的相包括的多个算子分别对应的核函数按照多个算子之间的数据依赖关系以及执行顺序排列多个硬件计算单元配置为共同执行对输入该[0136]关于执行组对输入执行组的输入数据进行推理操作的具体内容可以参考前述数它形式的处理单元以及相应计算机指令来实现这用于实现图1所示的步骤S20。从而关于获取模块101能够实现的功能的具体说明可以参考具体说明可以参考上述数据处理方法的实施例中的步骤S20的相关描述,重复之处不再赘[0143]本公开至少一实施例提供的数据处理器可以根据具体场景灵活配置执行组的数算子并行策略既可以兼顾延迟又可以兼顾吞吐量。数据处理器100可以实现与前述数据处[0146]如图6所示,电子设备200可以包括处理装置(例如中央处理器、图形处理器等)[0147]例如,计算机可读指令被处理装置201运行时可以执行根据上述任一实施例所述性存储器例如可以包括随机存取存储器(RAM)203和/或高速缓冲存储器(cache)等,例如,计算机可读指令可以从存储装置208加载到随机存取存储器(RAM)203中以运行计算机可读[0151]图7为本公开至少一实施例提供的一种非瞬时性计算机可读存储介质的示意图。[0156]此外,虽然本公开对根据本公开的实施例的系统中的某然而,任何数量的不同单元可以被使用并运行在

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论