CN115509749B 任务执行方法和装置、存储介质和电子设备 (苏州浪潮智能科技有限公司)_第1页
CN115509749B 任务执行方法和装置、存储介质和电子设备 (苏州浪潮智能科技有限公司)_第2页
CN115509749B 任务执行方法和装置、存储介质和电子设备 (苏州浪潮智能科技有限公司)_第3页
CN115509749B 任务执行方法和装置、存储介质和电子设备 (苏州浪潮智能科技有限公司)_第4页
CN115509749B 任务执行方法和装置、存储介质和电子设备 (苏州浪潮智能科技有限公司)_第5页
已阅读5页,还剩31页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本申请实施例提供了一种任务执行方法和用一组线程,一组线程中的每个线程需要使用N其中,GPU服务器集群中的M个GPU服务器中的不同GPU服务器上具有相同网卡名称的网卡接入一分线程分配到的N个GPU资源是多个GPU服务器上相同网卡名称的网卡对应的GPU资源;通过一组线程以及为一组线程中的每个线程分配的允许2在GPU服务器集群中的各个GPU服务器上的GPU资源中,为所述一组线程中的每个线程同GPU服务器上具有相同网卡名称的网卡接入所述一组交换机中的同一交换机,所述一组的至少部分线程分配到的N个GPU资源是多个GPU服务器上相同网卡名称的网卡对应的GPU通过所述一组线程以及为所述一组线程中的每个线程分配的允许使用的N个GPU资源,在所述M个GPU服务器中确定Y组GPU资源,其中,Y为正整数,所述在所述一组线程包括P个线程的情况下,在所述Y组GPU资源中在所述Y组GPU资源中查找到允许分配给所述P个线程使用的P组GPU资源的情况下,将在所述Y组GPU资源中的GPU资源的数量大于或等于目标数量的情况下,将所述Y组GPU在所述Y组GPU资源中选择所述P组GPU资源,其中,所述P组GPU资源5.根据权利要求2所述的方法,其特征在于,将查找确定每个相同网卡名称分别对应的Y组GPU资源中允许分配给所述P个线程使用的P组根据所述每个相同网卡名称分别对应的P组GPU资源确定每个相同网卡名称分别对应3确定所述目标集中度对应的目标网卡名称,以及将所述目标网卡名称对应的6.根据权利要求5所述的方法,其特征在于,根据所述确定步骤:确定所述M个GPU服务器中的每个GPU服务器中所有的GPU资源的第一数量;确定在将任一相同网卡名称对应的P组GPU资源分配给所述P个线程的情况下,所述M个GPU括:为其他线程分配允许使用的GPU资源的数量和允许分配给所述P个线程使用的GPU资源的数量;根据所述第一数量和所述第二数量确定所述任一相同网卡名称对应的GPU服务器循环执行所述确定步骤,直至确定所述每个相同网卡名称分别对应的GPU服务器集群确定所述第二数量和所述第一数量的商值的平方,并将所述将所述每个GPU服务器的集中度相加,以确定所述任一相同网卡名称在所述Y组GPU资源中未查找到允许分配给所述P个线程使用的P组GPU资源的情况下,在所述一组线程包括P个线程的情况下,在所述X组GPU资源中在所述X组GPU资源中查找到允许分配给所述P个线程使用的P组GPU资源的情况下,将每个线程被分配到所述P组GPU资源中对应的一组G服务器中的不同GPU服务器上具有相同网卡名称的网卡接入所述一组交换机中的同一交换4述一组线程中的至少部分线程分配到的N个GPU资源是多个GPU服务器上相同网卡名称的网执行模块,用于通过所述一组线程以及为所述一组线程中的每个线程5[0003]在图1所示的集群网络环境下,每个GPU服务器都会分别与leaf1和leaf2有连接,同一个leaf的高性能网卡进行通信,也可能会使用属于不同leaf的高性能网卡进行通信。述M个GPU服务器中的不同GPU服务器上具有相同网卡名称的网卡接入所述一组交换机中的整数,所述一组线程中的至少部分线程分配到的N个GPU资源是多个GPU服务器上相同网卡名称的网卡对应的GPU资源;通过所述一组线程以及为所述一组线程中的每个线程分配的[0007]在一个示例性实施例中,所述在GPU服务器集群中的各个GPU服务器上的GPU资源6线程的情况下,在所述Y组GPU资源中查找允许分配给所述P个线程使用的P组GPU资源,其[0008]在一个示例性实施例中,在所述Y组GPU资源中查找允许分配给所述P个线程使用的P组GPU资源,包括:在所述Y组GPU资源中的GPU资源的数量大于或等于目标数量的情况下,将所述Y组GPU资源中的所述目标数量的GPU资源确定为查找到的所述P组GPU资源,其[0009]在一个示例性实施例中,所述将所述Y组GPU资源中的所述目标数量的GPU资源确确定每个相同网卡名称分别对应的Y组GPU资源中允许分配给所述P个线程使用的P组GPU资GPU资源的数量和允许分配给所述P个线程使用的GPU资源的数量;根据所述第一数量和所述第二数量确定所述任一相同网卡名称对应的GPU服务器集群的集中度;循环执行所述确[0013]在一个示例性实施例中,在所述Y组GPU资源中查找允许分配给所述P个线程使用所述X组GPU资源包括X个GPU服务器中的每个GPU服务器上与不同网卡名称的网卡对应的一所述P组GPU资源中的每组GPU资源包括N个GPU资源;在所述X组GPU资源中查找到允许分配7给所述P个线程使用的P组GPU资源的情况下,将所述X组GPU资源中查找到的所述P组GPU资述一组交换机中的不同交换机、所述M个GPU服务器中的不同GPU服务器上具有相同网卡名称的网卡接入所述一组交换机中的同一交换机,所述一组网卡中的每个网卡与所在的GPU服务器上的一组GPU资源对应,M为正整数,所述一组线程中的至少部分线程分配到的N个[0017]通过本申请,由于确定目标任务申请使用的一组线程中的每个线程需要使用N个服务器上相同网卡名称的网卡对应的GPU资源;以及通过所述一组线程以及为所述一组线8[0028]本申请实施例可以运行于图2所示的网络架构上,如图2所示,该网络架构包括:交换机302……leaf交换机N连接,所述每个GPU服务器上设置有一组网卡(网卡1、网卡[0029]在本实施例中提供了一种运行于网络架构的方法,图3是根据本申请实施例的任服务器中的不同GPU服务器上具有相同网卡名称的网卡接入所述一组交换机中的同一交换述一组线程中的至少部分线程分配到的N个GPU资源是多个GPU服务器上相同网卡名称的网[0035]通过上述步骤,由于确定目标任务申请使用的一组线程中的每个线程需要使用N个图形处理器GPU资源,并为所述一组线程中的至少部分线程分配到的N个GPU资源是多个9配允许使用的GPU资源的第三数量;根据所述第三数量在第一GPU服务器集群中确定所述资源包括N个GPU资源;在所述Y组GPU资源中查找到允许分配给所述P个线程使用的P组GPU个线程被分配到所述P组GPU资源中对应的一组G确定可以根据所述Y组GPU资源为所述一组线程中的所有线程分配允许使用的N个GPU资源服务器上网卡名称为网卡1的网卡对应的GPU资源;在GPU服务器1网卡名称为网卡1的网卡器3网卡名称为网卡1的网卡对应的GPU资源为4个、GPU服务器4网卡名称为网卡1的网卡对应的GPU资源为3个的情况下,确定P组GPU资源为GPU服务器1网卡名称为网卡1的网卡对应于每个线程分配N个GPU资源为同一网卡名称的网卡对应的GPU资源,以及同一网卡名称的[0041]在一个示例性实施例中,在所述Y组GPU资源中查找允许分配给所述P个线程使用的P组GPU资源,包括:在所述Y组GPU资源中的GPU资源的数量大于或等于目标数量的情况下,将所述Y组GPU资源中的所述目标数量的GPU资源确定为查找到的所述P组GPU资源,其述Y组GPU资源中未查找到允许分配给所述P个线程使用的P组G述数值仅是为了更好的理解本发明实施例,本发明实施例对上述Y组GPU资源中的GPU资源的数量以及P个线程使用的GPU资源的数[0045]在一个示例性实施例中,所述将所述Y组GPU资源中的所述目标数量的GPU资源确为网卡1的网卡对应的GPU资源为2个、GPU服务器2网卡名称为网卡1的网卡对应的GPU资源确定每个相同网卡名称分别对应的Y组GPU资源中允许分配给所述P个线程使用的P组GPU资[0049]具体的,通过以下方式确定每个相同网卡名称分别对应的GPU服务器集群的集中定在将任一相同网卡名称对应的P组GPU资源分配给所述P个线程的情况下,所述M个GPU服务器中的每个GPU服务器中已分配的GPU资源的第二数量,其中,所述已分配的GPU资源包括:为其他线程分配允许使用的GPU资源的数量和允许分配给所述P个线程使用的GPU资源的数量;根据所述第一数量和所述第二数量确定所述任一相同网卡名称对应的GPU服务器及确定在将每个相同网卡名称分别对应的Y组GPU资源分配给P个线程时使用的P组GPU资[0052]具体的,通过以下方式确定所述任一相同网卡名称对应的GPU服务器集群的集中[0054]在一个示例性实施例中,在所述Y组GPU资源中查找允许分配给所述P个线程使用GPU资源包括X个GPU服务器中的每个GPU服务器上与不同网卡名称的网卡对应的一组GPU资GPU资源中的每组GPU资源包括N个GPU资源;在所述X组GPU资源中查找到允许分配给所述Pworker分配的GPU服务器和GPU资大GPU集中度对应的目标高性能网卡名称,使用目标高性能网卡名称的GPU服务器和GPU资[0068]图4是根据本申请可选实施例的任务执行方法的流程图,上述步骤S4和S5的具体[0074]步骤S405:当选择任一高性能网卡名称时,确定需要使用的GPU服务器列表及其[0075]以某个高性能网卡名称ibk为例,确定需要使用的GPU服务器列表及其GPU资源的器列表信息nodeIbListgpu,即将高性能网卡ibk所属空闲GPU资源数量小的GPU服务器放在GPU服务器的GPU资源分配给该woker,为每个worker分配GPU资源,如图5所示,其中nodeIbListgpu[i]表示第i个GPU服务器该ibk卡所属的空闲GPU资源数量,allocTaskNum表源的数量,基于bestfit算法进行资源分配,如图6所示,其中sortNodeListByFreeGpu(nodeList)表示对GPU服务器列表按照GPU服务器空闲GPU进行升序占)的GPU资源的数量(相当于上述实施例中的第二数量),gpuNumi表示第i个节点的GPU资个GPU服务器中的不同GPU服务器上具有相同网卡名称的网卡接入所述一组交换机中的同数,所述一组线程中的至少部分线程分配到的N个GPU资源是多个GPU服务器上相同网卡名[0090]通过上述装置,由于确定目标任务申请使用的一组线程中的每个线程需要使用N个图形处理器GPU资源,并为所述一组线程中的至少部分线程分配到的N个GPU资源是多个的数量大于或等于目标数量的情况下,将所述Y组GPU资源中的所述目标数量的GPU资源确应的Y组GPU资源中允许分配给所述P个线程使用的P组GPU资源;根据所述每个相同网卡名称分别对应的P组GPU资源确定每个相同网卡名称分别对应的GPU服务器集群的集中度;在及将所述目标网卡名称对应的P组GPU资源分个GPU服务器中的每个GPU服务器中所有的GPU资源的第一数量;确定在将任一相同网卡名用的GPU资源的数量和允许分配给所述P个线程使用的GPU资源的数量;根据所述第一数量和所述第二数量确定所述任一相同网卡名称对应的GPU服务器集群的集中度;循环执行所数量的商值的平方,并将所述商值的平方作为所述每个GPU服务器的集中度;将所述每个允许分配给所述P个线程使用的P组GPU资源的情况下,在所述M个GPU服务器中确定X组GPU资源中查找到允许分配给所述P个线程使用的P组GPU资源的情况下,将所述X组GPU资源中GPU服务器中的每个GPU服务器均与一组交换机连接,所述每个GPU服务器上设置有一组网中的不同GPU服务器上具有相同网卡名称的网卡接入所述一组交换机中的同一交换机,所线程中的至少部分线程分配到的N个GPU资源是多个GPU服务器上相同网卡名称的网卡对应[0103]S3,通过所述一组线程以及为所述一组线程中的每个线程分配的允许使用的N个有计算机程序,该处理器被设置为运行计算机程序以执行上述任一项方法实施例中的步GPU服务器中的每个GPU服务器均与一组交换机连接,所述每个GPU服务器上设置有一组网中的不同GPU服务器上具有相同网卡名称的网卡接入所述一组交换机中的同

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论