版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2 3 4 4 7 9 10 13 16 17 18 19 22 24 263一、研究背景随着我国数字经济规模总量的不断攀升,实体经济、数字经济和信息服务的深度融合正加速产业数字化和数字产业化变革。算力作为承载信息数据的重要基础设施,已成为全社会数字化转型的重要基石。根据中国信息通信研究院最新发布的《中国算力发展指数白皮书 (2023年)》显示,至2023年我国智能算力规模达到178.5EFlops,增速为72%,在我国算力占比达59%,成为算力快速增长的驱动力;据IDC等机构预测,至2025年,新增数据量180ZB,其中80%的增长来自于文本、图片、语音、视频等非结构化的数据。元宇宙、高性能计算等领域的发展,激发了更多智能数据处理的需求和场景,对新型智能算力的需求激增。本研究围绕典型智能计算应用对异构算力的协同及调度需求,研究泛在异构算力参与训练或推理过程的协同需求、调度需求,研究泛在异构算力参与训练或推理过程的协同需求,包括异构算力类型、规模要求、性能要求、网络要求、数据传输要求等,分析异构算力协同4池化和非池化异构算力并存等各种场景下,算力协同的需求及可行5代GPU架构GeForce256,标志着GPU时代的开始。随后GPU架构也不断升级,以适应日益增长的计算需求,GPU架构也不近年来,英伟达还发布了多款强大的GPU芯片,如Turing、Ampere等,这些芯片都具有高性能的计算能力,为各种应用提供了可达18432个FP32(单精度)和9216个FP64(双精度)的C架构、RDNA3架构、CDNA架构和CDNA2架构。最新一代面向高性能计算和人工智能CDNA2架构于架构采用增强型MatrixCore技6MI250XGPUFP64双精度运算算经网络专用芯片,是google为了为优化自身的TensorFlow机器于实现神经网络加速器、高性能计算单元等,为计算密集型的AI任AI张量块,包含密集的低精度乘法器阵列,针对矩阵和向量乘法进与更通用的芯片(如CPU和GPU)相比,ASIC芯片的定制化7DPU服务于云计算,主要作用是提升数据中心等算力基础设施宽和数据量急剧增长,由于CPU性能增长速度放缓,为了寻求效率更高的计算芯片,DPU由此产生。例如,英伟达将Mellanox的式推出了两款DPU产品BlueField-2DP机器学习和深度学习:异构计算可以利用AI算力的并行处理能8高性能计算(HPC)等科学计算场景:在科学研究、工程仿真等求。异构计算可以利用CPU和GPU联合的方式,实现更高的计和管理。通过异构计算,可以实现物联网设备的智能化管理和数据处理,提高物联网应用的效率和可靠性。异构计算可以利用CPU+GPU或者CPU+FPGA+GPU等异构算力联合的方式,实现区块链:区块链技术需要保证交易的安全性和可靠性,同时需要处理大量的交易数据。异构计算可以利用FPGA进行加密计算,除了上述典型的应用场景外,不同行业对异构智能算力的整体需9物流,0.04%物流,0.04%教育,4.00%政府,8.67%互联网,53.27%智能算力公共事业,0.97%服务,17.80%电信,4.16%来源:中国信息通信研究院、IDC据信通院与IDC的最新统计,由于互联网行业对数据处理和模型训练的需求不断提升,是智能算力需求最大的行业,占智能算力53%的份额;服务行业由于快速从传统模式向新兴模式发展,算力份额占比位列第二;政府、电信、制造、金融、教育等行业分列第三到八位。三、分布式异构算力管理和调度的关键技术能力异构算力多元泛在,对算力的管理平台提出了新的挑战。异构算力管理平台实现多种异构算力的管理和调度,并为智算应用提供应用层的推理和训练技术栈的支持,主要实现以下主要核心能力:●动态资源管理:管理CPU、GPU、FPGA等异构算力的注册和接入,算力拓扑信息,算力实时状态信息,实现对算力资源的虚拟化和池化的资源重构,提供细粒度的资管管理和隔离;●资源调度编排:实现异构算力节点的灵活调度,实现任务与节点资源的灵活编排,多以容器技术基于Kubernetes定制化研发实现对任务和资源的灵活编排调度,为上层功能模块提供资源能力;●异构算力适配:提供适配异构算力的从底层驱动到应用层框架整体技术栈的适配支持,以保证应用在不同算力节点上能弹性迁移支撑智算的平台能力:基于底层异构算力提供智算应用的数据处分布式异构算力的管理和调度是分布式异构算力平台的核心功异构算力虚拟化和池化是指在计算环境中利用不同类型的计算MIG(Multi-InstanceGPU)作为Ampere以及之后的Hopper架构推出的新特性,解决了像Ampere、Hopper这种大GPU在集群服务应用时一类需求GPU切分与虚拟化。MIG分割的每个GPU实例等,这样的切分方式也同时以利于容错和吞吐率以及延迟的预测。物理资源进行切分,包括系统通道、控制总线、算力单元(TPC)、全局显存、L2缓存、数据总线等;然后将分块后的资源重新组合,划分CI资源,这样通过排列组合,增加了配置的多样性。但是这些能力进行切片,分成多个逻辑上虚拟的GPU,以vGPU为单位分配同时为了丰富GPU虚拟化的能力,vGPU也可以支持多种不同的调超分等奠定了技术基础,为持续优化智算资源利用率创造了无限可算力的池化技术,它通过劫持对RuntimeAPI(如CUDAAPI)调用实现资源调度。当AI应用访问池化运行时的API远程调用资源等。API劫持技术的关键在于池化运行时仿真GPU/AI芯片的原生运行时,由于GPU/AI芯片种类、型号繁多,其原生运行二是应用程序监视器技术:这是一种完全与GPU/AI芯片无关的Hypervisor管理虚拟机的方式类似,分为前端、后端,前端监视指于不同GPU等异构硬件在支撑智算应用时,依赖不同的技术栈,包上的应用并不能调度到国产化的GPU上无缝运行,也更无法将一个运行在GPU上的程序不经过适配改动直接运行在FPGA上,技术栈的竖井问题导致一个智算应用目前仍然很难在不同的异构算力节点的背景下,K8s通过对设备插件的拓展支持实现对不同异构算力的识别和管理,算力设备厂商按照deviceplugin的接口规范实现自己的从而实现设备资源的发现、健康检测、分配等操作。当K8s集群具备对异构算力的管理能力时,则可以基于K8s的系统调度能力,对异构算力按照一定的机制进行管理。例如在Kubeflow平台中,GPU资源的管理和调度是通过GPU插件实现的,当用户提交一个GPU任务时,Kubernetes的GPU插件会首先检测系统中可用的GPU资源,并根据用户的要求为该任务分配一定数量的GPU资源。GPU插件会根据任务的需求和系统中GPU资源的可用情况,选择合适的GPU设备挂载给对应的Pod。在集群初始化阶段,K8s将通过设备管理将特定类型的硬件资源注册到Kubernetes集群中,并提供API接口实现对资源的管理。当接口来获取可用的GPU资源,并根据任务的需求选择最适合的GPU设备为任务分配,如图所示:NodeNodeKubeflow的API可以查询GPU资源的可用性和使用情况。用户也可以使用JupyterNotebook来创建、编辑和运行深度学习任务,在创建应的Pod,如果要实现任务的细粒度管理,可以使用GPU-Share的在的网络状态,以支撑策略对不同的集群网-基于实时资源状态调度:根据异构节点实时资源状态,包括之外FPGA、NPU、ASIC等形态的算力也被广泛应用于不同的使用场景。在混合异构系统的调度中,由于CPU负责对计算机的硬件资缺的,GPU、FPGA等芯片都是作为CPU的加速器而存在。主流的型训练在CPU上耗时长的问题,提升深度学习模型的训练效率,同多CPU核心可用于处理应用程序,从而大大提高数据中心的效率,辑控制。度量单位一般的可以用TOPS来衡量其运算能力;并行计算能力是指专门为了处理如图形图像等数据类型统一的一种高效计计算能力主要针对近年来AI神经网络、机器学习类密集计算型业务交易的基础,产业界也已经开始对算力标识的整体架构开展相关研异构AI算力的管理和调度平台,能够兼容适配多种形态智能AI硬件,实现硬件与计算要求有效对接、异构算力在节点间灵活调度、同时协同提供智算相关处理流程,将各类异构算力协同处理来发挥最大的计算效力,为多样化AI应用场景提供高性能、高可靠的算力支撑。当前产业界的各种智算平台已经对异构算力的管理和调度开展了不同技术方向的探索。(一)中国移动智算体系实现异构资源池化中国移动智算中心基于移动云底座的laaS能力,管理算力基础设施层的各类硬件资源,向上提供智算类业务所需任务式服务,构建一体化的AI新型智算体系。厘鼻运营智算运维鬣在整体方案上,智算中心划分为大模型训练池、小模型训练池及推理池。中国移动将在小模型训练池中,采用自研的容器基础设施EKI叠加相关池化模块,通过基于API劫持的池化技术,实现CPU、GPU/AI芯片、块存储/文件存储资源等基于高速无损网络的统一管理与调度,实现对智能算力的几大关键能力。包括算力的精细化分配,根据AI任务的资源需求进行按需供给,契合多样化业务的差异需求,基于高速无损网络,跨节点调取GPU、AI芯片等智能算力资源,使能CPU传统算力及GPU、AI芯片智能算力高度解耦,进一步降低碎片化比例,同时支持资源根据负载变化的动态分配、回收,支持全局资源可以适度超分,促进资源效率提升。该技术方案持实现资源跨节点远程调用、零散资源整合等,从而达到算力资源充分利用、碎片最小化效果,可有效提升资源效率,降低智算中心整体建设成本。(二)浪潮AIStation平台实现异构资源管理调度浪潮人工智能平台提供统一的主流深度学习框架(Tensorflow、Pytorch、Caffe、Mxnet、PaddlePaddle)开发训练平台以及计算资源可以实现物理计算资源(CPU、GPU、内存、存储)的统一管理与监控,实现基础资源服务管理,快速开展人工智能相关业务的开发和部关于异构算力的接入和管理,AIStation人工智能开发平台实现对基础设施的统一管控、形成资源池,由Kubernetes系统统一调度。AIStation人工智能开发平台可为用户分配使用配额。子子任务管理资源组管理监控报表节点管理配额管理AIStation提供了插件化设计,能够实现包括GPU、寒武纪、异腾Ascend、天垓等异构加速卡的配置化接入。平台默认接入GPU资源,接入其他加速卡资源时,平台UI会自动适配展示。AIStation接入加速卡后,能够通过平台发起训练任务、开发环境、模型测试等计算任务,并能够对加速卡进行监控报警、也对加速卡的使用情况自动进行适配统计展示。关于异构算力的调度,AIStation人工智能开发平台调度系统提供资源分配能力,在提高集群资源利用率的同时,尽可能的提高任务的性能,目前支持的可调度资源包括CPU、内存、GPU、IB卡。架drf络,同时支持按照接入交换机进行调度,尽量将任务调度在一个卡的使用率。提交任务时指定需要几个GPU卡,每个GPU卡需指定主机调度:创建任务时,允许指定一组主机,任务只能允许紧急任务调度:内置紧急任务队列,用户提交的训练任务带有紧急任务队列属性时,会将该紧急任务放到该紧急队列,在紧急任务队列的任务有最高的调度优先级,调度器在处理完全部的紧急用户组公平调度:提供基于用户组公平的调度机制,业务层创建不同的用户组,调度器会为每个用户组创建对应的调度队列,相同用户组的用户提交的训练任务会进入同一队列,调度器循环选),数据集亲和性调度:调度器处理更新集群节点已缓存的数据集信息,根据节点缓存数据集和作业所需数据集信息执行作业调度,超时任务优先调度:若一个任务因资源不足而继续等待调度,就如果计数达到阈值后该等待任务仍然未得到足够资源,则在同一资源组中,优先调度这个等待任务。该特性保证在资源紧张的情H3C傲飞高性能计算管理平台(AdvancedManag
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 密封式化验制样粉碎机安全操作规程培训
- 安全文明施工措施费使用计划报审表(表单模板)
- 碳材干燥安全规程培训
- 高处作业安全规范与防护培训
- 锚杆拉力试验工安全技术规程培训
- 2025-2026学年山东青岛五十八高二下学期物理期末试题含答案
- (2026年)口腔科放射工作制度
- 康复医学科心电运动实验室工作制度2篇
- 2025年河曲县数学三年级第二学期期中综合测试模拟试题(含答案解析)
- 2025年河南省偃师市数学三年级第二学期期末复习检测试题含解析
- 认知域作战基础知识课件
- 医疗结构化面试经典100题及答案
- 水平二 田径 大单元教学设计(18课时表格式)(第三版)
- DB13-T 6121-2025 氢基竖炉直接还原炼铁安全规程
- 妇产科中医护理应用
- 钳工培训课件
- 市场微观结构
- T/CECS 10035-2019绿色建材评价金属复合装饰材料
- XX包装纸业有限公司安全风险评估报告范文
- 公司停业股东协议书
- 《金属切割技术》课件
评论
0/150
提交评论