《智能计算基础设施 第1部分:系统框架》(征求意见稿)_第1页
《智能计算基础设施 第1部分:系统框架》(征求意见稿)_第2页
《智能计算基础设施 第1部分:系统框架》(征求意见稿)_第3页
《智能计算基础设施 第1部分:系统框架》(征求意见稿)_第4页
《智能计算基础设施 第1部分:系统框架》(征求意见稿)_第5页
已阅读5页,还剩29页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

ICS33.040.40CCSM3231IntelligentComputingInfrastr在提交反馈意见时,请将您知道的相关专利连同支持性文件一并附上。IDBXX/TXXXX—XXXX 2规范性引用文件 3术语和定义 4缩略语 25智能计算基础设施总体框架 35.1框架构成 35.2配套体系 45.3能力体系 45.4服务体系 45.5评价体系 46配套体系要求 46.1配套设施 56.1.1机房建设 56.1.2机电配套 56.2运行要求 66.2.1绿色节能 66.2.2安全可靠 67能力体系要求 67.1计算能力 67.1.1芯片要求 67.1.2服务器要求 77.2网络能力 77.2.1网络架构 77.2.2网络性能 87.3存储能力 97.3.1存储类型 97.3.2存储性能 97.4资源管理能力 97.4.1资源纳管 97.4.2资源调度 7.4.3资源维护 8服务体系要求 8.1算力服务 8.2算法服务 DBXX/TXXXX—XXXX8.3数据服务 8.4运营服务 9评价体系要求 9.1配套评价 9.2能力评价 9.2.1计算能力评价 9.2.2网络能力评价 9.2.3存储能力评价 9.2.4资源管理能力评价 9.3服务评价 9.4等级评价 DBXX/TXXXX—XXXX本文件按照GB/T1.1—2020《标准化工作导则第1部分:标准化文件的结构和起草规则》的规定起草。请注意本文件的某些内容可能涉及专利。本文件的发布机构不承担识别专利的责任。本文件由上海市经济和信息化委员会提出并组织实施。本文件由上海市信息标准化技术委员会归口。本文件起草单位:上海超级计算中心、中国电信上海分公司、中国信息通信研究院、上海大学、上海邮电设计咨询研究院有限公司、华为技术有限公司、曙光信息产业股份有限公司、浪潮电子信息产业股份有限公司、上海商汤科技开发有限公司、中兴通讯有限公司、新华三技术有限公司、上海市信产通信服务有限公司本文件主要起草人:DBXX/TXXXX—XXXX国家发布多项政策推进和规范智能计算基础设施建设,引导集约化、规模化、绿色化发展,而智能计算等新型基础设施具有高技术、高算力、高能效、高安全等特征,大模型应用的需求促进算力的快速迭代,上海市提出要规范智能计算基础设施建设,提高资源利用率,减少投资浪费。智能计算基础设施系列标准规定了智能计算基础设施应包含的部分和应满足的要求,从应用的角度将智能计算基础设施定义为配套体系、能力体系、服务体系和评价体系。DB31xx-xx《智能计算基础设施》拟由五个部分构成。——第1部分:系统框架。目的在于提供智能计算基础设施总体系统框架、各组成部分描述和要求以及对各部分评价的基本要求。——第2部分:能力体系。目的在于提供包括计算、网络、存储等资源的能力要求,以及对针对这些核心资源和能力的运维管理要求。——第3部分:服务体系。目的在于提供智能计算基础设施对用户提供的算力、算法、数据、运营等服务的要求。——第4部分:配套体系。目的在于提供智能计算基础设施的机房、机电配套设施的建设和运行要——第5部分:评价体系。目的在于提供智能计算基础设施配套体系、能力体系、服务体系以及整体系统等级的评价标准。1DBXX/TXXXX—XXXX智能计算基础设施第1部分:系统框架本文件规定了智能计算基础设施的总体系统框架,其中包括总体系统框架的组成和对各个组成部分的定义、要求和评价等相关内容。本文件适用于智能计算基础设施总体架构规划、设计、建设、运营及评价。2规范性引用文件下列文件中的内容通过文中的规范性引用而构成本文件必不可少的条款。其中,注日期的引用文件,仅该日期对应的版本适用于本文件;不注日期的引用文件,其最新版本(包括所有的修改单)适用于本文件。GB40879-2021《数据中心能效限定值及能效等级》GB50016-2014《建筑设计防火规范》GB50084-2017《自动喷水灭火系统设计规范》GB50174-2017《数据中心设计规范》GB50311-2007《综合布线系统工程设计规范》GB50370-2005《气体灭火系统设计规范》GB50736-2012《民用建筑供暖通风与空气调节设计规范》GB50898-2013《细水雾灭火系统技术规范》GB/T9813.3-2017《计算机通用规范第3部分:服务器》GB/T41867-2022《信息技术人工智能术语》GB/T42018-2022《信息技术人工智能平台计算资源规范》YD/T4389-2023《AI服务器及能力平台技术要求(信通院)》DB31/T310008-2021《公共机构绿色数据中心评定规范》3术语和定义GB/T41867-2022、GB/T42018-2022界定的以及下列术语和定义适用于本文件。3.1人工智能计算芯片AIcomputingchip计算芯片是一种专门设计用于执行复杂计算任务的半导体器件,包括但不限于CPU、GPU、FPGA、ASIC、TPU、NPU等类型。人工智能计算芯片是提供人工智能应用处理能力的计算芯片。[来源:GB/T41867-2022,3.1.5,有修改]3.2人工智能计算服务器AIcomputingserver人工智能计算服务器是一种满足人工智能训练或推理等复杂计算任务的特定的计算服务器。2DBXX/TXXXX—XXXX[来源:GB/T41867-2022,3.1.3,有修改]3.3智能算力AIcomputingpower算力是计算服务器通过对数据进行处理后实现结果输出的一种能力。智能算力是人工智能计算服务器进行人工智能算法模型训练与模型运行服务的计算系统能力。3.4异构算力heterogeneouscomputingpower异构算力是在同一服务器中,使用如CPU、GPU、FPGA、ASIC等多种不同架构的计算芯片协同工作,以满足不同的计算需求,提高计算效率和性能。3.5智能算力集群AIcomputingpowercluster智能算力集群是一种由多个人工智能计算服务器组成的集合,这些节点通过网络相互连接,形成统一的计算资源池,专门用于执行人工智能相关的计算任务。[来源:GB/T41867-2022,3.1.4,有修改]3.6模型训练modeltraining模型训练是在机器学习和人工智能领域,通过学习大量数据和算法来调整模型参数,使模型具有模式识别、预测和解决问题的能力。[来源:GB/T41867-2022,3.2.18,有修改]3.7模型推理modelinference模型推理是在人工智能和机器学习领域中,已经训练好的模型对新输入数据进行预测或分类的过程。[来源:GB/T42018-2022,3.12,有修改]4缩略语下列缩略语适用于本文件。AI:人工智能(ArtificialIntelligence)API:应用程序编程接口(ApplicationProgrammingInterface)ASIC:专用集成电路(Application-SpecificIntegratedCircuit)BA:建筑设备自动化系统(BuildingAutomationSystem)BF16:16位脑浮点(BrainFloatingPoint16)CLI:命令行界面(CommandLineInterface)CPU:中央处理器(CentralProcessingUnit)CUE:碳使用效率(CarbonUsageEffectiveness)FLOPS:每秒浮点运算次数(floating-pointoperationspersecond)FP8:8位半精度浮点数(8bitshalf-precisionFloatingPoint)FP16:16位半精度浮点数(16bitshalf-precisionFloatingPoint)FP32:32位单精度浮点数(32bitssingle-precisionFloatingPoint)FP64:64位双精度浮点数(64bitsdouble-precisionFloatingPoint)3DBXX/TXXXX—XXXXFPGA:现场可编程门阵列(Field-ProgrammableGateArray)GEMM:通用矩阵的矩阵乘法(GEneralMatrixtomatrixMultiplication)GDDR5:第五版图形用双倍资料传输率存储器(GraphicsDoubleDataRate,version5)GDDR6:第六版图形用双倍资料传输率存储器(GraphicsDoubleDataRate,version6)GPU:图形处理器(GraphicsProcessingUnit)HBM:高带宽内存(HighBandwidthMemory)HBM2:第二代高带宽内存(HighBandwidthMemory2)HBM2e:第二代增强型高带宽内存(HighBandwidthMemory2e)HBM3:第三代高带宽内存(HighBandwidthMemory3)HDFS:Hadoop分布式文件系统(HadoopDistributedFileSystem)HVDC:高压直流输电(HighVoltageDirectCurrent)INT4:4位八分之一精度整型(4bitsone-eighth-precisionINTeger)INT8:8位四分之一精度整型(8bitsquarter-precisionINTeger)IT:信息技术(InformationTechnology)M-LAG:跨设备链路聚合组(MultichassisLinkAggregationGroup)NPU:神经网络处理单元(Neural-networkProcessingUnit)NVMe:非易失性内存主机控制器接口规范(Non-VolatileMemoryExpress)OAM:开放加速模组(OpenAcceleratorModule)PCIE:外设部件互连扩展(PeripheralComponentInterconnectExpress)PUE:电源使用效率(PowerUsageEffectiveness)RDMA:远程直接内存访问(RemoteDirectMemoryAccess)ReLU:整流线性单位函数(RectifiedLinearUnit)RESTfulAPI:表现层状态转移应用程序编程接口(RepresentationalStateTransferAPI)RoCE:允许通过以太网使用RDMA技术进行数据传输(RDMAoverConvergedEthernet)SDK:软件开发工具包(SoftwareDevelopmentKit)SSD:固态硬盘(SolidStateDrive)TCP/IP:传输控制协议/因特网互联协议(TransmissionControlProtocol/InternetProtocol)UPS:不间断电源(UninterruptiblePowerSupply)VLLM:超大规模语言模型(VeryLargeLanguageModel)WUE:水使用效率(WaterUsageEffectiveness)5智能计算基础设施总体框架5.1框架构成智能计算基础设施是基于最新人工智能理论,采用领先的人工智能计算架构,提供算力服务、数据服务和算法服务的新型算力基础设施。智能计算基础设施总体框架由配套体系、能力体系、服务体系和评价体系四个部分构成,如图1所示。4DBXX/TXXXX—XXXX图1智能计算基础设施总体框架5.2配套体系智能计算基础设施的配套体系应根据所承载业务需求确定可用性等级,综合外市电容量、土地、既有建筑层高、承重等条件对机房、机电配套设施提出建设要求,同时在建设运营过程中充分考虑绿色节能、安全可靠的运行要求。5.3能力体系智能计算基础设施的能力体系应包括计算、网络、存储三大类核心硬件和整体的资源管理能力,以符合可支持各种大规模、复杂度高的智能计算任务的要求。a)计算能力应包括对AI计算芯片和AI计算服务器的要求,符合人工智能训练、人工智能推理等应用需求;b)网络能力应包括对业务网络、参数网络、管理网络、存储网络的架构和性能的要求,符合大规模组网、高带宽、零丢包、低延时和抖动以及高稳定性等特性;c)存储能力应包括对存储设备的类型和性能的要求,符合并行处理、数据并行访问、节点负载均衡、多级缓存、数据安全、高可靠和集群扩展等方面的要求;d)资源管理能力应包括对异构资源进行统一纳管、调度和维护,符合人工智能任务多机多卡部署、运行与调度,并优化服务器集群中的资源利用效率。5.4服务体系智能计算基础设施的服务体系应包括对外提供的智能算力服务、算法服务、数据服务、运营服务等服务内容,符合灵活的资源的提供与整合、丰富的业务的提供与生态、全栈的服务的支持与配套等方面要求。5.5评价体系智能计算基础设施的评价体系应包括对智能计算基础设施配套、计算能力、网络能力、存储能力、资源管理能力、服务以及系统等级的评价标准,符合可用于评估智能计算基础设施综合能力的要求。6配套体系要求5DBXX/TXXXX—XXXX6.1配套设施6.1.1机房建设智能计算基础设施的机房建设要求包含:a)智算机房的选址、设计、环保、节能、消防应满足GB50174的相关规定;b)应靠近干线通信线路,并具备多路由接入条件;c)应有可靠电力供应,宜引入一类市电;d)应有可靠的供水,满足智算工艺空调的用水量及水质要求;e)智算机房的建筑、装饰工程应符合智算工艺、通信工艺和电源对土建的要求;f)智算机房的平面布局、层高、承重应考虑高密度机柜设备及液冷空调设备的布置要求;g)智算机房各楼层应预留充足的电力、空调竖向管井和孔洞,为同楼层或跨楼层机房之间供配电和制冷量的灵活调度提供条件;h)宜采用预制装配式、模块化建筑;i)邻近主机房区域宜配置相应的客户操作用房。6.1.2机电配套智能计算基础设施的机电配套要求包含:a)智算机电配套系统包括电力、空气调节、网络与布线、给排水、智能化等子系统;b)各类机电设备应根据工艺设计进行布置,应满足系统运行、运行管理、人员操作、设备和物料运输、设备散热、安装和维护的要求;c)供配电、空调系统应为智能计算基础设施IT系统的可扩展性预留备用容量;d)通信电源供电形式应选择不间断电源系统,宜采用2N交流UPS系统,或一路市电+一路HVDC供电模式;e)柴发设备宜按照无冗余配置;f)智算机房空调系统应根据智算业务情况、室外冷源产品自身的特点、气象条件、水资源情况,选择合适的冷源系统,可采用风冷、液冷或风液混合形式;g)智能计算基础设施与其它功能用房共建于同一建筑内时,应设置独立的空气调节系统;h)空调制冷剂宜使用臭氧层破坏潜能值为0或者全球变暖系数值较低的产品;i)网络布线根据网络架构、用户需求和技术发展趋势进行规划和设计,房宜采用模块化的部署方式;j)机房线缆布放宜选择开放式线架采用上走线方式,强电、弱电,光纤、铜缆宜分别布线;k)辅助区、支持区布线系统设计应符合GB50311的有关规定,设备布置应满足时延要求;l)给排水系统应满足智能计算基础设施设备运行工艺需求,当工艺需求不明确时,可按GB50174和GB50736的相关规定确定;m)智能化系统宜分为机房运维区域、公共物管区两类场景来考虑;n)机房运维区建设内容应包括动环系统、BA系统、安防系统、巡检系统、AI调优系统;o)公共物管区建设内容应包括安防系统、BA系统、服务系统;p)智能化系统架构宜包含数据采集层、设备监控层和集中监控层,智能化系统应以实现园区级全局化、综合化、可视化的数据共享分析和高效管理,实现快速故障分析与定位,指导现场人员处置操作和日常巡检维护作业为目的;6DBXX/TXXXX—XXXXq)智能化系统应具有先进性、可靠性、安全性、集成性、可扩展性,并应支持后期建设的升级改造和新系统的接入。6.2运行要求6.2.1绿色节能智能计算基础设施运行中的绿色节能要求包含:a)在智能计算基础设施规划选址、设计、建设、采购、运营、改造、回收等全生命周期的各个阶段落实绿色减碳理念的植入和评价,实现“量化可见”的全程监控;b)智能计算基础设施建设运营期,宜采用清洁能源替代传统能源,通过有效的能源管理和碳中和措施来减少对气候的负面影响;c)应从供能侧、用能侧、抵消侧三个方面考虑减碳措施,包含绿色能源、绿色低碳园区、绿色低碳建筑、绿色低碳机电配套、绿色低碳算网、绿色低碳算力应用的各个方面;d)注重提高智能计算基础设施的能源效率,通过采用先进的节能技术和优化设备配置,最大限度降低能源消耗;e)新建智能计算基础设施的能效等级不应低于GB40879规定的2级水平,年均设计PUE不高于1.3,且应符合国家和上海市相关政策及规范要求;f)PUE值的计算及测试方法应参照GB40879的有关规定。6.2.2安全可靠智能计算基础设施运行中的安全可靠要求包含:a)配套体系的安全要求包括物理空间、供电、消防、环境方面的安全;b)安全防范应符合GB50348第5.1节“通用型公共建筑安全防范工程设计”中的“一般规定”和“先进型安防工程设计”的技术要求;c)智能计算基础设施防火和灭火系统设计应符合GB50016、GB50370、GB50898和GB50084的规定;d)配套体系中应建立安保防范系统,包括视频安防监控系统、入侵报警系统和出入口控制系统,各系统应具备联动控制功能;e)可靠要求指配套体系应具备良好的运行工况,以保障主设备及网络的持续稳定运行,达到提高智能计算基础设施的可靠性、排除隐患、延长寿命期的目的。7能力体系要求7.1计算能力7.1.1芯片要求智能计算基础设施中对AI计算芯片的要求包含:a)应支持多种AI计算芯片,包括但不限于GPU、ASIC、FPGA等,同时具备CPU等通用算力;b)应拥有片上高速内存储空间,该存储空间基于GDDR5、GDDR6、HBM、HBM2、HBM2e、HBM3或更新技术实现;c)宜支持芯片间高速专有互连协议,如NVLINK、OAM等;d)应支持FP32、FP16、INT8等基本精度;宜支持BF16、FP8精度;可支持FP64精度;7DBXX/TXXXX—XXXXe)应支持至少一种主流计算框架,如TensorFlow、PyTorch、MindSpore、PaddlePaddle等;f)应支持至少一种主流分布式计算框架,如DeepSpeed等;支持至少一种分布式并行策略,如张量并行、数据并行、流水线并行等;g)应支持人工智能常用算子,如GEMM、Sigmoid、ReLU等;h)应支持各类人工智能模型的训练、推理,包含但不限于机器视觉、机器学习、自然语言处理、语音识别、模式识别、图像和视频分析、知识图谱等;i)应具有良好的生态,以方便在不同的芯片间进行模型和业务的迁移,应提供完善的迁移工具。7.1.2服务器要求智能计算基础设施中对AI计算服务器的要求包含:a)应满足GB/T9813.3-2017中的相关规定;b)应支持DDR4及以上内存;c)应支持NVMeSSD等高速硬盘接口;d)应支持至少一种计算芯片的互联协议,如PCIE、NVLINK、OAM等;e)应支持冗余热插拔电源,支持单风扇失效;f)应支持带内和带外管理,具备远程管理和性能检测功能;g)应保证具有有效的散热和冷却系统,可支持液冷冷却,以保持系统的稳定性和性能;h)主要部件如硬盘、内存、网卡等应具有良好的扩展性;i)可按照业务负载分为训练服务器和推理服务器;j)应配置高速无损网络,支持RDMA互联;k)训练服务器应支持主流全线速网络拓扑架构,包括但不限于胖树等;l)推理服务器应配置高速网络,宜支持无损网络技术,宜支持RDMA互联。7.2网络能力7.2.1网络架构7.2.1.1业务网络智能计算基础设施的业务网络用于承载客户访问训练和推理集群、训练数据加载、训练结果导出等流量,其架构应符合以下要求:a)业务网络采用二层树形组网架构;b)两台业务接入交换机之间互联,同样运行M-LAG协议;c)业务网络采用传统TCP/IP协议,与常规数据中心业务网络无明显区别;d)业务汇聚交换机和业务接入交换机均成对部署。7.2.1.2管理网络智能计算基础设施的管理网络用于承载带内/带外管理流量,管理流量与业务流量应互相隔离,其架构应符合以下要求:a)管理网络应采用二层树形组网架构;b)智能计算基础设施内所有的网元(交换机、防火墙、服务器、存储节点等设备)的带外管理网口应接入到带外管理接入交换机;8DBXX/TXXXX—XXXXc)带内管理接入交换机宜成对配置,两台接入交换机之间可采用堆叠或M-LAG组网,管理汇聚交换机交叉上连至CE路由器或核心交换机;d)管理网络采用传统TCP/IP协议,与常规数据中心业务网络无明显区别;e)为保障管理网络的安全性,管理网和其他网络之间可通过防火墙进行隔离;f)服务器与存储节点宜通过带内管理口接入到带内管理交换机,带内管理接入交换机宜成对部署。7.2.1.3参数网络智能计算基础设施的参数网络用于训练场景下AI训练过程中的模型参数同步,单纯推理场景无需建设参数网络,其架构应符合以下要求:a)参数面应采用叶-脊组网架构;b)应结合交换机端口密度以及AI计算服务器规模,决定叶-脊组网架构层数,不宜超过3层;c)参数面网络应采用基于RDMA(RemoteDirectMemoryAccess)技术的协议;d)叶节点交换机与脊节点交换机应均匀全互联,叶节点交换机连接到每个脊节点交换机的端口数和速率都一样。7.2.1.4存储网络智能计算基础设施的存储网络包括样本面高速存储和存储集群,用于承载计算集群和存储阵列间的模型加载、数据集读取、checkpoint写入流量等,其架构应符合以下要求:a)应根据对训练或推理场景性能要求,确定样本网络是否与业务网络合设;b)存储网络应采用叶-脊组网架构;c)存储网络单独组网时,应采用基于RDMA(RemoteDirectMemoryAccess)技术的协议;d)存储网络与业务网络合设时采用传统TCP/IP协议;e)存储网络叶节点交换机应根据AI计算服务器与存储节点的接入方式,确定是否采用M-LAG组网;f)叶节点交换机与脊节点交换机应均匀全互联,叶节点交换机连接到每个脊节点交换机的端口数和速率应保持一致。7.2.2网络性能7.2.2.1业务网络与管理网络智能计算基础设施的业务网络与管理网络性能应符合以下要求:a)业务接入交换机下行带宽,应与服务器实际业务出口带宽保持一致;b)业务接入交换机之间的互联带宽应与下行总带宽成固定比例;c)业务网络、管理网络上下行带宽与性能要求应满足业务实际需求,与常规数据中心业务网络无明显区别;d)管理网络应具备性能优化、故障排除和网络管理等功能,并具备实时监测手段和工具。7.2.2.2参数网络智能计算基础设施的参数网络性能应符合以下要求:a)参数网络叶节点交换机下行单端口带宽,应与AI计算服务器实际单个GPU/NPU出口带宽保持一致;9DBXX/TXXXX—XXXXb)叶节点交换机上行单端口带宽不应低于下行单端口带宽;c)为减少参数网络拥塞,叶节点交换机下行总带宽与上行总带宽的比例应为1:1;d)参数网络应具备零丢包以及负载均衡能力,交换机各链路实际吞吐量应做到平均分配。7.2.2.3存储网络智能计算基础设施的存储网络性能应符合以下要求:a)普通存储网络可参考业务网络性能要求;b)样本高速存储网络单独组网时,应做到低延时、零丢包、高可靠、高吞吐,保证网络性能与可靠性。7.3存储能力7.3.1存储类型智能计算基础设施中对存储类型的要求包含:a)宜配套高性能热存储、大容量冷存储等多级存储系统,满足冷热数据存储需求;b)热存储宜采用分布式存储系统,全对称架构或者非对称架构;c)热存储应支持不同存储协议的访问需求,如文件、对象、块、HDFS等;d)热存储宜支持高速网络,支持RDMA技术或支持RDMA的RoCE等网络协议;e)热存储节点应采用通用的服务器架构,应具备部件扩展能力,如内存、硬盘等;f)宜支持多级存储,支持数据在热存储池和冷存储池之间的流动;g)应支持多维度冗余,如部件级冗余、节点级冗余、机柜级冗余等,保证数据高可靠性;h)应支持在线维护功能,在不影响系统正常运行的情况下进行硬件部件的更换和维护;i)应支持自动故障恢复能力,能够在故障发生时自动切换到备用路径或备用设备;j)应支持多种数据保护机制,如支持基于时间策略的快照、远程复制等功能;k)应具备数据的冗余存储和容错机制,以确保在节点故障或数据损坏时进行数据恢复;l)支持数据一致性检查功能,保证写入数据的一致性;m)应支持系统状态和性能的监控,支持邮件、短信等告警功能;n)支持在线系统扩容,且不需要更改应用程序,扩容时客户业务无感知。7.3.2存储性能智能计算基础设施中对存储性能的要求包含:a)应支持并行化技术,支持系统并行处理,数据并发访问;b)热存储应支持负载均衡,存储性能随节点增加近似线性增长;c)热存储宜采用性能优化技术,如优化协议、通信模式、数据压缩等,以提高系统的整体性能;d)热存储宜支持多级缓存机制,如内存、SSD缓存和基于客户端本地NVMe硬盘的缓存等;e)热存储宜支持计算卡对存储的直接访问;f)热存储宜支持NVMe协议,支持全NVMeSSD存储池。7.4资源管理能力7.4.1资源纳管DBXX/TXXXX—XXXX资源纳管应对AI计算芯片、存储设备、网络设备等物理资源进行统一的管理。为实现资源的高效整合,利用资源虚拟化技术,对上述设备资源进行抽象,在一定程度上屏蔽异构性,从而形成逻辑计算资源,以标准算力的形式提供给用户使用。资源虚拟化包括:算力虚拟化、存储池化、网络虚拟化,应提供如下功能:a)应采用分布式架构、模块化设计,具备可扩展性,可实现资源平滑扩展、持续运行;b)应支持异构计算芯片、存储设备、网络设备统一纳管,并提供细粒度资源管理能力;c)应提供数据分类分级管理机制与管理策略,并提供冷、热数据流动机制;d)应支持网络功能虚拟化和软件定义网络;e)应支持人工智能任务与计算资源的解耦能力,使得任务可运行在集群不同节点上;f)应提供资源封装与隔离功能,多个人工智能任务可共享节点资源,但它们之间应互相保持隔离,如同单独运行在物理机上;g)应提供高性能算力训练场景提供单服务器(多卡)、多服务器资源聚合能力,以实现大规模训练中的模型并行、数据并行与流水线并行。7.4.2资源调度资源调度通过调节人工智能任务部署位置和所属计算资源,实现人工智能任务多卡多机部署与运行,优化服务器集群中的资源利用效率。资源调度应包括如下功能:a)应支持对人工智能任务进行资源配置,如设置任务优先级、任务所属计算资源(节点数、算力/显存,CPU/内存)、任务调度类型、任务调度策略等内容;b)应为人工智能任务提供多种调度类型,如动态部署、任务迁移、动态调度、弹性扩缩容、跨集群调度等调度类型;c)应为人工智能任务提供多种调度策略,如亲和性和反亲和性、污点和容忍、组调度策略、自定义调度策略等调度策略。7.4.3资源维护资源维护通过对各类设备和资源的进行性能监控、告警监控、故障管理、以及健康检查,实现千卡/万卡智能计算基础设施关键性能监控和数据可视化展示,从而保障智能计算基础设施正常运行。资源维护应包含如下功能:a)应提供性能监控功能,如计算资源监控、存储资源监控、网络资源监控、租户资源监控等功能。除通用数据中心监控指标外,还需提供算力芯片使用率、显存使用率、算力芯片间网络传输等智算场景专属性能监控功能;b)应提供告警监控功能,如告警配置、告警通知、告警级别、告警日志等功能;c)应提供故障管理功能,如故障检出规则管理、故障分析、故障定位、故障预警等功能;d)应提供健康检查功能,并对各类设备和资源的定期健康检查与数据可视化展示。8服务体系要求8.1算力服务智能计算基础设施面向大模型开发场景,在算力服务支持能力方面包括以下内容:a)应支持智算场景下超大规模异构算力的纳管与高效调度;b)应支持智算场景下用户自助式算力集群资源管理、工作负载管理和用户权限管理;DBXX/TXXXX—XXXXc)应提供多种智算实例规格,包括提自助式裸金属、容器等计算云服务等;d)应提供大规模算力池服务,包括高性能、安全稳定、弹性伸缩、智能调度等特点;e)应支持不同模型开发与应用过程中,网络服务与存储服务的自助式选择和使用。包括高性能、强隔离的训推与存储网络服务、公网互通服务、高性能并行文件存储服务、海量低成本对象存储服务。8.2算法服务智能计算基础设施面向大模型开发工具链场景,在算法服务支持能力(MaaS服务)方面包括以下a)应具备模型管理服务,包括数据集创建、上传、删除,内部文件管理,模型来源管理,模型发布管理,模型分类管理,模型版本管理等;b)应支持模型推理服务,包括支持模型快速部署为在线推理服务,提供RESTfulAPI调用接口;支持为在线推理服务划分专用资源池;支持在专用资源池范围内根据服务访问量对模型实例进行扩容缩容;支持提供多种高性能推理引擎,包括TensorRT、VLLM等;支持超大模型分布式推理能力;c)应支持模型训练服务,包括支持单机多卡、多机多卡分布式训练任务,支持模型增量训练,支持仅使用增量数据对模型进行训练,支持直接将训练完成的模型部署推理的一键式流程,支持自定义调节训练任务的参数。8.3数据服务智能计算基础设施面向海量数据场景,在数据服务能力方面包括以下内容:a)应支持数据集生命周期管理,包括数据集接入、版本管理、数据可视化、数据集授权等,提供Web、SDK、CLI等多种开发者工具;b)应支持多模态数据标注能力,包括图片、视频、语音、文本、点云等多模态数据的标注,涵盖多模态数据标注工具集、AI智能标注;c)应支持标注质量控制标准管理,包含实时监控标注质量、把控标注进度、追踪审计标注行为、快速定位潜在风险;d)应支持敏感数据识别能力,包括但不限于人脸、车牌等敏感数据脱敏;e)应支持数据销毁,支持销毁指定数据不会留下任何痕迹;f)应具备数据安全措施,包括数据传输安全、存储安全、数据监控、访问控制、安全审批等。8.4运营服务智能计算基础设施,面向运营服务场景应包含以下内容:a)应提供准确、高效、容错的用户资源用量的统计机制与系统,支持计量审计和校验;b)应制定详细的计费规则,包括不同服务和资源的具体计费方式,如按量付费、预付费选项等;c)应提供完整的成本估算工具或指南;d)应采用实时数据处理和计费技术;e)应定期审计和校验计量系统;f)应按账户提供完整的计费历史记录和详细账单;g)应提供多种计费模式,满足不同业务需求;h)应提供支持服务等级说明,明确客户服务和支持;DBXX/TXXXX—XXXXi)可提供按需调整服务等级和资源配置功能;j)宜满足在基础设施变化和扩展时的计费模型和计量机制的适应性。9评价体系要求9.1配套评价智能计算基础设施对配套体系的评价要求包含:a)智能计算基础设施算力密度高,产生更多的热量,需要配置更高效的散热系统,包括更多的空调单元、液冷系统或其他先进的冷却技术;b)智能计算基础设施通常部署更高性能的服务器和存储设备,供电要求远高于传统数据中心,单机架供电能力宜可扩展承载训练服务器和可扩展承载推理服务器的功耗;c)智能计算基础设施算力集群规模越来越大,需要更多网络交换机和光纤通道,布线需求更为复杂,要求有足够的灵活性和可扩展性;d)智能计算基础设施应满足更高的环保标准和节能减排要求,采用高效能设备,可再生能源,环保建筑材料,智能能源管理系统,积极的绿色节能创新和实践活动,尽可能降低CUE;e)智能计算基础设施通常采用水冷等高效冷却技术,应结合水回收和再利用技术,提供更为环保和可持续的运营方式,尽可能降低WUE值;f)智能计算基础设施对能源效率的要求更高,应有更严格的PUE指标。9.2能力评价9.2.1计算能力评价智能计算基础设施对计算能力的评价要求包含:a)智能算力的占比应超过一定比例;b)算力规模以FLOPS为性能指标单位,以FP16数据类型的算力为代表;c)算力密度(FLOPS/架)远大于普通提供通算能力的数据中心;d)

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论