版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026年3月NVIDIA企业参考架构声明与免责声明NVIDIA企业参考架构文档属于NVIDIA机密信息,蕴含重要的知识产权与工程技术专有知识。NVIDIA仅授予您有限权限使用NVIDIA企业参考架构,以利用NVIDIA技术构建支持NVIDIA平台的数据中心集群。您不得使用NVIDIA企业参考架构开发竞争性产品或技术,亦不得协助第三方开展此类活动。除本通知及免责声明中明确说明外,您不会通过默示、禁止反言或其他方式获得任何其他许可或权利。NVIDIA反对并拒绝接受您提出的任何额外或不同的条NVIDIA企业参考架构可能会在不另行通知的情况下进行变更。NVIDIA的技术可能需要启用相应的硬件、软件或服务功能。您的成本和实际效果可能因情况而异。本文件并不构成对任何技术、代码或功能开发、发布或交付的承诺。NVIDIA保留随时(无需通知)对本文件进行修正、修改、增强、改进或其他变更的权利。您有责任自行评估并确认本文件中所含信息的适用性,并确保该产品适合您规划的应用场景。NVIDIA发布的关于第三方产品或服务的信息并不构成NVIDIA授予使用此类产品的许可,亦不构成相关产品的保修或推荐声明。使用此类信息可能需要NVIDIA的产品或服务均受相关NVIDIA产品或服务所附适用的NVIDIA产品条款及销售条款约束。NVIDIA提供这些资源并不扩大或改变其针对NVIDIA产品或服务所适用的保证或免责声明。您不得使用NVIDIA企业参考架构或NVIDIA的机密信息用于:(i)证实或支持任何知识产权主张(包括专利、版权或商业秘密或(ii)编制、提交、修改或申请任何专利。您同意向NVIDIA授予一项有限、性、不可撤销、不可再许可、不可转让、免版税且已全额支付的许可,该许可适用于您在访问NVIDIA企业参考架构后可能针对本文披露内容提出的任何专利主张。保证免责声明。NVIDIA提供的企业参考架构资料均按“现状”提供。在适用法律允许的最大范围内,NVIDIA不承担与本协议相关或由此产生的任何明示、暗示或法定保证及陈述(包括但不限于所有权、不侵权、适销性、特定用途适用性、商业使用及交易惯例方面的保证)。责任限制:在适用法律允许的最大范围内,NVIDIA在任何情况下均不对以下损害承担责任:殊、附带或后果性损害;或(ii)因本文件导致或与之相关的(a)采购替代货物的成本,或(b)利润、收入、使用价值、数据或商誉损失——无论该损失基于合同违约、侵权行为(包括过失)、严格责任或其他原因所致;即使NVIDIA已被告知此类损害的可能性,且您的救济措施未能实现其基本目的亦不例外。此外,在适用法律允许的最大范围内,NVIDIA因本文件产生或与此相关的所有责任、义务或索赔的累计总责任金额不得超过一百美元(US标志均为NVIDIA公司在美国及其他国家的商标和/或注册商标;其他公司名称及产品名称可能为相关公司的商标。©2025NVIDIA公司及其关联企业。保留所有权利。理查德·哈斯蒂ShashankSabhlokNVIDIA企业级RA2026年3月|NVIDIA企业级RA2026年3月|二X网络技术,为大规模人工智能训练与推理提供企业级数据中心支持,可实现实时应用及万亿参数模型的运行。该企业级RA架构专为解决当今最具挑战性的计算问题而设计。基于此架构的认证配置可在全球各地的企业数据中心中部署。>NVIDIAGB300NVL7272NVIDIAConnectX®-8超级网卡NVIDIASpectrum™-X以太网平台NVIDIAAI企业软件NVIDIA任务控制中心NVIDIANVLink和NVLink交换机本文档阐述了定义企业级RA(EnterpriseRA)可扩展且模块化架构的各个组件,该架构基于可扩展单元(SU)这一基础单元构建,每个NVIDIA企业级RA2026年3月|三月概述 5系统硬件与组件 6NVIDIAGB300NVL计算托盘 7控制平面/管理节点 8NVIDIANVLink第五代 9NVIDIANVLink第五代交换机托盘 NVIDIAGB300NVL72网络设备 10计算(东/西节点)以太网网络 融合型(北/南节点)以太网网络 11网络硬件 NVIDIABlueField-3B3240DPU 13NVIDIA带ConnectX-8的夹层网络板 NVIDIA以太网互连 14NVIDIASN5610交换机 14NVIDIASN2201交换机 网络物理拓扑结构 计算(东/西节点)网络 多平面拓扑方法 16双平面拓扑结构 17汇聚型(北/南节点)网络 17带外管理(节点)网络 18网络逻辑架构 企业级RA可扩展单元(SU) 20脊柱叶状网络结构 22带外(OOB)管理网络 22优化后的用例 22架构详情 22计算(东/西节点)结构表 24汇聚型(节点南北向)结构表 242机架式结构,共包含36个托盘,每个托盘配备144块BlackwellUltraGPU。 25NVIDIA企业级RA2026年3月|四月 26 29企业级RA软件 31 33 33 33 33 33 33 33 33 34 35 35 36NVIDIA企业级RA2026年3月|5日NVIDIAEnterpriseRA采用2-4-5-800(双平面)节点架构,搭配NVIDIAGB300NVL72服务器与NVIDIASpectrum-X网络设备,提供一套完全集成的机架级解决方案,专为最严苛的人工智能工作负载优化。该方案基于NVIDIA认证的NVL72GB300系统构建模块化架构,每台系统配备该系统采用液冷设计,每个可扩展单元(即单个NVL72机架)集成18个计算托盘,并通过第五代NVLink技术实现互联。虽然每个托盘(对应单台服务器或节点)仍可根据需求独立运行,但NVLink互连技术可动态组合GPU资源,使系统在处理大型工作负载时能够作为单一多GPU计算单元运作。这种紧密耦合的配置架构有效消除了系统瓶颈,从而确保最佳性能和应用可扩该系统经过全面测试,可扩展至8个可扩展单元(SUs)。可根据客户需求构建更大规模的该机架解决方案以预配置系统形式交付,可通过OEM厂商提供,并附带硬件支持。NVIDIA提供的软件支持基于按GPU计费的NVIDIAAIEnterprise订阅服务。尽管这份企业级RA文档可能使NVIDIAGB300NVL72与NVIDIASpectrum-XPlatformRA专为支持企业级人工智能部署而设计,主对当今最大的人工智能模型进行实时推理数据分析高速且支持大规模处理单精度与混合精度高性能计算对于所有使用场景,该架构均非常适合多用户、单一租户的工作负载。具体而言,其逻辑设计与软件架构经过优化,通过将配置调整为适用于所有用户均属于同一企业环境,并实现会计核算与访问控制的集中管理,从而显著简化部署与维护流程。该RA架构旨在支持Kubernetes、Slurm及相关应用程序与工具在非虚拟化工作负载中的部NVIDIA企业级RA2026年3月|6日系统硬件与组件技术,可将某些大型AI/ML工作负载所需的计算时NVIDIA企业级RA2026年3月|7日计算托盘/节点(图2),每个托盘配备4计算托盘采用完全集成的NVLink横向扩展架其他所有GPU相连。为实现计算网络连接,每个托盘配备两块中间层网络板(每块板搭载两个ConnectX-8硅芯片),共计四个ConnectX-8主机通道适配器(H用于操作系统存储的M.2NVMe硬盘以及四个E1.SNVMe存储设备(通常用作高速本地缓存)。NVIDIA企业级RA NVIDIA处理器,共配备72个ARMNeoverseV2核心,通过NVLinkC2C接口连接,并TBLPDDR5主内存。2NVIDIAB300GPU,配备总计1,152GB的HBM4NVIDIAConnectX-8夹层板,每块配备2个ConnectX-8网络2双端口QSFP112NVIDIABlueField-31平面节点的高可用性(HA)功能,以确保企业客户的系统可靠性。在本企业级方案中,我们假设控制平面由12个管理节点组成,能够为大型企业的部署提供足够的容量和高可用性。表2表2管理节点组件(x86控制节点)中央处理器NVIDIA企业级RA2026年3月|9日操作系统:2×960GBM.2或SATA/SAS固态硬盘,软件RAID1数据缓存驱动器存储/带内网络适配器4个ConnectX-7200G单端口设备平台安全性TPM2.0、SHA-256及安全启采用独立连接的主机BMC设备,支持Redfish1.4及版本、通过SSH实现的LAN串行通信、IPv6支持功能,并支持通过Redfish协议在带内发现BMC的IP地址。2个1Gb/s带内端口表3管理节点组件(ARM控制节点)组件系统内存操作系统:2×960GBM.2或SATA/SAS固态硬盘,软件RAID1数据缓存驱动器存储/带内网络适配器4个ConnectX-7200G单端口设备平台安全性TPM2.0、SHA-256及安全启采用独立连接的主机BMC设备,支持Redfish1.4及版本、通过SSH实现的LAN串行通信、IPv6支持功能,并支持通过Redfish协议在带内发现BMC的IP地址。2个1Gb/s带内端口NVIDIANVLinkNVIDIABlackwell架构引入了第五代NVLink技术,每块GPU可提供高达1800GB/s的带宽——是上一代的两倍。同时,新推出的NVSwitch芯片和NVLink交换器进一步支持更大规模的NVLink域配置。这些组件共同实现了BlackwellGPU之间的高带宽通信,为实时、低成本的大规模模型推理带来了显著优势。NVIDIA企业级RA2026年3月|10日在人工智能云数据中心领域的专业经验,并优化了网络流量传输路径。·南北(客户与存储网络)流量:指GB300NVL72与所有外部资源之间的数据传输,包括云管理与编排系统、远程数据存储节点以及数据中心或互联网的其他组成部分。NVIDIA企业级RA2026年3月|11日GB300NVL72预集成了全面的网络堆栈设计,以优化东西向及南北向流量。每个计算托盘均配备ConnectX-8网络接口卡(NIC),提供800Gb/s传输速率;同时配备BlueField-3数据处理单元,最高可达400Gb/s。该配置确保了18个计算托盘之间以及数据进出系统时均实现高带宽、低延迟通信。此架构简化了部署流程,并保GB300NVL72机架内的每个托盘均配备四个双端口ConnectX-8超级网卡,用于GPU之间的(东/西向)流量传输。每个ConnectX-8超级网卡可提供高达800Gb/s的低延迟网络连接速率,实现GPUDirect®及GPUDirectStorage存储技术,为AI集群内的GPU提供最高达800Gb/s的低延迟网络连接。对于部署以太网的数据中心,ConnectX-8具备多项创新功能——包括RoCE优化技术和多租户支持,这些特性在AI云环境中至关重要。此外,ConnectX-8还为VXLAN、NVGRE等覆盖层网络提供先进的硬件卸载方案,有助于降低CPU负载并提升网络效率。ConnectX-8不仅具备出色的传输速度,更通过先进的拥塞控制、基于遥测数据的路由机制以及服务质量(QoS)功能等特性显著提升网络性能,全面满足各类人工智能应用与训练需求。其内置硬件加速功能可支持IPSec和MACSec等加密协议的安全处理,将这些任务从CPU转移至专用硬件执行,从而确保系统性能稳定。采用NVIDIAB300平台的多节点部署应遵循以下针对每块GPUConnectX-8SuperNIC集成于基板上,保持1:1的GPU与NIC比例,以确保每个GPU都能获得最佳计算网络带宽总最小值•400GB/s(8个400GB/s以太推荐的总计算网络带宽•800GB/s(使用分线器的16个400GB/s以太网网卡)本节描述了GB300NVL72中北/南(North/SouNVIDIABlueField-3B3240是一款基于PCIe的数据处理单元(DPU),可处理约480Gb/s的总带NVIDIA企业级RA2026年3月|12日宽。该BlueField-3DPU专为北/南网络(如存储网络)优化,与专为东/西计算架构设计的ConnectX-8SuperNIC形成互补。•频段外资源调配:BlueField-3是专为数据中心控制平面设计的优化计算平台,支持自动化资源调配与弹性扩展功能。这使得GB300NVL72能根据需求波动动态调整资源规•存储加速:BlueField-3提供先进的存储加速功能,可优化数据存储访问效率。其创新的BlueFieldSNAP技术使远程存储设备能够发挥本地存储器的作用,从而提升存储性能并简化云操作流程。•安全基础设施:BlueField-3采用高度安全的零信任模式运行,独立于主机运行,显著提升了GB300NVL72平台的安全性。此外,BlueField-3还提供多种加速型安全服务BlueField-3B3240DPU集成于NVIDIAGB300NVL72平台后,可提供关键功能,显著提升资源管BlueField-3DPU支持三种运行模式,在本企业级RA系统中采用嵌入式功能(ECPF)或DPU络通信均先通过部署在DPUArm核心上的虚拟交换机控制平面处理,之后才传输至主机。为通过BlueFieldDPU安全地控制和管理NVIDIAGB300NVL72平台,NVIDIA在其Bl中集成了内置基板管理控制器(BMC)。该内置BMC支持使用包括RedfishAPI在内的标准工具对BlueField及NVIDIAGB300NVL72进行配置与管理,并配备外部可信根证书以确保BMC固件的安全性。BlueFieldBMC的主要接口为1Gb/s带外管理端口,可连接至数据中心及管理网NVIDIA企业级RA2026年3月|13日端口(图5),用于带内管理约为480Gb/s。企业级RA建议采用双端口配置以获得最佳性能和灵活性。每个计算托盘均配每个GB300计算托盘均配备一块中间层网络板(图6),用于构建计算(东/西向)网络。NVIDIA企业级RA2026年3月|14日企业级RA配置必须配备NVIDIA以太网互连模块。此类互连模块广泛采用可插拔式光收发器和NVIDIASN5610交换机(图7)共提供64个端口.每个端口速率为800Gbps.可为计算网络(东/西向)、客户网络与存储网络(北/南向)、带内管理以及企业级RA中的存储需求提供连接支持。NVIDIA企业级RA2026年3月|15日NVIDIASN2201交换机(图8)配备48个端口.可实现带外(OOB)管理的连接功能。OOB管NVIDIA企业级RA2026年3月|16日•带外管理网络本节将对每个网络进行讨论。计算架构(东-西方向)采用配备NVIDIASpectrum技术的交换机构建,采用完全非阻塞胖树拓扑结构,旨在为运行于GB300NVL72集群上的应用程序提供最高性能。该计算架构基于RDMA协议设计,采用叶脊式拓扑结构,可为应用程序实现网络中最短的传输跳数;各GPU通过各自的ConnectX-8网卡连接至优化型铁路式网络拓扑。这种设计能显著提升多GPU应用在机箱内部及跨机箱间的通信效率。叶片与脊柱结构设计可构建可扩展且可靠的网络,能够采用相同架构适配不同规模的集该计算架构旨在实现冗余设计、最大化带宽并降低服务器内部及机架内GPU互联所需的网络延迟。对于参数数量超过1920个B(假设采用FP4量化)的模型,需采用模型并行处理方并使用多于一个GB300NVL72机架托盘——这些托盘通过NVLink和NVSwitch技虽然每块GPU都配备专用的ConnectX-8超级网卡,但网卡与网络架构中的单个故障点(SPOF)之间的链路连接仍存在安全隐患。客户普遍采用负载均衡的多链路方案,既能充分发挥GPU带宽的全部容量,又能避免SPOF问题的发生。每个计算网络平面构成独立的网络架构,两平面间的容灾能力与负载均衡由主机端的NCCL模块负责实现。当某一平面无法提供GPU间连接时,流量将被导向备用平面;若两个平面均正常运行,则流量会通过NCCL实现跨平面均衡分配,充分利用两条链路的带宽资源。相较于仅具备“本地”流量感知能力且基于静态哈希分配(因熵值较低而不适用于AI工作负载)的LAG等其他L2/L3绑定方案,NCCL实现的负载均衡效率显著NVIDIA企业级RA2026年3月|17日双平面拓扑结构在本企业级RA架构中,我们采用了双平面拓扑结构。该拓扑结构涉及构建两个完全相同的平面,并分别连接至每个GPU接口。每个GPU通过ConnectX-8超级网卡提供800Gb/s带宽,因此双平面拓扑将接口划分为两个400Gb/s的接口组。每个此类接口均连接至不同的叶交换机,而每个叶交换机均属于独立的网络结构,作为该参考架构的一部分可扩展至1024个400Gb/s接口。GPU并不知晓这两个独立网络结构的存在(每个结构承载50%的流量仅能识别所有流量均件层面实现。发生故障或性能下降的平面所产生的影响与中断的企业RA系统采用了集成了存储与带内管理功能的融合网络,为企业提供灵活的存储资为共享存储提供高带宽,并通过融合网络连该方案独立于计算架构,可同时最大化存储性能与应用性能。每个计算托盘通过两个独立的400Gb/s端口连接至两台不同的交换机,而每个管理单元则通过四个200Gb/s端口连接至同一组交换机。该设计具备冗余性,并可实现每个节点高达40Gb/s的存储带宽。该架构基于以太网技术,支持融合以太网上的RDMA(RoCE并在每个计算托盘中采用该系统具有灵活性,可根据特定容量和带宽需求进行扩展。采用支持租户隔离的混合存储架构设计,可为每个租户同时提供共享存储和专用存储资NVIDIA企业级RA2026年3月|18日OOB管理网络连接了所有基础管理控制器(BMC)端口以及其他需要与系统用户物理隔离的设备,以实现基础设施管理。这包括1个Gb/s交换机管理端口和BlueField-3DPU管理端NVIDIA企业级RA2026年3月|19日该企业级RA采用脊叶网络架构,为表4所示的应用场景和需求提供物理网络结构。织物角色持纯粹的推理CPU融合技术存储支持服务器OOB管理GPU计算(东/西)网络是一种基于RDMA的叶脊架卡(SuperNIC)采用轨道优化网络拓扑进行连接。该设计可为计算节点内部及节点间的多GPU应用实现最高效的通信。在以下针对小型化设计的架构中,计算网络结构已与融合网针对规模较大的网络设计场景,由于需要处理大量终端节点,ComputeFabric采用了超级脊线、主干脊线及叶节点的网络架构。该架构不仅旨在满足所需的设计需求,还能确保系CPUConverged(北/南)网络通过两个400Gb/s端口连接至两台独立交换机,以实现冗余•存储连接NVIDIA企业级RA2026年3月|20该网络专门为存储基础设施提供融合式连接。存储设备主要接入此网络,并可根据需求通过CPU计算网络传输至各托盘/节点。•客户网络连接通常,这是一种上游连接,用于将集群接入企业客户的整体网络基础设施。该连接配置可•支持服务器网络配置•面向基础设施的带外管理网络所有基础设施均需管理。该网络为所有节点提供1GbRJ45连接的大规模集中管理功能,并采用低成本的集中管理交换机。这些交换机与核心网络基础设施建立上行连接,从而实现注:VLAN隔离技术可用于在单一物理网络架构上实现各网上述架构的例外情况适用于较小规模的集群布局,此时采用了折叠式脊叶结构设计。计算节点(托盘)。每个SU都是独立的计算实体,其规模与网络设备的端口可用性直接相NVIDIA企业级RA2026年3月|21日图10:连接至计算架构中两个平面(各含4条轨道)的18托盘SU系统示意图·对于计算(东/西)网络架构:共配置18个机架,每个机架配备4块单端口NVIDIA·对于融合(南北)架构:共18个托盘,每个托盘配备1块B3240DPU,提供2条400·对于带外管理架构,共配置18个托盘,每个托盘配备3个1Gb/s连接端口,NVIDIA企业级RA2026年3月|22日脊柱叶状网络结构网络架构采用配备NVIDIASpectrum-X以太网技术的交换机,构建为完全非阻塞型胖树拓扑结构,旨在为基于EnterpriseRA配置运行的应用程序提供最高性能。该网络采用符合RDMA标准的叶脊架构,各GPU通过各自的SuperNIC采用轨道优化网络拓扑进行连接。此设计可实现多GPU应用在节点内部及节点间的最高效通信。叶片与脊柱结构的设计使得该网络具备可扩展性与可靠性,能够采用相同架构适配不同规模的集群。该计算网络旨在最大化带宽并最小化连接服务器内部及铁路沿线GP除支持的计算架构外,融合式脊叶网络还具备以下特•提供高带宽、高性能的存储服务,并可连接至数据中心网络。•每个计算与管理节点均通过两个400Gb/s端口连接至两台独立交换机,以实现冗余•交换机的OOB管理端口该OOB网络还可连接其他出于安全考虑需物理隔离管理连接的设备。SN2201用于连接这些组件的BMC/OOB1Gb/s端口。可通过部署25Gb/s或100Gb/s的脊层来扩展该网络,以连接SN优化后的用例该架构针对推理和训练两种使用场景均进行了优化。部署此单一架构即可支持这两种工作负载类型。采用Spectrum-X800Gbps构建计算网络架构的企业级GB300NVL72企业RA系统的各组件如表5所NVIDIA企业级RA2026年3月|23日服务器以太网面料表5GB300NVL72服务器以太网面料组件每个GB300NVL计算托盘均经过以下配•一台NVIDIABlueFiel•四块NVIDIAConnectX-8超级网卡,每块均为双端口设计,传输速率为800Gb/s;这些适配器每个端口的运行速率均为2×400Gb/s。计算(东/西)脊叶织物汇聚式(南北向)脊叶织物NVIDIA企业级RA2026年3月|24日计算(东/西节点)结构表下表6展示了针对不同SU规模的双平面计算(东/西节点)网络架构所需电缆和交换机的数表6计算节点(东/西方向节点)及交换机组件数量28448986汇聚型(节点南北向)结构表下表7展示了针对不同SU尺寸的融合(北/南节点)网络结构所需电缆和交换机的数量。表7:汇聚节点(北/南方向)与交换组件数量ConvergedNetworkA228444248748NVIDIA企业级RA2026年3月|25日2机架式结构,共包含36个托盘,每个托盘配备144块BlackwellUltraGPU。·基础设施支持从1个扩展至2个服务单元(SU);叶交换机的配置密度刻意降低,以符网络设计连接性(在最佳条件下)·每个计算单元(SU)可提供144条、每条带宽为400Gbit/s的上行链路,用于传输GPU计算流量。NVIDIA企业级RA2026年3月|26日•为客户提供网络连接接口(支持36个100G/200G端口,每块GPU至少需配备25Gb带宽)•18个100G/200G存储接口(每块GPU至少需要12.5Gb带宽)计算织物设计•双平面光谱结构面料可确保高可用性、优异的抗冲击性能及均衡的负载分布。•每个平面均使用4个叶片开关,这些开关在所有托盘中均分配至相同的GPU位置(例•平面2镜像平面1以提供冗余性和吞吐量稳定性•ConnectX_8800Gb端口被划分为两条400Gb链路;每块GPU均配备两条400Gb传输路径•推荐使用双端口光学组件,以简化Conne•采用每台交换机通过两条100Gb/s连接接入核心网络的架构,构建具备高可用性的100•所有节点均连接至1Gb管理交换机,这些交换机又与核心管理网络相连。•VLAN隔离技术用于隔离坍缩物理基础设施内的各类南北向及东西向网络架构。•默认机架布局可在每个机柜内提供电源冗余;若无法实现,则应考虑采用其他机架布局•采用低密度港口布局策略并合理利用突破性布局,既为未来的扩展能力预留空间,又确保运营系统的韧性。NVIDIA企业级RAPlane1·设计参考内容涉及开关、收发器及电缆的要求,具体详见相关物料清单表(表6和表7)中的汇总说明。网络设计·叶片交换机最多可支持三个机架,但其配置数量经过刻意精简,仅适用于两个机架以连接性(在最佳条件下)NVIDIA企业级RA2026年3月|28日计算织物设计•NodeE_W网络的频谱计算架构采用64_port交换机构建完整的脊叶拓扑结•双平面Spectrum架构可为GPU流量提供高可用性、强弹性及负载均衡能•每个平面均配备4个叶片开关;所有托盘中的各叶片均连接至同一GPU位置(例如:•平面2与平面1相互镜像,每个ConnectX_8的800Gb端口均划分成两条400Gb链路,确保每块GPU都能获得专用的400Gb连接。•建议在ConnectX_8OSFP端口使用双端口光学接口以简化线路分配,具体细节请参•采用每台管理交换机通过两条100Gb/s连接与核心网络相连的架构,构建具备高可用性•所有节点均连接至1Gb管理交换机,这些交换机随后通过上行链路接入核心网络。•Per_SU管理系统采用两台SN2201交换机;在四机架架构中,共配置八台SN2201交换•VLAN隔离技术应用于共享底层物理基础设施的融合式NodeNorth_South网络架•默认机架布局可在每个机架内实现电源冗余;若无法满足此要求,则应考虑采用其他机架布局方案。NVIDIA企业级RA2026年3月|29日8机架:144个托盘,配备576块BlackwellUltraGPU·开关、收发器及电缆的相关要求详见配套材料清单表(表6和表7)。网络设计·对于大规模部署场景(约1024个节点及以上),需引入超级主干层以确保非阻塞型点连接性(在最佳条件下)NVIDIA企业级RA2026年3月|30日•每个服务单元(SU)可提供36条、每条带宽为400Gbit/s的上行链路,用于传输CPU流量。•最多支持12个服务器节点,所有节点均采用200Gb速率的四通道连接。•提供144个100G/200G接口,可连接至客户网络(每块GPU最低带宽要求为25Gb)。•提供72个100G/200G存储接口(每块GPU至少需配备12.5Gb带宽)。计算织物设计•NodeE_W网络专用的Spectrum网卡采用64_port交换机构建完整的超级主干-主干-叶节点拓扑结构,具备轨道优化特性且无阻塞性能。•双平面Spectrum架构可为GPU流量提供高可用性、强弹性及负载均衡能•每个平面均采用4个叶片开关;所有托盘中的各叶片均连接至同一GPU位置(例如:•第2平面与第1平面相互镜像,每个ConnectX_8的800Gb端口均划分为两个400Gb连•NVIDIA建议在ConnectX_8OSFP端口使用双端口光纤,以简化信号分配,具体方法•采用每台管理交换机均通过两条100Gb/s连接与核心网络相连的架构,构建具备高可用•所有节点均连接至1Gb管理交换机,这些交换机随后通过上行链路接入核心网络。•Per_SU管理系统采用两台SN2201交换机;在八机架架构中,共配置16台SN2201交换机,每台均通过两条100G链路与核心网相连。•VLAN隔离技术应用于共享底层物理基础设施的融合型南北网络架构中。•默认机架布局可在每个机架内提供电源冗余;若无法实现此功能,则应考虑采用其他机架布局方案。NVIDIA企业级RA2026年3月|31日基础设施软件是NVIDIA企业参考架构的关键组成部分,为大规模部署奠定基础。所包含的软件(表8)从上到下均针对人工智能进行优化,堆栈中的每个组件均旨在最大化企业参考架构的性能与价值。组件描述NVIDIA人工智能企业一套专为人工智能开发与部署优化的人工智能及数据分析软件套件,提供业界领先的开发工具、可直接投入生产的容器以及用于快速部署人工智能工作负载的框架。NVIDIAMissionControl是一款软件解决方案,可自动化并全面管理人工智能数据中心运营的各个环节,涵盖从基础设施配置到开发人员工作负载的全过程。该方案能优化工作负载部署、协调任务执行并监控资源状态。NVIDIA动力机NVIDIADynamo是一款开源推理软件,可高效地协调管理大量GPU集群中的AI推理请求,并以最低成本和最高效率实现AI工厂中推理模型的规模化运行。一个通过在整个AI生命周期中实现动态编排来加速AI运营的编排平台。一套专为人工智能和HPC优化的GPU容器集合。NVIDIANetQ™一套高度可扩展的现代网络运维工具集,可实时提供网络架构的可见性、故障排查及验证功能。注:存储管理软件由存储合作伙伴提供,不属于企业NVIDIA企业级RA2026年3月|32成功的部署不仅需要先进的基础设施,更需要提供全面的服务来加速部署进程、确保系统可NVIDIA与全球合作伙伴紧密协作,旨在扩大服务覆盖范围、提升交付规模,并在实施与运营•路线图服务–开展现有基础设施评估,模拟未来容量情景,并制定分阶段计划,以指导•首个项目实施服务–执行首个数据中心架构或模块的初始部署(涵盖安装、配置、调试至正式投入运营的全过程)•托管服务——负责数据中心的持续监控、维护与优化工作,包括提供全天候支持、合•支持服务——通过提供专业指导并接入计算、软件及网络领域的NVIDIA专家资源,最大限度减少系统停机时间,确保最佳性能与可用性。•教育服务–为客户及合作伙伴提供在线培训与实践培训,传授深入专业知识,助力客户最大化其人工智能投资价值,并帮助合作伙伴培养深厚的人工智能专业能力。如需了解有关NVIDIA企业服务的更多信息,请访问/en-us/support/enterprise/services/。NVIDIA企业级RA2026年3月|33NVIDIA企业级RA是专为满足人工智能工厂日益严苛且不断增长的需求而设计的领先数据中心规模架构。该企业级RA架构正是NVIDIA用于内部AI模型训练及HPC研发的核心方案。本文所述的2-4-5-800网络拓扑结构专为NVIDIAGB300NVL72机架解决方案设计,采用Spectrum-X技术实现计算与融合连接的互联。这款企业级RA解决方案完整集成了实现高性能人工智能功能所需的所有硬件与软件系统。各组件的协同配合确保系统稳定运行、性能卓越,并助力用户突破技术前沿极限。该方案同时提供适用于双平面与单平面网络拓扑结构的配置指南,可适配多种部署场景需求。NVIDIA企业级RA2026年3月|34结点GB300NVL72机架中配备的独立硬件托盘,可支持裸机操作系统设备的物理布局,例如垂直机柜中的服务器或交换机开放计算项目(OCP)机架该机架基于开放计算项目(OpenComputeProject)制定的OpenRackV3标准,垂直空间被划分为48毫米单元(OU电源通过电源柜、直流母线及交流电源线进行分配。电子工业联盟(EIA)机架传统的“企业级”机架最初基于EIA-310-D标准设计,其垂直空间被划分为44.45毫米机架单元(RU电源通过机架电源分配单元(rPDU)及交流电源进行分配。集成至GB300NVL72解决方案中的系统之一,通常为“节点”或“NVSwitch”(可包含1-2个NVSwitch专用集成电路直接安装于机架内。热空气隔离(HAC)指一组排风口均通向同一热空气收集区域的机架,通常由两排相对布置的机架组成。NVLink交换器专用集成电路具有特定逻辑端口数量的硅基构建模块,用于驱动网络拓扑结构全局织物管理器(GFM)管理NVLink域架构的外部服务NVLink域由单个多节点NVLink网络结构连接而成的完整节点集合NVLink数据块位于NVLink域内、分配给同一作业的一组节点。单个作业可将多个数据块分配至多个域中。NVLink分区这是NVLink域内的一组节点结构,这些节点仅能相互访问对方的GPU内存。一个分区可配置为整个域,或同一域内可存在多个分区。使用分区机制可防止一个分区上的任务运行受到其他分区的影响。分区通过调用GFM的API进行设置。NVIDIA企业级RA2026年3月|35本附录提供了关于计算托盘及网络配置的相关信息。表10显示了GB300计算托盘的要求组件配备2个NVIDIAGrace(C2)芯片,共计72个ARMNeoverseV2核心通过NVLinkC2C接口连接。系统内存1TB级集成CPU的LPDDR5主内存1块2TBGen4M.2接口固态硬盘,适用于操作系统数据缓存驱动器8块4TBE1.S型数据缓存SSD配备4个NVIDIABlackwellUltraGPU,总HBM3内存容量达720GB计算网络适配器2块NVIDIA夹层板,每块均配备2个ConnectX-8800存储/带内网络适配器1个双端口QSFP112NVIDIABlueField-3DPU,工作速率为40
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 甘肃省定西市名校2027届九年级物理第一学期期末质量检测模拟试题含解析
- 广西北部湾经济区2027届化学九年级第一学期期末联考试题含解析
- (新)工程造价咨询委托合同
- 七年级数学上册第7章可能性概率课件北师大版
- 2027届安徽省合肥五十中学(新学校和南学校)化学九年级第一学期期中质量检测试题含解析
- 补漆工培训问答题目及答案
- 2027届广东省高州市谢鸡镇九年级物理第一学期期末教学质量检测试题含解析
- 创业能力测试题及对应答案
- 2027届山东省菏泽市郓城一中学化学九年级第一学期期末达标检测模拟试题含解析
- 河北省永清县2027届九年级化学第一学期期中监测试题含解析
- 设备管理技术培训课件
- 管道焊接专项施工计划
- 集装箱活动板房施工方案
- 一体化消防泵房水池施工方案
- 脊柱骨折的急救处理措施
- 兼职安全员培训证课件
- 中国2型糖尿病运动治疗指南(2024版)
- CJ/T 283-2017偏心半球阀
- 2026届高中语文一轮复习板块五 文言文阅读 考点突破学案27 理解文言实词(一)-词分古今义究源流 (共107张) +学案+练习(含解析)
- 超市员工档案管理制度
- 高考英语3500词顺序版
评论
0/150
提交评论