计算机行业市场前景及投资研究报告:超节点万卡一机灵衢铸基_第1页
计算机行业市场前景及投资研究报告:超节点万卡一机灵衢铸基_第2页
计算机行业市场前景及投资研究报告:超节点万卡一机灵衢铸基_第3页
计算机行业市场前景及投资研究报告:超节点万卡一机灵衢铸基_第4页
计算机行业市场前景及投资研究报告:超节点万卡一机灵衢铸基_第5页
已阅读5页,还剩24页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

证券研究报告万卡一机,灵衢铸基——超节点系列报告(一)行业评级:看好2026年7月20日核心观点◼

大模型持续进化与国产芯片制程受限,共同推动超节点成为关键架构路径。(1)供给侧,先进制程、HBM等关键环节仍受约束,国产AI芯片短期内较难单纯依靠制程升级和单芯片性能提升追赶国际领先水平。(2)需求侧,LLM正向万亿参数、MoE稀疏架构、长上下文和多模态持续演进,单机已无法容纳完整模型及其计算和内存资源,必须依靠大规模多卡并行。(3)系统侧,过去约8年单节点计算能力增长约40倍,而节点间通信带宽仅增长约4—8倍;MoE-2T模型中TP与SP通信合计占训练流量的96.98%,传统Scale-out架构逐渐面临通信墙、内存墙和利用率瓶颈。超节点通过Scale-up高速互联将数百至数千颗芯片组织成一台逻辑计算机,以系统级协同满足LLM演进需求并弥补国产单芯片差距。◼已形成以灵衢UB2.0为底座的全层级超节点产品矩阵。(1)商业验证方面,Atlas

900

A3以384卡完成规模化落地,截至2026年二季度累计部署超过750套、服务超过2,000家政企客户。(2)产品覆盖方面,Atlas

950

SuperPoD将单一Scale-up域扩展至8,192卡,并可组成52.4万卡的Atlas

950

SuperCluster;另一方面,Atlas

850E支持单个风冷超节点扩展,大幅降低企业AI算力部署门槛与成本。(3)技术底座方面,灵衢UB2.0统一连接CPU、NPU、内存、DPU及交换设备,通过统一编址、平等协同、资源池化、分层FullMesh拓扑和APR多路径路由,降低协议转换与跨卡通信开销,使大量计算卡像一台逻辑计算机协同运行。◼

Atlas

950

SuperPoD实现了超节点从百卡向万卡级Scale-up域的关键跃迁。(1)Atlas

950

SuperPoD单系统支持8,192颗Ascend

950DT,FP8算力达到8EFLOPS,片上内存总容量达到1,152TB,系统互联带宽达到16.3PB/s。相比NVL144,Atlas

950超节点卡的规模是其56.8倍,总算力是其6.7倍,内存容量是其15倍,互联带宽是其62倍。(2)灵衢UB2.0是Atlas

950实现万卡级Scale-up的核心底座。UB白皮书指出,大模型TP与SP通信合计约占总通信流量的97%,具有明显的近距离局部性;UB-Mesh通过分层FullMesh拓扑让带宽随流量局部性分配,并结合统一互联协议、APR多路径路由、集合通信优化和故障自愈,使高频通信尽量在近端高带宽域完成。白皮书评估显示,UB-Mesh在多个LLM训练任务中可实现95%以上的线性度,在性能接近传统Clos网络的同时,成本效益达到其约2.04倍、可用性提高7.2个百分点,从而支撑Atlas

950将8,192颗NPU组织成一台逻辑计算机。◼

超节点产业化将同步拉动芯片制造、先进封装和整机交付需求。(1)算力芯片价值链关注海光信息、寒武纪、北方华创、中微公司、拓荆科技、华海清科、(2)

整机及系统相关标的关注软通动力、超聚变、神州数码、华勤技术、工业富联、广电运通等。(3)其他国产超节点及智算平台关注紫光股份、

通讯、中科曙光、浪潮信息和阿里巴巴等。◼

风险提示:核心技术与产品交付风险;市场需求与商业化风险;供应链及产业链映射风险。、华虹公司、盛合晶微和斯迪克等。201算力约束系统重构3为何选择超节点:供给约束+负载变化→把竞争推向系统层■

供给侧——须在可获得的芯片工艺上创造系统增量供给侧:算力可持续必须建立在实际可获得的芯片工艺上英伟达和昇腾芯片指标对比“中国半导体制造工艺将在相当长时间处于落后状态;可持续的算力只能基于实际可获得的芯片制造工艺。”时间2025

Q1品牌芯片型号

FP8算力910CFP4算力

FP16算力

内存容量

内存带宽800Ascend——128GB3.2TB/s—

徐直军,全联接大会2025TFLOPS192GBHBM3e2024

Q4—2025NVIDIAAscendB2004.5PFLOPS

9PFLOPS

4.5PFLOPS8TB/s可获得的制造工艺现实起点行业催化竞争单位2026

Q1950PR1PFLOPS

2PFLOPS—128GB1.6TB/s约束单芯片演进速度↓288GBHBM3e2025

H2—2026NVIDIAB3007PFLOPS

15PFLOPS

4.5PFLOPS8TB/sAI需求仍持续增长单颗芯片无法独立承载2026

Q42026

H22027

Q42027

H22028

Q4AscendNVIDIAAscendNVIDIAAscend950DT1PFLOPS

2PFLOPS—144GB4TB/s↓288GBHBM4Rubin

R100

16PFLOPS

50PFLOPS

8PFLOPS22TB/s9.6TB/s约32TB/s14.4TB/s算力、内存、互联、软件必须联合优化9602

PFLOPS

4PFLOPS—288GB↓约32100约16PFLOPS384GBHBM4eRubin

UltraPFLOPSPFLOPS“超节点

+

集群”把增量转向系统层架构答案9704

PFLOPS

8PFLOPS—288GB资料:全联接大会2025徐直军主题演讲,英伟达官网,浙商证券研究所整理为何选择超节点:供给约束+负载变化→把竞争推向系统层■

负载侧——让通信、访存和资源编排成为Token产出的共同瓶颈训练结果:同样约2000卡,单卡训练性能指数随超节点规模提升负载侧:MoE、长上下文与P/D分化改变资源需求■

约2000卡仿真中,256卡超节点单卡训练性能较8卡服务器高15%。总参数→单Token激活参数E1E2E3E4E5E6MoEE7E8E9E10E11E12■

64/128/256卡收益趋平,说明不是无限堆卡,而是寻找模型并行、互联成本和规模效率的最优Scale-Up域。稀疏激活降低计算量,却增加专家路由、同步与All-to-All通信长上下文∝KVCache容量

并发用户数上下文扩展同时抬升Attention计算量与KV缓存容量,数据放置和访问方式成为系统约束8年变化:算力增长远快于通信,系统瓶颈从单芯片转向多芯片协同■

近8年单节点算力约增长40倍,而节点间通信带宽仅增长约4-8倍。P/D同一模型的不同阶段,资源瓶颈方向相反■

Prefill需并行处理输入序列,核心约束更多来自计算能力;■

Decode

则以自回归方式逐Token生成,对内存带宽和互联能力更为敏感。若仍沿用CPU、NPU、内存与网络资源固定绑定的节点架构,则计算密集阶段可能受制于算力不足,而生成阶段则可能受制于访存与通信。■

当模型被切到多卡后,All-Reduce、All-to-All、KV

Cache搬运会把等待时间放大。超节点的价值正在于扩大资源协同边界,使计算、内存与互联能够围绕实时负载进行更高效的统一调度。■

传统Scale-Out更适合松耦合任务;大模型并行训练/推理要求更接近“单机内部总线”的协同效率。有效Token产出并非由单一算力指标决定,而是算力、内存容量与带宽、互联、资源编排及可靠性共同作用的系统工程问题5资料:HUAWEI

UB

White

Paper(2025),浙商证券研究所整理02超节点6Atlas

950

SuperPoD

超节点矩阵亮相WAIC◼

Atlas

950SuperPoD昇腾950超节点,为业界规模领先超节点,真机形态首次亮相

2026世界人工智能大会。➢支持8192颗Ascend

950DT芯片。满配包括由128个计算柜、32个互联柜,共计160个机柜组成,占地面积1000平方米左右,柜间采用全光互联。总算力大幅度提升,其中,FP8算力达到8EFLOPS,FP4算力达到16EFLOPS,互联带宽达到16PB/s。预计上市时间是2026年四季度。超节点系列覆盖全层级算力需求Atlas

950

SuperCluster52.4万计算卡,DCN

网络互联,总算力高达

524

EFLOPS

(FP8)Atlas

950

SuperPoD最高可达8,192

计算卡,灵衢2.0互联,总算力高达8EFLOPS

(FP8)×64Scale

-out核心定位:单一

Scale-up

垂直扩展域,面向超大规模AI训练的全液冷旗舰方案适配场景:万亿参数大模型训练、AIfor

Science、多模态基础模型研发。核心定位:面向海量

AI算力需求的

Scale-out智算集群。适配场景:

万亿参数大模型训练、AIforScience、国家级

AI

基础设施把超节点继续集群化双线产品分层,降低落地成本Atlas

850E企业级普惠型智算超节点,支持单个风冷超节点扩展至96卡商用部署核心定位:业界首个企业级风冷AI超节点,依托自研VCE相变散热技术与灵衢互联协议,支持风冷机房快速部署,实现把超节点技术部署到传统机房,大幅降低企业AI算力部署门槛与成本。适配场景:中小企业AI智能化升级、边缘计算中心建设、大模型推理与行业应用落地。资料:中国公众号、超节点行业发展报告、全联接大会2025徐直军主题演讲,浙商证券研究所整理走向万卡级超节点和52.4万卡集群◼

从芯片到集群的演进路径:2020

年起从单机8

卡Atlas

800

起步,经384

卡超节点技术验证,2026

WAIC

推出8192

卡万卡级

Atlas

950

SuperPoD,2027

年迭代至15488

卡Atlas960

SuperPoD,单集群规模实现数千倍扩容,目标支撑

52.4

万卡全域算力集群。20272028+20252026芯片层迭代910C芯片950PR950DT960芯片970芯片已规模交付商用2026

Q12026

Q42027

Q42028+

远期规划单超节点演进Atlas

950单节点

8,192

卡|

万卡级Atlas

960单节点

15,488

卡|

倍增Atlas

900A3单节点

384

卡|

已商用集群规模跃升Atlas

950

集群Atlas

960

集群52.4万卡

|

超大规模突破>100万卡

|

迈入百万卡级产品HBM容量

计算柜

互联柜

单机柜卡

FP16算力

FP8算力FP4算力互联带宽

训练吞吐量推理吞吐量面积288.7/307.2D2D双向Atlas

900A348TiB124326488--约0.29mnTPS4.91mnTPS约0.74mnTPS19.6mnTPS-PFLOPS784GB/sAtlas

9501152TiB4460TiB1281763244-8E

FLOPS16EFLOPS16PB/s1000平方米2200平方米SuperPoDAtlas

960-30EFLOPS

60EFLOPS34PB/s约15.9mnTPS约50.6mnTPSSuperPoD注:部分数据未披露统一口径用-表示资料:全联接大会2025徐直军主题演讲,浙商证券研究所整理Atlas

900A3:产品-交付-生态产业化闭环初步形成◼

基于灵衢

1.0的Atlas

900超节点自2025

年3月开始交付,到2026

年Q2

已商用部署750多套,灵衢1.0技术得到充分验证。Atlas

900已完成产品定义、规模化交付到生态服务的全链路闭环验证,是当前领先的国产AI超节点产品之一。Atlas

900

A3

SuperPod交付侧

产业化实际触点服务与生态

系统能力延伸由12个算力机柜

+

4

个总线级机柜组成,实现资源池高速互联,打破单机柜限制,像一台超级计算机协同工作。CloudMatrix

云服务Atlas900A3SuperPod于2025年3月开始交付将超节点算力通过云服务形式输出,代表产品CloudMatrix384为业界首个384卡逻辑超节点云实例,实现超节点上云与弹性调度。750+

套

Atlas

900累计部署量48

TiB

784

GB/s

200

nsCANN软件栈开源底层计算架构接口开源,社区上线

个67(至2026年Q2)片上内存统一编址D2D

双向通信单跳超低时延互联带宽项目,开源代码超万行,月活跃开12442000+

家

政企核心客户发者3500+

6,日均代码下载量达

万次。持续扩展生态协同边界。昇腾/超节点相对传统AI服务器、改造前训练或推理架构的对比MFU训练周期推理成本推理时延37.3%→55.9%3周→1周-40%~-50%30-50ms→15msA3超节点vs传统AI服务器昇腾384超节点vs原MoE训练超节点MoE推理

vs

原/业界方案超节点MoE推理

vs

原业务延迟资料:中国公众号,注:底部四项均来自《超节点发展报告》案例披露,浙商证券研究所整理Atlas950

SuperPoD较Atlas900A3全方位升级◼

Atlas

950

SuperPoD在算力、内存容量、内存访问速度、互联带宽等能力的大幅度增强,为大模型训练性能和推理吞吐带来显著提升。相比已经推出的Atlas

900超节点,Atlas950超节点的训练性能提升17倍,达到4.91M

TPS。通过支持FP4数据格式,Atlas950超节点的推理性能提升达26.5倍,达到19.6M

TPS。8,192Atlas9501,152Atlas95001NPU数量(张)02总HBM容量(TiB)21.3×59×24×384Atlas900

A348Atlas900

A316Atlas95003系统互联带宽

(PB/s)04性能提升倍数对比多维差异NPU规模训练TPS推理TPS21.3×17.0×0.27Atlas900

A326.5×10资料:全联接大会2025徐直军主题演讲,发布会,浙商证券研究所整理Atlas

950

SuperPoD对标英伟达◼

对标数据显示,Atlas

950

SuperPoD的系统规模、内存容量与总互联能力在规模与带宽维度领先,Atlas

950在AI芯片规模和互联带宽上领先幅度最大,推理吞吐达19.6mn

TPS。全球最强超节点Atlas

950

SuperPoD

,大幅领先英伟达56.8x62x6.7x15x规模(NPUs)FP8算力(EFLOPS)内存容量

(TB)互联带宽

(PB/s)8,19281,152164.83655761.51.2144750.26NVIDIANVL144NVIDIANVL576Atlas

950SuperPoD资料:发布会,浙商证券研究所03灵衢互联底座12LLM

通信高度局部:TP

与

SP

合计约占

97%论文基于内部

MoE-2T

模型的流量拆解;不同模型比例可能略有差异,但同样体现强局部性◼设计含义:不再为所有节点提供对称带宽;高带宽优先服务最常发生的短距离通信。TP

+

SP:高频、近距离、适合留在

8-64

个相邻

NPU的高带宽域各并行方式的通信模式并行术语专业解释单次传输数据量

总传输次数总通信量流量占比TP张量并行:将同一层的权重矩阵和计算任务切分到多张卡,完成后合并结果360

MB4,9921,775

GB52.90%TensorParallelismSP沿序列维度切分Token和中间激活,不同设180/360

MB4,992/1,6641,462.5

GB51.19

GB44.08%1.54%Sequence

Parallelism备处理不同序列片段EP将MoE模型的不同专家分布到不同设备,由Router完成Token的分发和回收10.5

MB192

MB4,99226Expert

Parallelism该图以三维方块阵列展示

LLM

训练中五种并行技术的关系——DP(DataParallel,数据并行)、SP(Sequence

Parallel,序列并行)、PP(PipelineParallel,流水线并行)、EP(Expert

Parallel,专家并行)与

TP(TensorParallel,张量并行)。PP按模型深度将不同层分配到不同设备,4.875

GB44.48

GB0.14%1.34%PipelineParallelismMicro-batch依次流过各阶段DP每个设备保存一份模型,处理不同数据批次,反向传播后同步梯度711.75

MB64每个小方块代表一个

NPU

上的计算分片,不同颜色箭头标示各并行维度上的数据切分与通信方向,直观说明训练任务是如何沿多个维度同时切分到大量

NPU

上的。DataParallelism96.98%总通信量构成:TP

52.90%SP

44.08%13高带宽本地通信长距离流量仅约

3%资料:HUAWEI

UB

WhitePaper(2025),浙商证券研究所整理UB-Mesh的核心结论:让带宽跟着流量局部性走,提升性价比◼UB-Mesh网络架构的两个优点:1)完美匹配大模型训练流量的局部性。2)大幅削减交换机、光模块硬件用量,降低单位成本。◼

性能上:与传统

Clos网络相比,UB-Mesh可以做到性能相近。◼

成本上:

UB-Mesh的成本效益达到传统Clos的2.04倍,以及7.2pcts

的可用性提升。UB-Mesh还在多个

LLM

训练任务上实现了

95%

以上的线性度。流量模式分层拓扑统一互联路由与训练自愈完整闭环TP/SP约97%近端粗

·远端细UB可分配

·

可池化APR+

集合通信

+

并行映射直接通知

+

64+1五层协同0102030405持续反馈优化让带宽跟着流量局部性走资本开支对比不同柜间互联的端到端性能对比CapEx阶段:节省的高性能交换机与长距离光缆/光模块;OpEx阶段:交换机与光模块用量的大幅减少。➢

相对性能:2D-FM(Shortest)、2D-FM(Detour)、2D-FM(Borrow)、2D-FM(Detour+Borrow)

与

Clos(均以Clos为

100%),各柱高度都在

99%~100%

附近,表明价格较低的

2D-FM柜间直连配合APR

路由策略即可达到与

Clos几乎一致的端到端训练性能。若将系统的成本效益定义为:成本效益

=平均性能

/(OpEx+CapEx),UB-Mesh可实现约

2.04倍的成本效益提升。序列长度256K下的线性度分析MTBF可用性估算可用性

=MTBF

/(MTBF

+MTTR)×

100%。其中平均无故障时间MTBF

=365×24/AFR(年化故障率);MTTR

为平均修复时间,按现有统计假设为

75

分钟➢

最终计算得UB-Mesh

的可用性为

98.8%,较

Clos的提升7.2pcts。➢

线性度

=(目标规模下的单NPU

性能)/(基准规模下的单

NPU

性能)×

100%横轴为归一化集群规模(1×

至64×),纵轴为线性度(85%~115%),不同模型上线性度始终保持在

95%

以上。14资料:HUAWEI

UB

White

Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化◼

UB支持超节点内所有组件全量平等协同。通过

Entity和

UMMU

实现统一编址和访问权限控制,使能计算资源平等互联访问。每个

UBEntity有一个唯一的身份标识

EID(Entity

ID),是全局通信的唯一标识。传统混合互联:资源跨边界必须不断换协议UB-Mesh

的主要构建模块NPU

:配备两个

UBIO

控制器,共提供

x72UB

通道。CPU:负责执行主机程序的

CPU

也配备一个

UBI/O

控制器,提供

UBx32I/OLRS:低基数交换机,低成本交换,UB

x72传统的基于

GPU的大语言模型训练系统

通常采用混合互连架构:CPU与

GPU、CPU

与网卡之间通过

PCIe互连;服务器内部的

GPU

之间通过

NVLink互连;服务器之间则通过

InfiniBand/RoCE

互连。HRS:高基数交换机,Pod级交换,UB

x512UB:一套互联语义连接异构资源UB

Domain:一个全部使用UB

Link连接起来的UBPU集合UB-Mesh的主要构建模块——UBProcessingUnit(UBPU):支持UB协议栈的处理单元,实现特定功能,包括:•

UBController:UBPU中执行UB协议栈的组件,并提供软硬件接口。UB同时支持:◼

同步操作:加载(Load)、存储(Store)和原子操作(Atomic)等;◼

异步操作:读取(Read)、写入(Write)和消息传递(Message)等;基于

UB,只需设计并实现一套统一的

UB

I/O

控制器,即可在

CPU、NPU

乃至

LRS交换机等不同模块中复用。•

UBMemoryManagement

Unit(UMMU):UBPU中执行内存地址翻译和访问权限控制的组件。资料:HUAWEI

UB

White

Paper(2025),浙商证券研究所整理15UB-Mesh

的硬件架构设计契合

LLM

训练的流量模式——解构Atlas

950

SuperPoD单板为1D,单Rack

架构2D◼

所有组件互连采用UB2.0灵衢技术,我们从UB-Mesh-Pod

来看950超节点架构——采用

4D-FullMesh

拓扑。1D单板2D单Rack✓

Rack为2D:64个NPU+16个CPU+1个备用NPU(18台LRS全互连成1个交换平面,共计72台

LRS)✓

Pod为4D:16个Rack构成◼SuperPod为nD:8个Pod的链接为Clos方式,不再用UB。◼

与

CPU、NPU同板的传统方案不同,这里二者是分离的:CPU

通过交换机连接NPU,从而支持灵活的

CPU/NPU配比单Pod

为4D:16个计算机柜,4个互联机柜Rack背面光缆4D-FullMesh

拓扑资料:HUAWEI

UB

White

Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化传统数据中心网络架构:Clos——多层交换机对称互连所有计算节点传统

Clos

架构:通过全局交换机(GlobalSwitch)、骨干交换机(SpineSwitch)、汇聚层(Aggregation)和机顶交换机(ToR)多层对称互连,流量分布均匀2D-FULLMesh+Clos混合拓扑示意✓

带宽分配:对称✓

互联介质:交换机+光电路✓

成本效益:低UB-Mesh

:nD-FullMesh

拓扑,短距离高频通信用UB,跨域拓展用Clos提出的

UB-Mesh

架构:按“单板(Board)→机柜(Rack)→行(Row)→组(Group)→Pod”分层局部化组织,L1/L2/L3

流量金字塔表示绝大部分流量集中在本地近距离范围✓

带宽分配:分层局部✓

互联介质:电缆/光缆✓

成本效益:高17资料:HUAWEI

UB

White

Paper(2025),基于灵衢的超节点参考架构白皮书,浙商证券研究所整理nD-FullMesh:高频走短链,跨层带宽递减1D、2D、3D……递归形成局部全互联域,并映射到板、机架、Pod、楼层等物理层级递归构建:相邻域继续组成更高一维的

FullMesh论文估算的链路构成短距无源电缆86.7%7.2%4.8%1.2%板级

1D机架

2DPod

4D更高维

nD有源电缆光缆(约百米)光缆(约千米)节点间直连局部高带宽域跨机架继续直连跨域带宽逐层收敛为什么有效0-2

跳:大多数

TP/

SP

传输可在局部直连域完成,减少数据移动距离。按维分配:每个维度的每节点带宽可按训练需求调整,不必全网对称。86.7%

为短距无源电缆18资料:HUAWEI

UB

White

Paper(2025),浙商证券研究所整理1K

NPU

以内用

4D-FullMesh,更大尺度回到

Clos当前实现是

4D-FullMesh

+Clos的混合架构,而不是整个数据中心全局满连当前实现的扩展边界4D-FullMesh:短距电直连HRS

/Clos:交换网络FullMesh

边界机架内

2DPod

内

4DPod

以上

Clos大尺度

DCN64NPU/机架1,024NPU/Pod8KNPU/SuperPod100K+NPU/DCN8

块板

×

8

NPUUB

x56

/

NPU16

个机架再叠加

2D-FullMeshUBx12

/

NPU多个

1K

Pod

由

HRS

连接UB交换机或

CPU板

NIC接入

Clos,主要承载大尺度DPUB

x4

/

NPU每个

NPU

的

UB

x72

I/O

如何分层分配(Fig.7)工程折中x56

机架内x12

Pod

内x44D:兼顾电缆距离、成本与云端切分x56

+x12

+x4

=x7219资料:HUAWEI

UB

White

Paper(2025),浙商证券研究所整理机架内每个

NPU

既是计算节点,也是路由节点8块

NPU板组成

64-NPU

2D-FullMesh;LRS负责汇聚、CPU/备份接入和跨机架输出64-NPU

机架的简化工作图四个关键事实8

×

8:八块板、每板八个

NPU,共

64

个常规NPU。NPU板

1NPU板

2NPU板

3NPU板

418×LRSNPU=

路由器:数据不必都先上大交换机;节点可承担间接转发。CPU

解耦:CPU

板与

NPU

板分离,比例与绑定关系可调整。2

CPU/备份8

常规NPUNPU

板

5NPU

板

6NPU

板

7NPU

板

8资源池化:CPU

/

NPU/

DDR

通过交换接入,提高利用率。8

跨机架基础模块的

UB

I/O

能力背板交换平面NPUCPULRSHRSx72x32x72x512CPU板备份

NPU被高亮的

NPU可直接转发:UB

IO

控制器具备路由能力直连负责主流量,LRS

负责必要的汇聚与弹性。20资料:HUAWEI

UB

White

Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化All-Path

Routing

面向

4D-FullMesh+Clos混合拓扑,拥塞或故障时可动态切换路径APR

不只走最短路:把闲置与绕行路径也纳入转发APR

的三个底层机制01

源路由(SR)ShortestPathFirstAll-Path

RoutingSS8-byte

紧凑头部携带逐跳指令,源端决定何时使用非最短路径。616102

结构化寻址

+线性查表5252按

Pod

/机架

/板划分地址段,以共享前缀与线性偏移缩小路由表。4D4D03

拓扑感知无死锁流控只用一条最短路径闲置链路无法贡献带宽多条可用路径并行故障

/

拥塞时切换TFC

用

2个虚拟通道(VL)支持全路径转发并规避环路死锁。输出:更高链路利用率

+

更强故障韧性21资料:HUAWEI

UB

White

Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化主路径优先留在局部全互联域;跨

Pod才进入

HRS/Clos,目的端可由

UBI/O

/

CCU

接收与归约一条消息如何穿过

UB-Mesh:先直达,必要时再绕行0102030405拓扑感知映射结构化目的地址局部直达APR

动态选路跨域与接收TP/SP

优先HRSCCUPRBNSD把

TP/SP

放进最近的高解析

Pod

/机架

/板

/优先

0-2跳的短距电连拥塞

/故障时使用绕行跨

Pod

才上

HRS/Clos;UB/CCU

完成接收带宽域NPU接路径正常路径局部直连优先,少数长距离通信逐层上收拥塞

/故障APR

切到非最短路径;论文的机架间评估还包含

Borrow

交换带宽策略工作方式的本质:软件先把大流量放对位置,网络再用直连与多路径把它送对地方。22资料:HUAWEI

UB

White

Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化AllReduce

借用闲置链路;All-to-All

同时沿多个维度发送,并可拆成分层广播与归约集合通信把

APR

的多路径能力转化为训练吞吐AllReduce:Multi-RingAll-to-All:多路径

+

分层23SAB14Y-FullMesh5D6X-FullMesh红:原始

Ring

1灰:借用闲置链路形成

Ring

2通用

All-to-All分层

Broadcast

+Reduce张量分成两份,同时沿

X

/

Y

维把

Token

分发

/

专家回收重写为1统一建模2映射多环3优化分片发送;最多一跳到达目标。分层操作,减少重复传输。节点、连接、带宽、时延保证逻辑路径不冲突按瓶颈分流吃满借入带宽CCU

硬件卸载UBI/O

内的集合通信单元可主动读写

HBM、发起传输、片上归约,并减少冗余数据拷贝。意义:网络提供多路径,通信库与

CCU

决定这些路径是否真正转化为吞吐。23资料:HUAWEI

UB

White

Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化仅有分层硬件还不够;错误映射会同时造成拥塞与带宽闲置调度也要懂拓扑:TP/

SP

放近,PP

/DP

放远把最“重”的通信放进最近的域三步搜索最优映射生成可行配置SuperPod

/

DCN:跨

Pod

交换域Pod:4D-FullMesh010203枚举

TP/SP/EP/PP/DP

组合并映射到集群机架内高带宽域计算通信成本模型同时考虑拓扑、APR

与集合通信行为TPSP

/CP选择最低开销EP迭代收敛到通信成本最小的并行方案PPDP优先级输出:通信开销最低的并行配置TP/SP

高PP/DP

低24资料:HUAWEI

UB

White

Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化直接通知缩短链路故障传播;64+1

备份用一跳重定向替代少卡运行两类故障、两条自愈链:链路改路,NPU

切备NPU

故障:激活

64+1

备份链路故障:直接通知受影响节点链路

1-3故障013571LRSB62246534NPU-3

故障预计算通信关系→直接通知节点6→APR切换路径原直连路径改为5→LRS→B增加一跳,但保留完整算力与带宽结构论文对

8K

NPU

网络模块的独立可靠性估算98.5h13.8h98.8%91.6%UB-Mesh

MTBFClos

MTBFUB-Mesh

可用性Clos

可用性25资料:HUAWEI

UB

White

Paper(2025),浙商证券研究所整理灵衢

Unified

Bus6

大特征×××××大规模组网×高可用性总线级互联平等×协同全量池化协议归一总线级互联:基于灵衢的总线级互联,提供百ns级同步内存语义访问时延和2~5

μs异步内存语义访问时延,满足算力单元高并发的访问需求;提供组件间TB/s级带宽,相比传统数据中心网络带宽至少提升10倍平等协同:基于灵衢的平等协同机制,支持超节点内所有组件去中心化的互相访问、调用和协同工作,提升组件间访存和通信性能全量池化:基于灵衢和Linux操作系统的灵衢扩展组件,提供超节点的设备管理、内存管理、通信和虚拟化等功能,支持超节点资源的高效池化

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论