版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
证券研究报告万卡一机,灵衢铸基——超节点系列报告(一)行业评级:看好2026年7月20日核心观点◼
大模型持续进化与国产芯片制程受限,共同推动超节点成为关键架构路径。(1)供给侧,先进制程、HBM等关键环节仍受约束,国产AI芯片短期内较难单纯依靠制程升级和单芯片性能提升追赶国际领先水平。(2)需求侧,LLM正向万亿参数、MoE稀疏架构、长上下文和多模态持续演进,单机已无法容纳完整模型及其计算和内存资源,必须依靠大规模多卡并行。(3)系统侧,过去约8年单节点计算能力增长约40倍,而节点间通信带宽仅增长约4—8倍;MoE-2T模型中TP与SP通信合计占训练流量的96.98%,传统Scale-out架构逐渐面临通信墙、内存墙和利用率瓶颈。超节点通过Scale-up高速互联将数百至数千颗芯片组织成一台逻辑计算机,以系统级协同满足LLM演进需求并弥补国产单芯片差距。◼已形成以灵衢UB2.0为底座的全层级超节点产品矩阵。(1)商业验证方面,Atlas
900
A3以384卡完成规模化落地,截至2026年二季度累计部署超过750套、服务超过2,000家政企客户。(2)产品覆盖方面,Atlas
950
SuperPoD将单一Scale-up域扩展至8,192卡,并可组成52.4万卡的Atlas
950
SuperCluster;另一方面,Atlas
850E支持单个风冷超节点扩展,大幅降低企业AI算力部署门槛与成本。(3)技术底座方面,灵衢UB2.0统一连接CPU、NPU、内存、DPU及交换设备,通过统一编址、平等协同、资源池化、分层FullMesh拓扑和APR多路径路由,降低协议转换与跨卡通信开销,使大量计算卡像一台逻辑计算机协同运行。◼
Atlas
950
SuperPoD实现了超节点从百卡向万卡级Scale-up域的关键跃迁。(1)Atlas
950
SuperPoD单系统支持8,192颗Ascend
950DT,FP8算力达到8EFLOPS,片上内存总容量达到1,152TB,系统互联带宽达到16.3PB/s。相比NVL144,Atlas
950超节点卡的规模是其56.8倍,总算力是其6.7倍,内存容量是其15倍,互联带宽是其62倍。(2)灵衢UB2.0是Atlas
950实现万卡级Scale-up的核心底座。UB白皮书指出,大模型TP与SP通信合计约占总通信流量的97%,具有明显的近距离局部性;UB-Mesh通过分层FullMesh拓扑让带宽随流量局部性分配,并结合统一互联协议、APR多路径路由、集合通信优化和故障自愈,使高频通信尽量在近端高带宽域完成。白皮书评估显示,UB-Mesh在多个LLM训练任务中可实现95%以上的线性度,在性能接近传统Clos网络的同时,成本效益达到其约2.04倍、可用性提高7.2个百分点,从而支撑Atlas
950将8,192颗NPU组织成一台逻辑计算机。◼
超节点产业化将同步拉动芯片制造、先进封装和整机交付需求。(1)算力芯片价值链关注海光信息、寒武纪、北方华创、中微公司、拓荆科技、华海清科、(2)
整机及系统相关标的关注软通动力、超聚变、神州数码、华勤技术、工业富联、广电运通等。(3)其他国产超节点及智算平台关注紫光股份、
通讯、中科曙光、浪潮信息和阿里巴巴等。◼
风险提示:核心技术与产品交付风险;市场需求与商业化风险;供应链及产业链映射风险。、华虹公司、盛合晶微和斯迪克等。201算力约束系统重构3为何选择超节点:供给约束+负载变化→把竞争推向系统层■
供给侧——须在可获得的芯片工艺上创造系统增量供给侧:算力可持续必须建立在实际可获得的芯片工艺上英伟达和昇腾芯片指标对比“中国半导体制造工艺将在相当长时间处于落后状态;可持续的算力只能基于实际可获得的芯片制造工艺。”时间2025
Q1品牌芯片型号
FP8算力910CFP4算力
FP16算力
内存容量
内存带宽800Ascend——128GB3.2TB/s—
徐直军,全联接大会2025TFLOPS192GBHBM3e2024
Q4—2025NVIDIAAscendB2004.5PFLOPS
9PFLOPS
4.5PFLOPS8TB/s可获得的制造工艺现实起点行业催化竞争单位2026
Q1950PR1PFLOPS
2PFLOPS—128GB1.6TB/s约束单芯片演进速度↓288GBHBM3e2025
H2—2026NVIDIAB3007PFLOPS
15PFLOPS
4.5PFLOPS8TB/sAI需求仍持续增长单颗芯片无法独立承载2026
Q42026
H22027
Q42027
H22028
Q4AscendNVIDIAAscendNVIDIAAscend950DT1PFLOPS
2PFLOPS—144GB4TB/s↓288GBHBM4Rubin
R100
16PFLOPS
50PFLOPS
8PFLOPS22TB/s9.6TB/s约32TB/s14.4TB/s算力、内存、互联、软件必须联合优化9602
PFLOPS
4PFLOPS—288GB↓约32100约16PFLOPS384GBHBM4eRubin
UltraPFLOPSPFLOPS“超节点
+
集群”把增量转向系统层架构答案9704
PFLOPS
8PFLOPS—288GB资料:全联接大会2025徐直军主题演讲,英伟达官网,浙商证券研究所整理为何选择超节点:供给约束+负载变化→把竞争推向系统层■
负载侧——让通信、访存和资源编排成为Token产出的共同瓶颈训练结果:同样约2000卡,单卡训练性能指数随超节点规模提升负载侧:MoE、长上下文与P/D分化改变资源需求■
约2000卡仿真中,256卡超节点单卡训练性能较8卡服务器高15%。总参数→单Token激活参数E1E2E3E4E5E6MoEE7E8E9E10E11E12■
64/128/256卡收益趋平,说明不是无限堆卡,而是寻找模型并行、互联成本和规模效率的最优Scale-Up域。稀疏激活降低计算量,却增加专家路由、同步与All-to-All通信长上下文∝KVCache容量
并发用户数上下文扩展同时抬升Attention计算量与KV缓存容量,数据放置和访问方式成为系统约束8年变化:算力增长远快于通信,系统瓶颈从单芯片转向多芯片协同■
近8年单节点算力约增长40倍,而节点间通信带宽仅增长约4-8倍。P/D同一模型的不同阶段,资源瓶颈方向相反■
Prefill需并行处理输入序列,核心约束更多来自计算能力;■
Decode
则以自回归方式逐Token生成,对内存带宽和互联能力更为敏感。若仍沿用CPU、NPU、内存与网络资源固定绑定的节点架构,则计算密集阶段可能受制于算力不足,而生成阶段则可能受制于访存与通信。■
当模型被切到多卡后,All-Reduce、All-to-All、KV
Cache搬运会把等待时间放大。超节点的价值正在于扩大资源协同边界,使计算、内存与互联能够围绕实时负载进行更高效的统一调度。■
传统Scale-Out更适合松耦合任务;大模型并行训练/推理要求更接近“单机内部总线”的协同效率。有效Token产出并非由单一算力指标决定,而是算力、内存容量与带宽、互联、资源编排及可靠性共同作用的系统工程问题5资料:HUAWEI
UB
White
Paper(2025),浙商证券研究所整理02超节点6Atlas
950
SuperPoD
超节点矩阵亮相WAIC◼
Atlas
950SuperPoD昇腾950超节点,为业界规模领先超节点,真机形态首次亮相
2026世界人工智能大会。➢支持8192颗Ascend
950DT芯片。满配包括由128个计算柜、32个互联柜,共计160个机柜组成,占地面积1000平方米左右,柜间采用全光互联。总算力大幅度提升,其中,FP8算力达到8EFLOPS,FP4算力达到16EFLOPS,互联带宽达到16PB/s。预计上市时间是2026年四季度。超节点系列覆盖全层级算力需求Atlas
950
SuperCluster52.4万计算卡,DCN
网络互联,总算力高达
524
EFLOPS
(FP8)Atlas
950
SuperPoD最高可达8,192
计算卡,灵衢2.0互联,总算力高达8EFLOPS
(FP8)×64Scale
-out核心定位:单一
Scale-up
垂直扩展域,面向超大规模AI训练的全液冷旗舰方案适配场景:万亿参数大模型训练、AIfor
Science、多模态基础模型研发。核心定位:面向海量
AI算力需求的
Scale-out智算集群。适配场景:
万亿参数大模型训练、AIforScience、国家级
AI
基础设施把超节点继续集群化双线产品分层,降低落地成本Atlas
850E企业级普惠型智算超节点,支持单个风冷超节点扩展至96卡商用部署核心定位:业界首个企业级风冷AI超节点,依托自研VCE相变散热技术与灵衢互联协议,支持风冷机房快速部署,实现把超节点技术部署到传统机房,大幅降低企业AI算力部署门槛与成本。适配场景:中小企业AI智能化升级、边缘计算中心建设、大模型推理与行业应用落地。资料:中国公众号、超节点行业发展报告、全联接大会2025徐直军主题演讲,浙商证券研究所整理走向万卡级超节点和52.4万卡集群◼
从芯片到集群的演进路径:2020
年起从单机8
卡Atlas
800
起步,经384
卡超节点技术验证,2026
WAIC
推出8192
卡万卡级
Atlas
950
SuperPoD,2027
年迭代至15488
卡Atlas960
SuperPoD,单集群规模实现数千倍扩容,目标支撑
52.4
万卡全域算力集群。20272028+20252026芯片层迭代910C芯片950PR950DT960芯片970芯片已规模交付商用2026
Q12026
Q42027
Q42028+
远期规划单超节点演进Atlas
950单节点
8,192
卡|
万卡级Atlas
960单节点
15,488
卡|
倍增Atlas
900A3单节点
384
卡|
已商用集群规模跃升Atlas
950
集群Atlas
960
集群52.4万卡
|
超大规模突破>100万卡
|
迈入百万卡级产品HBM容量
计算柜
互联柜
单机柜卡
FP16算力
FP8算力FP4算力互联带宽
训练吞吐量推理吞吐量面积288.7/307.2D2D双向Atlas
900A348TiB124326488--约0.29mnTPS4.91mnTPS约0.74mnTPS19.6mnTPS-PFLOPS784GB/sAtlas
9501152TiB4460TiB1281763244-8E
FLOPS16EFLOPS16PB/s1000平方米2200平方米SuperPoDAtlas
960-30EFLOPS
60EFLOPS34PB/s约15.9mnTPS约50.6mnTPSSuperPoD注:部分数据未披露统一口径用-表示资料:全联接大会2025徐直军主题演讲,浙商证券研究所整理Atlas
900A3:产品-交付-生态产业化闭环初步形成◼
基于灵衢
1.0的Atlas
900超节点自2025
年3月开始交付,到2026
年Q2
已商用部署750多套,灵衢1.0技术得到充分验证。Atlas
900已完成产品定义、规模化交付到生态服务的全链路闭环验证,是当前领先的国产AI超节点产品之一。Atlas
900
A3
SuperPod交付侧
产业化实际触点服务与生态
系统能力延伸由12个算力机柜
+
4
个总线级机柜组成,实现资源池高速互联,打破单机柜限制,像一台超级计算机协同工作。CloudMatrix
云服务Atlas900A3SuperPod于2025年3月开始交付将超节点算力通过云服务形式输出,代表产品CloudMatrix384为业界首个384卡逻辑超节点云实例,实现超节点上云与弹性调度。750+
套
Atlas
900累计部署量48
TiB
784
GB/s
200
nsCANN软件栈开源底层计算架构接口开源,社区上线
个67(至2026年Q2)片上内存统一编址D2D
双向通信单跳超低时延互联带宽项目,开源代码超万行,月活跃开12442000+
家
政企核心客户发者3500+
6,日均代码下载量达
万次。持续扩展生态协同边界。昇腾/超节点相对传统AI服务器、改造前训练或推理架构的对比MFU训练周期推理成本推理时延37.3%→55.9%3周→1周-40%~-50%30-50ms→15msA3超节点vs传统AI服务器昇腾384超节点vs原MoE训练超节点MoE推理
vs
原/业界方案超节点MoE推理
vs
原业务延迟资料:中国公众号,注:底部四项均来自《超节点发展报告》案例披露,浙商证券研究所整理Atlas950
SuperPoD较Atlas900A3全方位升级◼
Atlas
950
SuperPoD在算力、内存容量、内存访问速度、互联带宽等能力的大幅度增强,为大模型训练性能和推理吞吐带来显著提升。相比已经推出的Atlas
900超节点,Atlas950超节点的训练性能提升17倍,达到4.91M
TPS。通过支持FP4数据格式,Atlas950超节点的推理性能提升达26.5倍,达到19.6M
TPS。8,192Atlas9501,152Atlas95001NPU数量(张)02总HBM容量(TiB)21.3×59×24×384Atlas900
A348Atlas900
A316Atlas95003系统互联带宽
(PB/s)04性能提升倍数对比多维差异NPU规模训练TPS推理TPS21.3×17.0×0.27Atlas900
A326.5×10资料:全联接大会2025徐直军主题演讲,发布会,浙商证券研究所整理Atlas
950
SuperPoD对标英伟达◼
对标数据显示,Atlas
950
SuperPoD的系统规模、内存容量与总互联能力在规模与带宽维度领先,Atlas
950在AI芯片规模和互联带宽上领先幅度最大,推理吞吐达19.6mn
TPS。全球最强超节点Atlas
950
SuperPoD
,大幅领先英伟达56.8x62x6.7x15x规模(NPUs)FP8算力(EFLOPS)内存容量
(TB)互联带宽
(PB/s)8,19281,152164.83655761.51.2144750.26NVIDIANVL144NVIDIANVL576Atlas
950SuperPoD资料:发布会,浙商证券研究所03灵衢互联底座12LLM
通信高度局部:TP
与
SP
合计约占
97%论文基于内部
MoE-2T
模型的流量拆解;不同模型比例可能略有差异,但同样体现强局部性◼设计含义:不再为所有节点提供对称带宽;高带宽优先服务最常发生的短距离通信。TP
+
SP:高频、近距离、适合留在
8-64
个相邻
NPU的高带宽域各并行方式的通信模式并行术语专业解释单次传输数据量
总传输次数总通信量流量占比TP张量并行:将同一层的权重矩阵和计算任务切分到多张卡,完成后合并结果360
MB4,9921,775
GB52.90%TensorParallelismSP沿序列维度切分Token和中间激活,不同设180/360
MB4,992/1,6641,462.5
GB51.19
GB44.08%1.54%Sequence
Parallelism备处理不同序列片段EP将MoE模型的不同专家分布到不同设备,由Router完成Token的分发和回收10.5
MB192
MB4,99226Expert
Parallelism该图以三维方块阵列展示
LLM
训练中五种并行技术的关系——DP(DataParallel,数据并行)、SP(Sequence
Parallel,序列并行)、PP(PipelineParallel,流水线并行)、EP(Expert
Parallel,专家并行)与
TP(TensorParallel,张量并行)。PP按模型深度将不同层分配到不同设备,4.875
GB44.48
GB0.14%1.34%PipelineParallelismMicro-batch依次流过各阶段DP每个设备保存一份模型,处理不同数据批次,反向传播后同步梯度711.75
MB64每个小方块代表一个
NPU
上的计算分片,不同颜色箭头标示各并行维度上的数据切分与通信方向,直观说明训练任务是如何沿多个维度同时切分到大量
NPU
上的。DataParallelism96.98%总通信量构成:TP
52.90%SP
44.08%13高带宽本地通信长距离流量仅约
3%资料:HUAWEI
UB
WhitePaper(2025),浙商证券研究所整理UB-Mesh的核心结论:让带宽跟着流量局部性走,提升性价比◼UB-Mesh网络架构的两个优点:1)完美匹配大模型训练流量的局部性。2)大幅削减交换机、光模块硬件用量,降低单位成本。◼
性能上:与传统
Clos网络相比,UB-Mesh可以做到性能相近。◼
成本上:
UB-Mesh的成本效益达到传统Clos的2.04倍,以及7.2pcts
的可用性提升。UB-Mesh还在多个
LLM
训练任务上实现了
95%
以上的线性度。流量模式分层拓扑统一互联路由与训练自愈完整闭环TP/SP约97%近端粗
·远端细UB可分配
·
可池化APR+
集合通信
+
并行映射直接通知
+
64+1五层协同0102030405持续反馈优化让带宽跟着流量局部性走资本开支对比不同柜间互联的端到端性能对比CapEx阶段:节省的高性能交换机与长距离光缆/光模块;OpEx阶段:交换机与光模块用量的大幅减少。➢
相对性能:2D-FM(Shortest)、2D-FM(Detour)、2D-FM(Borrow)、2D-FM(Detour+Borrow)
与
Clos(均以Clos为
100%),各柱高度都在
99%~100%
附近,表明价格较低的
2D-FM柜间直连配合APR
路由策略即可达到与
Clos几乎一致的端到端训练性能。若将系统的成本效益定义为:成本效益
=平均性能
/(OpEx+CapEx),UB-Mesh可实现约
2.04倍的成本效益提升。序列长度256K下的线性度分析MTBF可用性估算可用性
=MTBF
/(MTBF
+MTTR)×
100%。其中平均无故障时间MTBF
=365×24/AFR(年化故障率);MTTR
为平均修复时间,按现有统计假设为
75
分钟➢
最终计算得UB-Mesh
的可用性为
98.8%,较
Clos的提升7.2pcts。➢
线性度
=(目标规模下的单NPU
性能)/(基准规模下的单
NPU
性能)×
100%横轴为归一化集群规模(1×
至64×),纵轴为线性度(85%~115%),不同模型上线性度始终保持在
95%
以上。14资料:HUAWEI
UB
White
Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化◼
UB支持超节点内所有组件全量平等协同。通过
Entity和
UMMU
实现统一编址和访问权限控制,使能计算资源平等互联访问。每个
UBEntity有一个唯一的身份标识
EID(Entity
ID),是全局通信的唯一标识。传统混合互联:资源跨边界必须不断换协议UB-Mesh
的主要构建模块NPU
:配备两个
UBIO
控制器,共提供
x72UB
通道。CPU:负责执行主机程序的
CPU
也配备一个
UBI/O
控制器,提供
UBx32I/OLRS:低基数交换机,低成本交换,UB
x72传统的基于
GPU的大语言模型训练系统
通常采用混合互连架构:CPU与
GPU、CPU
与网卡之间通过
PCIe互连;服务器内部的
GPU
之间通过
NVLink互连;服务器之间则通过
InfiniBand/RoCE
互连。HRS:高基数交换机,Pod级交换,UB
x512UB:一套互联语义连接异构资源UB
Domain:一个全部使用UB
Link连接起来的UBPU集合UB-Mesh的主要构建模块——UBProcessingUnit(UBPU):支持UB协议栈的处理单元,实现特定功能,包括:•
UBController:UBPU中执行UB协议栈的组件,并提供软硬件接口。UB同时支持:◼
同步操作:加载(Load)、存储(Store)和原子操作(Atomic)等;◼
异步操作:读取(Read)、写入(Write)和消息传递(Message)等;基于
UB,只需设计并实现一套统一的
UB
I/O
控制器,即可在
CPU、NPU
乃至
LRS交换机等不同模块中复用。•
UBMemoryManagement
Unit(UMMU):UBPU中执行内存地址翻译和访问权限控制的组件。资料:HUAWEI
UB
White
Paper(2025),浙商证券研究所整理15UB-Mesh
的硬件架构设计契合
LLM
训练的流量模式——解构Atlas
950
SuperPoD单板为1D,单Rack
架构2D◼
所有组件互连采用UB2.0灵衢技术,我们从UB-Mesh-Pod
来看950超节点架构——采用
4D-FullMesh
拓扑。1D单板2D单Rack✓
Rack为2D:64个NPU+16个CPU+1个备用NPU(18台LRS全互连成1个交换平面,共计72台
LRS)✓
Pod为4D:16个Rack构成◼SuperPod为nD:8个Pod的链接为Clos方式,不再用UB。◼
与
CPU、NPU同板的传统方案不同,这里二者是分离的:CPU
通过交换机连接NPU,从而支持灵活的
CPU/NPU配比单Pod
为4D:16个计算机柜,4个互联机柜Rack背面光缆4D-FullMesh
拓扑资料:HUAWEI
UB
White
Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化传统数据中心网络架构:Clos——多层交换机对称互连所有计算节点传统
Clos
架构:通过全局交换机(GlobalSwitch)、骨干交换机(SpineSwitch)、汇聚层(Aggregation)和机顶交换机(ToR)多层对称互连,流量分布均匀2D-FULLMesh+Clos混合拓扑示意✓
带宽分配:对称✓
互联介质:交换机+光电路✓
成本效益:低UB-Mesh
:nD-FullMesh
拓扑,短距离高频通信用UB,跨域拓展用Clos提出的
UB-Mesh
架构:按“单板(Board)→机柜(Rack)→行(Row)→组(Group)→Pod”分层局部化组织,L1/L2/L3
流量金字塔表示绝大部分流量集中在本地近距离范围✓
带宽分配:分层局部✓
互联介质:电缆/光缆✓
成本效益:高17资料:HUAWEI
UB
White
Paper(2025),基于灵衢的超节点参考架构白皮书,浙商证券研究所整理nD-FullMesh:高频走短链,跨层带宽递减1D、2D、3D……递归形成局部全互联域,并映射到板、机架、Pod、楼层等物理层级递归构建:相邻域继续组成更高一维的
FullMesh论文估算的链路构成短距无源电缆86.7%7.2%4.8%1.2%板级
1D机架
2DPod
4D更高维
nD有源电缆光缆(约百米)光缆(约千米)节点间直连局部高带宽域跨机架继续直连跨域带宽逐层收敛为什么有效0-2
跳:大多数
TP/
SP
传输可在局部直连域完成,减少数据移动距离。按维分配:每个维度的每节点带宽可按训练需求调整,不必全网对称。86.7%
为短距无源电缆18资料:HUAWEI
UB
White
Paper(2025),浙商证券研究所整理1K
NPU
以内用
4D-FullMesh,更大尺度回到
Clos当前实现是
4D-FullMesh
+Clos的混合架构,而不是整个数据中心全局满连当前实现的扩展边界4D-FullMesh:短距电直连HRS
/Clos:交换网络FullMesh
边界机架内
2DPod
内
4DPod
以上
Clos大尺度
DCN64NPU/机架1,024NPU/Pod8KNPU/SuperPod100K+NPU/DCN8
块板
×
8
NPUUB
x56
/
NPU16
个机架再叠加
2D-FullMeshUBx12
/
NPU多个
1K
Pod
由
HRS
连接UB交换机或
CPU板
NIC接入
Clos,主要承载大尺度DPUB
x4
/
NPU每个
NPU
的
UB
x72
I/O
如何分层分配(Fig.7)工程折中x56
机架内x12
Pod
内x44D:兼顾电缆距离、成本与云端切分x56
+x12
+x4
=x7219资料:HUAWEI
UB
White
Paper(2025),浙商证券研究所整理机架内每个
NPU
既是计算节点,也是路由节点8块
NPU板组成
64-NPU
2D-FullMesh;LRS负责汇聚、CPU/备份接入和跨机架输出64-NPU
机架的简化工作图四个关键事实8
×
8:八块板、每板八个
NPU,共
64
个常规NPU。NPU板
1NPU板
2NPU板
3NPU板
418×LRSNPU=
路由器:数据不必都先上大交换机;节点可承担间接转发。CPU
解耦:CPU
板与
NPU
板分离,比例与绑定关系可调整。2
CPU/备份8
常规NPUNPU
板
5NPU
板
6NPU
板
7NPU
板
8资源池化:CPU
/
NPU/
DDR
通过交换接入,提高利用率。8
跨机架基础模块的
UB
I/O
能力背板交换平面NPUCPULRSHRSx72x32x72x512CPU板备份
NPU被高亮的
NPU可直接转发:UB
IO
控制器具备路由能力直连负责主流量,LRS
负责必要的汇聚与弹性。20资料:HUAWEI
UB
White
Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化All-Path
Routing
面向
4D-FullMesh+Clos混合拓扑,拥塞或故障时可动态切换路径APR
不只走最短路:把闲置与绕行路径也纳入转发APR
的三个底层机制01
源路由(SR)ShortestPathFirstAll-Path
RoutingSS8-byte
紧凑头部携带逐跳指令,源端决定何时使用非最短路径。616102
结构化寻址
+线性查表5252按
Pod
/机架
/板划分地址段,以共享前缀与线性偏移缩小路由表。4D4D03
拓扑感知无死锁流控只用一条最短路径闲置链路无法贡献带宽多条可用路径并行故障
/
拥塞时切换TFC
用
2个虚拟通道(VL)支持全路径转发并规避环路死锁。输出:更高链路利用率
+
更强故障韧性21资料:HUAWEI
UB
White
Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化主路径优先留在局部全互联域;跨
Pod才进入
HRS/Clos,目的端可由
UBI/O
/
CCU
接收与归约一条消息如何穿过
UB-Mesh:先直达,必要时再绕行0102030405拓扑感知映射结构化目的地址局部直达APR
动态选路跨域与接收TP/SP
优先HRSCCUPRBNSD把
TP/SP
放进最近的高解析
Pod
/机架
/板
/优先
0-2跳的短距电连拥塞
/故障时使用绕行跨
Pod
才上
HRS/Clos;UB/CCU
完成接收带宽域NPU接路径正常路径局部直连优先,少数长距离通信逐层上收拥塞
/故障APR
切到非最短路径;论文的机架间评估还包含
Borrow
交换带宽策略工作方式的本质:软件先把大流量放对位置,网络再用直连与多路径把它送对地方。22资料:HUAWEI
UB
White
Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化AllReduce
借用闲置链路;All-to-All
同时沿多个维度发送,并可拆成分层广播与归约集合通信把
APR
的多路径能力转化为训练吞吐AllReduce:Multi-RingAll-to-All:多路径
+
分层23SAB14Y-FullMesh5D6X-FullMesh红:原始
Ring
1灰:借用闲置链路形成
Ring
2通用
All-to-All分层
Broadcast
+Reduce张量分成两份,同时沿
X
/
Y
维把
Token
分发
/
专家回收重写为1统一建模2映射多环3优化分片发送;最多一跳到达目标。分层操作,减少重复传输。节点、连接、带宽、时延保证逻辑路径不冲突按瓶颈分流吃满借入带宽CCU
硬件卸载UBI/O
内的集合通信单元可主动读写
HBM、发起传输、片上归约,并减少冗余数据拷贝。意义:网络提供多路径,通信库与
CCU
决定这些路径是否真正转化为吞吐。23资料:HUAWEI
UB
White
Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化仅有分层硬件还不够;错误映射会同时造成拥塞与带宽闲置调度也要懂拓扑:TP/
SP
放近,PP
/DP
放远把最“重”的通信放进最近的域三步搜索最优映射生成可行配置SuperPod
/
DCN:跨
Pod
交换域Pod:4D-FullMesh010203枚举
TP/SP/EP/PP/DP
组合并映射到集群机架内高带宽域计算通信成本模型同时考虑拓扑、APR
与集合通信行为TPSP
/CP选择最低开销EP迭代收敛到通信成本最小的并行方案PPDP优先级输出:通信开销最低的并行配置TP/SP
高PP/DP
低24资料:HUAWEI
UB
White
Paper(2025),浙商证券研究所整理三个方式:统一通信语言+创新拓扑结构+路由策略优化直接通知缩短链路故障传播;64+1
备份用一跳重定向替代少卡运行两类故障、两条自愈链:链路改路,NPU
切备NPU
故障:激活
64+1
备份链路故障:直接通知受影响节点链路
1-3故障013571LRSB62246534NPU-3
故障预计算通信关系→直接通知节点6→APR切换路径原直连路径改为5→LRS→B增加一跳,但保留完整算力与带宽结构论文对
8K
NPU
网络模块的独立可靠性估算98.5h13.8h98.8%91.6%UB-Mesh
MTBFClos
MTBFUB-Mesh
可用性Clos
可用性25资料:HUAWEI
UB
White
Paper(2025),浙商证券研究所整理灵衢
Unified
Bus6
大特征×××××大规模组网×高可用性总线级互联平等×协同全量池化协议归一总线级互联:基于灵衢的总线级互联,提供百ns级同步内存语义访问时延和2~5
μs异步内存语义访问时延,满足算力单元高并发的访问需求;提供组件间TB/s级带宽,相比传统数据中心网络带宽至少提升10倍平等协同:基于灵衢的平等协同机制,支持超节点内所有组件去中心化的互相访问、调用和协同工作,提升组件间访存和通信性能全量池化:基于灵衢和Linux操作系统的灵衢扩展组件,提供超节点的设备管理、内存管理、通信和虚拟化等功能,支持超节点资源的高效池化
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年公职人员保密知识专项测验附答案
- 2026年马术教练员职业技能试题附答案
- 2025-2026学年貂蝉教学设计与指导
- 2025-2026学年逛书店教案
- 2025-2026学年高二下学期《你我共同努力终结结核流行》主题班会教案
- 2025-2026学年美式音标教学设计软件
- 2025-2026学年车作品美术教案
- 2026年度厨师长年度工作总结课件
- 2025-2026学年课程设计中的整合性教学
- 2025-2026学年鹿寨古诗教案大班
- 2025-2026学年风筝教学设计图片素材
- 《地球的“面纱”》教学设计-2026-2027学年青岛版四年级科学上册
- 完整版农田建设项目施工组织设计方案
- 2026增材制造用金属粉末球形度控制关键技术突破
- 2026年生态环境行政执法与刑事司法衔接竞赛
- 2026年特殊食品考核测试卷【必刷】附答案详解
- 云知账号案例分析(小约翰可汗)
- 三生公司直销培训课件
- 2025年南京神学院考试题及答案
- 煤矸石处置申请书
- 会展公司安全管理制度
评论
0/150
提交评论