AI+时代算力集群光互联技术发展探讨_第1页
AI+时代算力集群光互联技术发展探讨_第2页
AI+时代算力集群光互联技术发展探讨_第3页
AI+时代算力集群光互联技术发展探讨_第4页
AI+时代算力集群光互联技术发展探讨_第5页
已阅读5页,还剩13页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

AI+时代算力集群光互联技术发展探讨2026年9月201.

高速光互联核心需求关键技术及其新进展总结与展望3人工智能加速迭代驱动光互联技术演进人工智能加速迭代演进,带宽无法匹配模型参数增长的陡峭斜率,超节点等新架构出现引发互联方式变革。其中,光互连在scale-out的应用及向scale-up的渗透引发诸多关注,高速率、高集成、高能效相关光互联技术持续涌现。高速率Scale-in:晶圆级/片上光互连,主要用到硅光技术Scale-up:

当前电互连,但转变为光互连的趋势明显Scale-out:光互连,PAM4

224G或更高Scale-across:

相干光学,coherent或coherent-lite电互连光互连来源:信通院来源:Lightcounting来源:CelestialAI来源:华为Atlas950高集成高能效单通道400G

LPO/LROCPO/NPO/OIOXPO401.

高速光互联核心需求关键技术及其新进展总结与展望5单通道100G/200G光模块成熟,AI算力应用持续加速规模部署单通道100G/200G光模块已全面成熟,国际标准体系完整并实现大规模商用部署。近年来AI算力资本开支爆发,单通道100G/200G光模块需求端刚性增量+供给端刚性约束导致的供应链紧张格局预计持续至2027年末2028年初。标准化组织技术方案距离进展IEEE802.3df8×100Gb/s8对MMF/SMF50m/100m/500m/2km已发布802.3dj4×200Gb/s4对SMF500m/2km在研4波长复用SMF500m/2km/10km8×200Gb/s8对MMF50m/100m在研8对SMF500m/2kmIPEC8×100Gb/s8对SMF500m已发布2×400Gb/s

FR44波长复用SMF2km已发布8×200Gb/s(Gen1)MMF/SMF50m-2km+已立项4×400Gb/s(Gen2)SMF500m/2km已立项CCSATC6WG48×100Gb/s8对MMF/SMF50m/100m/500m/2km已发布2×400Gb/sCWDM44波长复用SMF2km/6km/10km已发布4×200Gb/s4对SMF500m/2km已发布4波长复用SMF500m/2km/10km8×200Gb/s8对SMF/8波长复用SMF500m/2km/10km已发布产能锁定投资上涨

全球云厂商算力资本开支大幅扩张需求激增

AI服务器光通道搭载量远超传统设备头部客户长单锁产,提前透支未来

2–3

年供给需求侧价格飙升缺口放大交期拉长InP衬底与200G/L

EML光芯片为最核心卡点高速DSP电芯片产能被海外云厂商提前锁死配套元器件(隔离器、连接器、PCB)同步短缺供给侧AI应用光模块销售额持续增长全球五大头部云厂商资本支出持续增长国内外标准体系基本完善800G&1.6T速率为2025-2030年以太网市场主导6单通道400G光模块技术路线尚未收敛,预计2年左右规模商用单通道400G光互连是204.8T容量交换机与十万卡级智算集群的必由之路。单通道400G可插拔光模块需求明确、技术分层,工程化与良率为核心瓶颈,多材料平台并行发展(InP、TFLN方案可行,硅光性能具有挑战),关键芯片器件原型推出、但标准与应用尚不成熟,暂无规模应用。三大平台并行发展调制格式按需选择FEC以KP4为基线200G/L及以下400G/L新方案优/劣势分析EMLSiPhEMLSiPhTFLN直接驱动TFLNNRZPAM4PAM4PAM6PAM8外FEC:RS-FEC

(KP4)内FEC:Hamming(128,120)外FEC:RS-FEC

(KP4)内FEC:SP4(180,170),

BCH(128,120)优势:铌酸锂调制器速率极高,可达320GBaud512Gbps;劣势:材料尚不成熟,晶圆尺寸小、成本高良率低、异质集成困难。优势:更高调制格式对器件频率要求更低;劣势:更高调制格式将导致预算进一步降低,需要更强的编码以补偿信噪比优势:编码增益更高,对频率要求更低;劣势:编码复杂度提升,系统时延、功耗等上升推进技术方案收敛与生态成熟PCB架构、高密度连接器博通首发商用级400G/L光DSP(3nm工艺)@OFC2026GPU连接:

Scale-up机柜连接:

Scale-out高密度交换(1Pbps)IEEE:448G以太网特别工作组2025年6月成立OIF:

CEI-448G框架文件2025年11月发布NIDA:400G

per

Lane

MSA白皮书2026年4月发布99GHz超高频EML

(OFC2026)超110GHz带宽TFLN

(OFC

2026)85GHz硅光异质集成(OFC2026)80GHz纯硅光方案(OFC2026)探测器、驱动器、跨阻放大器原型推出400G/L概念验证功能演示工程原型预计2026年末-2027年开展客户验证,2028年实现规模商用,2029-2031年全面普及7线性光模块低能耗优势突出,但大规模部署尚待时日LPO/LRO在发端/收端全部或部分去除DSP,相较传统光模块,低能耗优势明显,但受信号完整性限制,核心应用场景为200G/L及以下速率的短距互连。过去2年内LPO的热度很高,但目前尚未见到该类产品大规模部署。现阶段,1.6T

LRO光模块获得了更多的产业支持。LPO:开始上线LRO:小批量验证800G

LPO已出货,华为Atlas

850采用800G

LPO进行机柜间互连;1.6T

LPO完成客户小批量送样验证。LPO模块相对于传统重定时光模块,对TP1a和TP4处的要求更高,OIF于2025年Q3已完成100G/L电接口规范制定;200G/L在研。LPO在交换机侧及算力网卡侧等能耗要求严格场景应用潜力大,主流部署距离预计≤500m。800G

LRO模块得到小批量验证,1.6T

LRO处于样品阶段,OFC2026上,新易盛、华工正源等展出1.6T

LRO模块

;LRO光口与TP1a电口可采纳现有重定时模块IEEE

802.3相应速率的标准。接收侧电接口标准在OIF

RTLR

制定,2025年Q4已完成100G/L;200G/L在研。LRO对于SR、FR距离以及单通道200Gb/s的支持性更好,主流部署距离预计≤2km。。主机传统可插拔光模块主机线性可插拔光模块信号完整性挑战环境适应性压力传输距离短板高度依赖交换ASIC

与系统链路核心芯片受限应用场景局限运维体系重构测试设备缺口互操作性认证缺失技术瓶颈 产业瓶颈低能耗(降低50%)架构简化、稳定性高低时延(亚纳秒)支持可插拔满足能耗诉求 缓解散热压力低成本(下降15%) 硬件利旧沿用可插拔形态技术优势 产业优势8新型可插拔XPO方案崭露头角,兼顾带宽密度与可维护优势…MSA驱动:45+成员,发布XPO白皮书与实施协议,定义12.8T

XPO标准产业引领:多家中国企业跻身MSA创始成员并首发12.8T产品OSFPXPOCPO架构传统可插拔超高密度可插拔共封装每模块带宽可达1.6Tbps可达12.8Tbps或更高视系统设计冷却方法风冷集成液冷系统级液冷供电电压3.3V

DC50V

DC系统级供电架构部署复杂度低中高XPO(eXtra-densePluggable

Optics)在大幅提升带宽密度与系统运行效率的同时,保留了传统可插拔光模块易维护、可更换的优势。新型可插拔方案仍将是封装级光互连时代到来前的重要缓冲。突破AI集群前面板带宽瓶颈。在相同机柜占用空间下,XPO

的带宽密度最高可达传统

OSFP

封装的4

倍。简化大型AI交换网络层级。助力部分系统减少叶节点、脊节点乃至超脊节点设备数量。适配液冷基础设施。在架构设计之初便将液冷作为核心考量,可实现网络设备与计算设备共用一套热管理方案。提升AI机柜内部供电利用率。相比传统低压架构分立OSFP:超高吞吐场景下,能效比更高,减少网络侧电力消耗。9NPO/CPO/OIO形成差异化技术体系,瓶颈与突破方向各有侧重NPO/CPO/OIO分别适配算力场景,NPO适配跨柜与单机柜两类短距场景,CPO分宽窄带路线适配不同算力集群,OIO面向片间超短距互联。三者分别对应不同传输距离与带宽需求,瓶颈与技术突破路径差异化清晰。NPO技术路径选择:硅光、VCSEL。硅光:2km以内跨机柜组网、天然支持波分复用,可平滑从3.2T→6.4T→12.8T演进、支持万卡训练集群、相关技术积累利于布局下一代CPO。VCSEL:≤100m单机柜/相邻机柜短距、3.2T以内、低成本/低能耗需求较强的中等规模集群。CPO技术路径选择:窄带高速、宽带低速。窄带高速:跨机柜Scale-Out组网

、100m~2km传输、复用现有高速SerDes、机房液冷配套,商用落地更快。宽带低速:单机柜万卡Scale-Up超短距训练、极致低功耗诉求、全新定制液冷机房、面向远期迭代。OIO技术路径选择:硅光、microLED。硅光:跨机柜分布式算力与柜内短距互连、2km以内、复用现有高速SerDes、追求成熟供应链。MicroLED:单机柜短距(≤10m)、极致低功耗需求、晶圆级海量并行互连、实现单机柜

Scale-Up

训练集群内存扩展。最主要瓶颈:高密度板间高速互连

+

多厂商标准碎片化,无统一光电接口规范突破方向:推进OIF

NPO标准项目统一机械尺寸、物理接口、管控接口、电源等参数最主要瓶颈:光电耦合高损耗、芯片级强热串扰,光器件温漂失效、封装良率低突破方向:玻璃中介层(Glass

Bridge)放宽耦合对准公差;微通道分区液冷热隔离;晶圆级无源耦合工艺提升量产良率最主要瓶颈:III-V

激光器单片异质集成良率低,片上光损耗与热密度双重约束突破方向:微转印晶圆键合集成光源;微环谐振调制器低功耗化;三维堆叠光电芯粒分层散热架构10NPO技术可行性与产业供给逐步成熟,商业部署在即NPO兼具技术可行性、量产能力与可靠性。近一年,行业接连推出3.2T、6.4T等多款NPO迭代产品。大型云厂商同时评估多技术路线,部分厂商对封闭自研的CPO方案持保留态度,加之NPO供应商更为丰富,这些企业或将优先部署NPO方案。云公司光引擎供应商Passage™

L20

光引擎6.4T

BiDi

NPO:

32

端口@212G板载集成形态或独立模块形态6.4TSiPhNPO:

32*200Gbps6.4TSiPhNPO:

32*200Gbps线性接口,

功耗~26W可拆卸电接口3.2TVCSELNPO:

32*100Gbps能效:

1pJ/bit2025Q4

阿里云宣布成功点亮

3.2TNPO模块,随后应用于国产四芯片交换机联合合作伙伴研发3.2T

NPO光引擎,并已于2026Q1完成样品验证。目前正对CPO与NPO两类方案同步评估,但将优先部署NPO。来源:OFC2026来源:OFC2026推动CPO量产,但也指出NPO具有灵活性,也将提供NPO方案,二者共存。11架构、硬件、系统运维等多点需求发力,加速NPO技术走向实用NPO技术热点集中在线性直驱架构、光源方案、连接器、热管理、超节点系统运维等方面。高密度电连接器,高通道数、低插入损耗,支持多次插拔、厂商适配;热管理,板级协同散热与热耦合抑制,液冷配置;高密度光纤耦合与阵列互连架构与信号链路硬件与热管理系统与运维线性直驱架构与多光源、多材料技术路径协同演进高密度连接器、光耦合与板级热管理协同突破AI

超节点落地,构建适配智算业务的运维体系线性直驱,去掉光引擎内部

DSP,降低功耗与时延;外置光源便于故障更换,但会占用机柜空间。内置光源集成度更高,但面临光芯片温漂风险;硅光、VCSEL、microLED等多材料技术路径超节点Scale‑

up/Scale-out场景落地,平衡性能与运维成本;监控与故障管理,状态实时遥测、故障定位、告警上报,适配智算中心运维体系技术热点12破解接口碎片化难题,需推进NPO多维度标准化体系建设机械外形电气接口光层光源可靠性管理运维NPO光引擎外形尺寸、安装定位;Socket插座完整2D/3D机械定义,整机空间预留、散热界面机械约束等。主机与NPO光引擎之间芯片‑

模块高速电气接口,电源供电、复位、管理信号引脚定义等,保障多厂商互通。温度循环、振动冲击、湿热老化;Socket插拔寿命、光引擎在板工作温度区间等可靠性要求以及多厂商交叉测试方法。标准化核心目标是解决接口碎片化,重点围绕机械外形、电气接口、光层参数、可靠性、管理运维等,实现多源互通,支撑3.2T~12.8T产品规模化商用。光层光源参数通用光引擎光接口PMD参数,内置光源、外置光源两套规范,耦合接口、光通道数量定义。可靠性测试体系互通状态读取、故障识别、告警上报,兼容现有数据中心管理栈,对接OIF管理协议。管理运维协议适配尺寸兼容难度大VSR难以兼容多方案光源类型依据场景区分与交换芯片热耦合严重寄存器模型跨厂商对齐13CPO故障影响半径大,需综合考虑性能与可维护性做平衡设计CPO高度集成的特点将牺牲热插拔、独立更换、简易维护能力。集成度越高→性能越强→维护边界越模糊、故障影响半径越大,需从集成架构、连接、冗余、生态多维度综合考虑性能与可维护性的平衡设计。集成架构连接生态124实例高性能取向平衡取向光引擎与电芯片在同一基板上

2.5D/3D

共封,电路径

<

2mm。光引擎做成分立可拆卸组件,通过高密度连接器/中介板与主基板连接,保留毫米级短电通道。新华三S9827-64EO

CPO交换机使用外置光源光纤/光波导直接集成在封装/基板内,无连接器、无面板插拔可拆卸光纤阵列与连接器,可现场插拔、清洁、更换Lightmatter

vClick™

可拆卸光纤阵列单光引擎+单电芯片,无硬件冗余,追求低能耗、高密度。冗余光源/光通道,多光源资源备份拓扑AyarLabsSuperNova

并行部署实现资源多备份光引擎+电芯片+封装单一厂商定制,无标准化接口,协同最优。光引擎接口、电接口、光连接器标准化,多源生态。OIF

CPO

框架文件、3.2T模块/外置光源实施协议冗余314NPO与CPO共存互补支撑Scale-up/out场景差异化落地对比维度NPOCPO整体市场节奏2026-2027年样品与小规模试点,2028年规模放量2026‑

2027年小批量验证,2029

年后大规模商用,短期以头部客户试点为主产业链结构上游光电芯片大量沿用现有供应链;中游新增高速连接器、高速PCB;下游云厂商、运营商等共同定义接口上游高度依赖先进封装,光电芯片深度协同设计;中游光引擎与交换ASIC绑定;下游头部云厂商定制,多厂商互通难度大主要约束连接器、高速电通道性能、标准化先进封装良率、产能、稳定性来源:Lightcounting来源:Lightcounting中长期来看CPO与NPO将共存发展,共同适配Scale-up、Scale-out算力场景。CPO先从Scale-out网络切入,但考虑到英伟达GPU集群需求,预计到2031年,其在Scale-up场景下的出货量会更高。NPO则在两类网络中的应用占比基本持平。NPO/CPO与传统光模块市场规模对比 NPO/CPO不同场景中的市场规模对比多方标准和联盟组织积极布局,相关标准研制加速标准组织和产业联盟支持多封装形态,加速研究NPO、CPO等互连规范。2026年3月成立并发布计算互连接口规范支持

可插拔/

板载/NPO/CPO

结合NRZ调制与WDM技术2026年3月成立,预计9月发布规范支持NPO/NPC/CPO/CPC多种形态,当前聚焦单通道200G阿里牵头ETH-X

Ultra项目,2025年10月发布NPO相关白皮书;腾讯牵头UPO项目,2026年1月发布NPO初步技术规格2026年5月正式立项,面向NPO的全球统一标准项目,将定义基于单通道200G速率,12.8Tb/s与

6.4Tb/s规格的NPO模块接口1512.8Tb/s

NPO模块实施协议17十五五期间可插拔预计仍为市场主导,多项新型技术逐步落地发展期迭代期变革期2024博通发布第二代CPO,成本较第一代下降40%,2025英伟达发布CPO原型,适配AI

大模型训练集群;阿里、腾讯相继发布NPO新进展,NPO技术进入快速发展阶段2015100G

可插拔光模块正式商用,小规模适配

AI

推理计算场景2026800G/1.6T可插拔光模块全面替代400G成为主流;LPO/LRO小规模验证2015-2018标准确立与小规模商用100G/200G可插拔光模块标准化成型,低速率光互连开始小规模适配AI训练集群基础算力需求完善光互连网络2029CPO/NPO/可插拔多技术架构协同,构建AI

智算中心较2018光互连与AI芯片初步适配

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论