2025万卡级智算集群网络建设运维及演进 - 罗远_第1页
2025万卡级智算集群网络建设运维及演进 - 罗远_第2页
2025万卡级智算集群网络建设运维及演进 - 罗远_第3页
2025万卡级智算集群网络建设运维及演进 - 罗远_第4页
2025万卡级智算集群网络建设运维及演进 - 罗远_第5页
已阅读5页,还剩29页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

万卡级智算集群网络建设运维及演进2025万卡智算集群建设运维分享目录更大规模智算集群的演进思考大模型基础说明01大模型基础说明大模型发展、讯飞星火大模型、大模型介绍、训练集群并行方式认知智能大模型的技术阶跃ChatGPT发布2个月,月活用户过亿相比ChatGPTGPT-4进步显著且具备多模态能力2023年3月15日Sora发布,划时代的文本生成视频,深度模拟真实物理世界2024年2月15日2022年11月30日认知大模型的智能涌现,有望让机器真正掌握和运用人类语言和知识,开启机器自然语言交互式学习的“类人”新范式,点亮通向通用人工智能的星星之火!讯飞星火大模型V1.52023年6月9日突破开放式问答多轮对话能力再升级数学能力再升级V1.02023年5月6日首次发布七大核心能力发布

大模型评测体系发布2023年8月15日突破代码能力多模态交互再升级V2.02023年10月24日通用模型对标GPT-3.5(中文超越,英文相当)2024年1月30日多项能力大幅提升接近GPT-4

Turbo当前水平V3.52024年4月26日春季上新首发OCR大模型长文本能力全新升级V4.02024年6月27日全面对标GPT-4

Turbo语音、图文识别能力再升级认知智能大模型带来智能涌现的意义认知大模型的智能涌现,有望让机器真正掌握和运用人类语言和知识,开启机器自然语言交互式学习的“类人”新范式,点亮通向通用人工智能的星星之火!语言智能是人类智慧的重要部分,是相互交流和深邃思考 的媒介,也是全社会知识财富积累的载体!推动了机器智能实现范式的再次跃迁,可以“类人”地 交流、学习和进步!语言智能运动智能多模态智能以语言智能涌现为核心的突破,将推动机器智能进入全新阶段人类智慧自然语言交互式学习数据训练专家知识“大力出奇迹”下的“智能涌现”随着模型尺寸增长,任务效果不会线性增加,必须达到一定临界值时,才会突破。这类任务通常是那些需要步骤推理、或者逻辑推理的任务。(单词解读、重复指令、修辞分析等)随着模型尺寸增长,任务效果线性增加。这类任务通常是那些需要知识和简单文本操作的任务。(日期理解、格式规整、单位转换等)Beyond

the

Imitation

Game:

Quantifying

and

extrapolating

the

capabilities

of

language

models大模型的参数规模会越来越大模型规模持续增大,模型越大智能化越高,当前业内向着超大稠密和万亿/十万稀疏模型不断演进OpenAI的GPT系列快速进步✦更强的推理能力和更高的准确性✦幻觉问题得到显著缓解✦个性化和定制化功能方面实现重大更新✦更好的多模态模式,具备视频理解与生成能力✦能根据文本描述,生成长达60秒的视频✦更强大的上下文理解能力✦更多赋能开发者✦更强大的知识库✦增加了多模态语音和图像能力✦数据:约5000~7000B

Tokens✦模型参数:约1.76万亿✦算力:至少3000P训练3~6个月GPT-3ChatGPTGPT-4GPT-4oSORAGPT-4

TurboGPT-4V✦数据:300B

Tokens✦模型参数:1750亿✦算力:300P训练1个月(

A100)✦数据:约是GPT3的

3~5倍✦模型参数:1750亿✦算力:约300P训练2个月02万卡智算集群建设运维分享万卡集群简介、集群光链路问题、集群负载均衡优化、平台工具与体系建设基础设施的耦合基础设施算力需求根据模型和任务估算算力需求机房能力限制算力规模机房根据所有设备估算机房承重、制冷、电力需求以及桥架等机房设施计算、存储根据算力需求,结合所采用的计算卡,推算计算和存储的规模网络综合算力、计算、存储相关需求制定网络架构智算时代,基础设施的耦合度越来越高需求衔接层层相扣,一环变更,环环变更万卡算力集群的关注点1.光连接稳定性2.负载均衡优化10000+张计算加速卡3.故障定位效率500+台交换机设备30+台存储设备30000+根光纤广泛部署的胖树拓扑Introducing

data

center

fabric,

the

next-generation

Facebook

data

center

network二层模型预训练对延时不敏感二层(盒>框)>三层(盒>框)三层预训练中的并行方式Server400GBPP200Gb/s-1

Server-5

Server-9

Server-13Server-1Server-5Server-9Server-13TPTP400GBPP200Gb/sleafleafleafSpineSpineleaf400Gb200Gb200Gb并行方式模型张量并行(TP)模型流水线并行(PP)数据并行(DP)特征通信量巨大,通信时间不可掩盖通信量较大(模型相关),通信时间不可掩盖/流水可掩盖通信量大通信时间计算可大部分掩盖对通信的需求节点内allreduce跨节点P2P跨节点allreduce超高带宽中带宽高带宽数据通道总线400GB网络200Gb网络200Gb三种并行通信模式中,两种依赖网络互联DP200Gb单轨与多轨张量并行流水线并行数据并行采用单轨还是多轨,是由算力卡决定;单轨方案对负载均衡要求更高;光连接稳定性万卡集群故障分析万卡集群自交付起的163天的故障统计。算力平台相关问题多种类型,复杂多样。Llama3故障根因Root-cause

categorization

ofunexpected

interruptionsduring

a

54-day

periodofLlama

3

405B

pre-training.机房防尘等级人员操作规范光纤模块清洁硬件设备设计多种负载均衡方式数单据击包此喷处洒编的辑按标包题负载方式智算网络场景的流数量少但是流量通常都非常大,是典型的“大象流”,这意味着数据流的五元组呈现的熵值更低。传统的哈希算法仅根据流量五元组计算下一跳,算法因子不考虑流量大小,多路径下一跳负载情况,只和流量五元组有关,在智算网络这种流少带宽大的场景中容易负载不均衡,甚至发生负载均衡极化的现象。ECMP单击自此适处应编路辑由标题01单静击态此路处径编绑辑定标题

05增单强击型此的处哈编希辑算标法题和030206

单算击网此一处体编化辑调标度题04

单信击元此交处换编方辑式标题负载均衡讯飞万卡集群的负载均衡正在从1.0版本的静态路径绑定向算网一体化调度的2.0方案过度。算网协同一体化调度传统流转发流级hash,负载分担不均AI调度平台网络控制器1、AI任务调度2、控制器获取AI任务信息0、控制器获取网络拓扑3、控制器集中算路(核心算法)4、控制器下发路径step1step2step323456718算网协同联合调度方案千卡大模型测试结果千卡大模型未开启NSLB训练时间:34天千卡大模型开启NSLB训练时间:28天训练时间缩短6天,训练性能提升17%3428040关闭开启NSLB训练时间(天)智算集群项目运维难点跨产品问题难定位AI算力平台涉及大规模计算、存储、网络设备组网,跨产品难以定位海量光纤/模块问题难排查海量光纤、光模块组网复杂,大集群涉及上万根线缆技术/人力不足算力集群运维难度大,人员技能要求高AI训练要求故障快速恢复备件及时到达算力集群故障,会导致模型重训或断点续训,需要快速恢复故障统一运维平台健康检查、跨层故障诊断全栈光模块监控、参数面拓扑可视、基于任务/卡间故障分析人员补充建设补充数通、计算运维人力不足提供故障处理、日常配置变更、巡检等支持厂商支持技术经理7*24响应支持免鉴权通道,专属VIPTAC团队维保服务7*10*ND备件(含介质保留),现场更换软件升级授权,在线技术支持跨专业域的任务级运维平台算存网一体、任务级智算运维平台50+智算运维指标任务劣化感知、故障定位效率缩短至分钟级机房环境CPU总数/利用率系统盘水位服务器功耗TOP5端口利用率峰值NPU总数.温度/功耗数据盘水位发送/接收带宽TOP5端口平均利用率NPU显存利用率HBM多比特隔离分页数异常服务器数量端口当前利用率接口监控集群读写IOPS服务器数光模块监控时延协议已用/空闲/总容量集群使用带宽任务级别IOPS元数据数量/文件数连接的客户端总数服务器网络存储可用度诊断准确率诊断覆盖率诊断时长并行诊断数支持的算力规模易用度健康检查覆盖度软件平台任务执行时长任务中断次数运行中任务数成功任务数失败任务数排队中任务数取消任务数任务失败率训练任务日志监控交换机网络控制器分析器告警监控硬件监控日志BMC带外系统/驱动日志计算卡日志网卡日志硬盘/RAID日志host主机日志采集运维

Agent框架日志日志清洗训练容器AI服务器任务调度平台日志平台南向接入层作业信息训练日志带内带外跨域任务级运维平台集群智能故障诊断跨域故障诊断硬件故障诊断软件栈故障诊断基础分析能力任务范围界 日志一键收定

集故障首节点分析专家知识库跨层跨域诊断规则硬件诊断规则软件诊断规则组织流程变革,构建符合智算特点的融合型团队流程增强点联合二线运维:与原厂驻场保障团队协同,包括故障、问题、变更、重客保障、技能传递,保障断点续训等业务问题快速解决12原厂三线直达接入:专属技术团队

VIP受理&处理问题,并提供重点问题分析报告备件管理服务:AI精准预测与补库,小时级派送<=4H,7*24响应,专业人员进行现场备件更换,保障备件快速响应原厂三线直达&VIP

TAC增强客户

运维团队/驻场工程师技术服务请求发起VIP受理(优先接入,专属团队)现场支撑故障通告及提问题单制定方案支持实施备件管理及更换技术服务请求关闭问题分析报告(高频、共性问题分析)跟踪或加速专属专家CSMVIPTACR&D资源协调

WarRoom协助支撑确认解决增强点增强点增强点3运维流程融合、问题工单直达原厂赋能、建设及沉淀,提升团队面对智算领域的运维能力方案培训实施方案培训运维流程培训问题处理、变更流程管理系统培训CCAE使用、故障诊断等计算产品培训Atlas800日常维护网络产品培训CE交换机日常维护存储产品培训OceanStor日常维护整体《网络详细设计文档》计算《万卡集群验收测试报告-计算》、《资产信息表-计算》、《巡检报告-计算》、《计算产品文档》网络《数通产品验收报告》、《万卡集群网络运行资产表》、《数通巡检报告》、《数通产品文档》存储《存储测试报告》、《存储资产运行表》、《存储实施巡检报告》、《存储产品文档》跨领域、全人员多轮次培训赋能80+人次;46个深化设计文档、验收测试报告、维护指导、产品技术文档等;培训赋能建设运维知识库内存故障硬盘故障电源故障NPU故障光模块故障性能降低分布式训练故障……丢包故障PFC死锁故障主控板故障接口板故障交换网板故障端口流量异常光模块故障……主存硬盘故常故障BBU模块故障风扇模块故障接口卡/光模块故障节点故障……故障处理知识沉淀涉及计算、网络和存储三个产品,共计398个故障场景指导保障大模型任务长时稳定运行指标项描述计算公式TPS(TokensPer

Second)(单卡/单节点/千卡/单集群)一秒时间内处理token的数量𝑇𝑃𝑆

=

𝑇𝑜𝑘𝑒𝑛𝑠𝑇𝑖𝑚𝑒WPS(WordsPer

Second)(单卡/单节点/千卡/单集群)一秒时间内处理token的数量𝑊𝑃𝑆

=

𝑊𝑜𝑟𝑑𝑠𝑇𝑖𝑚𝑒MBU(ModelBandWidthUtilization)模型计算的带宽利用率,实际带宽速度/峰值带宽速度。𝑀𝐵𝑈

=实测带宽

硬件峰值带宽MFU(ModelFlopsUtilization)模型计算的算力利用率,实际算力/峰值算力。𝑀𝐹𝑈=硬件峰值算力实测算力100.0075.0050.0025.00故障0.00集群NPU占用率(%)保障大模型任务不间断长时稳定运行:

模型算力利用率任务算力使用率任务算力可用度算力可用度任务有效训练时间任务无故障运行时间任务长稳训练时间任务异常中断损失时间……03更大规模智算集群的演进思考训练集群网络演进、集群互联选择、网络拓扑优化、思考与探讨技术演进网络拓扑负载均衡拥塞控制RDMA机制运维管理接入带宽:200G->400G->800G芯片容量:25.6T->51.2T->102.4TSerdes:

56G->112G-224G网络拓扑:减少网络直径,盒式交换机,

Rail-Optimize、Drgonfly、Torus网络侧:基于全局或逐跳的队列调度实现拥塞控制、精细的反压端侧:感知网络信息,如时延、网络队列等变化进行速率调整高性能可视化监控

更精细全面的监控精度全域可视化监控故障的快速定位逐包(定长or非定长)负载分担、NSLB动态

路径调整类信元模式负载:入网等长切分为等长数据包,终端重新组包保序RDMA传输模式:优化的QP机制(非连接的可靠传输or动态连接池资源共享)以太网在网计算重传机制:Go

BackN—>选择性重传演进新型RDMA协议,长途RDMA更大规模集群中的设备互联1.6T800G400G?光模块功耗越来越大20151050100GQSFP28800GOSFP200G

400GQSFP56

QSFP-DD功耗(W)200G100G…以太网接口速率越来越高1.

铜缆仍有可用之处,但是使用场景大为受限1.高稳定2.低功耗3.优成本光模块故障影响训练效率,甚至会导致训练任务中断。光模块功耗已与设备相当,对设备散热设计挑战巨大不仅从光模块本身审视成本,更应从模型训练整体评估2.

LPO光模块符合当前需求,关注在实际环境中的效果LPO光模块互联方案Linear-drive

Pluggable

Optics在光模块中不再包含DSP/CDR,而将该功能集成到交换芯片中,只留下Driver和TIA由交换芯片所含的收发DSP/Serdes功能来对高速信号进行补偿优势低成本:800G光模块BOM成本约为600~700美金,去掉DSP,系统总体成本 预计下降约8%左右低功耗:功耗下降约50-70%低延迟:由于不涉及对信号的复原,latency降低约75%劣势系统误码率和传输距离有所折衷ServerTORLeafSpinePOD内跨POD<50mSRLPO<500mDR?LPO?<2kmFR更大规模集群的组网选择三层Fat

Treeclos组网方式,TOR、leaf、spine三层结构,智算场景下一般要求1:1收敛比Dragonfly二层全互联结构,网络直径小,路由选路想必胖树更加复杂Dragonfly+POD内采用胖树方式,POD间为全互联组网方式不同拓扑下的组网规模对比网络架构组网说明最大规模(400G端口)设备数量互联线路数量备注Fat

Tree二层要求1:1收敛比,Leaf设备64上行64下行最大64台Spine最大128台Leaf819264*12819264+128819264*128三层要求1:1收敛比,Leaf设备64上行64下行

Spine设备64下行组内互联,64上行组间互联

POD:最大64台Spine和64台Leaf4096=64*64规模,128=64+64台设备集群:最大支持128个POD4096=64*64个SS设备52428864*64*12816512(64+64)*128+64*64104857664*64*128+64*64*128Dragonflya=64每台设备32下行64组内互联32组间互联

POD:65台交换机全互联2080=65*32规模集群:最大支持2080=65*32个POD4326400(65*32)(65*32)13520065*(65*32)648960065*64/2*65*32+65*32*65*32/2a=63计算方式与上面一致4194304(64*32)(64*32)13107264*(64*32)629145664*64/2*64*32+64*32*64*32/2考虑到典型情况下一台服务器八个GPU节点,多轨方案下,为了防止服务器跨POD接入,限定每个POD的交换机数量为8的倍数Dragonfly+POD内部组网与三层Fat

Tree一致集群:最大支持4096=64*64个POD16777216(64*64)(64*64)524288(64+64)(64*64)25165824(64*64)(64*64)+(64*64)(64*64)/2以51.2T芯片、128口400G设备为例,计算在不同的组网拓扑下,理论上能达到的最大集群规模和设备、线缆情况对比十万卡集群不同拓扑的集群对比网络架构组网说明POD数量规模(400G端口)设备数量互联线路数量不改造网络时还可扩容Fat

Tree(三层)要求1:1收敛比,Leaf设备64上行64下行

Spine设备64下行组内互联,64上行组间互联

POD:最大64台Spine和64台Leaf4096=64*64规模,128=64+64台设备集群:按照25个POD进行计算,集群按照最大支持32POD规模需要16组共1024=16*64个SS设备25102400(64*64)*254224(64+64)*25+16*6420480064*64*25+64*64*257POD28672Dragonfly(a=63)每台设备32下行63组内互联32组间互联

POD:64台交换机全互联2048=64*32规模集群:按照49个POD进行计算集群按照最大支持65POD规模建设49100352(64*32)*49313664*4913641663*64/2*49+32*(49-1)*49/216POD32768Dragonfly+POD内部组网与三层Fat

Tree一致集群:按照25个POD进行计算,集群最大支持33个POD规模25102400(64*64)*253200(64+64)*25151552(64*64)*25+(64*64)*(25-1)/28POD32768以51.2T芯片、128口400G设备为例,组建约十万卡集群,计算在不同的组网拓扑下,集群的设备、线缆情况对比以51.2T单芯片交换机组建十万卡集群为例,相比于三层胖树拓扑结构,dragonfly拓扑可以节省1/4

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论