33期数字化领航 2025 -算力狂飙时代 新华三如何掀起底座革命_第1页
33期数字化领航 2025 -算力狂飙时代 新华三如何掀起底座革命_第2页
33期数字化领航 2025 -算力狂飙时代 新华三如何掀起底座革命_第3页
33期数字化领航 2025 -算力狂飙时代 新华三如何掀起底座革命_第4页
33期数字化领航 2025 -算力狂飙时代 新华三如何掀起底座革命_第5页
已阅读5页,还剩163页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

HI3C数字化解决方案领导者总期第33期2025年06月版数字化解决方案领导者[前瞻洞察]算力狂飙时代新华三如何掀起底座革命?迎接AGI时代,我们真的准备好了吗?[P63]人工智能在医疗领域的应用:临床医师的视角与未来展望[P67]太原地铁大数据平台融合AIGC技术探索与实践主办新华三集团数字化领航手机阅读编委会成员张弢/刘新民/杨玺/谌平/徐润安/孙松儿/曾富贵/乔剡本期顾问黄伟高书葆中国信通院信息化与工业化融合研究所总工程师至顶传媒副总经理、首席技术官本期编辑/徐姗姗版权声明本刊所有文章除注明转载外,版权归新华三所有。欢迎转载,请注明出处。免责声明虽然新华三试图在本资料中提供准确的信息,但不保证本资料的内容不含有技术性误差或印刷性错误,为此新华三对本资料中信息的准确性不承担任何责任。任何意见或建议,欢迎与本刊编辑部联系。投稿信箱techonline@稿件征集长期进行中……CONTENTES/目录01前瞻洞察01算力狂飙时代:新华三如何掀起底座革命03迎接AGI时代,我们真的准备好了吗05AIGC时代大模型的安全风险与防护实践08智算场景下南向互联技术发展研究2210DDC,以创新架构树立智算网络性能标杆新华三LinSeerCube大模型一体机打通AI落地最后一公里15先进存力:如何定义下20应对大模型挑战的算力平台技术新路径24一图一脑双向协同,构建IT运维新范式27AI时代下的液冷技术革新与可持续发展实践30让大模型生长而非重建H3CH3C3336面向GPU算力纵向扩展的Scale-up网络技术研究44面向万卡集群的Scale-out网络技术研究50数据快递:海量数据跨广域高效传输技术实践57算力网络架构演进的思考4462新华三:以AI自实践领航数字化转型,赋能百行百业数智升级65人工智能在医疗领域的应用:临床医师的视角与未来展望69太原地铁大数据平台融合AIGC技术探索与实践算力狂飙时代:文|新华三集团高级副总裁、技术委员会副主席刘新民当“杰文斯悖论”穿越工业革命,投射至当代AI算力领域时,效率提升与需求扩张的共生效应再一次得以印证。随着DeepSeek等模型通过创新优化降低单个模型训练的算力需求,让更多企业和从业者有机会去尝试、去探索,引发了一场广泛而深刻的行业变革,进而推动算力需求的跃迁式上升,这无疑给算力基础设施带来了巨大的挑战。算力结构正在向“集中式训练+边缘推理”的架构进化生成式AI的爆发,尤其是DeepSeek的横空出世,正在重塑算力版图。DeepSeek类模型的训练成本下降虽带来个体效率提升,却引发更复杂的系统性挑战。数据显示,全球智能算力需求以78%的复合年增长率狂飙,其中超三分之一的增量直接源于DeepSeek类模型的场景渗透。DeepSeek的混合专家模型(MoE)将单次推理计算量压至传统模型的20%,但开源生态的爆发——日均50亿次调用——让总算力消耗翻了3倍。算力结构正在向“集中式训练+边缘推理”的架构进化。训练侧因低资源需求放缓,智算中心从“堆算力”转向“挤效率”;推理侧需求却因门槛降低而井喷,用户并发调用激增带来海量参数处理需求。云计算厂商正在从集中式训练转向分布式推理,数据中心开始向边缘延伸。我们看到算力供给的场景定制化趋势愈发明显,例如智能驾驶和机器人需要低时延、高并发的专用推理服务器,金融风控和医疗影像等需要快速接入推理能力的场景则倾向绿色高效的一体机。同时,海量数据吞吐对高性能存储和AI网络提出更高要求。优化互联架构、提升存储性能、创新网络协议,已成为提升智算中心能效的几大关键可以预见的是,未来算力中心发展将呈现“大小兼顾”的格局。大型算力中心仍是AI训练的脊梁,头部智算中心凭借高功率机柜和液冷技术屹立不倒。而推理需求的爆发,则催生小型算力中心的崛起,尤其在边缘计算和本地部署场景中,中小企业借此搭上AI快车。放大到国家层面,近年加速布局建设全国一体化算力网络国家枢纽节点,强调区域平衡与“东数西算”并重,东部集群强化热数据处理,西部则借绿电优势承接冷数据和训练任务,将形成一幅“东训西存”的互补图景。算力底座的四个关键技术发展方向面对AI掀起的算力狂潮,企业需要怎样的底座?新华三认为这四个层面的技术创新将决定未来算力基础设施的核心承载能力:Scale-up、Scale-out、高性能存储和广域数据传输。AI大模型动辄千亿参数,单张GPU早已不堪重负。Scale-up网络纵向扩展GPU互联,支持几十到数百GPU互联,从而加速AI任务完成。而Scale-out网络则通过横02向扩展支持万卡甚至十万卡互联,确保集群高可用。由于训练数据的读取带宽对于不同数据要求不同,因此整个训练过程需要高性能的存储和网络配合。为满足AI存储大带宽、高吞吐、低延迟的要求,可通过冷热数据分离提升读取效率,使用高速存储协议(NVMe-oF)和全闪阵列等方面进行优化。随着智算业务需求量的不断发展,海量样本入算、存算分离拉远训练、跨数据中心协同训练和业务推理等海量数据跨广域流动的场景逐渐增多。在广域网络中,跨域的物理时延较大,数据传输的可靠性也面临挑战,丢包处理和拥塞控制尤为重要。面向算力需求的发展,新华三提出“算力x联接”理念,力求通过多元化算力和标准化联接的协同,提供更高效的智算解决方案。在Scale-up层面,新华三G7系列模块化服务器以丰富的软硬件生态兼容性,已完成和超过10余家芯片厂商的联合设计,适用于集群训练、训推一体、边缘推理等场景。在面向万亿模型的超节点集群方面,H3CUniPoD超节点支持单机柜、多机柜等多种形态,Scale-up互联规模提升300%,大幅提升通信效率和模型算力利用率,为万亿参数模型训练提供强大支持。在Scale-out层面,新华三推出全球首款单芯片51.2T800G“LPO+液冷”交换机,满足智算网络的高吞吐、低时延、绿色节能需求。创新研发的端网融合Scale-out整体解决方案,在UEC技术基础之上,配合网络控制器的全局能力,自研高效拥塞控制算法,大幅提升集群网络有效吞吐率。在高性能存储方面,新华三全面重构存储软件栈,打造单节点80GB/s带宽、200万IOPS的下一代AI数据存储平台H3CUniStorPolarisX20000系列,实现性能优化、协议融合和架构进化。在广域数据传输方面,新华三的确定性网络和数据快递技术方案,通过软硬件协议栈重构,在5000km距离下实现90%以上带宽利用率,数据传输效率较传统协议提升5倍,打造“数据高铁”。能效方面,所谓“人工智能的尽头是能源。新华三通过AI运维与算力平台调度,识别低利用率服务器的任务进行集中和关停,在不牺牲性能的前提下,实现算力利用率和能效显著提升。联接标准的打通将是迈向算力时代的重要一步新华三的开放创新:技术纵深+生态广度下一代算力和网络会与当前完全不同。面对算力基础设施的指数级复杂度增长,新华三不仅在产品矩阵布局上,构建了从硬件基础设施到行业解决方案的完整链条,更通过“技术纵深+生态广度”双螺旋驱动的开放创新,定义AI新纪元的演进法则。未来,大模型的训练将在芯片内、芯片间、设备间、数据中心内、城市内以及相距上千公里的城市间都会有互联互通的需求,联接标准的打通将是迈向算力时代的重要在互联标准层面,积极参与和跟进UEC(超以太联盟)、UALink(加速卡超级互联联盟)等国际组织的标准建设工作,携手产业伙伴共同探索和推动联接标准化,进一步提升算力密度,推动产业智能化进程。我们希望通过推动开放、标准的联接,实现生态兼容的同时保留差异化特色,最终形成即插即用的通用解决方案。在AI基础设施领域,新华三积极实践“AIinALL”技术战略,发挥“算力×联接”的倍增效应,以“技术融合、标准共建、场景赋能”为支点,携手广泛的产业伙伴,服务百行百业。迈向AI新纪元,新华三不仅是算力基础设施的提供者,更是产业跃迁的筑梦者。作为技术领导者,我们始终坚信:未来的“联接”,不只是算力的互联,而是万物的互联。真正的创新不在于追赶技术浪潮,而在于定义下一个技术纪元的演进法则。新华三正加速以技术创新之力,引领AI时代的算力革命。本文整理自至顶科技媒体访谈实录03迎接AGI时代我们真的准备好了吗文|新华三集团高级副总裁、云与计算存储产品线总裁徐润安作为深耕人工智能领域的技术实践者,我们清醒地认识到:AGI时代的到来既是必然趋势,也伴随着必须跨越的技术鸿沟。从AI到AGI,仍需攻克三大核心挑战诺贝尔奖近年频繁授予AI领域研究者的事实,印证了这项技术对科学革命的推动作用。但是随着AI技术的深度应用,与AI三要素——算力、数据、算法息息相关的一系列痛点也随之而来,将AI工具真正提升为具备自主决策能力的AGI系统,仍需攻克三大核心挑战。首当其冲的是算力效率瓶颈。当前企业既面临基础算力不足的困境,又需解决模型训练与业务推理的协同难题。我们在实践中发现,单一算力架构已无法满足多样化场景需求,必须通过CPU/GPU多元算力池化、服务器内外标准化联接等技术手段,构建可动态调度的智能算力集群,高效地调度算力和优化资源配置。数据正成为制约大模型发展的关键因素。一方面,AI大模型的发展需要愈发强大的数据治理能力,来保证高质量数据的获取和管理,以满足大模型高效训练的要求;而另一方面,数据规模的急剧增长,也使得数据治理的难度大大增加。此外,数据的质量又进一步影响到算法的准确性和可靠性。加之现实问题的复杂性、各领域数据的差异性等,都要求企业对算法进行迭代与提升,在特定应用场景中选择最合适的算法,能够实时处理数据并做出快速反应。能耗治理是常被忽视却至关重要的环节。根据国际能源署发布的数据,全球数据中心消耗的电力超过250TWh,约占全球电力需求的1%,占全球碳排放的0.3%。预计到2030年,这一数字将达到8%。因此,如何构建新一代数字基础设施,实现更高效、更智能的能耗治理,提高数据中心前瞻性布局,加速走向AGI时代尽管面临诸多挑战,但AGI时代的到来仍充满无限机遇。现在我们能够看到openAI推出的新模型已经出现了慢思考、推理的过程,加上脑科学、神经科学的进展,所以我相信AI会越来越接近人类。AGI一旦实现,则将会深刻改变人们的生活与工作模式,助力社会各个层面的创新与发展。面对未来的信心,不仅来自我们对技术进步的深刻理解,也在指导新华三的前瞻技术布局。面向智算场景对现有基础设施的新需求,我们提出"算04HI3CAI具有指数级的放大能力,乘以AI能够让所有业务收益倍增力×联接"的核心理念,旨在通过多元化算力和标准化联接的深度融合,打造更为强大的算力基础设施。这种技术路径既包含将AI技术全面融入产品的NAI智原生能力,也涵盖多元异构算力基础设施的可进化能力,通过计算技术和网络技术的深层融合和调优,让算力得以更灵活、高效地调度和释放。在算力方面,提供CPU和GPU多元化选择,满足市场与客户的多样化需求,并加强供应链的供给保障;而在联接层面,积极推动联接标准化,通过服务器内、外部GPU联接标准化,实现异构GPU的智算集群,降低算力部署和应用的成本。要满足百行百业在不同AI应用场景下的不同算力需求,既需要计算侧的互联,也需要网络侧的互联,让不同的算力资源实现池化,再加以科学调度和管理,打造智算集群从而带来智算效率的大幅提升。傲飞算力平台便是这一理念下的重要产物之一。作为智能调度平台,它不仅支持万卡集群的通用算力、智能算力统一调度,还能够根据不同的智算场景和规模为客户提供算力服务,为AI技术的大规模商用提供资源支撑。除了算力层面,在数据、能耗等方面,新华三持续推出行业领先的解决方案并不断迭代。在解决数据治理问题上,绿洲大模型数据治理平台能够通过异常清洗、过滤、去重、去隐私、语料增强、多维评估等流程将原始数据转化为训练数据,并对结构化数据、文本、图片、音视频等多模态数据进行高效管理,覆盖AI数据应用的全流程、全生命周期。致力于持续突破散热技术边界,为提升散热系统能效、降低智算中心PUE,新华三已经实现并加速迭代覆盖冷板式和浸没式两大技术路线的全栈液冷解决方案。产生更大的化学反应因此在新华三的布局中,不管是算力的释放、数据的治理,还是能耗的优化,这些过程都离不开AI的深度赋能。AI具有指数级的放大能力,我们提出“×AI”,也就是在基础架构升级中全面引入AI之力,大幅提升各项产品及解决方案的应用体验,从而使基础架构在AI等新型业务负载中获得更加优异的表现。“×AI”能够让所有业务收益倍增,产生更大的化学反应,而不仅仅是作为一个特性需要强调的是,AGI时代的到来绝非单一企业的技术竞赛。对于企业而言,面向AGI时代的转型绝非单纯的技术变革,更是一种思维上的革新。培养新的生态思维是大势所趋。尤其是在通往AGI时代的道路上,新问题层出不穷,只有多方联手,做好生态建设,才能推动整个产业的共同繁荣。而从这种生态思维出发,新华三也在持续致力于建立一个包容不同伙伴类型、倡导多样性、开放性的良性生态系统,在此之上携手合作伙伴联合创新,深化AI技术的行业应用,共同孵化越来越多的融合解决方案,推动百行百业实现智能化转型。这种生态协作模式证明,只有通过产业链协同创新,才能有效解决算法适配、场景落地等共性站在技术演进的前沿,我们坚信AGI时代即将到来。但通向AGI的道路需要全行业建立理性认知:既要保持对技术潜力的信心,又要对现实挑战保持清醒。唯有持续攻克核心技术瓶颈、构建开放协作生态,才能将AGI的宏伟畅想加速转化为现实生产力。本文整理自《哈佛商业评论》访谈实录05AIGC时代大模型的安全风险与防护实践文|新华三集团高级副总裁新华三信息安全技术有限公司总裁孙松儿当前,生成式人工智能(AIGC)技术飞速发展,尤其是以GPT为代表的大语言模型(简称“大模型”)的出现,加速了智能新时代的到来。然而,随着技术的蓬勃发展,大模型的网络安全也面临着巨大的挑战。如何更大程度地发挥大模型的社会和商业价值,促进AIGC健康长久发展,已成为业界普遍关注的话题。在此背景下,大模型的安全性成为制约AIGC技术发展前景的关键要素。大模型面临的“三重”安全风险大模型作为一种全新的技术手段,加速了各行业从“数字化”走向“智能化”的转变。然而,在人工智能技术与业务深度融合的同时,也带来了诸多潜在的安全风险。经过业务实践,目前大模型主要面临“三重”安全风险。从大模型自身的“内因”来看,大模型训练过程中的训练安全和推理过程中的内容合规是两个关键环节;从“外因”来看,如何防御外部攻击者高度隐蔽、快速迭代的持续精准攻击,成为抵御外部威胁的重点。风险一:大模型训练安全◆训练数据带来的风险大模型在训练过程中通常需要海量的训练数据,然而这些数据中可能存在部分违规内容。这些违规数据会误导大模型,形成错误的引导和不公平的结果,从而产生负面影响。此外,一些描述不准确、完整度不足、内容过时的低质量训练数据也会导致模型训练偏差,输出逻辑混乱的内容,进一步降低大模型训练的效果。◆模型算法自身风险大模型通过深度学习等人工智能算法,实现了对海量数据的高效处理与模式识别,极大地提升了人工智能的智能化一是算法偏见风险。由于训练数据的局限性和算法自身的局限性,大模型可能存在偏见和歧视性输出,对社会公正和个体权益造成威胁;二是算法可控性风险。随着大模型在关键领域的应用加深,其算法的可控性和稳定性成为重要考量因素,一旦算法失控,可能造成严重的经济损失;三是算法缺陷。攻击者利用算法设计中存在的缺陷引导大模型输出风险二:大模型内容合规风险虽然大模型具备生成高质量自然语言内容的能力,但受模型训练影响,可能生成有害信息,包括虚假信息、误导性内容以及带有偏见和歧视的言论。这些内容违反社会公序良俗,甚至触犯法律法规。由于大模型强大的生成能力,这类问题可能出现在各种形式的内容中,包括文字、图像、语音此外,恶意用户的恶意引导也可能诱使大模型生成意料之外的甚至是恶意的内容输出。这就是所谓的提示注入攻击,攻击者利用大模型基于上下文内容生成响应的特性,通过设计“提示”干扰正常的内容输入,比如在输入问题时加06H3C入一些隐晦的指示,以绕过现有的审查体系,生成攻击者希风险三:大模型运行环境风险大模型作为一个重要的业务应用,与其他应用一样面临巨大的安全挑战。由于大模型与垂直领域的深度融合,它逐渐成为攻击者的主要攻击目标。除了传统的DDoS攻击、网络入侵等攻击手段外,攻击者开始针对大模型进行持续、精准的攻击。首先,由于大模型的训练和推理需要依赖海量的硬件资源,攻击者对算力基础设施的攻击逐渐增多;其次,大模型在为内外部用户提供应用服务时,传统保护方案缺乏精细化、动态的访问控制手段,导致数据泄露、越权访问等风险增加;最后,由于大模型的日常访问流量巨大,且作为攻击者的重要目标,攻击手段变得更加复杂和隐蔽。因此,在高吞吐场景下进行加密流量监测已成为重要挑战。大模型安全防护策略及实践2023年7月,国家互联网信息办公室发布《生成式人工智能服务管理办法》,从内容监管、算法监管、数据监管、服务监管以及惩罚监管等多个维度提出全面要求,强调了促进AIGC技术健康发展与规范应用的重要性。2024年5月,全国网络安全标准化技术委员会发布《网络安全技术生成式人工智能服务安全基本要求》(征求意见稿),进一步从技术层面明确了AIGC服务的安全能力要求。因此,面对大模型所面临的三大安全挑战,需要从大模型的训练安全、内容合规安全以及运行环境安全三个方面出发,构建一个更加全面有效、智能动态的网络安全防护体系,实现大模型从训练到推理、从外部环境到内部应用的全面安全。训练安全:垂直行业数据安全治理与模型训练大模型的训练数据以及其自身算法带来的风险,最终可能导致大模型输出不精准、不正确或不可用的内容。这就需要引入训练数据治理和模型训练微调等手段,以优化算法缺陷,降低大模型自身的偏见,并解决大模型可控性的风险。数据是大模型训练的基石,因此数据安全治理是降低训练风险的关键。需要确保训练数据的完整性和准确性,剔除不相关、冗余或错误的数据,并将其转换为一致的格式。同时,对数据进行精确的标注,扩展数据集规模,以提升模型的泛化能力。通过不断改进数据治理流程,以提高数据的有效性与安全性。为了降低大模型自身的算法偏见、可控性和缺陷带来的风险,需要进行多轮的模型训练迭代,持续优化大模型。这包括利用大量且广泛的数据集进行大规模预训练,以及进行定向微调以产生多个候选模型。每个候选模型都需经过风险评估和可用性评估,若评估结果显示模型未达到预期的效果,则需要对模型进行进一步优化。这种大模型数据治理与螺旋式前进的模型训练和微调方法,构建了一个高度安全的垂直领域大模型共建方案。这不仅降低了大模型的安全风险,还提升了大模型在垂直领域应用的有效性、可靠性和实用性。目前,新华三正在与多家行业头部客户合作共建大模型,在安全前提下满足用户的定制化需求。内容合规:大模型内容安全防护在满足业务应用需求与国家监管要求的双重考量下,内容安全已经成为大模型实际使用中的“生死红线”。因此,构建一个体系化的大模型内容防护机制显得至关重要。一个出色的大模型内容防护体系应从输入侧、模型侧和输出侧三个层面对大模型进行综合防护。在输入侧,需对用户的输入进行严格审查,以确保其合规性与安全性。当系统监测到用户输入中包含恶意内容时,应立即中止当前会话,以避免潜在的安全风险。这既涉及显而易见的恶意内容,也包括更为隐蔽的恶意指代。在模型侧,管理是内容合规的核心,需要监控用户与大模型交互的全过程。通过实时监测,可以及时发现并阻止恶意用户试图实施的提示注入攻击,避免引导大模型产大模型的安全建设需要实战化、行业化、场景化07生违规内容。针对涉及敏感红线问题的情况,由内容安全产品代替回答,以确保回答的客观性和全面性,防止大模型误导用户或传播不合规信息。在输出侧,由于大模型生成的内容具有一定的随机性,因此存在不可控的风险。为此,必须对大模型输出的内容进行持续的检测和审查,重点检测输出内容中是否存在违规内容、侵权内容和隐私泄露的问题,确保用户能获得安全可靠的合法信息。新华三基于自主研发的“百业灵犀”私域大模型,推出了名为“灵犀卫士”的大模型安全防护体系。该体系从模型的输入侧、模型侧及输出侧为大模型提供全生命周期的安全保护。目前,“灵犀卫士”已在政务、金融、运营商等多个行业进行了落地实践,取得了行业客户的高度认可与信赖。运行安全:智算安全底座面对新型网络攻击行为的高度隐蔽性、快速迭代、持续攻击和精准打击,企业在构建和运行大模型时必须高度重视其运行环境的安全性。通过加强算力基础设施监控、业务访问控制和加密流量监测等措施,企业可以有效防范和应对各由于大模型业务依赖于海量算力资源,其在运行过程中面临着漏洞利用、网络攻击、数据泄漏等安全风险。为了应对这些潜在的威胁,需要我们在现有安全防护体系的基础上,进一步根据大模型的特性进行细化和补充,以提升大模在业务访问层面,大模型的用户包括外部用户和内部用户,他们各自拥有不同的访问权限,因此,实施有效的访问权限控制以及快速动态的授权机制至关重要。在传统防护体系的基础上,我们可以进一步引入零信任安全模型,根据业务需求和用户状态来快速调整权限,从而避免“一次授权、在流量监管层面,大模型产生了大量的业务流量,其中可能隐藏着各种形式的加密攻击。因此,提升对加密流量的监测能力成为防范这类攻击的关键所在。通过引入先进的流量分析工具和技术进行详细的流量分析和异常检测,我们能够识别潜在的安全威胁,并采取相应的防御措施来保障大模结束语人工智能的发展势头强劲,其技术与业务的深度融合也将不断深化。但不可忽视的是,安全作为保障AIGC的核心基石,拥有至关重要的业务价值。如果缺乏安全保障,人工智能产业化落地将缺乏稳固的根基,难以持续发展。更重要的是,大模型的安全发展需要与行业场景深度融合,才能让大模型真正应用于实际。因此,大模型的安全建设需要实战化、行业化、场景化。只有在实战中不断锤炼大模型的安全能力,才能应对日益复杂的攻防挑战;只有紧密贴合行业需求,才能持续增强模型的专业能力,使大模型真正变得08智算场景下南向互联技术发展研究文|中国信息通信研究院信息化与工业随着大模型参数达到万亿级别,建立大规模智算集群的需求驱动南、北向互联性能快速提升。相较北向互联,南向互联对互联带宽性能要求更高,是目前互联效率提升的主要瓶颈,也是互联技术创新最为活跃的领域。南向互联整体发展态势智算场景对AI芯片间互联提出高带宽、低延迟、高可靠性需求。随着大模型参数量呈指数级增长,单卡算力已无法满足海量数据处理需求,卡间互联技术成为制约大模型训练效率的关键瓶颈。当前GPU服务器架构正加速向超节点形态演进,单节点规模已扩展至数十乃至数百个GPU,由此产生的TB级数据吞吐需求和All-to-All通信模式对互联技术提出三重刚性需求:其一,物理层需突破高带宽传输极限;其二,链路层要实现微秒级低时延保障;其三,系统级需构建高可靠通信架构。特别是混合专家模型(MoE)等新型模型架构的广泛应用,使得Scale-up互联技术的优化成为行业攻关重点。南向互联网络的多层优化为其突破八卡限制实现超节点奠定基础。GPU间的通信域已从单机内的总线域扩展到包含数十乃至数百个GPU的超节点内,这不仅需要处理Tbps级别的高效互联需求,在规模和技术复杂度上也面临挑战。超节点方案面向机内拓扑、互联协议等进行改进,提出支持大规模GPU互联的开放性标准以及基于该标准的高速接口。此外,为了进一步提升超级节点的性能和可靠性,业界普遍对互联通信的物理层、链路层和事务层进行针对性优化,包括物理层轻量级FEC实现低时延优化,链路层重传及流控、报文格式优化,传输及事务层在网计算及拥塞管理、内存语义优化等,这些优化对提升带宽、降低时延等起到至关重要的作用。南向互联国内外技术发展情况及问题英伟达凭借私有的NVLink高速互联技术,在全球保持领先态势。当前,英伟达已推出最新第五代NVLink技术,并在其最新产品GB200得以应用,卡间互联速率可达1800GB/s,并搭配其高速交换机NVSwitch,实现灵活且高效的数据传输拓扑,一级Switch实现72卡互联,两级Switchs可实现576卡互联,率先实现了超级节点产品形态。此外,英特尔、AMD、微软、谷歌以及Meta等国际头部企业联合成立UALink联盟,AMD、博通等供给侧企业贡献互联、网络设备等关键技术,微软、Meta等需求侧企业提供海量应用场景,意图通过产业链上下游协同,以开放标准挑战英伟达既有领先态势。单机内卡间互联方面,国内GPU厂家通过私有协议实现8卡互联互通,互联拓扑较为简单,在互联规模与带宽性能扩展上面临挑战。国内GPU厂家主要采用基于PCIe、CXL等演化的私有协议,尚未对底层协议进行优化,且仅限于自家GPU互联,目前主要存在三条技术路线。一是私有互联协议,其优点在于可针对自身产品进行09定制研发和优化,实现高互联速率,但各家的方案无法兼容,卡间互联速率普遍能达到400GB/s(英伟达A800水平)。二是基于RoCEv2协议改进的方案,该方案和既有的以太网交换技术天然兼容,生态系统成熟,规模化部署难度较小,但存在互联延迟较大、编码效率和众核调度效率不高等问题。三是采用基于PCIe的互联方案,该方案无需额外设计或更改硬件,适用性强,但带宽与私有互联协议相差较大,如最新的PCIe6.0在16通道下的双向带宽仅有256GB/s,不及当前多数私有协议的50%。超级节点卡间互联方面,国内已有多家整机及网络厂商尝试推出基于Link+Switch的解决方案,互联规模及带宽大幅提升,并致力于研发Scale-up新型高速互联的统一标准,从而实现千卡级别的互联规模,以及800GB/s的带宽性能。其中,新华三基于自身在网络和计算领域的技术优势,推出集互联协议、计算节点、交换设备为一体的超级节点解决方案。中国移动联合行业企业主导的卡间OISA互联标准,基于总线技术路线,包括大规模GPU对等互联及高效物理传输等解决方案。此外,各领域厂商也在着力推动差异化的技术布局,如:UB标准,从卡间网络发展至卡间与机间,基于高速网络协议建立分布式全对等互联架构;OLink标准,基于以太网技术路线,对标国际组织UEC,对事务层语义操作、物理层FEC以及软件接口层框架进行优化;ALink标准,明确了从协议到芯片再到设备和软件的全链路的生态系统,支持UALink国际标准,数据面互连采用UALink协议。国内卡间互联技术分散、互不兼容,难以形成发展合力,成为制约我国高速互联技术发展的主要问题。当前,我国卡间互联技术呈现“多轨并行、生态割裂”的发展态势,已成为制约国产智算体系突破的关键因素。第一,技术路线碎片化削弱整体竞争力。国内头部企业各自为战,形成多套私有协议体系,虽单点性能可达英伟达A800水平,但协议互不兼容导致设备间难以协同。这种技术孤岛现象不仅造成重复研发投入,更使国产方案在与国际主流生态竞争时难以形成合力。第二,架构耦合性抬高生态统一门槛。现有私有协议均与芯片底层设计深度绑定,涉及物理层编码、链路层流控等核心模块的定制化开发。若强行推动协议统一,企业需重构芯片架构与配套软硬件体系,技术迁移成本高达数代产品周发展建议我国GPU卡间互联技术的突破需以“标准统一、生态开放、渐进融合”为核心原则,通过政策引导、技术协同与产业联动,将分散创新转化为生态合力。一是以开放标准为牵引,加速技术路径收敛。聚合头部企业、科研院所及用户单位,共同制定兼容现有方案的开放式互联协议框架,在物理层、事务层等核心模块设定统一接口规范,同时允许厂商在链路层保留差异化优化空间,兼顾生态统一性与技术创新性。二是实施分层推进策略,降低技术迁移成本。短期内可通过Chiplet等方式对计算、互联单元进行解耦,并在互联单元内支持不同私有协议间的数据包转译,缓解生态割裂问题,长期可利用市场选择,最终确定统一的协议路线,实现互联解决方案的完全统一。三是构建开放认证体系,推动生态国际化。建立第三方兼容性认证中心,对符合统一标准的设备进行性能测试与互操作性认证,并纳入政府采购目录,激励企业技术适配,同时积极参与国际标准制定,推动国内协议与UALink、UCIe等国际标准互联互通,提升全球话语权。DDC,以创新架构树立智算网络性能标杆文|新华三集团交换机产品线韦赟当今数智化热潮中,智算项目已智算网络的首要目标是与AI训练数据的传输需求匹配,AI业务对网络◆高带宽:AI训练的本质是大量GPU进行并行计算,而GPU之间需要通过高速网卡和外部网络实现数据交换。目前主流网卡接入速率为200G和400G,800G也即将上市,因此网络设备的接口应满足400G/800G的接◆大规模:智算网络架构需要面对规模迥异的AI训练规模,从数十卡到数十万卡,满足训练资源持续扩容的需求,能平滑扩展的大规模组网能◆无损传输:AI训练业务对丢包极为敏感,轻则导致吞吐效率降低,重则将使训练任务中断。而AI数据的流量模型又极易导致网络拥塞,传统的ECMP技术已无力应对,亟需新的◆多元异构:当前智算生态百花齐放,各厂商的GPU/网卡产品均具备独特的产品特色,一张具备异构整合能力的网络,将使客户在升级算力、目前应用于AI场景中的有如下几种主流的网络解决方案,但均具备一◆机架式核心交换机高性能的机架式交换机,采用CLOS架构设计,通过后端交换网板和前端业务线卡的交叉连接,以及基于信元的传输技术,实现框内无阻塞传输的效果,从网络负载技术的角度非常适合AI业务。而这种方案的缺点是单台设备端口数有限(通常仅有数百个端口),且单台设备功耗过大,◆盒式交换机+RoCE技术该方案组网模型类似数据中心的Spine-Leaf架构,通过数十至数百台400G/800G盒式交换机互联,支持规立决策转发,因此ECMP哈希极化问不均而产生拥塞。与此同时,大规模Spine-Leaf架构也会带来的大量设备◆私有的封闭方案部分同时可提供GPU和网络方案的厂商,会通过集合通信库(CCL)将二者进行捆绑,迫使客户只能选择整套解决方案。此种网络方案可能更适用于同品牌算力资源,但在面对异构算力需求时,则展现出封闭的态度面对以上技术需求和现实挑战,新华三DDC(DiversifiedDynam-ic-Connectivity,多元动态联接)DDC架构DDC是新华三创新推出的智算网络架构,基于创新的设备和架构设计,搭配ComwareV9操作系统平台,整合信元转发平面和大规模组网能力,解决了AI应用的拥塞与调度难题。DDC架构关键创新能力如下。◆架构创新DDC借鉴了机架式交换机的机内和业务线卡设计成独立工作的盒式形态,再通过800G高速网络进行同时,新华三采用控制转发一体化设计,简化了机架式的主控板机制,将组网精简为NCP+NCF两级架构(NCP相当于业务线卡,NCF相当去中心化方案在完整保留DDC功能的同时,大幅提升了系统的可靠性和可扩展性,使其更加适应云原生、分布式网络的演进需求,避免了管理◆极致性能Queueing)和信元(Cell)交换机VoQ是一种用于拥塞控制的高性能队列管理技术,其核心机制是采用多虚拟输出队列对应多出端口。发送端在发送前,先向接受侧申请带宽资源,获取资源确认后,再灵活调度队列完成流量转发。利用VoQ技术,可以实现DDC系统内的有序流量调度,提高网络利用率:通过避免拥塞和优化数据流传输路径,提升网络的信元交换则是实现多路径负载均弱负载均衡效果图2信元交换转发机制NCF2NCF1③端口4NCF2NCF1③端口4端口2端口3端口412NCP1端口3端口21Cell转发域NCP2NCP32NCP4②12NCP1端口3端口21Cell转发域NCP2NCP32NCP4②①④IP转发域①④Server2Server3Server4Server2Server3Server4Server1图3DDC信元转发流程示意衡的关键技术,数据报文通过NCP进换的多链路利用率更高,能实现100%通过信元交换机制,DDC大大降低网络拥塞风险,提高了网络的稳定文,在NCP1查转发表,得到System-Port和远端NCP封装信息索引;2)NCP1根据SystemPort将报文入VoQ队列,如果有令牌,则将报文切割后加Cell封装,封装头中包含ModID、PortID等信息,然后通过Cell口喷射给NCF;3)NCF收到Cell报文后,查找本地Cell转发表得到出接口后发给通过VoQ和信元交换,DDC在大规模网络内实现了最优的无损传输和负载均衡效果,实际性能可参考后◆开放解耦DDC的开放解耦能力,体现在对算力设施的解耦支持和DDC系统的开12NCF-YNCF12...NCP-X12...NCP...图1DDC组网架构示意·在算力设施的解耦支持上,信元交换和标准RoCE协议的组合,成在智算网络中,端侧(CCL/G-PU/网卡)部分的能力将会影响整体网络的吞吐效率和负载均衡部署方案。例如,当网络采用逐包负载方案NCP新品NCFNCP新品NCF新品128*800GOSFP信元端口36*400G36*400GQ112以太端口+20*800GOSFP信元端口18*800GOSFP以太端口+20*800G/40*400GOSFP信元端口S12500AI-36DH20EPS12500AI-36DH20EPS12500AI-18EP20EP图4H3CS12500AI系列DDC交换机50403020100H3CDDCH3CDDCInfiniBand图5DDC网络性能测试(All-to-All)DDC可以实现网络与端侧能力的解耦,不仅支持多种端口封装的网卡互联,同时利用信元切片和重组能力,将乱序重排功能集成到网络侧,另外,在传统方案中,不同网卡对应流的会话(QP规格)数不同,会带来的哈希效果不同的问题。DDC的信元转发机制,可以忽视QP特征样本数量,即使单QP同样可以切片喷洒,将网卡QP规格不足的劣势完美化解。因此,DDC方案可以完美解决端侧生态能力不一带来的网络性能问题,从而打破算网设施的捆绑,解除·在架构内的开放能力上,新华三在设计DDC架构之初,就完全考虑DDC的控制平面使用标准的BGPEVPN协议,不但实现网元之间自协能支持不同厂商的NCP/NCF实现异构基于DDC在协议层面的开放设计,2024年,新华三与合作伙伴针对DDC架构开放和标准化分别在需求场景分析、方案框架定义、技术方案落地等三个方面提交多篇标准议案,致草案中明确了DDC的架构实现框架OSF(OpenScheduleFabric,开放调度网络),将调度式网络架构与传统以太网络结合,达到均衡利用网络资源、故障快速切换等优化目标,旨在通过网络侧优化解决AI应用给以太网络带来的新挑战。该草案中对于OSF网络,明确定义以下层次。OSF管理层:主要负责监控、配置与维护OSF设备。OSF控制层:主要负责维护OSFOSF数据层:主要负责根据控制层下发的路由信息对数据包进行封装、转发和解封,并将数据包发送到通过标准化各层的实现机制和信息交互,不同网络厂家均可以基于此标准开发NCP/NCF设备,并在DDC架构下实现互通,达到传统以太Spine-Leaf架构中的异构互通效果。基于架构创新、极致性能、开放解耦三方面的关键能力,新华三在业界首发了基于DDC架构的H3CS12500AI交换机,充分验证了设计H3CS12500AI系列DDC交换机新华三全新一代DDC交换机H3CS12500AI提供普遍适用于超大规模的800GOSFP800,NCP下行端口支持400GQSFP112和800GOSFP800两种形态,可以充分满足当前主流网DDC组网提供远超于单框式设备的扩容能力,摆脱传统框式设备端口NCF+NCP两级组网下提供9216端口400G或4608端口800G接入能力,DDC多级多集群互联组网方案中,最DDC目前已经通过Tolly测试机构基于多卡GPU的集合通信库NVIDIA(NCCL)以及大模型(Llama3)的性能测试,其中NCCLAll-to-All测试结果表明,H3CDDC架构网络的总线带宽(busbw)较InfiniBand方案平均提升2.5%,在大消息传输场景下表当前,新华三DDC产品已在多家行业客户中规模化部署,这一实践充分印证了遵循开放标准的DDC技术在全栈智能、应用为先新华三LinSeerCube大模型一体机打通AI落地最后一公里随着“AI平权”步入深化应用的新阶段,大模型技术正面临创新突破与落地实践的双重考验,在底层架构持续突破◆部署流程复杂,应用门槛高:传统大模型部署涉及复杂的软硬件适配与冗长的测试验证周期,难以满足业务快速上线的需求。◆模型通用性强,场景适配不足:通用大模型无法满足细分场景需求,定制开发投入资源多、周期长,行业数据如何整合为行业知识库、如何实现大模型的行业化调优、如何◆前后端割裂化,运维成本高:模型部署后的性能调优与持续迭代需专业技术团队全程支持,形成“部署即负债”的运维困局。全栈智能,开箱即用面对大模型落地“三重困局”,新华三集团依托在AIGC领域的全栈技术生态与行业实践沉淀,推出了业界首个“智算-算法-治理”深度耦合的DeepSeek大模型一体机——LinSeerCube。依托强大算力,全面搭载Deep-SeekV3、R1模型,不仅可支持国内外不同GPU品牌,更可全面实现从14B至671B规模的大模型单机推理及单机训推一体服务。同时,LinSeerCube大模型一体机还以开箱即用的全栈交付、垂直领域的深度定制、端到端全生命周期全栈交付:开箱即用的智能引擎新华三基于ICT全栈布局及“算力×联接”的理念,打造“硬件+算法+平台”三位一体的全栈AI解决方案。基础设施层:提供预集成的智能算力集群,实现网络、存储、安全的统一编排。算法服务层:预置DeepSeek基础大模型及行业优化版本,支持后续模型的蒸馏和微调。应用使能层:内置H3CAlStore智能资产平台,免费开放超过1000款开源数据集、模型及镜像,商用资源一键付费获取。使用户获取上百GB镜像和模型等AI资产的时间从几天缩短到几小时。通过“交钥匙”交付模式,实现快速部署,内置Web前端可视化操作界面,提供标准化API,减少重复开发工作场景智能:垂直领域的深度定制新华三深耕政企市场,聚焦行业场景差异化与数据多样性挑战,通过中试场等平台积累行业专家经验,按需深度定制金融、医疗、制造等垂直场景模型并打造可复制的典型应用,打通模型落地“最后一公里”。LinSeerCube大模型一体机支持DeepSeek及其他大模型的蒸馏、微调和推理到工作流编排,提供AI一站式服务,支持行业数据资产化、模型调优积木化、AI应用工作流自由编排,实现端到端的行业AI应用交付。新华三LinSeerCube大模型一体机持续进化:端到端全生命周期服务新华三提供“硬件+模型+全栈+服务”服务体系,包括前期咨询(基于政企服务经验,为企业定制场景化落地方案)、中期部署(支持弹性扩缩容与API封装,算力资源按需动态调整,提升利用率)、后期运维(通过AI能力,提升自动化运维监控手段和效率)、增值服务(提供算力优化、模型调参等订阅服务,释放AI性能潜力)的全生命周期服务,为用户提供LinSeerCube大模型一体机的本地化部署及服务。应用为先,加速落地新华三助力百行百业客户收获AI红利大模型一体机这种开箱即用的一站式交付方式,不仅可以快速满足不同规模、不同业务阶段企业的AI能力部署需求,更以本地部署的模式充分确保了用户的数据安全和业务安全。同时,在无网络或弱网络环境下,本地部署的一体机展现出不可替代的稳定性与可用性。随着Deep-Seek在垂直领域的渗透,大模型一体机更可以通过行业适配与生态协同,充分满足不同客户的场景化应用与个性化需求。这种端到端的解决方案让企业省去算力资源搭建和大模型部署调优的繁琐过程,即刻开启AI应用开发进程。面对百行百业不同应用场景、不同业务体量的个性化需求,新华三快速携手业内头部合作伙伴,融合场景应用软件,通过以新华三LinSeerCube大模型一体机为底座的软硬一体解决方案,为客户交付端到端的模型部署和AI应用开发能力。目前,新华三已经在政府、教育、医疗、金融、企业等多个行业帮助客户实现了DeepSeek大模型的本地私有化部署及场景落地,取得了良好的应用效果和行业示范效应。在教育领域,新华三为包括华东师范大学、南昌大学等在内的众多“双一流”高校实现了DeepSeek大模型在科研、教学等多个核心业务场景的应用,提升学术研究效率、教学体验和校园管理质量的同时,还满足了高校对科研数据和师生信息的隐私保护需求。在医疗领域,新华三助力无锡中医医院等多个三甲医院成功落地DeepSeek大模型,以满足复杂医学模型的训练和快速诊断推理需求,助力医院在临床诊断、医疗科研及医院运营和患者服务等方面的效率与体验提升。在金融领域,针对智能客服、实时风控、精准营销等典型业务场景,新华三成功帮助多家商业银行完成Deep-Seek的私有化部署,真正实现了AI技术信贷风控、智能投研等关键金融业务场景的垂直适配。在政府领域,基于DeepSeek系列模型的部署与应用,新华三助力杭州、郑州、咸阳等城市实现了AI政务应用落地,通过公文处理、民生服务和决策支持等典型场景应用,形成可复制的城市治理范式,有效推动了AI技术在全国重点省市级行政区智慧应用中的规模化部署进程。在央企和制造业领域,新华三助力其实现基于AI技术的关键业务流程优化,充分发挥DeepSeek大模型的自然语言处理能力及对复杂任务拆解能力,改善自身研发和生产销售流程,推进客户在产品研发优化、生产供应管理、企业运营提质、业务决策分析等环节的智能化转型升级。新华三还与运营商展开积极合作,推进多项基于LinSeerCube大模型一体机的业务场景测试,有望在运营商政企领域打通大模型场景化应用的最后一公里。新华三LinSeerCube大模型一体机不仅满足了企业级场景的严苛需求,也再次验证了新华三智算基础设施对大模型的卓越支撑能力,充分激活大模型的智能潜力。未来,新华三集团将继续秉持“精耕务实,为时代赋智慧”的理念,不断加速产品技术进化、完善生态合作体系,赋能包括DeepSeek等在内的优质大模型,加速百行百业数字化变革。如何定义下一代AI数据存储平台文|新华三集团云与计算存储产品线徐菲随着人工智能、科学计算等智算场景的快速发展,海量非结构化数据的实时处理与超大规模模型训练对存储系统提出了前所未有的挑战。分布式存储技术凭借其横向扩展、多节点协同和全局资源池化的特性,正成为支撑智算基础设施的核心基座。通过重构的架构设计和底层协议优化,新华三Polaris分布式存储系统实现了存储性能的突破性跃迁:在带宽维度上,依托全闪存硬件与RDMA网络构建的超高速数据通道,可稳定提供百GB级带宽性能,充分释放GPU集群的计算潜力;在IOPS维度上,通过独创的元数据管理框架,将随机读写性能提升至百万级指标,完美匹配AI训练、实时推理等高并发场景需求。这两大技术支点不仅重新定义了存储性能边界,更为智算时代的数据密集型Polaris如何应对AI训练中的高带宽存储挑战随着AI市场的爆炸性增长和大模型如GPT系列等的涌现,AI领域对算力和存储的需求呈指数级增长。这种需求的快速扩张不仅源于模型训练数据的庞大体量,还由于这些模型包含数以十亿计乃至万亿的参数,需要强在AI训练过程中,需要在极短的存储系统在AI应用的训练阶段尤GPT-4等模型,其参数规模的迅速增长已经超越了传统存储系统所能轻松处理的范围。这些模型的参数量由数十亿转向数千亿,甚至上万亿,导致对存储系统的带宽和响应时间方面的要求大幅提升。同时,这种增长也对数据处理速度和存储稳定性提出了更严苛的需求,以便能在训练过程中H3C实时、高效地读取和存储数据。在大模型开发过程中,训练中断是常见的现象,可能由诸如网络问题、硬件故障及其他未知原因引起。为了减小损失并提高效率,多数大模型厂商会使用“检查点”(Check-point)技术。通过定期保存当前的训练状态,一旦系统中断可从最后的检查点继续,从而避免重新训练整个模型。然而,这一过程本身是一个同步阻塞的过程,意味着当GPU执行检查点的存储操作时,无法进行其他计算,直接导致训练暂停。此外,AI大模型的训练过程是耗资巨大的。据报道,微软Azure为训练ChatGPT构建了一个超过1万枚英伟达A100GPU芯片的庞大计算集群,其完整的模型训练成本高达数千万美元。因此,在训练阶段,对每一分钟的GPU利用率的优化极为关键,为了实现高效稳定的训练,AI开发者需要在算力和存储资源之间取得平衡。特别是在执行检查点操作时,存储系统必须应对高并发和高吞吐量的挑战,以确保GPU资源能够最大限度地发挥其作用。这不仅关系到大模型训练的效率,也影响整个AI计算集群的经济效益。Polaris如何应对高带宽存储挑战众所周知,Checkpoint本质上是一组大小从GB到TB不等的大型数据文件。在处理这些Checkpoint文件时,优化读写性能显得尤为重要。从存储角度来看,这一优化主要集中在提升大I/O操作的效率。Polaris在软件方面,通过高性能并行客户端减少东西向数据量的转发;通过智能分流、RDMA技术缩短IO路径;通过内存零拷贝技术减少IO路径上的数据通用NAS访问方式计算节点计算节点EPC客户端 EPC客户端计算节点计算节点EPC客户端 EPC客户端IB/RoCEMPI-IOEPC客户端计算节点计算节点通用客户端通用客户端通用客户端TCP/IPTCP/IPCIFSFTPNFSTCP/IPTCP/IPTCP/IPCIFSFTP图1访问方式对比:NASvs并行文件系统拷贝。这些多管齐下的优化策略,使Polaris释放了存储系统的性能潜力,全闪单节点带宽超过50GB/s,确保在处理Checkpoint文件时能保持高效、稳定的性能水平。◆高性能并行客户端原有的标准协议架构,1个标准的NFS客户端只能与一个存储节点相连,客户端访问的数据需要在存储节点间二次转发,才能实现跨节点的数据访问。而Polaris支持高性能并行客户端(EPC),通过并行客户端可直接访问多个存储节点,无需通过存储间节点转发,缩短IO路径,降低数据访问时延。◆智能分流技术在协议层将大小IO分开处理。小IO写入Cache后,即可返回写请求,小IO性能得到提升。大IO则绕过缓存,请求下发到持久化层后,由持久化层直接通过RDMA读命令,从协议层拉取数据,缩短IO路径,减小网络、内存和硬盘带宽的开销,提高大IO落盘效率。大IO直通持久化层,经过副本/EC策略后落到持久化介质,节省了Cache占用和相应的CPU资源开销。◆智能分流技术在协议层将大小IO分开处理。小IO写入Cache后,即可返回写请求,小IO性能得到提升。大IO则绕过缓存,请求下发到持久化层后,由持久化层直接通过RDMA读命令,从协议层拉取数据,缩短IO路径,减小网络、内存和硬盘带宽的开销,提高大IO落盘效率。大IO直通持久化层,经过副本/EC策略后落到持久化介质,节省了Cache占用和相应的CPU资源开销。大IO小IO小IO小IO小IO小IO协议层-NFS/SMB/SMB/S3/iSCSI/NVMe-oF大IO小IO小IO小IO小IO小IO协议层-NFS/SMB/SMB/S3/iSCSI/NVMe-oF缓存层-分布式Cache缓存层-分布式Cache小小IO小IO小IO小IO小IORDMA持久化层-HDD持久化层-HDD/SSD拷贝拷贝发送端接收端BufferBuffer应用应用发送端接收端BufferBuffer应用应用拷贝BufferCPUOSBufferCPUOSBufferCPUOSBufferCPUOS拷贝…………RDMA…………BufferBufferBufferBufferTCP/IP图3RDMA技术优化存储性能◆全RDMA互联与传统的TCP/IP通信机制相比较,RDMA技术通过运用内核绕行(KernelBypass)和零拷贝(ZeroCopy)技术实现了关键性能优化。这种优化显著降低了网络传输延迟,并有效减少了CPU使用率,进而缓解了内存带宽瓶颈问题,充分提升了系统对带宽资源的利用效率。◆内存零拷贝传统用户态设计中,一次数据传输过程,发生了4次上下文切换和四次拷贝。第一次拷贝,把磁盘上的数据拷贝到操作系统内核的缓冲区里,这个拷贝的过程是通过DMA搬运的。第二次拷贝,把内核缓冲区的数据拷贝到用户的缓冲区里,于是我们应用程序就可以使用这部分数据了,这个拷贝到过程是由CPU完成的。第三次拷贝,把刚才拷贝到用户的缓冲区里的数据,再拷贝到内核的Socket的缓冲区里,这个过程依然还是由CPU搬运的。第四次拷贝,把内核的Socket缓冲区里的数据,拷贝到网卡的缓冲区Polaris采用了全用户态设计,实现了内存零拷贝。在Polaris存储系统中1次数据传输过程,不发生上下文切换,仅需要2次DMA拷贝。无CPU拷贝,减少了CPU的开销,因此提升了CPU拷贝2CPU拷贝3用户态Socket缓冲区内核DMA拷贝4用户缓冲区 Read切换1切换2CPU拷贝2CPU拷贝3用户态Socket缓冲区内核DMA拷贝4用户缓冲区 Read切换1切换2Write切换3切换4DMA拷贝1缓存区用户进程用户进程硬件持久化缓存/元数据协议组件存储引擎基础组件(网络管理+零拷贝内存管理)NFSSMBS3 客户应用EPC-私有客户端 协议组件网络EPC-内核组件DMA拷贝1DMA拷贝2内核接口存储节点计算节点持久化缓存/元数据协议组件存储引擎基础组件(网络管理+零拷贝内存管理)NFSSMBS3 客户应用EPC-私有客户端 协议组件网络EPC-内核组件DMA拷贝1DMA拷贝2内核接口用户态内核硬件RDMA(RoCE/IB)硬件H3CPolaris全用户态设计传统设计用户态/内核态反复切换Polaris为AI训练提供超百万IOPS小文件处理能力IOPS是什么IOPS是Input/OutputPerSecond的缩写,即每秒的输入输出量(或读写次数)。IOPS是衡量存储设秒可以执行多少次数据读写操作。IOPS越高,意味着存储设备处理数据AI训练为什么需要百万IOPSGPU训练计算数据加载检查点保存近年来,AI领域取得了显著的发展,成为广泛关注的热点。AI的工作负载主要由两个关键阶段组成:训练和推理。在训练阶段,存储系统的性能对于整体效率至关重要,特别是在两个方面:训练数据的加载和检查点(checkpoint)的保存。前文中已讨论了Polaris通过加快检查点写入速度以减少GPU等待时间,从而提升训练效率。检查点是一组GB到TBGPU训练计算数据加载检查点保存存储的要求是提供高带宽能力。那么训练数据的特点是什么?对存储的要以NvidiaDGXSuperPOD的于A100单节点AI服务器,其推荐的读用这一带宽,系统需要每秒处理多达GPU训练检查点保存必须具备极高的并发处理能力和低延迟,以确保在如此高的文件访问频率GPU训练检查点保存GPU训练存储检查点保存存储检查点保存表1不同GPU在处理自然语言模型时对存储系统的要求性能应用场景数据集加载方式H100A100单AI服务器写(GBps)单AI服务器读(GBps)单AI服务器写(GBps)单AI服务器读(GBps)1(Bert、GPT)24122Net、ResNet50)48243高清图像、视频处理405超百万IOPS是如何炼成的处理海量小文件的读写操作通常会带来高额的I/O开销和沉重的元数据管理负担。在这些操作中,元数据处理往往占据了很大的比例,可能达到整体操作的70%至80%。这使得元数据性能成为限制系统I/O操作次数(IOPS)的主要瓶颈之一。为应对这一挑战,Polaris系统引入了一种高效的元数据管理框架,能够提供百万级的IOPS性能。首先,Polaris采用了一种全局分散的元数据处理策略,将元数据均匀分布到多个节点进行处理。这种方法有效地消除了单点瓶颈,极大地提高了系统的并其次,Polaris引入了全局共享的分布式缓存策略,为业务I/O提供了一个共享的分布式缓存加速资源池。用户的写请求在被写入该缓存池后立即返回成功确认,从而显著提升了请求的响应速度。在数据落盘时,Polaris通过ROW(Redirect-on-write,写时重定向)技术,将随机的小I/O操作聚合成大I/O进行顺序写入。这不仅有效地减少了EC(纠删码)场景下的写惩罚,还降低了元数据操作次数及CPU的开销,同时减少了容量浪费。这些技术应用显著提升了Polaris在处理小文件时的性能表现,使其能够更高效地应对海量小文件操作带来◆全局分散的元数据处理方式MDS(元数据服务)采用全主模式,每个元数据节点提供n个VMDS服务。每个VMDS处理归属自己的元数据,处理能力随硬件资源提升线性提升。目录A创建后,系统会为其自动生成x个虚拟目录。虚拟目录通过Hash算法随机打散到VMDS上。每个虚拟目录对应固定的VMDS服务(假设虚拟目录1对应的元数据服务是VMDSn)。当向目录A写入文件file1时,系统会根据file1的文件名称计算落到哪),file1的元数据处理就自动分配到VMDSn。◆全局分布式缓存&ROW技术业务主机下发的小IO写入分布式数据在分布式缓存中,随机小IO通过ROW技术聚合成大IO顺序落盘。EC场景则聚合成满条带写入持久化介质。避免了未满条带的情况下带来的写惩罚,无需将原有数据读出后计算新的校验位再写入。减少了元数据的操作次数和CPU开销,从而提升了系统性能。结束语在智算时代数据洪流与算力需求双重爆发的大背景下,存储系统作为连接数据价值与计算效能的核心枢纽,其性能边界直接决定了AI基础设施的整体效率上限。新华三Polaris分布式存储系统通过架构层级的颠覆IOPS的双重突破,为AI训练场景构建了全维度性能支撑体系,不仅解决了传统存储系统在扩展性、延迟和吞吐量上的固有瓶颈,更通过存储与算力的深度协同,使GPU集群的资源利用率得以大幅提升,为千亿参数大模型训练节省成本,提升效率。未来,随着AI工作负载的持续复杂化,Polaris将持续深化软硬协同创新,以存储基座的重构推动智算生态的效率跃迁,为全球AI产业提供坚实的数据动能引擎。目录A目录A……目录x-1…………VMDS1VMDSn+1VMDS2n+1VMDS2 VMDSn+2VMDS2n+2VMDSn-1…………VMDS1VMDSn+1VMDS2n+1VMDS2 VMDSn+2VMDS2n+2VMDSn-1VMDS2n-1VMDS3n-1VMDSnVMDS2n VMDS3n……NODE1NODE3NODE2NODE1NODE320H3C应对大模型挑战的算力平台技术新路径文|新华三集团云与计算存储产品线吴若昊随着技术的加速迭代,尤其是千亿级参数大模型的爆发式增长,正在全球范围内引发新一轮算力革命,以DeepSeek-R1-671B为代表的国产大模型在2025年展现出强劲发展势头,其技术路径与产业实践为破解算力瓶颈、重构AI基础设施提供了全新思路。智算时代已经到来,算力平台技术的新发展将为智算时代带来无限可能。热潮背后近年来,国家大力推进算力平台建设发展。相关数据显示,预计我国2025年智能算力规模将较2024年增长43%,2026年实现翻倍,进一步巩与之相对,国家相关政策、标准也频频出台:国务院国资委在2024年中央企业人工智能专题推进会上强调,将人工智能发展纳入国资央企全局工作,明确要求中央企业加快建设智能算力中心。2024年7月,国资委进一步提出“有序推进智算中心和算力调度运营平台建设”,要求通过多元异构算力调度技术支撑千亿级大模型训练,并推动建设万卡级算力集群,做强智算能力供给;住建部《城市数字公共基础设施标准体系》也首次将以智算中心为代表的算力基础设施纳入城市数字基建标准,明确多元算力协同的技术规范;工信部发布的《算力基础设施高质量发展行动计划》则从技术路径与实施机制层面细化政策落地,提出“算力效能倍增计划”,其深层逻辑在于推动算力从“规模扩张”向“质量跃升”转型……在日渐火热的市场需求与政策引领背后,人工智能、算力平台的概念其实早已热潮涌动许久。早在2017年,新华三从数据出发面向实际场景:建立学生画像,助力学校扶贫攻坚;建立病历分析模型,提高医疗效率;建立网流分析模型,保障企业网络安全。而随着神经网络技术的不断迭代演进,新华三基于“ABC架构”,即AI、Bigdata、Cloud,通过云上能力,结合数据支撑,打通了一站式AI平台的技术路径。解决了用户算力资源的管理、监控、调度问题,通过在AI算法领域的积累,解决了算法工程学习门槛高、使用不便捷的问题。2023年,大模型的大潮奔涌之下,算力平台的概念又一次站在了时代的浪尖上,也在这一年,新华三云平台凭借万级容器大规模集群调度的能力荣获国家科技进步二等奖。傲飞作为新华三云平台能力的延伸,成为AI和HPC资源一体化管理的集群算力平台,基于八年来的技术沉淀,傲飞不仅保留了降低用户使用门槛,可视化算法开发流程的能力,也基于容器调度、容器管理、容器监控等能力,充分挖掘计算性能,融合异构算力,实现了AI和HPC资源的灵活调配管理与统一运营调度,真正实现了业务的深度融合。为满足国产化潮流带来的更深刻的智算需求和更严苛的业务场景,傲飞算力平台以新华三“云-网-安-算-存-端”全产业链综合布局为抓手,探索全新的异构融合的算力调度解决方案,加速推进国产化数字化转型升级。作为一项专门面向AI场景的平台,傲飞在原有云底座的基础上进行了升级,整合了ICT的多个套件,囊括网络、通信、计算、存储、安全等功能。灵活底座支撑全场景灵活适配随着智算中心建设如火如荼,如何让算力运营价值最大化成了投资方思考的重点。在这个时代背景下,新华三敏锐地察觉到部署国产化、异构算力将极大提升客户算力投资的回报。首先,在平台部署的技术路线上,傲飞支持CloudOS7.0与Matrix底座,可以应对大规模算力运营和自建型算力中心两种差异化场景。在这两个场景下,既可以应对拥有对AI业务旺盛需求的中小客户,也可以灵活应对需要精细化管理和运营的大规模集群客户,实现高中低灵活应对。异构兼容架构带来高效算力卡适配傲飞算力平台适配了多家厂商40+款加速卡型号,其中超半数为国产化加速卡设备。为了充分利用现有的算力卡设备,提高昂贵算力设备的利用率,傲飞坚持基于容器技术搭建平台的技术路线,整合优化资源调度引擎和监控管理模块实现算力的合理分配和使用,支持用户根据不同任务选择不同的算力资源分配策略。再次,国产化算力设备的交付选择也带来了不同架构算力卡的适配兼容问题——不同算力卡的底层架构不一致,上层插件不通用。为了应对这个挑战,傲飞将设备驱动的部分接口层进行抽象处理,调度层将所有的算力卡以CRD形式池化纳管,业务层针AI作业HPC作业Jupyter作业AI作业(Volcano/Slurm)智算资源池A智算资源池B超算资源池智算资源池AHPC-NodeAI-NodeAI-NodeAI-NodeAI-NodeHPC-NodeHPC-NodeAI-NodeAI-NodeAI-NodeAI-NodeAI-NodeAI-NodeAI-NodeAI-NodeHPC-NodeHPC-NodeAI-NodeAI-NodeAI-NodeAI-NodeHPC-Node图1傲飞统一管理AI和HPC算力资源22对资源监控、资源调度等建立统一API接口,极大降低了国产算力卡的适配难度,其适配周期由原有的2-3周缩短到了2天以内。应用牵引相关从业者都希望终有一天AI能够成为自己提高工作效率的帮手,成为自己突破知识瓶颈的伙伴。当AI从静态的“工具”进化为动态的“智能体”,人工智能的终极形态正加速照进现实。从OpenAI的GPT-4o多模态交互,到Manus的20多个工具的

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论