IT服务Ⅱ行业深度报告-AIInfra研究专题2:AI云业务核心竞争点-单任务成本_第1页
IT服务Ⅱ行业深度报告-AIInfra研究专题2:AI云业务核心竞争点-单任务成本_第2页
IT服务Ⅱ行业深度报告-AIInfra研究专题2:AI云业务核心竞争点-单任务成本_第3页
IT服务Ⅱ行业深度报告-AIInfra研究专题2:AI云业务核心竞争点-单任务成本_第4页
IT服务Ⅱ行业深度报告-AIInfra研究专题2:AI云业务核心竞争点-单任务成本_第5页
已阅读5页,还剩25页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

目录云业务核心竞争力1:全栈优势 7全栈优势核心1:从“局部最优”到“系统最优” 7谷歌全栈自研:“芯片+模型”跨层协同优化使底层芯片算力更充分地转化为有效吞吐(GoogleTPU+Gemma) 7英伟达+Nebius联合调优提高效率:NebiusAICloud+NvidiaRun:ai联合测试GPU动态分片可提高效率1.2全栈优势核心2:为客户提供更高附加值 1.3从全栈角度对比Nebius和CoreWeave 16云业务核心竞争力2:规模优势 19规模优势核心1:通过大数定律消除流量波动,提高集群利用率 19GPU分片提高利用率 19提高continuousbatching效果 20Prefill/Decode解耦更有效 21大规模集群提高资源复用:如冗余复用、KV-Cache复用、模型和MoE复用等 22规模优势核心2:边际成本(TCO)下降 24规模优势意味着:降低采购成本&持续锁定电力 24摊薄软件成本、团队人力等固定成本 25如何理解Hyperscaler与Neocloud各自的竞争优势? 26CSP的核心竞争力:全栈+规模 26横向的规模优势 26纵向全栈整合优势 27Neocloud的差异化竞争力:专业AI集群优化+同质第三方流量 28Neocloud快速成长核心支撑:供需缺口+竞争平衡 28Neocloud未来核心差异化优势来源 29投资建议 32风险提示 32图表目录图1:2030年,预计全球token调用量将增长24倍 6图2:不同上下文长度下的TPU和GPU推理基准测试结果对比 8图3:TPU和GPU推理对比 9图4:Pathways和JAX多程序并发聚合吞吐对比 10图5:Google的全栈优化 图6:Run:ai通过集群级资源调度提升GPU利用效率 12图7:使用0.5GPU分片的并发用户为GPU总容量的86% 12图8:使用0.5GPU分片的输出吞吐量为满GPU吞吐量的77% 12图9:使用0.25GPU分片的容量比全GPU分配高72% 13图10:使用0.25GPU分片的吞吐量略低于全GPU分配 13图在NebiusAICloud的NVIDIAHGXB200集群上运行多个模型的系统用户总数增加了近3倍 13图12:在NebiusAICloud的NVIDIAHGXB200集群上运行多个模型时的总吞吐量 13图13:Llama3.18B在NVIDIAHGXB200上的自动扩展结果 14图14:AI基础设施的四大层级及代表企业所处层级 15图15:CoreWeave大客户收入占比显著高于Nebius 17图16:Nebius全栈技术能力 17图17:CoreWeave全栈技术能力 18图18:GPU分片 20图19:静态批处理和连续批处理的时序对比 21图20:连续批处理大幅提高模型token吞吐量 21图21:P/D解耦架构 22图22:专家并行策略 23图23:FlexMoE、SwiftMoE动态调整专家提高训练收敛速度 23图24:FlexMoE、SwiftMoE动态调整专家提高留存率 23图25:云计算成本构成 24图26:2015-2020年台湾广达、SMCI营业利润率低于Dell和HPE服务器相关业务营业利润率 24图27:谷歌云利润弹性主要驱动来自人员成本的规模效应 25图28:2022-2034年,全球云计算市场规模不断扩大(单位:万亿美元) 26图29:HyperscalerVSNeocloud业务规模对比 27图30:2025年Neocloud增速明显高于Hyperscaler 29图31:小型模型CoreWeave的成本效益显著高于大型云厂商 30图32:中型模型CoreWeave的成本效益显著高于大型云厂商 30图33:大型模型CoreWeave的成本效益显著高于大型云厂商 30图34:CoreWeave的GPU利用率高于Hyperscaler 30图35:大规模的同质流量具备显著的效率优势 31图36:共享前缀比例为1时,吞吐量达到最大值 31图37:共享前缀比例为1时,有效带宽最高 31表1:全栈层级优化技术框架 7表2:TPUv5p、TPUv6e和GPUH100性能对比 8表3:TPUv5p-8和GPU2×H100训练效果对比 8表4:AI基础设施的四大层级 15表5:CoreWeaveVSNebius 16表6:大规模云厂商多维度领先传统数据中心 19表7:大型云厂商PUE显著低于行业平均水平 25表8:中美云厂商自研芯片情况 27表9:ASIC芯片和GPU用芯片对比 28表10:各大厂商盈利预测 32AI50%2026Token调用量呈指数级增长,单位推理成AI云业务的核心竞争点。=cost/

基础设施折旧+电力+网络+运维单位时间完成的任务数我们认为“全栈优势”和“规模优势”是降低单位有效任务成本的核心胜负手,其中全栈技术充分挖掘每一份算力效率,规模优势提高集群利用率,最大程度减少闲置算力。图1:2030年,预计全球token调用量将增长24倍GoldmanSachsResearch1:全栈优势技术本身不构筑壁垒,全栈技术在帮助企业实现“更优的经济模型”中构筑壁垒。针对每一次推理,在模型层、推理系统层、集群层、数据中心层和芯片层都有优化方法。优化层级 优化方法表1:全栈层级优化技术框架优化层级 优化方法模型层 蒸馏、MoE、Quantization(权重/KVCache)、稀疏化推理系统层 推理系统层 PD分离、连续批处理、PagedAttentionspecdecoding显存管理/调度芯片层 内存带宽跟算力匹配、优化适配芯片层 内存带宽跟算力匹配、优化适配PD分离、设计专用计算单元加速低精度矩阵计算数据中心层 降低功耗、散热和部署成本浙商证券研究所1:从“局部最优”到“系统最优”无论是训练还是推理,GPU利用率不足的原因主要来源于算力集群的“短板效应”:算力集群整体性能与利用效率,并非由性能最强的GPU硬件决定,而是受限于网络传输、底层基建、调度机制、缓存资源等配套薄弱环节。2024Fujitsu数据显示,即便处于峰值75%GPU70%。Aixenerge数据进一步表明,GPU“数据饥饿”问题,GPU因数据阻塞等待任务的闲置时长30%-65%。Epoch-AI数据表明,GPUAI40%,闲GPU仍会持续产生电力与硬件折旧成本。GPU算力、显存带宽,使得硬件计算能力大幅提升,但大散热基建、资源分配、智能调度系统等配套体系未能同步升级迭代。软硬件能力GPU算力长期受网络时延、带宽不足、调度冗余等问题制约,持续GPU综合利用率、压降推理成本。谷歌全栈自研:“芯片+模型”跨层协同优化使底层芯片算力更充分地转化为有效Token吞吐(GoogleTPU+Gemma)单芯片硬件规格NVIDIAH100超过GoogleTPUv5p/v6e;但在GoogleCloud公有云环境测试Gemma-4-31B;TPUv5p-8+Gemma-4-31B在训练速度、训练成本、长上下文推理场景下的吞吐和首Token延迟等表现上均优于GPUH100。从单芯片硬件规格来看,NVIDIAH10080GBHBM3BF16989TFLOPSTPUv5p(459TFLOPS)TPUv6e(918TFLOPS),3.35TB/sHBM显存带宽,单芯片算力与内存带宽层面具备明显优势。表2:TPUv5p、TPUv6e和GPUH100性能对比指标TPUv5pTPUv6eNVIDIAH10080GBHBM3BF16459TFLOPs918TFLOPs989TFLOPS显存容量102.8GB31.25GB80GB显存带宽2765GBps1,638GBps3.35TB/s互连ICIICINVLink互连带宽1200GBps800GBps900GBpsarxiv、Google、Nvidia公司公告JatinKishnanGoogleCloudGemma-4-31B为测试对象,在完全TPUv5p-8、TPUv6e-8GPU2×H100LoRA微调及推理部署TPUv5p-8+Gemma-4-31B在训练速度、训练成本、GPUH100。TPUv5p-8训练速度较H100提升1.61GPUH100的47.06%。表3:TPUv5p-8和GPU2×H100训练效果对比指标TPUv5p-8GPU2×H100优胜者实际耗时3.34小时5.39小时TPU(1.61X)吞吐量(Token/s)763486TPU(1.51X)每个样本所需时间1.21秒1.94秒TPU(1.60X)最终训练损失0.0722.258TPU总训练成本56.11美元119.23美元TPUarxivTPUv6e-8延迟上同样表现更优。随着输入4k、8k16k,TPUv6e-8的优势快速显现,16k2×H100高出45%,同时在QPS为4的情况下,中位数TTFT最高可比H100快23.6倍。图2:不同上下文长度下的TPU和GPU推理基准测试结果对比arxivTPU优势显著。图3:TPU和GPU推理对比arxivTPUTPUJAX/XLA编译栈、Gemma模型的跨层协同优化。TPUICIHBM带宽,提升多芯片计算中的数据交换效率;模型算法层:一方面,TPUJAX-XLAGemma模型结构,而Gemma-4PyTpile训练产生额外开销。另一方面,GoogleTPUHBMPod互联拓扑、通信硬件能力;因此,MoE专家数量、专家分片策略、激活规模、数值精度选TPU硬件特征做约束设计,让模型天然适配硬件能力,避免出现硬件很难高效执行的算子与通信模式。编译层:XLAJAXMoE模型计算图,完成算子融合、内存复用、SPMDMoEall‑to‑allgather/scatterTPU硬件的指令,把模型逻辑映射到矩阵计算单元、通信加速硬件。JAX/XLAKernelLaunchKVCache降低长上下文场景下的显存占用、提升并发承载能力。多层级的协同使底层吞吐。除上述实验包括的核心层级外,Google还在其他技术层级完成了配套优化升级,进一步完善全链路性能:推理服务层:JetStream推理服务框架承接线上推理流量JetStreamKV‑Cache缓存管理、Prefill/DecodeMoE模型封装成可用的推理服务,充分发挥TPUPod集群的吞吐能力。Google数据表明,JetStream(每百万个token0.30美元)在Gemma7B上每美元可实现高达3倍的推理次数。Pathways实现跨设备/Pod分片与全局调度MoEPipelineSPMDGooglePathways构建统一的RuntimeTPU,并协调计算、通信与资源分配,减少因调度和通信等待造成的芯片空闲。Pathways能够高效地在不同程序之间进行加速器时间复用,而且上下文切换几乎不产JAXTPUPathways通过时图4:Pathways和JAX多程序并发聚合吞吐对比arxivJetStreamPrefill/DecodeJAX/MaxTextXLA完成计算图编译与算Pathways实现跨节点、TPUPodTPU集群硬API请求到硬件算力执行的全链路协同优化。图5:Google的全栈优化浙商证券研究所英伟达+Nebius联合调优提高效率:NebiusAICloud+NvidiaRun:aiGPU动态分片可提高效率262月,NVIDIARun:aiNebius进行联合集成和性能验证,证明多模型生产推理GPU分片提高资源利用率。背景:传统LLM推理受权重预加载机制限制,为控制延迟普遍采用GPU独占模式,GPU资源静态固化,难以多模型共卡部署,依赖人工做算力扩容运维,非高峰算力大量闲置,无法实现资源弹性复用。NvidiaRun:aiGPU分片调度能力等。Run:aiGPU分割成更小的单元,GPUNIM推理微服务、GPU/网络OperatorNGCNebiusNVIDIA专用硬件架构深度协同。NVIDIAGPUNVIDIAQuantumInfiniBandNVIDIANIMRun:aiNebius集群后,寻找“每种模型应该分配多少GPU、部署多少副本、何时扩缩容”,在利用率、吞吐和延迟之间取得最佳平衡。图6:Run:ai通过集群级资源调度提升GPU利用效率NvidiaNvidiaRun:aiNebiusAICloud专用基础设施实验结果显示在各种规模参数的模型GPU中等规模参数模型(Llama3.18BInstruct):64GPU的情况下,0.5GPU配8,768GPU总容量(10,200个并发用户)86%152,694个token/GPU(198,680token/77%GPU分片仅会带来轻微的性能损失,但不会造成显著的容量损失。图7:使用0.5GPU分片的并发用为GPU总容量的86% 图8:使用0.5GPU分片的输出吞量为满GPU吞吐量的77%Nvidia Nvidia(Phi-4-Mini-4B32GPU的情况下,NVIDIARun:ai0.25GPUGPU分配高出72%P95300ms45token/秒的输出吞吐。图9:使用0.25GPU分片的容量比全GPU分配高72% 图10:使用0.25GPU分片的吞吐量低于全GPU分配Nvidia NvidiaGPU0.5GPULlama3.18B、0.25GPU的Phi-4Mini0.125GPUQwen-Embeddings335TPSNVIDIARun:ai调度器能够打包异构推K8s原生调度无法实现多模型混合部署。图11NebiusAICloudNVIDIAHGXB200集群上运行多3倍

图12NebiusAICloudNVIDIAHGXB200集群上运行多个模型时的总吞吐量 Nvidia Nvidia弹性扩容自动验证:Run:ai基于并发用户阈值自动扩缩推理实例,扩容过程无TTFTSLA,不会出现性能断崖式下跌。图13:Llama3.18B在NVIDIAHGXB200上的自动扩展结果NvidiaNebiusGPU专用硬件层、高速网络和超大规模数据中心级别的性能和弹性,结合NvidiaNIM服务对多模型推理负载的精准适配、Run:aiGPU分片调度与弹性扩缩容能GPUtoken延迟、推理吞吐量等SLA指标的前提下,实现中小模型近乎无损的分片运行,有效盘活闲置算力、大GPUAI全链路、全集群系统最优的升级。2:为客户提供更高附加值AI基础设施可以靠全栈能力,向更高附加值的层级演进,从底层到顶层依次包括:物理基础设施、托管基础设施、托管推理服务、智能体优化层。层级 提供服务 计费单位 主要客户表4:AI基础设施的四大层级层级 提供服务 计费单位 主要客户物理基础设施提供裸金属售卖/租赁 兆瓦/大订单面向OpenAI、云厂等只有算需求的厂商提供网络、存储、计算等虚托管基础设施托管推理服务

拟化、管控和安全等服务,GPU小时 面向主流的AI研究团以GPU小时数为单位交付提供模型推理服务,企业不面向专注于产品,不做模型的垂直AI公司工厂)用管理系统/智能体优化层端到端任务执行20VC访谈

以任务完成为最终计费单位

面向更丰富的客户层级NeoCloud中,NebiusFactory托管推理HyperscalerAzureGoogleOracleAIAgents产品进入第四层级。图14:AI基础设施的四大层级及代表企业所处层级20VC访谈不同客户所需要供应商提供的技术栈不同。全栈能力不仅意味着全局技术优化能带来更高的资源利用率,还意味着更丰富和分散的客户结构。AIAI的终端需求方,客户群体由少数大订单客户扩散为多元、分散的客户池。AI基础设施能力向更深层级演进,企业作为供应商能够介入、实施优化的技术栈依托自研芯片能力,的系统性技术门槛与成本优势。NebiusAICoreWeave作为当前北美及欧洲市场最受关注的两AIGPU集群、灵活租赁模式和英伟达深度战略合作作为卖NvidiaNeocloud2026年分别获得英伟达20AI、Azure、GCP这类Hyperscaler,NebiusCoreWeaveAIGPU算力构建NebiusAI基础设施业务处于行业演进的第三层级(托管推理/TokenFactory),而同属新型云厂商(Neo-Cloud)的CoreWeave则主要定位在第二层级(托管基础设施多租户云)。CoreWeave Nebius表5:CoreWeaveVSNebiusCoreWeave Nebius裸金属/算力租赁 核心主业(占营收90%+) Microsoft、Meta等大客户主采购专属GPU算力2客户收入占比约40%推理服务 少 推理服务 少 TokenFactory数据中心数量 43个(主要租赁) 7个(租赁+自建)在线电力容量 >850MW 170MW;AI厂商:Meta(350亿美元;

AI应用企业:包括ArcherAI、Decart、CognitionAI、OpenAI(累计算力合约224亿美元);Microsoft(历主要客户

史上最大营收来源);模型)、Cohere、Mistral、AdaptionLabs、

AccurateDataRobotCosineCursorHiggsfieldWand、Reactor等Claude工业自动化客户:CoreAutomation、RoboForceWorldLabs等 其他行业客户Cambrium南洋生物GenesisAI(JaneStreet

TherapeuticsBasecamp生物医药SabiRiverTrading、AdvaitaBio)momoview、MorganStanley、新浪财经、公司公告

HudsonRevolt(金融科技)、Shopify(跨境电商)Nebius相较CoreWeave所处层级的差异具体体现为:客户结构分散NebiusAIAI云”。2025Meta40%CoreWeave2025年约三分之二的收入来2026ARROpenAIMetaAI基础设施所处价值层级的不同。业务布局越向上层高附图15:CoreWeave大客户收入占比显著高于NebiusCoreWeave、Nebius公司公告NebiusAI全栈技术能力NebiusAI20262收购智能体搜索Agent5EigenAIEigenAI4-bitSpAtten稀23Clarifai核心团队补齐集群层能力,实现完成从底层数据中心、AgentAI云平台。图16:Nebius全栈技术能力浙商证券研究所CoreWeave的核心优势主要集中在硬件/GPU、InfiniBand、CKS、MissionControlAI集群的部署与运NebiusAgent应用层。由此,NebiusCoreWeaveAI垂直全栈能力。图17:CoreWeave全栈技术能力算力版图2:规模优势1)大规模流量让昂贵算力更容易被持续填GPU集群利1:通过大数定律消除流量波动,提高集群利用率在AI云商业化竞争深化阶段,算力与业务流量规模的放大,依靠海量真实推理流量平滑算力负载的潮汐波动,大幅提升GPU集群利用率,从推理效率层面进一步压缩边际生产大规模推理集群并非消除了流量波动,而是依托大数定律对冲波动风险。表6:大规模云厂商多维度领先传统数据中心因素典型的数据中心Hyperscale(AWS/Azure/GCP)电力使用效率(PUE)1.5-2.01.1-1.2平均服务器利用率10-15%65-80%可再生能源份额通常为0至30%100%冷却技术CRAC设备,传统风冷液冷,AI驱动优化硬件刷新周期5-7年3-4年碳减排潜力基线参考80-96%与本地部署相比用水追踪 高,很少被监控 主动追踪,所有目标到2030年实现净零用水的供应商GartGPUToken务的生产成本。多元的业务种类、稳定的任务请求,能给“流量池化、批处理、PDGPU分片提高利用率GPUGPU”的部署方式转变为多个模型共享同Embedding等GPU分片实现算力和显存的精细化复用,并根据并发用户数、SLAGPUGPU资源承载更多有效请求,降低单位任务的算力成本。图18:GPU分片知乎continuousbatching效果大模型推理负载天然具备潮汐波动、请求随机到达的特征。(StaticGPU在等待期间大量计算单元(SM)处于空闲状态,造成了巨大的算力浪费。连续批处理(ContinuousBatching):不等待整个批次完成。一旦检测到某个请求生成GPU空闲槽位。这一决策发生在每一次迭代中,因此称为“连续”。GPUGPU然而连续批处理的优化效果也高度依赖可调度的候选请求池规模。在并发请求总量较小的集群中,即便开启连续批处理,当部分任务提前完成释放算力与显存碎片,请求池内往图19:静态批处理和连续批处理的时序对比《设计机器学习应用系统》图20:连续批处理大幅提高模型token吞吐量AnyScalePrefill/Decode解耦更有效大模型推理过程可以分为预填充(Prefill)和解码(Decode)两个阶段:Prefill(预填充)阶段:负责处理用户输入提示词(Prompt),一次性计算生成输入序列对应的全部KV‑Cache;该阶段属于计算密集型任务,GPU算力消耗高。coe解码KVoken,属于显存带宽密集型任务,对GPU显存带宽资源提出较高要求。DecodeGPUPrefill计算任务的调度,造成集群算力闲置,叠加耦合的流量曲线难以独立扩缩,最终降低整体算力利用率。PDGPUGPUPrefillDecodeGPU的资源分配失衡不会对Prefill资源Decode资源池,充分发挥任务解耦的性能优势。图21:P/D解耦架构arxiv大规模集群提高资源复用:如冗余复用、MoE复用等冗余复用大模型部署时,为了承接突发峰值流量,需要预留一定比例的冗余算力。GPU件平均利用率偏低。大型多租户平台承载成百上千项来源相互独立、错峰运行的推理任务,单个业务的流量尖峰对整体资源池造成的冲击被庞大的算力基数稀释,不同业务之间波峰、波谷能够在全局层面互相抵消。平台不再需要为每一个模型单独配备峰值缓冲资源,转而维护一份全局共享的冗余算力池,由此摊薄整体的冗余成本。在大规模多租户推理集群中,全局流量调度器统一承接全部模型的请求,依靠海量异构流量之间天然的错峰效应,不同模型的负载波动能够在集群层面互相抵消,峰值冗余算力可以跨模型实现资源共享,不需要为每一个模型单独预留全套的峰值备份算力,摊薄了副本冗余带来的硬件成本。复用AgentKV-Cache的GPUPrefill计算开销。KVGPU节点,破坏缓存局部性,取决于调度器、路由模块的算法能力。模型与专家的复用MoEGPU之上,针对访问GPU之间的通信开销,方案的落地收益高度依赖高性能互联网络与高效调度系统的配套能力。图22:专家并行策略AMDDeepSpeed:静态专家复制策略,专家副本数量在训练启动时固定配置,全程不随专家访问热度动态调整,属于无调度的基线方案。(1050或100次迭代SwiftMoE则采用细粒度实时自适应专家复制策略,可根据专家负载变化近乎动态地增减副本,对热点专家及时扩容、对冷门专家及时缩容。eppeedFlexoE各变体均优于eppeed,SwiftMoE留存率指标呈现相同排序:DeepSpeedtoken留存率最低,大量输入因热点专家容量溢出被直接丢弃;FlexMoEtoken丢弃比例;SwiftMoE则凭借实时自适token留存水平。图23:FlexMoE、SwiftMoE动态调专家提高训练收敛速度 图24:FlexMoE、SwiftMoE动态调专家提高留存率arxiv arxiv2:边际成本(TCO)下降图25:云计算成本构成前瞻产业研究院规模优势意味着:降低采购成本&持续锁定电力降低采购成本:企业的大体量订单拥有较强议价能力,能够获取阶梯批量折扣、直直采模式,降低采购成本。2015-2020ODM企业台湾2%OEM品牌厂商戴尔(Dell)和惠普(HPE)10%、。图26:2015-2020年台湾广达、SMCI营业利润率低于Dell和HPE服务器相关业务营业利润率台湾广达、SMCI、DELL、HPE公司公告、2020FY2020(2019.7.1-2020.6.30)、FY2021(2020.2.1-2021.1.29),持续锁定电力:ITPUE2025年,statistaPUE1.54PUE1.141.091.12、1.19PUE表现,作为规模效应的侧面支撑。扩容后,固定成本基数将重新抬升,原有规模摊销的降本效应随之降低。表7PUE公司PUEAWS1.14谷歌云1.09微软云1.12阿里云1.19Amazon、Google、Microsoft、阿里巴巴公司公告摊薄软件成本、团队人力等固定成本202320243.810.19.9百分点。人员成本的规模效应是利润释放弹性的重要驱动力。图27:谷歌云利润弹性主要驱动来自人员成本的规模效应Google公司公告HyperscalerNeocloud各自的竞争优势?随着生成式AI产业快速扩张,大模型训练与大规模推理算力需求迎来爆发。StraitsResearch预测,2034年全球云市场规模预计将达到4.32万亿美元。GPU、AzureCoreWeaveNebiusAI专属算力CSP依托全栈云生态与+路线;Neo-CloudAI工作负载优GPU利用率作为降本的核心抓手。图28:2022-2034年,全球云计算市场规模不断扩大(单位:万亿美元)StraitsResearchAnalysisCompanyPublicationsandPrimaryInterviewsCSP的核心竞争力:全栈+规模横向的规模优势FortuneBusinessInsights数据显示,202612363.4亿美元。SynergyResearchGroup、Azure、Googlecloud31%、24%12%2025Azure则达到千亿NebiusCoreWeave5.3亿、51.3亿美元,直观体现业务规模的显著差异。图29:HyperscalerVSNeocloud业务规模对比Amazon、Google、Microsoft、Nebius、CoreWeave公司公告纵向全栈整合优势GPUAzure减少单一外部芯片供应链约束同时提高全栈能力,进一步压降大规模推理场景下的单位ASICGPU与自研芯片并行的双轨算力布局。表8:中美云厂商自研芯片情况公司 公司 自研芯片 发布时间亚马逊(Amazon)

CPU:AWSGraviton 2018Graviton1;2026Graviton5AI加速芯片:Inferentia 2018年Inferentia1;2022年Inferentia2AI加速芯片:Trainium 2020年Trainium1;2025年Trainium3谷歌(Google) ASIC芯片:TPU 2015年TPUv1;2025年TPUv7CPU:Cobalt 2023Cobalt100;2025Cobalt200微软(Microsoft)阿里巴巴(平头哥)

AI加速芯片Maia 2023年Maia100;2026年Maia200AI加速芯片:含光800 2019年AI加速芯片:真武810E 2026年服务器CPU:倚天710 2021年服务器CPU:倚天710 2021年2023年SSD510智能网卡芯片:磐脉2023年SSD510公司公告、维基百科、百度百科一方面,ASICGPU40%-65%prefilldecode特Prefill高算力吞吐、Decode高带宽访存的差异化需求进行架构定向设计,甚GPU的性能与成本优势;另一方面,当云厂商全栈能力向-硬件-调度-Runtime无法复刻的结构性降本飞轮。芯片-GPU功耗曲线、散热需求固定;机房、水冷、供电按照通用所分摊的电费等运营成本。芯片-Runtime:在传统外购硬件模式下,推理引擎仅能通过通用驱动接口调度Runtime的效数据-芯片--芯片架构迭代-Runtime软件同步升级-推理成本差距,构建长期算力成本壁垒。表9:ASIC芯片和GPU通用芯片对比GPU ASICGPU ASIC定义 图形处理器,用于图形渲染、并行算、AI训练和推理

专用集成电路,为特定应用定制设计的芯片能耗 相对较高,尤其是高性能能耗 相对较高,尤其是高性能GPU 低,专为特定任务设计,可性能优化并行处理能力

采用数量众多的计算单元和超长流水线,具备高并行结构,通过多核并行计专为特定任务设计,高度并行化算支撑大算力需求灵活性较高,可通过软件编程实现不同灵活性低,制造完成后功能固定;可拓展灵活性和可拓展性功能;可拓展性好,可通过多GPU扩性差展计算能力可定制性 通用性强,可通过软件更新实现一定程全定制化,完全根据特定应用定制,需要度的定制;已有成熟产品线《中国智算中心产业发展白皮书》

较长的设计和制造周期NeocloudAI集群优化+同质第三方流量(Hyperscaler)具备综合竞争优NeocloudAIAI集群底座,叠加第三方模型同质流量,或能形成区别于传统超大规模云厂商的差异化核心竞争力,在大模型训练与推理赛道占据独特市场位置。Neocloud快速成长核心支撑:供需缺口+竞争平衡2025年,以NebiusCoreWeave为代表的Neocloud实现了高速发展,Nebius和CoreWeave的营业收入增长率分别达到351%、168%。图30:2025年Neocloud增速明显高于HyperscalerAmazon、Google、Microsoft、Nebius、CoreWeave公司公告在英伟达GPU短缺的市场环境下,Neocloud得以快速发展,得益于:CSP更和定制化响应成本;HyperscalerAIAIAI负产业多方制衡:CSPGPU供给紧张阶段,Hyperscaler存在内部业务算力优先的倾向,外部模型企业不愿长期依赖竞争对手掌控的算力底座,具备强烈的多云部署诉求;因此,对于OpenAI、Anthropic这类大模型厂商而言,Neocloud可充当第二、第三算力供应商,以此对冲单一云厂商锁定、商业谈判议价、服务中断以及同业战略竞争等多重风险。Neocloud阵营,构建制衡传统云厂商的独立算力力量。Neocloud未来核心差异化优势来源我们判断,Neocloud长期竞争优势主要来源于其专业优化AI集群和第三方模型推理的高效率。AITCO成本GPUNebiusAIAI与推理场景量身打造。AINeocloudNeocloudAI训练/推AI集群,并且搭建面向训练和推理优化的软件栈,所以他们的物理集群更GPU/TPU的工作特征设计。Signal65围绕GPU与存储需求搭建小、中、大型三套集群配置模型,测算结果显示,在三类模型下CoreWeave均表现出显著优于超大规模云厂商的成本效益。其TCO较超大44%-47%CoreWeaveAIAI单K8sInfiniBand高速集群AI任务的调度与故障恢复机制,减少通信等待带来的算力浪费,实现了更低GPUGPU本地对象传输加速器)能力,可直接在对象存储层输出高性能,无需额外配置成本高昂的独立LustreCoreWeaveKubernetesTCO优势。图31:小型模型CoreWeave的成本效益

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论