全球云基础设施的钱都烧到哪儿去了?Omdia这份报告我反复看了几遍,有几个点确实值得拿出来聊聊。2025年第四季度全球云基础设施支出同比增长29%,这个数字看起来只是比前几个季度高了一点,但结合顶级云厂商在AI基础设施上的动作来看,它不是简单的水涨船高,而是整个云计算的底层逻辑在变。如果你正在做云架构、搞运维,或者手里握着预算要决定往哪儿投,这篇就当是跟同行在茶馆里把数据掰开揉碎了聊一遍,顺便说说我看到的一些方向性变化。
1. 29%增长背后:钱到底流向了哪三层
很多文章把29%归功于AI的拉动,这话对,但太笼统。我拆开看了下Omdia的统计口径和各家财报里的资本开支明细,这29%的增长不是均匀撒在各家头上的,也不是全都买GPU去了。它大致分布在三个层面,而每一层的逻辑和受益方都不一样。
1.1 算力层:GPU集群取代传统服务器成为采购主力
先看最直观的算力层。2025年第四季度的增长大头,来自超大规模云厂商对AI训练集群和推理集群的采购。这一季度,单家头部厂商的AI服务器采购量已经是传统x86服务器的数倍,而且单台AI服务器的单价动辄是传统服务器的5到10倍。
这意味着什么?就算采购台数不涨,只要AI服务器的比例从20%提到40%,整体基础设施支出的金额也会被顶上去。而实际上,台数也在涨。因为AI训练需要的是大规模并行,不是一台两台,而是几千张甚至几万张GPU卡同时工作。我在帮客户规划集群时,一个典型的700B参数模型训练集群,光GPU就是几千卡起步,加上配套的CPU节点、存储节点和网络设备,整体预算很快就能到数亿级别。
1.2 网络层:集群规模变大后,网络反而成了瓶颈
第二个花钱的地方是网络。很多人以为买了GPU就完事了,但GPU之间的数据交换速度直接决定整个集群的利用效率。
第四季度云厂商的资本开支里,数据中心交换机的采购量同比增长非常夸张,尤其是支持RDMA(远程直接内存访问)的网络设备,基本是翻倍往上涨。华为的CloudEngine系列、思科的Nexus系列,这些支持无损网络的交换机,现在在云厂商机房里是抢手货。因为GPU训练是典型的“木桶效应”,网络带宽跟不上,几千张卡的集群实际利用率可能只有40%到50%,算力全浪费在等待上了。
1.3 基础设施层:电力、散热、机房空间成为隐形军备赛
第三层可能是普通人不太注意但恰恰是最烧钱的——电力与散热。A100的功耗是400W,H100大约700W,到了B200,单卡功耗直接破1000W。一个万卡集群的电力需求差不多相当于一座小型城镇的用电量。
云厂商在第四季度的大额资本开支里,很大一部分用在了变电站扩容、柴油发电机备用电源、液冷系统改造和机房楼栋建设上。这些不是今年投入明年就能收回来的纯基础设施投资,但它们决定了未来两三年谁能建更大的集群。所以29%这个数字,背后其实是算力、网络、电力三线并进的投入。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 顶级云厂商为什么敢这么砸钱:AI基础设施的商业模式已经跑通
上一部分说的是钱花在哪儿了,这一部分聊聊更核心的问题——为什么这些云厂商敢在AI基础设施上压这么大的注。因为如果只是一阵风,资本开支不可能持续扩张,毕竟财报是每个季度都要见投资者的。
2.1 从卖资源到卖服务的商业模式跃迁
以前云厂商卖的是虚拟机、存储、带宽这类标准化资源,客户用自己的代码在上面跑应用,云厂商赚的是资源差价和规模效应,毛利其实不算特别高,竞争也激烈,价格战打得飞起。
AI基础设施改变了这个局面。云厂商现在提供的不仅仅是裸的GPU,而是从底层算力到模型训练平台、推理服务的一整套解决方案。客户不再需要自己搞集群、调网络、装驱动,直接调用API就能用上大模型能力。这意味着云厂商从卖资源变成了卖服务,客户粘性和客单价都大幅提升。
我在实际接触的客户里,很多中小企业宁可订阅云厂商的AI平台服务,也不愿意自己买卡搭环境。原因很简单:自己搭一套能跑通大模型训练的环境,从驱动适配、分布式框架调试到网络调优,没有三五个资深工程师几个月的时间根本搞不定,而云平台把这一切都包装成了开箱即用的产品。
2.2 推理需求爆发,一次训练终身收租
除了商业模式的升级,AI基础设施的投资回报周期也比过去短了。训练一个模型确实很贵,但推理是持续不断的。GPT、文生图、代码生成,每一个用户请求背后都是一次推理计算,这种高频调用带来的现金流是持续的。
我看到的数据是,2025年云厂商的推理算力需求已经超过训练,而且还在快速增长。这意味着,前期砸进去的钱买的GPU,在模型训练完之后并不是闲置的,而是转入了推理服务,每天都在产生收入。所以头部云厂商的逻辑很清晰:先重投入建好算力池,然后用训练把模型做出来,再用推理服务把成本赚回来,形成一个完整的商业闭环。
2.3 竞争格局:规模效应拉大马太效应
这里想聊一个观察。AI基础设施的竞争,正在从技术竞争变成资本密度竞争。建一个万卡集群不是几十个亿能搞定的事,这导致中小云厂商基本退出了AI基础设施的正面战场,转而选择跟头部厂商合作,或者专注垂直行业场景。
头部云厂商之间的竞争,本质上是“谁能在相同时间窗口内建出更大、更稳定的算力池”。因为客户在选择云厂商时,第一看的往往不是你技术多炫,而是你能不能给我足够的卡、稳定的集群、可靠的服务。当AWS、Azure、Google Cloud这些厂商把全球基础设施的规模拉上去之后,后来者想要追赶,需要付出的代价是指数级上升的。
3. AI基础设施的技术栈已经变了:运维工程师要面对的新世界
上面聊了商业逻辑,下面聊点跟每位从业者切身相关的东西。我身边不少做云基础设施运维的朋友,最近都在问同一个问题:AI基础设施来了,运维到底变了什么?我的回答是,变的不是工作内容,而是整个技术栈的复杂度。
3.1 从分布式系统运维到AI集群运维,难度不在一个量级
传统的云基础设施运维,核心是保证虚拟机、容器和应用的高可用,你关注的是CPU使用率、内存占用、磁盘IO这些指标。到了AI集群运维,面对的是一套完全不同的技术栈。
首先是GPU的状态监控,除了显存和算力利用率,还要关注GPU温度、NVLink带宽、PCIe错误率这些过去根本不用管的指标。一张GPU卡因为散热问题降频,整个训练任务的进度就会被拖慢。而且AI训练任务是长时间运行的长任务,一个几千卡集群训练一个模型可能要跑几周甚至几个月,中途任何一个节点故障都可能导致整个任务中断,这对运维的可靠性要求是极高的。
我见过的AI集群运维,已经不是靠人肉盯监控能搞定的了,而是需要用自动化工具去提前预判故障、自动迁移任务、自动恢复。一套成熟的AI集群运维方案,需要同时具备分布式系统、机器学习框架、高性能网络、存储系统等多方面的知识储备。
3.2 GPU虚拟化与调度,这是AI基础设施的“操作系统”
还有一个值得注意的变化,就是GPU虚拟化和调度技术的重要性正在快速提升。以前调度CPU就像分配食堂的餐位,大家排队刷卡进去就行。现在GPU调度更像是管理一个超级VIP包厢,你得考虑谁能进、什么时候进、进多少人、每个人在里面待多久、和谁一起进才不会打架。
NVIDIA的MIG(多实例GPU)技术允许把一张A100/H100物理卡切成多个独立的小实例,每个实例拥有独立显存和算力,互不干扰。这意味着你可以把一张大卡切给多个小任务用,大幅提高利用率。但MIG的配置和管理,如果没搞明白,很容易出现“切了之后没生效”“性能互相干扰”这类问题。
Kubernetes在AI基础设施中扮演的角色也比以前重要得多。现在主流的做法是用K8s统一编排GPU资源,配合调度器实现算力的按需分配。但GPU调度和普通的CPU调度逻辑差异很大,你要考虑显存独占、算力亲和性、拓扑感知,这些都是一线运维人员踩过无数坑总结出来的经验。
3.3 值得关注的趋势:基础设施运维工程师认证正在成为职业分水岭
顺着AI基础设施的热度,我注意到一个趋势:海外主流的云厂商和行业组织,都陆续推出了跟AI基础设施相关的运维工程师认证。这些认证不是原来那种考几道选择题就能过的证书,而是直接在真实环境里考你排查GPU集群故障、调优网络参数、配置存储策略这些硬本事。
这些认证体系的出现,意味着AI基础设施运维正在从“技术极客的副业”变成一个独立的职业方向。过去你说自己是运维工程师,大家默认你管的是Linux服务器、数据库和网络。现在出现了专门做GPU集群运维、专门做AI平台SRE的岗位,薪资普遍比传统运维高一个档次甚至更多。
我自己也去了解过AWS、Azure、Google Cloud三家在AI基础设施运维方面的认证体系,考察的内容都包括深度学习框架的分布式训练原理、GPU集群的监控与告警体系设计、以及大规模故障的应急响应流程。如果手里还没有相关证书,可以趁现在学习曲线还不算陡峭的时候先考一个占个坑,等这波技术浪潮完全落地之后再行动,门槛只会更高。
4. 写给决策者和架构师:在AI基础设施上花钱的正确姿势
前面聊的都是行业层面的分析和趋势,这一部分把视角拉回到实际的工作场景中。不管你是公司里负责技术选型的架构师,还是手里握着IT预算的决策者,面对AI基础设施这股浪潮,总会遇到一个非常现实的问题:我到底该怎么投入,才不会花了冤枉钱?
4.1 需求优先级判断,AI基础设施不是万能药
先泼一盆冷水。AI基础设施投入的高回报,是建立在确切的业务需求之上的。如果公司连明确的大模型应用场景都没想清楚,上一堆GPU服务器,结果就是资产闲置、电费照付,最后只能挂在闲鱼上卖二手。
我见过不少企业,看着头部厂商加码AI基础设施就觉得不用AI就是落后,于是也跟风买卡买设备,结果买回来之后发现自己的数据集根本不够训练一个大模型,卡都在机房里吃灰。决策的第一步,不是算力需求,而是业务场景:你到底是要训练一个垂直领域的大模型,还是要做推理服务,还是只是想把现有业务做智能化升级?场景不同,对基础设施的要求完全不同。
如果只是需要调用大模型的能力,更好的选择是用云上的推理API,按量付费,用多少花多少,完全不需要自己持有GPU资产。只有当业务量足够大、调用足够频繁、数据安全要求足够高,累计成本超过自建集群的持有成本时,自建AI基础设施才是划算的。
4.2 上云与自建:算一笔账,结论可能和你想的不一样
很多决策者拿着“自建比上云便宜”这个前几年的旧结论来做出判断,但AI基础设施时代,这个逻辑已经发生了变化。
我帮客户做过一个成本模型,自建一个中等规模的推理集群,硬件投入大概多少、机房改造成本多少、电费多少、需要几个运维工程师、这些工程师的年薪多少,全部算下来,月成本轻松超过六位数。相比之下,同等规模的云上推理服务,如果流量波动不大,成本大概率是自建的一半左右,而且不需要一次性投入巨额资本开支。
自建集群的优势在于数据完全可控、深度定制空间大,适合那些对数据隐私要求极高、或者需要大规模长期稳定训练需求的团队。但对于绝大多数中小团队来说,直接用云上的AI基础设施是更理性的选择。等到业务规模大到一定程度,再考虑“混合部署”的路线——把需要长期运行的推理任务放自建集群,把波峰流量和训练任务放公有云弹性扩展。
4.3 多区域部署与容灾设计,是花钱少但收益大的投资
在AI基础设施的架构设计中,多区域部署经常被忽略,但我觉得这恰恰是性价比最高的一笔投入。很多团队建好集群之后,把全部任务放在一个可用区里跑,结果一次光纤被挖断或者机房断电,整个训练任务中断,几周的工作量全部作废,这种代价远远超过了事前做容灾设计的成本。
现在主流的云厂商都提供了跨区域的算力调度能力,可以把训练任务做定期快照和检查点,主区域故障时自动切换到备用区域继续跑。AI训练任务不像传统应用,中断了重启就行,它的状态是海量的模型参数和训练中间状态,恢复起来非常复杂。做好跨区域容灾,相当于用不算高的成本买了一份针对“训练任务连续性”的保险。
5. 写在最后:这波基础设施大潮,对一线从业者的真实影响
最后不聊宏观数据了,聊点实际的。AI基础设施支出增长这件事,对于在一线做技术的人来说,不是一个遥远的新闻,它正在直接影响我们的职业选择和技能方向。
我自己观察到的现象是,过去传统的Linux运维、网络工程师岗位,招聘数量虽然没有断崖式下降,但薪资涨幅已经明显放缓。与此同时,具备AI基础设施运维能力的人,在人才市场上是绝对的卖方市场。会部署GPU集群、能调优分布式训练性能、熟悉LLM推理优化这些技能的人,薪资从三年前到现在至少翻了一倍。这种差距,未来只会越来越大。
如果你现在还在观望,我的建议是从小处着手。不用一上来就搭一个几千卡的集群,可以先从一台GPU服务器开始,熟悉GPU驱动的安装、容器化环境的配置、分布式训练框架的部署,再慢慢扩展到多机多卡。这个过程不需要花太多钱,几万块就能启动,但带来的技术认知和职业竞争力提升,远比这个投入值钱。
云基础设施的投入方向已经转向AI了,对个人来说,顺势学习AI基础设施相关技能,等于站在了技术浪潮的上升通道上。这波红利期不会永远持续,趁现在动手,时机正好。
