最近翻到Omdia发的季度跟踪数据,2025年第四季度全球云基础设施支出同比增长29%,标题里直接点名“顶级云厂商加码AI基础设施”。乍一看,29%在云市场算是个相当亮眼的数字,但如果你只盯着这个百分比,可能会错过真正重要的东西——钱都流向了哪里,云基础设施的定义是不是正在被改写得面目全非。
我自己的关注点有两个:一是这轮高增长里,AI基础设施到底占了多大权重;二是作为云原生时代的技术人,我们的工作内容和技能树是不是也要跟着变。带着这两个问题去拆解这份报告,会发现在“全球云基础设施支出增长29%”这个结论背后,隐藏着一条从芯片、数据中心、网络到运维岗位的完整产业链变化。这篇就顺着这条线索展开,聊聊顶级云厂商的钱花在哪、为什么敢这么花,以及我们这些和云打交道的人该怎么理解这波变化。
1. 29%不是全部:Omdia季度数据的统计口径与参考价值
1.1 Omdia如何统计云基础设施支出:为什么不是“云服务收入”
先搞清楚一个基本问题:Omdia这个季度数据统计的到底是什么。云基础设施服务支出,业内一般指IaaS(基础设施即服务)、PaaS(平台即服务),以及部分托管的私有云基础设施服务。它跟云厂商财报里的“云服务收入”不一样,后者往往包含SaaS、许可证、技术支持、专业服务这些偏应用层的收入。Omdia这类第三方市场研究机构在统计时,尽量把口径收窄到客户为计算、存储、网络等基础设施资源实际掏的钱,这样更容易观察到底有多少算力在真正被消耗。
为什么这个口径很重要?因为我们讨论的是“基础设施支出”,它的增长曲线往往比整体云收入更早、更灵敏地反映技术迭代信号。企业可以暂时不买新的SaaS套件,但只要业务要跑模型、要扩集群、要处理数据,基础设施账单就压不住。所以当Omdia给出29%这个数字时,我首先理解的是:全球企业客户在云上购买计算、存储、网络资源的意愿和体量在明显放大,而不是单纯因为某家云厂商搞了个大促销。
不过也要提醒一句,第三方机构的数据很多时候基于公开财报、抽样调研和供应商访谈,跟实际账单之间会有估算误差。不同研究机构对“云基础设施”的界定也不尽相同。打个比方:同样统计“房租支出”,有人只算租金,有人把物业费、装修摊销都算进去,结果自然有差异。所以我不建议拿单一机构的某一个季度数据做绝对化判断,更值得看的是它连续几个季度、逐年变化的趋势曲线。
1.2 29%的增幅处于什么历史水平:不仅是回暖,更是结构性加速
把时间轴拉长一点,前几年全球云基础设施支出的季度同比增速曾经经历过一轮明显的回落,一度掉到20%以下。那段时间行业内很多人讨论“上云红利见顶”“云厂商增速进入平台期”。但2025年第四季度这个29%的增速,说明市场不是简单回暖,而是出现了新的结构性拉动因素。顶级的云厂商在这个时间节点密集加码AI基础设施,等于在原本的云资源消耗之上又叠加了一层巨大的算力需求,两个引擎同时运转,增速自然被拉起来。
我自己的习惯是看数据时把“同比”和“环比”分开。同比29%固然说明大趋势向上,但单季度同比也容易受到去年同期基数影响。如果去年同期增速偏低,今年的同比数值就会显得特别高。更靠谱的做法是同时关注环比变化和云厂商财报里的资本开支指引。幸运的是,从多份头部云厂商的财报和公开信来看,2025年的资本开支确实在大幅上修,而且上修的部分绝大多数都指向AI相关基础设施。Omdia这个数据,本质上是把需求端的消费情况呈现了出来。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 顶级云厂商的预算到底砸向了哪里:AI基础设施的钱花在哪
2.1 GPU集群与加速卡:算力采购从“千卡”到“十万卡”
先说最直观的部分:AI基础设施里最烧钱的就是加速芯片,也就是常说的GPU、TPU、NPU。过去几年,大模型训练集群的规模从几百张卡扩展到几千张、几万张,现在头部玩家已经在规划十万卡级别的集群。为什么规模这么重要?因为大模型训练是典型的“规模竞赛”,更快的迭代速度意味着更早发现模型问题、更早验证算法假设、更有可能抢到领先地位。
但采购加速卡只是第一步。十万卡集群并不是把十万张卡堆到同一个机房就行,它需要配套高速互联网络,比如NVLink域、RoCE或InfiniBand组网,解决卡与卡之间的通信瓶颈。很多团队在规划预算时只盯着“买卡钱”,等真正搭集群才发现网络设备的开销一点不比显卡少。我见过不止一个案例,前期为了省钱在网络上用了偏低配的方案,结果分布式训练跑起来通信效率上不去,训练吞吐大打折扣,最后不得不再花一笔钱升级网络,典型的因小失大。
2.2 网络与存储:AI训练集群中的隐形瓶颈
AI基础设施的第二个大头是存储和网络。很多人以为存储不就是硬盘吗,能有多贵?这里面的门道在于,大模型训练会产生海量Checkpoint(模型检查点),每次保存可能就有几百GB甚至上TB。如果存储系统性能跟不上,训练过程不得不长时间停顿等待数据落盘,整体效率会差非常多。
分布式训练对存储的要求可以概括为“高带宽、低时延、强一致”。并行文件系统、高性能对象存储、NVMe全闪阵列,都是AI基础设施里的常见配置。网络方面,除了训练集群内部的GPU互联,东西向流量的大规模增长也让云厂商必须重新设计数据中心网络架构。传统云计算时代“三层架构”偏向南北向通信,而AI训练集群是典型的“全对全”通信模式,每个节点都要和其他节点频繁交换梯度数据。为了支撑这种流量模型,Cloud Fabric、Spine-Leaf、无损网络等方案成为标配,这部分的资本开支占比相当可观。
2.3 从传统风冷到液冷:数据中心物理设施的改造压力
AI基础设施还有一个很容易被忽略的维度,就是数据中心物理层的改造。以前一个普通机柜的功耗大约在10千瓦左右,风冷就可以应对。到了GPU服务器时代,单个机柜的功耗轻轻松松突破50千瓦,高密度场景甚至上百千瓦。老一代数据中心如果继续用风冷,散热能力根本压不住这种热密度,于是液冷方案从“可选项”变成了“必选项”。
液冷并不只是换一套散热系统那么简单,它涉及机柜设计、冷板或浸没方案选型、冷却液管路布局、与机房暖通系统的联动,每一样都会推高单机柜的建设成本。这也是为什么顶级云厂商在新建数据中心时,越来越倾向选择电力资源充裕、气候条件适宜的地区,而不是单纯靠近用户。电力、散热、机房空间,正在像芯片和网络一样,成为AI基础设施的稀缺资源。下表可以比较直观地展示传统云基础设施和AI基础设施的差异:
| 维度 | 传统云基础设施 | AI基础设施 |
|---|---|---|
| 算力核心 | CPU为主 | GPU/NPU等加速芯片为主 |
| 单机柜功耗 | 10-15kW | 50-100kW以上 |
| 网络流量模型 | 南北向为主 | 东西向大规模并行通信 |
| 散热方案 | 风冷为主 | 液冷成为主流选择 |
| 存储访问特征 | 常规读写 | 超高带宽、大文件并发、频繁Checkpoint |
| 故障影响面 | 单点故障影响部分业务 | 单点故障可能导致训练中断回滚 |
3. 高增长背后不只是“AI热”:三重驱动力正在重塑云基础设施投入
3.1 大模型训练:从“能用”到“规模竞赛”的算力需求跃迁
很多人以为“AI热”是不是一阵风,2025年是不是已经降温了?从Omdia这个数据看,至少云基础设施层面的投入还在加速。核心驱动力之一,是大模型训练本身对算力近乎贪婪的需求。模型参数规模从百亿走向千亿、万亿,训练数据集的体量也在膨胀,而算力需求并不只是随参数线性增长,很多时候是指数级增长。你模型参数翻一倍,训练时的计算量可能翻好几倍,对显存、带宽的要求都一起上升。
头部云厂商之所以愿意砸重金建设AI基础设施,是因为他们已经把这看作“核心生产资料”。谁拥有更大规模的训练集群,谁的模型迭代周期就更短,谁就能在下一轮产品竞争中占住身位。这种竞争逻辑决定了资本开支不是一拍脑袋的冲动,而是经过严密测算的战略决策。对于圈内人来说,关注云厂商资本开支的投向,往往比关注单季度营收更能看清未来12到24个月的技术风向。
3.2 推理成本下降与生成式应用普及:第二波算力消耗高峰
训练只是第一阶段,真正让算力消耗变成持续、稳定大额账单的,是推理环节。早期大家关注大模型,重点是“训练出来一个多强的模型”;到了2025年,GPT级别的模型已经不只是DEMO里的玩具,而是嵌入到办公助手、代码工具、客服系统、内容生成管线等真实业务里。推理调用量一旦上来,对算力的消耗是持续的、每天24小时不间断的。
而推理侧的优化技术,量化和蒸馏让模型可以用更低的精度跑、用更小的模型达到接近的效果,单位成本确实在降;但与此同时,应用场景的扩张速度更快。就像油价降了,开车的人反而更多了,总里程数反而上升。Agent类应用、多模态内容生成、实时交互场景,每一个新玩法都在加大推理算力需求。这就解释了为什么云基础设施支出在AI应用落地的第二年依然保持高增速。
3.3 区域算力布局与交付形态:为什么厂商愿意跨区域长期投入
第三重驱动力是区域算力布局的长期化。云计算厂商的资本开支决策早就从“季度签单”变成了“三年规划、五年布局”。AI基础设施涉及能源、土地、机房建设、芯片交付周期,每一环都需要提前锁定资源。顶级云厂商在全球多个区域并行建设大型数据中心集群,这种投资节奏决定了短期内不可能踩急刹车,也意味着Omdia统计到的季度支出增长并不是某个促销活动拉出来的临时波峰,而是长周期投入的中间节点。
另外,AI基础设施的交付形态也在多样化。除了公有云上的裸金属GPU实例,云厂商还提供私有化部署、专属算力集群、混合云AI一体机等方案。企业客户可以按自己的数据合规要求、时延要求和成本预算选择不同交付方式。这种灵活的产品矩阵反过来又放大了整体支出规模,因为无论客户选哪种交付形态,底层消耗的都是云厂商构建的AI基础设施资源池。
4. 算力军备竞赛下,运维工程师的职责边界正在被重新定义
4.1 从“修虚拟机”到“修GPU”:运维对象的质变
云基础设施支出越来越大,对于一线技术人最直接的影响,是运维对象的质变。传统云计算时代,运维工程师的核心工作对象是虚拟机、容器、数据库实例、对象存储这些“逻辑资源”;而AI基础设施时代,大家要直接面对GPU服务器、高速并行网络、液冷系统这些更接近物理层的设备。
一个很实际的例子:GPU集群训练任务跑了一半,突然有节点报错,或者网卡出现丢包,如果没有高效的故障定位能力,整个训练可能就要中断回滚,前面几万GPU时都白花了。这类问题的排查难度远高于传统的“重启一下虚拟机”。所以运维工程师需要掌握新的技能栈:GPU健康监控、NCCL通信诊断、分布式训练作业调度、InfiniBand/RoCE网络排障、液冷系统状态监测。
我注意到一个趋势:很多平台型公司已经在组建专门负责AI基础设施的团队,并把它和传统的IaaS运维团队分开设置。因为两者的运维逻辑差异太大了:传统IaaS追求稳定、可用、标准化;AI基础设施团队还要懂模型训练的朴素原理,知道哪些指标波动会影响训练收敛,知道该在什么时候干预而不打断任务。这种角色,既要有运维的严谨,又要有一定的机器学习工程认知。
4.2 新的认证体系和技能树:运维工程师的“AI硬件”必修课
最近有朋友问我怎么看待海外一些云基础设施运维工程师认证,说考试内容越来越“硬”了。确实,从国外主流云厂商和行业机构更新的认证方向来看,AI基础设施运维已经成了一块独立的知识领域。以前考一张系统运维认证,重点还在网络配置、Linux管理、虚拟化、安全组规则;现在再往上走,题目里开始出现GPU集群调度、并行文件系统调优、液冷机房运维、大模型训练任务稳定性保障这些内容。
我之前对比过几家主流云厂商的运维认证课程更新,发现一个共同点:课程都在讲如何管理GPU资源、如何做训练任务的可观测性、如何设计高可靠的AI推理架构。哪怕你暂时不打算考认证,我也建议先把这类课程大纲过一遍,它会帮你系统性地梳理“AI基础设施运维到底要懂哪些东西”,比自己在网上零散搜资料高效得多。
对个人而言,这个变化是机会也是门槛。机会在于,懂AI基础设施的人才目前处于供不应求状态,HR在招聘社区里挂出来的GPU集群运维工程师岗位薪资普遍高于传统运维;门槛在于,如果还是停留在“会重启、会配nginx、会看监控大盘”的层面,确实跟不上行业节奏了。我的建议是,不必急着追每个新工具,但一定要把分布式训练的基本流程、GPU故障类型、高性能网络原理这三块补起来,它们是未来五年云基础设施运维的核心底座。
5. 预算向AI倾斜之后,对云服务生态和普通企业的连锁影响
5.1 云厂商的价格策略:AI算力与通用算力的定价分化
资本开支的大头去了AI基础设施,带来一个很现实的连锁反应:云厂商的产品定价会跟着调整。可以看到的一个趋势是,GPU云实例、AI训练加速服务、推理API的价格依然维持在相对高位,因为这些资源是稀缺的、折旧也高。与此同时,传统CPU云主机、块存储、常规带宽这类成熟产品,由于规模效应和激烈竞争,价格反而可能继续走低。
这其实是一种“交叉补贴”式的市场策略:厂商靠规模化优势守住通用算力市场,同时在AI算力上获取更高利润,再把利润投入到下一轮AI基础设施扩张。对企业用户来说,这种定价分化意味着技术选型时要把成本账算清楚。如果某项业务用传统CPU就能满足,没必要为了“上AI”去租用昂贵的GPU实例;反过来,如果是真正的AI推理场景,GPU云主机的账单虽然贵,但算上自建机房的人力、电力、散热成本后,云上方案往往还是更划算的。
5.2 中小企业怎么应对算力焦虑:不盲目自建,而是用好“云上AI”
每次看到大厂动辄几十亿美元资本开支的消息,中小企业难免有些焦虑:别人都在建AI基础设施,我们是不是也要赶紧买卡、建机房、招算法团队?我的看法是,大部分企业完全没必要自建AI基础设施。大厂之间的军备竞赛,最终会把算力变成更便宜、更好用的公共服务。中小企业真正要做的,是抓住应用层的机会。
现在云厂商在AI基础设施上的投入,本质上是在造一个巨大的“算力自来水厂”。企业用户不需要自己打井,只需要按需付费接入API,或者租用GPU实例,就能跑起自己的模型和应用。这也是我前面提到的趋势:花在AI基础设施上的钱越多,后续推出的托管推理服务、模型服务化工具、自动训练平台就越成熟,中小企业的试错成本越低。
当然,这里有一个前提:你要懂得如何评估和选择算力资源。我个人的经验是,先明确业务对时延、数据隐私、成本的要求;再决定是用公有云的共享推理服务,还是独占GPU实例,还是混合云部署。不要一上来就追求“全部上GPU”,更不要被市场情绪带着走,算力是工具,业务价值才是终点。
最后再分享一个观察。每次看到行业报告里出现一个漂亮的数据,我习惯先问一句:这个数字是靠什么撑起来的?Omdia这29%的背后,是顶级云厂商的巨额资本开支,是GPU集群的扩张,是数据中心物理形态的重塑,也是运维工程师技能树的升级。对我们的实际参考价值,不是在朋友圈转发一张图,而是认真想一想:自己所在的企业、自己所处的岗位,在这轮AI基础设施投资周期里,应该主动往哪个方向靠。多去碰一点真实的大模型训练任务,多看两眼GPU集群的监控指标,多了解一点基础设施的物理限制,这些积累比追逐任何一个季度数字都更有长期价值。
