1. Omdia数据解读:29%增长背后的产业信号
先说结论:Omdia这份2025年第四季度全球云基础设施支出报告,表面看是“云厂商花钱更猛了”,实际上是在宣告一个产业周期的拐点——AI基础设施已经不再是云厂商的“试点项目”,而是直接决定了下一轮竞争的排位赛。
29%这个数字,很多人第一反应是“云市场回暖”,但我更倾向于把它理解为“结构性提速”。传统企业上云带来的采购增量,早几年就已经进入平稳期,真正拉动大盘跳到29%的,是AI算力集群的大规模部署。简单拆一下这个逻辑:云基础设施支出包括服务器、存储、网络设备、数据中心建设等硬件投入,其中GPU服务器和AI加速器的采购占比在2025年下半年明显飙升。Omdia的数据口径里,只要头部云厂商在批量上架AI训练集群,整体支出就会立刻被拉高。
另外一个关键点是时间窗口。第四季度向来是云厂商的“集中交付季”,既要完成全年预算的冲量,又要为下一年度的算力储备提前下单。2025年Q4叠加了多个大模型训练集群的扩容周期,所以29%不仅是季度波动,更是一个可持续数年的增长通道的开端。
作为常年跟云基础设施打交道的人,我关注的不只是“涨了多少”,而是钱花在了哪里。从Omdia以及多家第三方机构的交叉数据来看,这轮支出增长有几个明显特征:
- 头部集中度进一步加剧:前五大云厂商贡献了大部分增量,中小型云服务商的采购节奏相对温和;
- 电力与散热成为新的瓶颈:不少云厂商的采购预算开始从“买GPU”向“改造数据中心供配电和液冷系统”倾斜;
- 自研芯片的占比在上升:为了对冲GPU采购成本和供货周期的不确定性,头部厂商在ASIC和自研加速卡上的投入明显加快。
这些特征叠加在一起,指向一个更底层的判断:AI基础设施正在从“能用”走向“好用”,而“好用”的代价就是持续、高强度、系统性的资本开支。这篇文章,我就结合这份报告的数据,把AI基础设施的构成、云厂商的布局逻辑、以及运维工程师在这个浪潮里的机会,逐层拆开聊一聊。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. AI基础设施的硬件全景拆解
既然聊AI基础设施,就不能只停留在“买了很多GPU”这种粗颗粒度的认知层面。一套真正支撑大模型训练和推理的云基础设施,从底层到上层至少包含五个子系统,任何一个环节的短板,都会让GPU的算力打折扣。
2.1 GPU算力池:训练集群与推理集群的差异化配置
GPU服务器是AI基础设施的核心,但训练和推理场景对硬件的要求截然不同。
训练集群追求的是“高带宽、低延迟、大规模并行”。以NVIDIA H800/A100级别的集群为例,单台8卡服务器搭配NVLink和InfiniBand网络,才能支撑千亿级参数模型的梯度同步。这里有一个容易被忽视的点:训练集群的规模效应非常明显,1000张卡和5000张卡的集群,单卡效率会有显著差异。因为模型并行和数据并行的通信开销,只有集群大到一定程度才能被有效摊薄。
推理集群则更看重“吞吐量”和“延迟”的平衡。上线一个面向用户的大模型服务,不需要几千张卡同时跑一个任务,而是要把模型切分成多个副本部署,让每张卡独立处理请求。这时候GPU的选型就倾向于性价比更高的型号,甚至可以考虑用FPGA或专用推理芯片替代。我在实际项目中见过不少团队,一上来就买最贵的训练卡来跑推理,结果成本翻了几倍,利用率却不到30%,这就是典型的“装备过剩”。
2.2 高性能网络:决定集群规模的隐形天花板
谈到AI基础设施,人们总是先看GPU,但真正决定一个集群能“堆多大”的,往往是网络架构。一张GPU卡算得再快,如果数据传不出去,整体算力就会被通信瓶颈锁死。
目前主流的AI集群网络方案主要是InfiniBand和RoCE(RDMA over Converged Ethernet)两条路线。InfiniBand延迟低、丢包率极低,但成本很高,而且对交换机硬件的绑定比较深;RoCE则构建在以太网之上,兼容性好、成本可控,但需要非常精细的流控和拥塞控制配置。以400G/800G以太网为底座的RoCE方案,在2025年的云厂商部署中占比越来越高,原因也简单——弹性更好,能跟现有的VPC网络打通。
这里我多说一句:网络调优直接决定了DPU(数据处理单元)要不要上车。当集群规模超过几百张卡,CPU处理网络协议栈的开销就会明显侵占计算资源。很多云厂商在AI服务器上标配DPU,把存储和网络的I/O处理从CPU上卸载掉,效果立竿见影。如果你在规划AI集群,不要只看GPU数量和型号,网络方案和DPU选型同样要提前定,不然后期改造的代价是灾难级别的。
2.3 存储架构:数据管道的四层联动
存储是AI基础设施里最容易被低估的环节。大模型训练的过程,本质上是数据不断从存储系统流向GPU显存的过程。数据流的任何一个环节卡顿,GPU就得空转等待。
一套完整的AI存储架构,通常包含四个层级:
- 高性能文件存储:承载训练数据集和checkpoint,要求高吞吐、高IOPS,常见的方案有Lustre、WEKA等并行文件系统;
- 对象存储:作为数据湖底座,存放原始数据和归档模型,S3兼容接口是事实标准;
- 缓存层:把高频访问的样本数据放到NVMe SSD组成的缓存池中,避免每次训练都去对象存储拉数据;
- 本地盘:GPU节点自带的NVMe盘,主要存临时数据,减少网络I/O。
在2025年第四季度这轮支出增长中,存储的占比有明显抬升,原因是多模态模型的训练数据量级已经从TB走向PB,存储系统和数据管线如果不重构,根本喂不饱GPU算力池。
2.4 数据中心物理基础设施:电力与液冷的破局之战
很多人在分析云基础设施支出时,会把注意力全部放在IT设备上,但2025年真正卡住云厂商脖子的,其实是电力和散热。
先看电力。一个万卡级别的GPU集群,满载功耗可以达到几十兆瓦,相当于一个小型城市的用电量。云厂商在一个区域部署大规模AI集群,首先要跟当地电力部门确认变电站容量是否够用。国内头部云厂商在西部布局的智算中心,很多都配备了自建变电站和储能系统,就是为了规避电网容量的限制。
再看散热。风冷方案在单机柜功率超过20kW之后就难以为继,液冷成为必然选择。2025年Q4的部署中,冷板式液冷是主流,因为它的改造成本相对可控,而且对现有数据中心的架构冲击较小。相比之下,浸没式液冷虽然散热效率更高,但运维复杂度和TCO都不低,目前只在特定场景下落地。
我见过不少团队在规划AI集群时,把预算几乎全部分给GPU服务器,最后发现机房电力不够、散热跟不上,只能被迫缩减部署规模。物理基础设施的规划一定要前置,最好在项目立项阶段就和IT架构同步设计。
2.5 智算调度与集群管理:硬件之上的软件栈
最后,硬件之外还需要一套软件栈把资源“管起来”。AI基础设施的利用率高低,很大程度上取决于调度系统是否聪明。
Kubernetes已经成为AI工作负载调度的事实标准,但原生K8s在调度GPU任务时有不少局限。比如GPU显存的细粒度分配、多租户的算力隔离、拓扑感知调度等,都需要额外的插件或自研组件来补充。2025年很多云厂商在推的“智算平台”,底层就是K8s加上一层GPU虚拟化和任务编排引擎。
另外一个重要组件是集群监控和故障自愈。万卡集群的故障率远高于传统CPU集群,一张GPU卡偶尔报错、一根光纤性能劣化,都是家常便饭。如果没有自动化的故障检测和迁移机制,运维团队会被这些琐碎问题淹没。所以,我始终认为AI基础设施的竞争力,不在于硬件堆料,而在于“硬件之上的软件系统能把这个集群的可用算力释放到多高”。
3. 云厂商的算力军备竞赛与资本开支逻辑
Omdia这份报告把“顶级云厂商加码AI基础设施”作为一个整体信号来观察,但不同厂商在战略路径上其实有明显的分化。理解这些差异,对我们判断行业走向和自身技术选型都很有帮助。
3.1 头部云厂商的三种典型演进路径
我把头部云厂商的AI基础设施策略大致归纳为三条路径:
第一种是“全栈自研型”。这类厂商从芯片、服务器到网络架构,全部自研定制,追求极致的性能和成本控制。自研AI芯片的优势在于可以根据自身业务形态定制架构,比如针对推荐系统或大模型推理做特化优化,长期来看单位算力成本可以比采购商业GPU低不少。但劣势也很明显,研发投入巨大、生态兼容性弱、迭代周期长。
第二种是“深度绑定型”。以大规模采购商业GPU为基础,在硬件之上做自研的调度系统、网络组网和数据中心优化。这样做的好处是能看到最新最强的硬件能力,快速跟上模型参数量膨胀的速度;代价则是议价能力有限,毛利空间被硬件成本侵蚀。
第三种是“混合策略型”。既采购商业GPU,也布局自研芯片,根据不同工作负载的特征来做分流。训练任务跑在最强算力的商业GPU上,推理和中小规模的微调任务则运行在自研芯片或性价比更高的ASIC上。
从2025年Q4的支出结构看,走混合策略的厂商越来越多。原因在于GPU的供应周期太长,完全依赖商业GPU会错失市场窗口期的机会成本。自研芯片虽然起步难,但一旦形成规模,利润率和供应链稳定性都会明显改善。
3.2 资本开支背后的财务模型逻辑
很多人看到“云厂商加码AI基础设施”,第一反应是“厂商在烧钱”。从财务报表的角度看,资本开支确实会侵蚀当期利润,但如果我们把视角拉长,会发现这种加码背后有一套完整的财务模型在驱动。
关键指标是“算力单位成本”和“算力利用率”的赛跑。云厂商的算力产品定价,本质上是基于单位算力成本加上一定的毛利率。当新采购的GPU集群单位成本低于现有集群时,即使当期资本开支大增,未来的盈利空间反而是扩大的。H100服务器的单位算力成本,相对于上一代A100有明显的下降,这就是厂商敢加码的核心原因。
另一个重要指标是MPC(Machine Procurement Cycle,机器采购周期)。从下单到上架可用,GPU集群通常需要3-6个月。如果厂商不在Q4提前锁单,等到应用需求暴增时再采购,会错过整个增长窗口。所以Q4的支出增长,很大程度是在为下一年做“算力期货”。
我在跟企业客户讨论上云方案时,经常被问到“为什么云厂商的AI算力价格没有想象中便宜”。答案就在这个财务模型里——云厂商的投资回报周期是按3-5年计算的,前端价格会根据硬件折旧和利用率动态调整。了解这个逻辑,你在采购云GPU资源时就能更好地判断什么样的计费模式(包年包月、按量计费、竞价实例)最适合自己的业务。
3.3 区域布局与产业协同效应
AI基础设施的部署不是一个孤立的技术问题,它与区域经济、产业协同紧密相关。一个典型的现象是,AI算力集群的选址开始从传统的一线城市数据中心向能源富集地区转移。
逻辑也不复杂:AI集群的电力消耗是传统机房的数倍,电力成本占TCO的比重可能超过30%。在电价较低的区域部署算力集群,即使网络延迟稍高一些,对训练任务来说也可以接受,因为训练场景对延迟的敏感度远低于推理场景。很多云厂商在部署训练集群时,采用“东部训练、西部推理”的分层布局,东部数据中心负责对延迟敏感的在线推理服务,西部智算中心专注于长周期的训练任务,这样既降低了成本,又实现了区域间的负载均衡。
产业协同方面,头部云厂商也在通过AI基础设施输出生态能力。例如,将智算集群与行业解决方案打包,向自动驾驶、生物医药、金融风控等领域输出“算力+模型+服务”的整体方案。这种模式对云厂商来说,提高了单用户的ARPU值;对行业客户而言,省去了自建AI基础设施的巨大投入。
4. 运维工程师的新挑战与认证价值解析
聊完宏观趋势和硬件架构,再把视角拉回来——跟我们运维工程师最切身相关的话题:AI基础设施浪潮带来的技能升级要求和职业发展路径。
4.1 从传统云运维到AI基础设施运维的技能迁移
传统云运维和AI基础设施运维,看似岗位名称差不多,实际工作内容差异很大。传统运维关注的是服务器状态、网络连通性、应用可用性;AI基础设施运维则要额外面对GPU状态监控、分布式训练任务调度、高速网络调优、功耗与散热管理等全新课题。
举几个实际场景:
某天深夜,训练任务突然变慢,监控系统显示GPU利用率下降。传统运维只需要判断服务器是否宕机、网络是否通。但AI基础设施运维需要进一步排查:是不是某张GPU卡触发了温度保护而降频?是不是InfiniBand链路出现了丢包重传?是不是存储系统IO延迟升高导致数据供给不足?这些问题的排查链路更长、涉及的技术栈更复杂。
再看故障恢复。传统业务应用可以从容地重启服务,但大模型训练任务动辄跑数天甚至数周,一旦中断,前面的计算全部作废。所以AI基础设施运维的核心能力之一,是“checkpoint的自动保存与快速恢复”。你需要设计好异常时的任务恢复策略,确保任何单点故障都不会导致整个训练任务从零开始。
技能迁移的大致路径如下:
- 掌握GPU生态:了解CUDA版本管理、NVIDIA驱动兼容性、GPU显存监控(nvidia-smi、DCGM);
- 熟悉高性能网络:理解InfiniBand和RoCE的原理与排错方法,能看懂网卡和交换机的丢包与拥塞指标;
- 了解分布式训练框架:至少知道PyTorch DDP/DeepSpeed的通信模式,能定位数据集加载瓶颈;
- 液冷与供配电基础:理解冷板式液冷的工作原理和常见告警,能配合机房团队处理散热问题。
4.2 国外云基础设施运维工程师认证的含金量与备考建议
在AI基础设施需求爆发的背景下,职业认证市场也出现了明显变化。“国外云基础设施运维工程师认证”这一热词的背后,反映的是大量从业者希望通过体系化的学习来补齐技术短板,提升职业竞争力。
先说说这些认证的含金量。海外云厂商主导的运维认证,比如AWS的SysOps Administrator、Google的Professional Cloud DevOps Engineer,考核重点集中在传统云上,但近两年也增加了不少AI相关考点,比如托管机器学习平台的运维、GPU实例的选型与监控等。这类认证的行业认可度较高,适合希望进入外企或出海企业工作的运维工程师。
备考建议方面,我个人的经验是“项目驱动为主,认证驱动为辅”。认证本身就是一张纸,项目能力才是真正决定你职业天花板的东西。
建议分三步走:
- 先搭建一个小规模AI环境。不需要自建数据中心,买个几卡GPU的云实例就行,把CUDA环境、容器运行时、K8s调度在这套环境上完整跑通;
- 再学习监控体系。部署Prometheus加Grafana,把GPU利用率、温度、功耗、网络吞吐量这些指标全部可视化,建立对AI基础设施可观测性的直觉;
- 最后研究自动化运维。写一套IaC代码(Terraform/Ansible),实现AI集群的一键部署和扩缩容。
如果这三步能高质量完成,再去备考认证,你会发现很多理论知识点其实是实操经验的总结,备考效率会高很多。
4.3 云厂商认证体系对比:选哪个更有价值
海外云基础设施运维相关的认证体系,目前主流的就三家:AWS、Azure、Google Cloud。当然,如果你在本土云厂商的生态里深耕,阿里云ACP、腾讯云TCP这类认证也值得关注。这里主要对比一下海外认证的差异。
| 认证名称 | 发证方 | 侧重点 | 适合人群 |
|---|---|---|---|
| AWS Certified SysOps Administrator | AWS | AWS平台运维、监控、成本优化、高可用架构 | 在AWS生态中从事运维工作的工程师 |
| AWS Certified DevOps Engineer | AWS | CI/CD、自动化运维、基础设施即代码 | 需要推进DevOps实践的运维/开发工程师 |
| Google Professional Cloud DevOps Engineer | Google Cloud | SRE理念、可观测性、自动化运维 | 推崇SRE文化的团队或个人 |
| Microsoft Azure Administrator | Microsoft | Azure资源管理、存储、网络、计算 | Azure生态的运维人员 |
| CKA/CKAD | CNCF | Kubernetes管理、应用调度、故障排查 | 所有需要与K8s打交道的工程师 |
我的个人建议是:如果所在企业或目标企业深度使用某个云平台,优先考该平台的专家级认证;如果你的工作更偏向K8s和云原生,CKA是性价比很高的选择。AI基础设施运维的核心场景,无论跑在哪朵云上,底层调度几乎都是Kubernetes,掌握K8s是“一证走天下”的基础。
5. 从报告数据到落地实践:企业如何接住这波AI基建红利
对于大型云厂商来说,加码AI基础设施是战略刚需;对于普通企业和个人开发者来说,关键是“如何用更低的成本借到这波基建红利”。这一节我们聊实操。
5.1 预算与规划:三个关键决策点
如果你所在的企业正在考虑部署AI基础设施,而不是直接购买云服务,那在规划阶段至少有三个决策点需要认真对待。
第一个决策点是“训练还是推理”。如果业务是内部私有化模型的持续迭代,且训练数据敏感,那就需要自建训练集群;如果只是上线一个AI应用API,直接使用云厂商的推理服务可能是更理性的选择。把这一个决策想清楚,预算的差异可能有十倍以上。
第二个决策点是“自建还是租用”。自建数据中心加自购GPU,适合业务规模大、模型迭代频繁、且具备较强硬件运维能力的团队。租用云GPU则适合需要快速验证、业务量波动大的场景。2025年GPU租赁市场的价格战已经比较激烈,很多云厂商推出了包月制和竞价实例,短期项目用租赁形式成本优势很明显。
第三个决策点是“规模化节奏”。AI基础设施投资不是一次性的,它会随着模型的迭代和应用的增长持续投入。建议把预算分成三个部分:基础算力池(满足当前需求)、弹性扩容池(应对突发流量)、未来技术储备池(用于测试下一代芯片和架构)。规划好节奏,可以避免前期的过度投资让后期资金周转吃紧。
5.2 部署流程参考:从立项到上线的七步路线图
结合我做过的多个AI基础设施项目,这里给出一份通用的部署流程参考。
第一步,需求调研与场景定义。明确AI基础设施要支撑的业务场景、模型类型、并发规模和延迟要求,输出容量规划初稿。
第二步,技术选型。根据上一步的输出,确定GPU型号、网络方案、存储架构、调度平台。此时建议做一个POC(概念验证),用真实模型跑一轮性能测试,验证选型方案是否满足需求。
第三步,机房与能源评估。核实目标机房的电力容量、制冷能力、机柜空间和网络带宽。如果条件不满足,尽早规划改造方案。
第四步,网络与存储方案设计。绘制网络拓扑图,规划IP地址段和路由策略;设计存储分层方案,测算IOPS和吞吐量需求。
第五步,部署与调优。实施硬件上架、系统安装、网络配置、存储挂载,然后部署K8s集群和GPU调度插件,做性能基准测试和稳定性测试。
第六步,可观测体系搭建。部署监控告警系统,将GPU状态、网络质量、存储延迟、任务进度等指标全部纳入监控范围。
第七步,安全与合规加固。规划多租户隔离、密钥管理、审计日志、数据加密等安全策略。这一步经常被忽略,但在企业级场景中往往是上线前的“拦路虎”,务必前置。
5.3 成本优化:让每一分算力预算花得更值
AI基础设施的投入动辄千万级,成本优化不是一个可选项,而是必答题。分享几个我实际验证有效的成本优化策略。
弹性伸缩是第一个抓手。训练任务可以容忍中断,但推理服务不行。把训练集群做成竞价实例或Spot实例,利用折扣价部署可中断的训练任务;推理集群保留按量付费的保底容量,再搭配竞价实例应对峰值。这个组合能让成本下降20%-40%。
算力调度优化是第二个抓手。通过更细粒度的GPU共享和任务混部,提高GPU利用率。比如把推理请求的Batch Size调大、把多个小模型共享一张GPU卡、把显存不敏感任务放到同一台机器上,这些都是能直接降低单位推理成本的手段。
第三个抓手是硬件生命周期的精细化管理。GPU服务器的折旧周期一般3-5年,但实际使用中,不同GPU的“服役位置”可以有差异化处理。新采购的高性能GPU先服务在线业务,随着新硬件到位,退役的GPU可以降级跑离线任务或作为突发流量兜底资源,最大化榨干硬件价值。
6. 趋势展望:2026年AI基础设施的四个确定性方向
结合Omdia的报告和整个行业的节奏,对于2026年的AI基础设施发展,我认为有四个方向是确定性比较高的,值得关注和提前布局。
第一个方向是“推理算力占比将持续上升”。随着大模型应用在千行百业落地,推理场景的需求增长会超过训练场景。这意味着整个基础设施的架构设计需要更多考虑推理的延迟和吞吐特征。对运维人员来说,推理集群的监控、弹性和精细化调度能力会变得更加重要。
第二个方向是“智算中心将走向标准化和预制化”。为了缩短部署周期、降低建设成本,模块化数据中心和预制化液冷机柜会成为主流。一个标准化的智算单元,可能在出厂时就已经集成了供配电、液冷、网络和计算设备,到现场只需完成硬件对接和软件初始化。这种变化会大幅降低建设门槛,同时也对运维的“工厂化交付”能力提出新要求。
第三个方向是“AI基础设施与数据战略深度绑定”。数据是模型的燃料,AI集群的价值最终取决于它能被怎样高效地喂给模型。未来,DataOps和MLOps会更加深度地融合到基础设施运维中。数据质量监控、数据版本管理、特征一致性校验,这些工作可能不再只是数据团队的事,运维工程师也要理解数据管道的基本逻辑,才能在上游出问题时快速定位。
第四个方向是“绿色低碳成为基础设施硬性指标”。碳排放约束会越来越严格,AI集群的PUE和CUE(碳利用效率)会被纳入监管和披露范围。这意味着运维团队不仅要关注性能和成本,还要掌握能耗优化、绿电采购、碳排放核算等新技能。
以上四个方向,无论你是做技术决策、还是做一线运维,都值得提前思考并针对性地做一些知识储备。行业浪潮来的时候,提前站在岸上的人和被动被卷进水里的人,看到的是完全不同的风景。
我个人在实际操作中的体会是,这一轮AI基础设施的浪潮跟以往任何一次技术升级都不太一样。以前的技术更新,更多是应用层的迭代,基础设施层相对稳定;但这次是从最底层的芯片、网络、电力到上层调度、运维、应用的全链路重构,变化的速度和深度都远超预期。对工程师来说,焦虑是正常的,但更重要的不是焦虑本身,而是持续学习、保持动手实践、在真实项目里解决真实问题的能力。
如果你正在考虑是否要投入精力学习AI基础设施方向,我的建议很直接:先去云平台上开通一个GPU实例,把你现在手头最熟悉的应用搬上去,量一量性能指标,观察一下运行状态。从这个最小的动作开始,你会发现这个领域的门槛并没有想象中那么高。只要迈出了第一步,后面的一切都会自然展开。
