1. 为什么英伟达愿意为 OCS 掏 20 亿美元
先说个结论:这 20 亿不是英伟达在“买技术”,而是在“买时间”。AI 算力集群的规模膨胀速度,已经超出了传统网络架构能承受的物理极限。当你要把几万张 GPU 卡组成一个训练集群,卡与卡之间的通信不再是“局域网级别”的问题,而是“城市级组网”的问题。这里的瓶颈已经不是交换芯片的转发能力,而是光模块和交换端口之间的连接方式。
传统方案是电交换,也就是信号每经过一跳,都要完成一次“光→电→光”的转换。这个转换过程不光有延迟,还有功率损耗。一个 8 卡服务器内部的通信还好说,一旦到了跨机柜、跨列、跨机房的大规模集合通信,电交换的代价会指数级上升。英伟达自己的 NVLink 和 InfiniBand 虽然快,但它们解决的是短距离、高带宽的互联,到了跨机柜这一层,光交换的优势就体现出来了。
OCS(Optical Circuit Switching,光路交换)的核心思路很粗暴:既然光电转换费电又费时,那我干脆让光信号直接“走捷径”,用镜片或液晶单元把光路从输入端口直接导向输出端口,中间完全不碰电。这个方案在 2010 年左右就有学术团队在搞,但当时 AI 算力还没起来,市场需求不够大,成本也压不下来。现在不一样了,英伟达一年出货几十万张加速卡,GPU 之间的通信需求已经把光模块的带宽逼到了 800G 甚至 1.6T,这时候 OCS 就不再是“可选优化”,而是“必选项”。
另一个关键点是故障隔离。几万张卡组成的集群,每天都有卡或光模块在坏。传统电交换机一旦某个端口出问题,要么整机重启,要么需要手动换线。OCS 可以在毫秒级把光路切到备份端口,相当于给网络做了一次“热插拔”,这个特性在超大规模集群里比带宽本身更值钱。英伟达愿意花 20 亿,买的不只是交换能力,更是集群的可用性和运维效率。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 三大光交换技术路线:MEMS、液晶、硅光到底在争什么
OCS 的核心是“怎么把光从 A 点搬到 B 点”。目前主流的方案有三种:MEMS 微镜阵列、液晶(LCoS)光束偏转、以及硅光集成波导。这三条路线没有谁绝对碾压谁,而是各有各的甜点区。
2.1 MEMS:成熟可靠,但物理运动是硬伤
MEMS 微镜阵列的基本原理是用静电力驱动一个微米级的镜子偏转,把入射光反射到不同的输出端口。你可以把它理解成“一堆会动的镜子”,每个镜子对应一个输入通道。这个方案的优势是插损低,通常在 1dB 以内,而且切换速度快,能做到微秒级。缺点是机械结构天生怕震动、怕老化,而且在切换瞬间会出现光路中断。
在实际部署中,MEMS 的寿命是大家最担心的问题。微镜的悬臂梁在反复偏转后,金属疲劳是必然的。虽然在实验室里能跑几亿次,但放到机房环境里,温度和湿度的变化会加速老化过程。所以一般建议把 MEMS 用在“切换频率不高,但要求低延迟”的场景,比如光纤故障后的自动恢复,而不是高频动态调度。
2.2 液晶(LCoS):无运动部件,但偏振依赖是麻烦
LCoS 方案没有物理运动,而是靠液晶分子的排列改变光的相位,从而实现光束偏转。这个方案最大的好处是没有机械磨损,可靠性大幅提升。技术难点在于:液晶对偏振态敏感,输入光的偏振方向不一致,偏转效率就会打折扣。
为了让系统正常工作,LCoS 方案需要在输入端加偏振分束器,把光拆成两个偏振方向分别处理,再在输出端合波。这个流程会增加大概 0.5 到 1dB 的插损,但对于不需要频繁切换的骨干网络来说可以接受。英伟达选择 LCoS 的一个重要原因是它支持“广播”功能。在分布式训练里,很多时候一个参数需要同时发给多个 GPU,MEMS 是点对点反射,天然做不到一对多,而 LCoS 可以把一束光同时偏转到多个方向,这个特性在集合通信中非常有用。
2.3 硅光:集成度高,但当前成本还偏高
硅光方案是把光波导和微环谐振器刻在硅片上,通过热光或电光效应改变折射率,从而控制光的走向。这是三者中集成度最高的方案,一个指甲盖大小的芯片上可以集成几十个通道,非常适合大规模扩展。
但硅光 OC S的问题在于热调谐的功耗。硅材料的热光系数高,意味着你只要给它加一点热,折射率就会明显变化。但反过来也是缺点:环境温度一变,就得额外加功耗去补偿。而且硅光的插损和串扰指标目前还不如 MEMS 和 LCoS,尤其在 1.6T 这种超高带宽场景,串扰会导致误码率上升。现阶段硅光 OCS 更适合用在端口密度极高的场景,比如数据中心内部的东-西向流量调度,而不是骨干级的光路交换。
到这里你应该明白了:英伟达这次不是“押注某一条路线”,而是三条路线都在布局。从公开的专利和收购来看,MEMS 负责核心骨干的高可靠交换,LCoS 负责需要广播和多播的参数同步场景,硅光则留给未来高密度集成的小型化设备。
3. 优峰技术 1550nm 可调谐激光器的角色:为什么偏偏是它
OCS 只是一个光路交换骨架,它本身不产生光信号。光从哪里来?从激光器来。而优峰技术做的 1550nm 可调谐激光器,恰好是整个系统里最不起眼、但最不可或缺的组件。
先解释一下为什么是 1550nm。光通信有两个主流窗口:850nm 用于短距,1310nm 用于中短距,而 1550nm 是长距传输的黄金窗口。1550nm 的光在石英光纤里的损耗最低,大约 0.2dB/km,同时配合掺铒光纤放大器(EDFA)可以实现全光中继,不需要把信号转成电再放大。在 OCS 这种大范围光路调度场景里,链路距离通常跨越多个机房甚至多个园区,只有 1550nm 能保证足够的光预算。
可调谐激光器比固定波长激光器贵很多,为什么非要用可调谐的?
因为 OCS 系统里的波长规划本质上是一个动态过程。当某条光路发生故障,系统需要立刻把流量切换到另一条路径。如果用的是固定波长激光器,那你必须保证备份路径上的所有器件都支持这个波长,这在工程上几乎不可能。可调谐激光器则可以在几十纳秒内把输出波长切换到目标值,让网络重新收敛。另外,在波分复用(WDM)系统里,可调谐激光器还能实现“波长随需分配”,提高频谱使用效率。
优峰技术做的 1550nm 可调谐激光器,有几个指标是值得关注的。第一个是调谐范围,通常要覆盖 C 波段的全频段,也就是从 1530nm 到 1565nm,共约 4.5THz 的频谱宽度。第二个是输出光功率,一般要达到 20mW 以上,不然经过多个 OCS 节点后,光功率会跌到接收灵敏度以下。第三个是波长稳定性,在温度变化和老化影响下,波长漂移要控制在 ±2.5GHz 以内,否则就会造成相邻通道的串扰。
在优峰技术的方案里,激光器用的是外腔式结构,也就是把增益芯片和外部波长选择元件分离。这种结构的优势是线宽更窄,可以达到 100kHz 以下。线宽越窄,意味着相位噪声越低,在高速调制时误码率越低。对于 800G 甚至 1.6T 的传输速率,窄线宽激光器是刚需,这个是分布式反馈(DFB)激光器很难做到的。
4. AI 算力网络中的 OCS:从架构逻辑到部署实操
4.1 胖树架构的瓶颈与 OCS 的引入逻辑
传统 AI 集群网络采用胖树(Fat-Tree)拓扑,每个交换机上面还有更高级的交换机,形成分层结构。这种架构的好处是容错性好、扩展性强。但它有一个致命问题:层级越高,需要的交换机端口越多,成本爆炸式上升。
举个例子,一个 4096 卡的集群,如果用 128 端口的交换机做胖树,需要两层交换机加一层核心交换机,光模块数量大概在 18000 个左右。而如果引入 OCS 做光路直连,很多“多跳”路径可以直接变成“一跳”,需要的电交换端口可以缩减 30% 到 40%。这笔账算下来,20 亿美元的投入,大概一年半就能靠省掉的光模块和电费收回成本。
具体操作上,OCS 并不是替换所有电交换机,而是和电交换机形成一个混合架构。常规的流量还是走原来的电交换网络,只有那些“大象流”(占带宽高、持续时间长的流量)才被调度到 OCS 光路上。这个设计的好处是,OCS 不需要处理逐包转发,只需要周期性重配置光路拓扑,控制器的负载非常低,不会成为新的性能瓶颈。
4.2 OCS 控制面的关键技术点:拓扑感知与重配置
再往深一层看,OCS 的控制面是整个系统的软件核心。硬件再怎么快,如果没有聪明的调度算法,光路的利用率也提不起来。目前主流的做法是:控制器收集所有 GPU 节点之间的流量矩阵,每几十毫秒做一次计算,找出那些通信量大的偏斜流量,把它们固化到 OCS 光路上。
这个过程有两点非常关键。第一是流量预测的准确性。如果预测不准,今天把光路给了进程 A,明天进程 A 不通信了,光路就浪费了。实际工程里常见做法是用滑动窗口预测未来 1 到 2 个窗口的流量变化趋势,再配合一点阈值触发的机制,也就是当流量突变超过某个阈值时,立刻触发一次重配置。第二是重配置期间的光路中断问题。MEMS 微镜切换需要一定时间,如果是机械式偏转,切换期间光会完全中断,这对 NVLink 这类对延迟极其敏感的协议是不可接受的。所以生产环境里的 OCS 重配置,一般会采用“先建后拆”的策略,也就是先在目标端口建立新的光路,确认无误后再断开旧的光路。
4.3 1550nm 可调谐激光器在 OCS 中的摆位:一个容易踩的坑
以前我做相关项目时,第一版方案里把可调谐激光器放在了光模块的发射端,结果发现了一个问题:光模块内激光器的温度是受控的,但 OCS 机柜里的环境温度变化幅度要远大于光模块内部。波长稳定性一差,系统误码率直接上升一个数量级。
后面换了思路,把可调谐激光器做成独立的外置光源(External Light Source, ELS),再通过光纤把光送到光模块的调制器部分。这样激光器可以放在温度更稳定的区域,光模块只负责调制和接收,散热压力小很多。这个架构在业界叫作“外置光源+无源调制”,也是目前 1.6T 光模块的主流演进方向。优峰技术的 1550nm 可调谐激光器之所以被市场关注,很大程度上就是因为它适配了这种 ELS 架构,而不是传统的光模块内置方案。
4.4 实际部署中的参数计算:光链路预算怎么算
这里给一个实际部署中会用到的链路预算计算过程,方便你理解为什么 OCS 对激光器功率有要求。
假设一个典型的 OCS 链路包含以下损耗源:
- 可调谐激光器输出光功率:+17dBm(约 50mW)
- 光纤连接器损耗:0.5dB/对,链路中通常有 4 对,共 2dB
- OCS 交换节点插损:2dB(LCoS 方案的典型值)
- 光纤传输损耗:2km 光纤约 0.4dB(按 0.2dB/km)
- 接收端光组件损耗:1dB
那么链路总损耗 = 2 + 2 + 0.4 + 1 = 5.4dB。接收端收到的光功率 = 17 - 5.4 = 11.6dBm。这看起来很大,但接收端灵敏度通常只有 -10dBm 左右,所以系统余量有 21.6dB。实际工程经验是至少保留 10dB 余量,用来应对连接器脏污、光纤弯折、器件老化等情况。如果用的是固定波长激光器,输出光功率一般只有 +7dBm 左右,链路余量立刻掉了 10dB,老化之后的可靠性就会打折扣。这就是为什么 1550nm 可调谐激光器要追求更高的输出功率,不只是为了信号更强,而是为了给系统留足“安全垫”。
5. 常见踩坑与排查实录
做 OCS 相关系统,不像写软件改几行代码就能验证。光路的排查需要仪器和经验的结合,我这里把近两年遇到的项目问题和排查思路整理一下,免得大家走弯路。
5.1 波长漂移导致误码率飙升
现象:系统运行几小时后,误码率逐步上升,但光功率看起来正常。
排查步骤:第一步用光谱仪查看激光器输出的中心波长,确认是否偏离了 ITU 网格上的标准波长。第二步检查激光器的温度控制电路,看 TEC(半导体制冷器)的驱动电流是否在正常范围。第三步检查 OCS 节点的波长选择元件的中心波长是否和激光器匹配。
大概率结论:激光器的 TEC 控温精度不够,或者环境中存在强烈的气流导致激光器壳体温度波动超过 ±2°C。解决办法是给激光器加一个独立的温控罩,同时把 TEC 的控制参数改成 PID 闭环。
实际上还有一种隐蔽情况:LCoS 元件在长期工作中,液晶分子的取向会发生缓慢变化,导致它对波长的偏转效率发生微小的偏移,表现为“波长选择窗口漂移”。这种情况用光谱仪不是很好排查,建议直接看交换机上报的 FEC(前向纠错)误码统计,如果某个通道的 FEC 纠错前误码持续增加,先检查光模块的接收光功率,再检查频率偏移响应曲线。
5.2 OCS 切换瞬间丢光导致上层业务中断
现象:OCS 重配置完成后,上层应用开始报错,出现大量 TCP 超时或 RDMA 重试。
排查思路:先用光功率计记录切换瞬间的光功率曲线。如果发现光功率在切换过程中跌到零,说明切换采用的是“先断后建”方式,上层必须容忍光路中断。解决办法是明确 OCS 控制器的执行策略,必须采用“先建后拆”:先在目标端口把光路建立起来,再断开旧光路。同时,在控制面增加一个光功率阈值检测,只有目标端口的光功率稳定在正常范围后,才允许下发断开命令。
这里还有一个容易忽略的细节:MEMS 微镜切换后有振荡收敛过程,光功率会先冲高再回落,最后稳定在目标值。如果你的控制器只在“切换完成”的时间点检查一次光功率,很可能恰好落在振荡的高点,误判为正常。建议在切换完成后的 10ms 内,连续采样 20 次光功率,取平均值和方差,两个指标都达标才判定为切换成功。
5.3 偏振相关损耗造成信号劣化
现象:LCoS 方案的通道插损不稳定,同一通道在不同时间测出来的插损差异超过 1dB。
原因分析:偏振相关损耗(PDL)。LCoS 的内部光学元件对入射偏振态有选择性,偏振态变化后偏转效率也跟着变化。这个现象不是说器件坏了,而是它在不同的偏振输入下工作状态不同。解决方案是在激光器输出端加一个偏振稳定器,或者选用带偏振分集接收的光模块。如果你的方案使用的是外置光源,外加偏振稳定器是更稳妥的选择,成本大约增加 3% 到 5%,但对系统稳定性的提升非常明显。
5.4 可调谐激光器的“波长锁定失败”
现象:激光器在调谐到某个新波长后,输出光功率正常,但波长始终锁定不上,报错信息显示“Unlocked”状态。
排查步骤:先检查波长选择元件的驱动电压是否已经更新到目标值,再检查激光器的辅助波长计通道的采样值是否在合理范围内。在实际操作中发现,很多时候是波长计通道的参考光功率太弱,导致反馈环路无法正常收敛。解决办法是调整辅助通道的分光比,确保参考光功率始终落在光电探测器的线性响应区间。
关于这一点,我在选型时的经验是:一定要选择带“波长锁存”功能的产品,也就是说,即使外部断电再上电,激光器能自动恢复到断电前的波长,而不是回到默认波长。如果没有这个功能,系统重启后所有光路都要重新建连,恢复时间会从分钟级变成小时级。
6. 体验总结与选型建议
在最后分享几个从项目中沉淀下来的判断,不一定对,但可以作为参考。
第一,OCS 是一个“三分硬件,七分软件”的系统。硬件做的是把光路物理打通,但真正的价值在于控制器怎么预测流量、怎么调度光路、怎么处理故障恢复。如果你们团队有系统工程师,尽快开始准备 OCS 控制面的多控制器协调机制,因为一台 OCS 设备最多只能覆盖几百个端口,大规模集群需要多台设备协同工作。市面上大部分开源方案只解决了“单台设备的控制”,多台设备的跨域调度才是真正的壁垒。
第二,1550nm 可调谐激光器的选型,不要只看峰值功率和线宽这两个指标。建议把重点放在长期波长稳定性和温度漂移系数上。选型时可以问供应商要 1000 小时加速老化测试数据,重点看波长偏移是否收敛,还是持续漂移。我见过一个极端案例:某厂家的激光器在老化测试中波长持续向长波方向漂移,三千小时后漂了 15GHz,直接超过了 50GHz 通道间隔的容限,整批设备全部不能用。这种风险,靠后期运维是救不回来的,只能选型时规避。
第三,如果项目预算紧张,可以优先考虑 LCoS 方案搭配中等性能的可调谐激光器,而不是旗舰激光器搭配低端 MEMS。因为 LCoS 的维护成本低,没有机械部件,而 MEMS 在长期运行后振镜校准是必然的维护动作,这笔费用往往比买高端激光器还高。
最后再说一个实用的工具技巧:在 OCS 链路调试阶段,强烈建议准备一台可调谐激光器、一台光谱仪、一台光功率计、以及一台带 OTDR 功能的光纤测试仪。OTDR 在判断光纤断点、脏污连接器这类问题上效率极高,不要等出了问题才想起来。我在一个项目里用 OTDR 排查一个“光功率间歇性抖动”的问题,结果发现是机房地板下的光纤被踩出了一处微弯,常规光功率计完全测不出来。这种问题,没有 OTDR 至少得折腾一天,用 OTDR 十分钟就定位了。
OCS 和可调谐激光器的组合,在未来两三年会是 AI 算力网络基础设施的标配。这个方向值得持续关注。
