随着AI集群从400G和800G向1.6太比特网络演进,光学在基础设施成本、功耗和运营风险中的占比越来越大。CISCO的Bill Gartner解释了为什么一条不稳定的链路可能拖累整个训练集群的GPU利用率,以及为什么下一个重大架构转型可能会将光学部件更靠近硅片。
本文关键要点
1、随着网络速度提升,光收发器在经济上的重要性日益增加,在400G及以上速率中,光器件的成本有时甚至超过其所支持的交换机端口。
2、AI基础设施分为三个层级——scale-up、scale-out和scale-across——每个层级都有不同的网络需求,并且对高容量光链路的依赖越来越大。
3、链路可靠性在AI网络中至关重要;错误可能导致显著的性能下降,使光学稳定性成为衡量计算效率的关键指标。
4、行业正朝着1.6T光学迈进,预计在超大规模企业的推动下将出现早期部署,以改善每比特的成本和功耗效率。
5、共封装光学等新兴架构旨在降低功耗并提高端口密度,但会引入与组件故障和互操作性相关的运营挑战。

在现代数据中心时代的大部分时间里,光学在网络中扮演着辅助角色。光收发器连接交换机、路由器和设施,但通常被视为其周围更重要基础设施的附件。
人工智能正在颠覆这种计算方式。
AI训练集群的巨大带宽需求使光学成为基础设施堆栈中经济上最重要、运营上最敏感的组件之一。随着网络从400G和800G连接向每秒1.6太比特演进,光器件的成本现在可能超过其所支持的交换机端口的成本。
与此同时,一个故障连接可能会让世界上一些最昂贵的基础设施等待网络恢复。
“AI确实改变了光学在行业中的相关性,”CISCO光学系统和光学业务高级副总裁兼总经理Bill Gartner最近在一次播客中表示。
Gartner说,在每秒10G时,光学约占网络端口物料清单的10%。在100G时,这一比例增加到约50%。
“在400G及以上,光器件的成本实际上可能超过端口本身的成本。”
这种经济反转正在发生,同时数据中心运营商面临着一个同样重要的功耗方程。网络消耗的每一瓦电力,都是无法用于GPU产生实际训练或推理输出的电力。
互连是必要的,Gartner指出,但其价值在于保持计算基础设施运行,而非执行计算本身。这给了网络设计者强烈的动力去降低每传输一个比特的功耗和成本。
“我们希望尽可能将其降至接近零,”他说。“显然我们无法达到零,但降低互连中的功耗损失将推动为GPU和CPU提供更好的解决方案。”
AI工厂内部的三个网络
理解光学挑战首先要认识到AI集群包含几个不同的网络环境。
Gartner将AI基础设施大致分为三个层级:scale-up、scale-out和scale-across。每个层级运行在不同的距离上,承载不同级别的流量,并对互连产生不同的要求。
Scale-up描述的是机架内部的连接,运营商在服务器中放置尽可能多的GPU,然后将这些服务器塞进可用的机架空间内。Gartner估计,该环境内的带宽大约是传统广域网应用的500倍。
Scale-up连接仍然严重依赖电气接口,因为电互连在短距离内相对便宜且功耗高效。
一旦机架的计算容量用尽,集群必须扩展到更多机架中。这就是scale-out网络,400G和800G可插拔光学在此连接大量并行运行的GPU系统。
Gartner将scale-out带宽描述为传统WAN环境容量的约50倍。
第三层scale-across出现在数据中心达到其实用功耗极限,AI基础设施必须扩展到另一个设施时。这些数据中心可能相隔数十或数百公里,需要能够长距离传输极高容量信号的相干光技术。
据Gartner称,scale-across网络可以代表约14倍传统WAN带宽。
综合来看,这三个层级说明了为什么光学已与AI基础设施讨论密不可分。网络容量必须在机架内部、机架行之间以及越来越多地在独立数据中心之间扩展——所有这些都不能消耗过多的功耗预算或引入使GPU闲置的故障。
一条链路拖慢整个集群
AI网络的可靠性要求与传统企业或互联网基础设施截然不同。
在传统TCP/IP网络中,错误可能触发数据包重传。应用程序或用户可能永远不会意识到错误发生。
AI训练集群的运行方式不同。GPU并行处理大问题,必须保持同步。当一条链路上发生错误时,其影响可能扩展到整个集群。
“所有GPU都需要停下来,回退到一个检查点,然后重新启动,”Gartner说。“因为在GPU基础设施中一切都是并行运行的,一条链路上的链路错误实际上会影响相邻链路。”
这些故障可能由不良连接、光连接器脏污、链路上的噪声或其他物理和电子问题引起。由此产生的不稳定性通常被描述为链路震荡——连接反复断开和恢复。
Gartner表示,CISCO从超大规模客户那里收到的信息表明,链路震荡可使GPU基础设施的效率降低高达40%。
这个数字改变了光学可靠性的实际含义。收发器不再仅仅是网络中数千个组件中的一个。一条不稳定的链路可能会破坏与之连接的昂贵得多的加速器的利用率。
“我们有一切动力确保光学器件超级可靠,”Gartner说。
其经济性是显而易见的。运营商正在投资数十亿美元建设AI园区,旨在让加速器以尽可能高的利用率运行。一个迫使数千个GPU停止、返回检查点并重新启动的网络问题可能会削弱整个部署的生产力。
在这种环境下,光学可靠性成了计算效率指标。

1.6T正在走向部署
目前大多数大型AI训练网络都围绕400G和800G连接构建。Gartner将这些技术描述为超大规模训练基础设施中无处不在的技术,各自服务于网络的不同部分。
下一步已经临近。
CISCO正在与客户一起试用1.6T光学样品,Gartner表示首批批量部署预计将于今年晚些时候开始。与之前从10G到100G、从100G到400G以及从400G到800G的过渡一样,其吸引力在于改善每比特的成本和功耗效率。
“毫无疑问,市场对1.6T有需求,”他说。“我们也在关注1.6T之后的下一步发展。”
各客户细分市场的采用将不均衡。
超大规模企业推动了800G和1.6T技术的大部分需求和用量。传统服务提供商仍处于其400G和800G部署的早期阶段,而400G在许多企业网络中仍处于早期阶段。
这种区别很重要,因为超大规模采购量将有助于决定该技术的成本曲线。Gartner建议服务提供商和企业密切关注最大型云和AI基础设施运营商正在采用的架构。
“如果你想处于低成本曲线上,就应该处于超大规模企业的成本曲线上。”
即将到来的电-光转换
从400G到800G再到1.6T的演进是重要的,但Gartner将其视为熟悉的代际演进。更具颠覆性的转变将发生在电连接无法再承载scale-up网络内所需带宽的时候。
约束归根结底是物理问题。
随着信号比特率的增加,其传输距离通常会减少。电互连在机架内部仍然具有吸引力,因为它们廉价且高效,但行业最终将达到一个临界点,即使是在短距离内也无法支持所需的容量。
“我最终押注于光学解决方案,”Gartner说。
有几种潜在的架构正在开发中,包括共封装光学、近封装光学、使用较低速率信号的宽电气总线和射频技术。
共封装光学和近封装光学将光学组件从交换机前面板移出,移近交换芯片。系统不是通过线卡将高速电信号传输几英寸到可插拔收发器,而是在更靠近芯片的地方将信号转换为光。
较短的电路径可以减少重复重定时信号的需求,从而降低功耗。将可插拔模块从面板移除还可以提高端口密度,因为光连接器比完整收发器需要更少的空间。
CISCO预计共封装解决方案将于今年进入市场,让运营商有机会获得该架构的实际经验。
但这种过渡引入了运营上的权衡。
可插拔光学器件是可更换的、可互操作的,并且可从多个供应商获得。当一个发生故障时,技术人员可以更换受影响的模块。在共封装设计中,光学组件可能直接安装在线卡上或与交换芯片集成。
这引出了一个更棘手的问题:当单个光通道发生故障时会发生什么?
运营商可能需要依赖软件绕开故障链路,更换系统的更大部分,或重新考虑他们如何备货和维护网络设备。涉及多供应商采购和组件互操作性的问题也将需要解决。
Gartner预计,在共封装或近封装光学在scale-up网络中普及之前,这些运营问题将在未来几年内得到解决。
路由光学降低scale-across代价
光学架构已经在改变运营商连接数据中心的方式。
传统长距离光网络使用放置在专用机箱中的收发器线卡。收发器从交换机或路由器接收光信号,将其转换为能够长距离传输的形式,并将其与同一光纤上的其他波长组合。
通过收购Acacia,CISCO开发了一种称为路由光网络的架构。该方法用直接插入路由器的相干可插拔光学器件取代了独立的收发器线卡。
Gartner表示,该架构比传统的基于收发器的方法消耗约90%的功耗,同时需要更少的空间并降低成本。
超大规模企业是最早的采用者之一,使用相干可插拔器件跨数据中心连接AI基础设施。该技术现在正进入服务提供商网络和企业园区环境。
对于AI运营商来说,路由光网络使scale-across架构更加实用。当一个地点的功耗上限阻止集群进一步扩展时,相干光链路可以将训练环境扩展到另一个设施中。
Gartner说,光学不是在成为瓶颈,而是帮助AI网络超越单个建筑的物理和电气限制继续扩展。
“我们将看到越来越多的单个训练基础设施涉及多个数据中心的场景。”
相干光学进入数据中心内部
scale-out和scale-across之间的界限也可能变得不那么清晰。
传统数据中心光学通常使用强度调制直接检测技术(IMDD)进行约2公里范围内的连接。随着比特率持续增加,维持该传输距离变得更加困难。
交换机之间的物理距离并不会因为网络升级到更快的一代而变短。运营商期望每一代新技术都能支持已部署的布线和布局。
Gartner说,在某个节点上,传统数据中心光学可能无法再维持所需的传输距离。届时行业可能需要采用相干光学的技术,这些技术历史上用于城域、区域和长距离网络。
“很可能我们将不得不借用一些数据中心外部使用的相干技术,并将其引入数据中心内部。”
这种演进可能进一步模糊数据中心园区、城域集群和地理分布式AI基础设施之间的区别。能够支持超过1000公里连接的光学系统已经在扩展数据中心互连的实际覆盖范围。
将相干技术引入设施内部将产生新的功耗和成本考量,但它可以允许运营商继续提高比特率,而无需围绕更短的传输距离重新设计每个物理网络。
推理改变优化目标
训练集群目前占据了行业大部分的关注,因为其巨大的规模和资本需求。Gartner预计下一波主要部署将随着训练模型进入推理而到来。
推理环境通常需要的系统规模小于前沿训练集群,但它们将在超大规模企业、服务提供商和企业中更广泛地部署。
因此优化目标将发生变化。
训练重视规模和连接大量GPU的能力。推理将对成本效率、功耗效率以及在靠近用户和应用的地方支持专用模型的能力施加更大压力。
这将使光学保持在基础设施方程的中心位置,即使部署的类型和规模发生变化。
对数据中心运营商而言,其根本启示是:网络不能再被视为在计算、电力和设施决策之后才添加的次要层。光学的成本、功耗、传输距离和可靠性正成为AI工厂本身的设计输入。
正如Gartner所说,光学目前并没有限制AI网络的发展。它恰恰是让AI网络能够超越单个数据中心的功率和地理边界继续发展的关键技术之一。

作者:Bill Gartner是CISCO光学系统和光学业务高级副总裁兼总经理。
(素材来自:CISCO 智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
