为何人工智能数据中心会消耗如此多的电力?一个被忽视的重要原因

AI工作负载的波动性迫使数据中心运行次要任务,从而增加了能源消耗、基础设施需求、成本和电网压力。

对AI数据中心电力消耗的审视已达到沸点。作为回应,政策制定者、电力公司和科技公司正试图弄清楚如何在不让普通消费者电费上涨的情况下,建设足够的发电能力来满足需求。然而,一个关键问题得到的关注却少得惊人:AI数据中心一开始为什么需要这么多电力?

答案中一个重要但被忽视的部分不在于模型本身,而在于数据中心如何管理现代AI工作负载所导致的电力需求快速波动。现在,在控制用电量的巨大压力下,行业再也负担不起依赖次要工作负载等传统方法来平滑电力需求了。

工作负载波动性如何加剧电力消耗

问题的根源在于大型AI模型的训练方式。现代训练通常是批量同步的:数千个GPU并行进行计算,然后短暂暂停以在集群中交换数据和同步结果。在这些暂停期间,许多GPU闲置,之后再次加速。

在超大规模下,这些同步空闲期会导致整个数据中心的电力需求出现急剧快速下降。这种波动会给变压器、配电单元甚至上游电网组件带来压力,有造成停电或代价高昂的停机的风险。

数据中心运营商管理这些波动的最常见方法之一是在GPU原本空闲时运行次要工作负载。这些工作负载不是主要AI训练任务的一部分;相反,它们的存在是为了防止GPU空闲时电力需求下降过猛。它们运行的时间刚好足以填补电力使用的短暂下降,然后在主要计算恢复时立即让出。例如,在Oracle,这个过程由一个毫秒级的“GPU心跳”指导,该心跳持续测量GPU活动,并以近乎即时的定点触发次要工作负载。

这种方法稳定了数据中心的电力需求曲线,但不必要地增加了整体电力消耗,并引入了其他低效率,这些低效率在大规模下会迅速复合。

次要工作负载的隐藏成本

次要工作负载通常分为两类:在空闲期间执行有用工作的生产性工作负载,以及仅为了维持稳定电力曲线而存在的虚拟工作负载。两者都带来显著的权衡。

生产性工作负载:在某些情况下,运营商使用生产性次要工作负载——这些任务最终需要运行,并且可以利用空闲的GPU周期。然而,生产性次要工作负载会与主要AI训练任务竞争GPU资源、内存带宽和散热空间。结果是主要工作负载的有效性能降低,因为训练时间更长、同步开销增加或吞吐量减少。

换句话说,生产性次要工作负载通过牺牲性能来稳定电力需求。在大型AI集群的规模下,即使是微小的效率损失也会转化为训练时间、成本和上市时间的显著增加。

虚拟工作负载:当性能不能妥协时,运营商转向虚拟工作负载,这些负载执行无意义的计算。虚拟工作负载不干扰训练性能,但也不产生任何有用的输出。在拥有数万个GPU的大型数据中心中,这代表着巨大且基本不可见的能源浪费。

级联运营影响

虽然运行次要工作负载通常被视为一种次要的电力管理策略,但它们会产生级联的运营后果,远远超出浪费电力或性能损失。

更高的运营成本:

维持峰值电力使用水平会增加全方位的运营成本。电力、冷却和基础设施必须按支持最高可能负载的规格来设计,即使实际工作负载只是间歇性地需要该容量。

更长的电网互联时间:

此外,峰值负载更高的设施需要更长时间才能连接到电网。公用事业公司根据项目的最大电力需求来评估项目。如果公用事业公司必须分配比可用容量更多的发电或输电容量,审批可能会延迟,基础设施成本可能会增加。

加速设备磨损:

最后,持续以最大利用率运行硬件会加速磨损。当 GPU、电力系统和冷却基础设施在持续峰值水平下运行时,会承受更大的热应力和电应力,从而缩短设备寿命并增加维护成本。

为什么现在这个问题很重要

如果行业真的想要减少AI数据中心的电力足迹,就必须超越次要工作负载之类的变通方法,采用更智能的方式来管理快速的需求波动。使用额外的计算(无论是生产性的还是虚拟性的)来平滑电力曲线,最终是替代更好系统设计的昂贵方案。事实上,它加剧了行业正面临压力的电力挑战。

这在目前很重要,因为这些约束不再是理论上的。电网互联延迟正在拖慢项目进度,电力成本受到更严格的审查,社区越来越多地质疑AI的好处是否值得其不断增长的能源需求。辩论不能只关注我们以多快的速度建设更多电力。它还必须关注我们如何智能地使用已经拥有的电力。通过更高效、专门设计的解决方案来解决工作负载波动性,并不能解决AI供电中的所有挑战,但会立即解决最被忽视的浪费来源之一。

作者Taavi Madiberk是Skeleton Technologies的首席执行官兼联合创始人,该公司是一家专注于人工智能数据中心、电网基础设施和工业的全球储能技术公司。

(素材来自:Skeleton Technologie 全球储能网、新能源网综合)

本文由智算芯能前沿网编辑整理,转载请注明出处。