两年翻倍:机架功率密度的陡峭曲线
机架功率密度——即机架持续运行的用电负荷——一直在稳步攀升。不久前,许多运营商还将每机架10kW视为“典型”水平,更高密度主要出现在特殊场景中。而今天,AI工作负载、空间限制以及不断改善的散热方案,正在把实际可行的机架容量推向极端,一些设计方案甚至将目标定在每机架1MW。
数据的变化曲线非常直观。2016年,平均机架负载约为6.1kW。到2024年,这一数字上升至12kW。截至2026年,平均值已达到26kW。从2024年的12kW到2026年的26kW,两年内平均值增长了一倍多。
但“平均值”掩盖了AI机架的真实面貌。据Uptime Institute第16届全球数据中心年度调查,2026年“模态机架密度”(最常见的每机架功耗值)为11kW,较2025年的9kW有所提升。这个11kW描述的是典型企业服务器机房的水平,而非AI训练集群。
AI机架所处的功耗等级完全是另一番天地。根据英伟达NVL72 AI工厂参考架构,英伟达GB300 NVL72每机架功耗高达142kW。英伟达最新平台Vera Rubin NVL72于2026年6月进入全面量产阶段,供应链行业报道将其机架功耗定位在190至230kW之间。其后续产品Rubin Ultra NVL576“Kyber”机架已规划在2027年下半年上市,功耗约为600kW。
为什么机架功率涨得这么快
多种力量正在共同作用。
首先是AI热潮。AI加速器和现代服务器的耗电量远超前几代产品,据报道在某些配置中,单个GPU或其他加速器的功耗可高达700W。
其次是对容量的持续需求。由于数据中心用地供应紧张,运营商正在现有场地内塞入更多计算资源,方法包括提高机架密度、采用更高或更深的机柜,或两者兼用。无论哪种方式,结果都是单机柜功耗上升。
第三是更好的散热方案。先进的散热方案——包括芯片级直接液冷、后门热交换器和浸没式冷却——使得更高的机柜密度在不引发过热失控的情况下变得可行。此外,机房布局和设备搬运方式的新思路(例如为空间受限房间配备的天花板吊装设备),也让在狭窄空间中的操作和维护变得更轻松。
有分析师指出,关于限制密度的最大误解是,人们认为限制来自每个机箱的GPU数量,或者是一个换几台更大风扇就能解决的冷却问题。真正划定上限的是三个问题:机架能散多少热、芯片消耗多少电,以及设施能安全输送多少电力。

风冷已到极限,液冷全面接管
每机架功耗超过约50kW后,风冷便变得不切实际。超过这一阈值,风扇已无法输送足够的气流来应对热负荷。
通过芯片冷板输送液体的直接液冷方案,目前可处理每机架100至150kW的热量,并已成为主导液冷方式。据施耐德电气统计,截至2026年,其市场份额占比达55%。
浸没式冷却则支持更高的密度。IEEE发表的研究案例显示,浸没式冷却可将与空气处理和泵相关的冷却能耗降低最多40%,并支持超过100kW的机架密度,超出风冷系统的极限。曙光数创发布的MW级相变浸没液冷整机柜方案,单机柜最高可支持超过900kW的功率,散热能力是传统液冷方案的3至5倍,可将数据中心PUE降至1.04以下。
国内厂商也在快速跟进。字节跳动在OCP开放计算中国峰会上展示的AI Rack 3.0系统,采用双柜组合设计,单柜功率可达500kW,整套双柜集群总功率突破1MW,配套100%整机柜全液冷散热架构和800V HVDC高压直流供电。英伟达已宣布其新一代Vera Rubin平台将采用100%全液冷技术,系统内无任何风扇,计划于2026年秋季启动量产。
供电架构的升级压力
更高的机架功率,首先冲击的是配电系统。
即便整体场地容量足够,传统配电架构也可能难以以适当的冗余度向单个机柜输送数百安培的电流。传统54V直流配电在铜导线用量和电流承载能力上正面临物理瓶颈,向800V高压直流架构迁移成为行业共识。
施耐德电气与AMD联合推出的Helios AI Factory参考设计,支持单机架最高246kW、IT容量最高10.4MW,最多2880个GPU的集群规模。在散热上液冷承担了84%的负荷,风冷仅负责剩余16%。
供电侧的另一个现实是:获得新的电网容量在某些主要市场需要三到四年,往往超过设施建设本身的时间。这意味着运营商需要在既有电力分配内最大化计算容量,而非围绕无限未来电力来设计。
被忽视的结构与空间挑战
功率密度上升的影响远不止电力和散热。
更重、更密集的机柜会增加地板承重和搬运难度。原本按轻型机柜设计的设施,可能需要进行结构加固、采用替代地板系统,或调整安装与维护通道。
将1MW的IT负载集中在20个机架上,意味着每个机架需要承载50kW的功率,热量必须快速排出,而传统的外围空气冷却从未被设计用来应对这种集中度。

运营商现在应该做什么
每机柜约1MW的负载在可预见的未来仍将是个例,但每机柜10kW被视为“典型”水平的时代正在结束。
为保持领先,数据中心需要在三个方向同步升级:
第一,规划能够以适当冗余度和故障容错能力支撑更高单机柜功耗的电力架构,包括向800V高压直流迁移的路线图。
第二,将散热策略(尤其是液冷方案)与未来的密度规划及技能培养计划相匹配,液冷带来的资本支出、监测与维护需求、水管理与泄漏检测要求以及新的技能需求,并非每个设施都能快速消化。
第三,针对更重、更密集的设备,验证地板承重、通道和搬运设备是否满足要求。
简而言之,在以AI为核心的环境中,更高的机柜负载已经到来并持续攀升。那些主动升级电力、散热和结构系统的设施,将最有能力抓住下一波计算需求的浪潮。
(全球储能网、新能源网、智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
