AI工作负载将数据中心机架密度推至风冷极限之上。三种液体冷却方法提供了不同的权衡和优势。
随着AI和高性能计算(HPC)推高服务器功率密度,数据中心正转向液体冷却以更高效地散热。机架密度已从5-10kW跃升至30kW、50kW甚至更高——这是风冷难以应对的水平。更多功率意味着更多热量,而液体冷却在源头就能更有效地捕获热量。
在以下中,详细解释了为什么更多数据中心正在采用液体冷却,以及主要选项在实践中是什么样子。
比较风冷和液体冷却
风冷是将冷空气吹过服务器,并将热空气排入通道。这种方法在较低热量水平下可行,但在较高机架密度下效率会越来越低。
空气导热性能较差,因此必须通过更大或更多的风扇来移动大量空气。这增加了能源成本、噪音和复杂性。这也增加了热点的风险——某些区域温度过高,使组件承受应力。
液体导热远优于空气。液体冷却在更靠近产热部件的地方捕获热量,通常直接在芯片处,因此更少热量逸散到房间中。这意味着风扇更少或更小,温度更稳定。
许多液体系统采用温水回路运行,可减少对能源密集型冷水机组的依赖,并实现废热再利用,如为附近建筑供暖。在合适的设计中,液体冷却可以提高性能、稳定性和整体能源成本。

数据中心屋顶巨大的散热风扇
液体冷却的三种工作方式
RDHx(后门热交换器):
RDHx用液体冷却盘管替换机架后门。当服务器排出热空气时,盘管在热量扩散到房间之前吸收热量,有助于保持通道更凉爽,并减轻房间空调的负荷。
RDHx在改造中很受欢迎,因为它不将液体引入服务器内部,且安装相对简单。权衡之处在于RDHx仍依赖服务器内部风扇,且在极高热负荷下效率可能较低。
直接芯片冷却:
直接芯片冷却将带有内部冷却液通道的小型金属冷板放置在最热组件上:CPU、GPU,有时也包括内存。一个歧管将冷却液分配到每个服务器,而冷却液分配单元(CDU)管理温度、流量和压力,并将热量传递到设施水回路。
根据系统设计,直接芯片冷却可在源头消除机架约70-90%的热量。风扇继续处理低热组件,如电源和网络设备,但整体房间热量急剧下降。它非常适合GPU密集的AI训练集群。
浸没式冷却:
浸没式不是将液体带到服务器,而是将整个服务器浸没在非导电流体中。
在单相系统中,液体不沸腾;泵将温热的液体输送到热交换器。在两相系统中,液体在相对较低的温度下沸腾;蒸汽上升,在冷却表面凝结,再回到液态。
浸没式可消除服务器风扇,简化气流管理,并在极高密度下实现均匀冷却。然而,它需要专用硬件、不同的处理和维护程序,以及较高的前期成本。
选择正确的方法
液体冷却是一个工具箱而非单一产品。RDHx对渐进式升级和现有站点改造具有吸引力。直接芯片冷却为AI和HPC集群提供强大的源头级热量移除,无需完全重新设计环境。浸没式可实现极高密度部署和均匀冷却,但需要更专业的基础设施和运营成本。
数据中心正在变得越来越热。随着AI工作负载的增加,运行它们所需的电力也在增加。现代基于GPU的服务器,尤其是用于AI训练和高性能计算的服务器,正将机架密度推至远超设施最初设计承受能力的水平。因此,虽然机架过去平均为5至10kW,但现在常见的是机架处理30kW、60kW甚至更多。
这就是液体冷却发挥作用的地方。液体冷却听起来可能像是一项尖端创新,但实际上它已经存在多年。任何熟悉高性能游戏PC的人都知道,液体冷却早已用于保持这些系统冷却。其理念是通过比空气更高效地传导热量,液体冷却使这些系统在重负载下运行得更快、更安静、更可靠。
一种思考方式是,现代AI机架就像一台高端游戏PC,只是被放大了很多倍。

液冷系统在PC玩家群体很流行
液体冷却旨在解决的主要挑战是热量移除。传统的风冷系统通过移动冷空气穿过服务器并将热空气从后部排出。但空气有其局限性。它导热性相对较差,移动足够的空气来移除所有热量需要大型风扇、宽阔的通道和大量能源——更不用说所有这些风扇会产生大量噪音。
因此,在更高密度下,气流更难管理,热点更容易形成,风扇能耗增加。仅仅因为需要大量风扇来移动足够的空气以保持组件冷却,你的能源成本就会增加。冷却系统可能难以跟上。
随着GPU数量的增加,这个问题尤其棘手,因为GPU除了服务器通常产生的热量外还会产生额外热量。
为应对这些挑战,数据中心正转向液体冷却,不是因为它新,而是因为它正变得必不可少。
为什么液体冷却效果更好
使用液体冷却的关键优势很简单。液体导热比空气高效得多。水或工程冷却液每单位体积可携带的热量是空气的数千倍。这意味着你可以使用相对少量的液体来移除相同的热量。
热量也可以在更靠近源头的地方被捕获,甚至直接从产生热量的芯片捕获,冷却系统整体运行效率更高。
使用液体冷却的另一个主要好处是能够在更高温度下运行。液体冷却系统可以在比传统风冷系统更高的冷却液温度下运行。
这解锁了两个重要优势。首先是减少压缩机使用,减少对能源密集型冷水机组的依赖。还有热量再利用的潜力:废热可以被回收和再利用。例如,你可以用它来为建筑供暖或用于工业过程。
简而言之,液体冷却不仅更好地移除热量;它改变了冷却的经济性。
现在,重要的是要知道,液体冷却不只有一种技术。数据中心中的液体冷却涵盖了一系列技术,每种技术适用于不同的需求和使用场景。以下我们将详细讨论三种用于数据中心散热的液冷技术。
后门热交换器(RDHx)冷却
第一种被称为后门热交换器(RDHx)。后门热交换器用液体冷却盘管系统替换服务器机架的标准后门,在热空气进入房间之前从排出的空气中移除热量。
后门热交换器的工作原理很像汽车中的散热器。想想汽车。在汽车中,发动机产生大量热量。冷却液吸收热量并流向散热器,在那里空气通过散热器盘管并将热量带走。这个过程使汽车免于过热。
现在,在数据中心中,这个过程基本上是相反的。服务器产生热量,就像汽车发动机一样,并将热空气从后部排出,热空气通过后门中的液体冷却盘管。液体吸收热量并将其带走。因此,与汽车中空气冷却液体不同,这里液体冷却空气。但热交换原理与汽车散热器相同。

后门热交换器(RDHx)系统结构
那么,它是如何工作的?
空气从冷通道进入服务器。这与它一直以来的工作方式相同。然后,服务器内部风扇将空气推过CPU、GPU、内存和其他组件。然后,热空气从服务器后部排出。热空气不是直接进入房间,而是进入机架后门,其中包含一个充满循环冷却液的盘管。当空气通过盘管时,热量从空气传递到液体,空气温度显著下降。加热后的液体将热量带走至设施的冷却系统。实际上,后门热交换器在机架层面充当热捕获点。
这改变了整个房间的动态。热通道比原本的温度显著降低。在某些情况下,特别是在低密度环境中,热通道可能不比冷通道更热。此外,更少热量逸散到数据大厅,减少了对冷却装置的负荷。由于热量被更有效地移除,气流需求也下降,风扇能耗也可能降低,特别是在更高密度下。在某些情况下,设计良好的后门热交换器可以移除机架的大部分热负荷,使房间的风冷系统成为辅助而非数据中心冷却的主要手段。
当我们谈论后门热交换器时,这些设备分为两种主要设计:主动式和被动式。被动式后门热交换器门内没有风扇。它完全依赖服务器气流,简单且非常高效。最适合中等密度系统。当我们谈论主动式后门热交换器时,它们包含内置在门中的风扇,设计用于将空气拉过盘管。它们可以处理更高的热负荷,并且无论服务器气流如何都能提供更一致的性能。
通常,后门热交换器用于需要对现有系统进行改造的环境。换句话说,组织希望在保留现有风冷系统的同时采用液体冷却,并对它们进行改造以使用它。这是一种将液体冷却引入数据中心的简单且相对低成本的方式。它对现有IT设备的干扰最小。运营是熟悉的。与其他将液体引入单个设备的液体冷却形式相比,风险相对较低。
后门热交换器的主要限制是它们仍然依赖服务器内部的空气流动,而且在非常高的机架密度下,它们的效率也低于直接芯片冷却。
直接芯片冷却
说到这里,让我们将注意力转向直接芯片冷却。直接芯片冷却是将液体直接输送到服务器内部最热组件的方法。这可能是服务器的CPU、GPU,甚至内存。
其理念是有一个液冷冷板直接接触这些组件。这与高端游戏PC中使用的方法非常非常相似。
如果你有一台带液体冷却器的PC,那么你已经见过它的一个版本。在游戏PC中,有一个金属块,称为水冷头,直接放在CPU或GPU上。液体流过该水冷头,吸收组件的热量。然后,加热后的液体流到散热器。风扇使空气通过散热器,热量在此释放。
因此,数据中心中的直接芯片冷却基于非常相似的原理。只是它被放大并针对可靠性、可维护性和连续运行进行了工程化。

直接芯片冷却系统示意图
它是如何工作的?
冷板直接安装在CPU、GPU或其他热组件上,然后冷却液通过设施连接流入机架。它进入一个将液体分配到每个服务器的歧管。然后,有一个快速断开装置,允许在不排空系统的情况下维修服务器。液体流过每个冷板,直接吸收芯片表面的热量。然后液体离开服务器并返回机架回路。液体被引导至冷却液分配单元(CDU),该单元将热量传递到设施水系统,同时隔离IT冷却液回路并调节温度流量和压力。
因此,直接芯片冷却非常有效。它大大减少了在房间内释放的热量。它允许更高的机架密度而不会使风冷系统不堪重负。
风扇仍然存在,但它们的角色略有不同。通常,风扇用于风冷低负载组件。这可能是电源或网络组件,或只是来自服务器的余热。但液体冷却用于较热的组件:CPU、GPU、内存等。但大部分热量,通常70-90%的热量,被液体捕获。这非常适用于AI训练集群、GPU密集环境和高性能计算。
浸没式冷却
现在,我要讨论的第三种液体冷却是浸没式冷却,它与我讨论的另外两种根本不同。它不是将冷却带到服务器,而是将整个服务器浸没在液体中。是的,服务器被浸没在液体中。
这里说的不是水。是一种特殊液体,设计为电介质,即不导电。这意味着你的服务器组件可以在浸没在液体中时安全运行。
有两种主要类型的浸没式冷却:单相和两相。单相浸没就像把一个热锅放入装满水的水槽中。水吸收热量并逐渐升温,但锅一旦浸入水中就会非常迅速地冷却。两相浸没就像在炉子上烧水。热量导致锅中的液体沸腾,这是一个“相变”。随着沸腾过程的进行,它将热量从锅中带走。

两相浸没式液冷系统示意图
进一步分析单相和两相浸没。在单相浸没中,服务器被浸没在介电流体浴中。这种液体不沸腾。相反,泵将温热的流体循环通过热交换器,热量在此传递到设施水并被带走。因此,物理上发生的是热量从组件传递到周围液体,然后最终进入冷却回路。
两相浸没的工作方式非常不同。发生的是服务器仍然浸没在液体中,但这种液体设计为在非常低的温度下沸腾,因此芯片的热量使其沸腾,气化的液体蒸发。它变成蒸汽,然后蒸汽与位于装满液体的水箱正上方的冷却板接触。当蒸汽与冷却表面接触时,它凝结回液体。然后,液体返回冷却罐。这就是热量被移除的原因。热量通过相变被移除。换句话说,从液体到蒸汽再回到液体的转换。
这类液体冷却的主要优点是对服务器风扇的需求最小、能耗更低、无需移动大量空气、所有组件均匀冷却以及非常高效的传热。这意味着你可以实现更高的服务器密度。它还减少了噪音,因为你不需要所有这些风扇,并简化了气流管理。
然而,也有一些限制。一方面,它需要全新的运营模式。你不能简单地将现有的基于机架的系统浸入液体罐中。不是那样工作的。你需要专用硬件。因此,会有硬件兼容性和处理方面的考虑。此外,你必须考虑流体管理、长期维护和规划,因为记住,你的服务器浸没在液体中,因此它们不像以前那么容易接近。还有更高的初始实施成本,这也是需要考虑的。
顺便提一下:浸没式冷却不再仅用于加密货币挖矿。虽然它在该领域获得了早期关注,但现在这类冷却正被试点、测试,并越来越多地被用于企业、AI和高性能计算工作负载,在这些领域中密度和效率正成为关键约束。
一系列选项
总体而言,液体冷却不是单一解决方案;它是一系列选项。
后门热交换器(RDHx)延长了风冷环境的使用寿命,且实施成本相对较低。直接芯片冷却能够针对最强烈的热源。浸没式冷却则彻底改变冷却方式以实现最大密度和效率。
最后要记住的重要一点是,液冷正成为下一代数据中心的必要条件,而非可选项。
(智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
