分析师们对数据中心行业走向进行了评估,Digital Realty、AWS、DPR Construction和施耐德电气展示了他们如何利用AI。
数据中心运营商正竞相建设AI工作负载所需的容量,与此同时,他们也越来越多地部署AI来更高效地运营自己的设施。从冷却和电力优化到预测性维护和事件响应,AI正在整个行业中从试点走向生产。
虽然数据中心完全自治在今天仍然罕见,但AI已经在能源使用、正常运行时间和运营速度方面带来了可衡量的收益。
超大规模企业以及最大的托管服务提供商在内部工具方面处于领先地位,中型运营商在运营压力不断加大的情况下正在试点有针对性的应用场景,而许多较小的环境仍在评估采用。
本文详细考察了Digital Realty、亚马逊AWS、DPR Construction和施耐德电气今天如何应用AI,以及未来的采用方向。
数据中心中的AI:今天行之有效的做法
分析师表示,运营商仍处于早期阶段。当今的部署重点是分析数据以在问题发生前进行预测、优化冷却和电力使用、提高IT资源利用率,以及为技术人员提供更好的信息来解决问题。
在某些情况下,AI自主解决问题,但人类通常保留最终决策权。
Omdia IT运营首席分析师Roy Illsley表示:“AI正以离散的软件包形式被用于处理工作中的一小部分”。
Illsley说,运营商希望最终能实时优化整个数据中心,但这尚未实现。“我们将走向这样一个世界:许多具体任务由AI智能体完成,然后人类将连接这些任务并监督决策”。
Illsley表示,超大规模企业和最大的托管服务提供商走在前列,通常自行构建工具。一些中型运营商在感受到运营痛点时正在进行试验,而大多数企业和较小的数据中心尚未采用AI。
Digital Realty:OPDaaS、冷却优化和可衡量的节省
Digital Realty在其设施中应用机器学习已有超过五年的时间,并且自大约三到四年前生成式AI出现以来就一直在使用它,该公司首席技术官Chris Sharp说道。
公司在全球运营着300多个数据中心,服务于从超大规模企业到企业的各类客户。其内部的“运营数据即服务”(OPDaaS)平台是一套精选的AI工具集,可将来自电力、冷却和其他建筑系统的亚秒级遥测数据提取到中央数据存储中。
Sharp表示,该平台通过API公开这些数据,以便Digital Realty自身的工具和客户的工具都可以对其进行分析,并调整电力和冷却以提高效率和支持预测性维护。
例如,AI可以检测到风冷系统的过滤器何时堵塞,迫使风扇不必要地以接近或达到100%的功率运行。他说,主动清洁或更换过滤器可以带来两位数的效率提升百分比。
Digital Realty还在其位于北弗吉尼亚州的IAD51数据中心部署了Phaidra的AI平台,Nvidia是该数据中心的客户。Sharp指出,该工具提供了对二次液体冷却回路的可见性,使冷却能够与实际计算需求相匹配,而不是默认以满负荷运行。

该公司已在超过10个数据中心部署了OPDaaS,并计划在2026年底前再上线约30个。
根据该公司2025年环境影响报告,Digital Realty的投资组合增长了34%,而用水量仅增加了3%——Sharp将这部分收益归功于OPDaaS和AI驱动的优化。“这是一个巨大的差距,如果没有生成式AI存在于我们的系统中,监测泵、过滤器和全部基础设施,我们不可能实现这一目标”。他补充说,该公司在2025年节省了17,800MWh能源。
如今,人类根据AI系统发现的信息做出运营决策,但Sharp预计这种情况会随着时间的推移而改变,公司会逐步允许一些决策更加自主地进行,尤其是在时间紧迫的情况下。
Digital Realty目前在其网络运营中心有一个团队监控该系统。“你会开始看到一些决策在人类的监督下做出。那将是我们迈出的第一步”。Sharp说:“但由于基础设施的复杂性,我确实看到未来你将不得不允许更多决策以算法和更自主的方式进行”。
AWS:用于网络运营和减少搁浅电力的AI智能体
亚马逊AWS正在使用由生成式AI驱动的软件来优化服务器在机架中的放置,以减少搁浅电力——即未被使用的可用能源。该公司还在其网络运营中使用AI和智能体工作流来大规模管理基础设施。
该公司表示,AWS的网络高度自动化,但在某些情况下,自动化无法确定正确的操作,因此系统会升级给工程师处理。目标是使用AI智能体进行调查、收集和关联来自不同数据源的信息。

对于事件响应,AI智能体通过关联来自多个监控系统的遥测数据自动调查网络问题,在几秒钟而非几分钟内确定根本原因,从而显著减少为客户诊断问题的时间,AWS网络可观测性和自动化总监Zak Islam表示。
他说,对于跨服务、计算基础设施和网络的常规运营问题,AI会审查传入的工单,将其与历史模式进行比较,并在许多情况下无需人工干预即可修复问题,使工程师能够专注于更复杂或新出现的问题。
Islam说,AWS还使用AI监控其光纤基础设施,自动联系供应商以加快维修速度。在网络建设期间,该公司使用AI标记配置错误并将其路由到正确的团队,工程师越来越多地使用自然语言查询网络遥测数据,而不是手动检查仪表板。
总体而言,AWS利用机器学习和自动推理已有十多年的历史。“随着LLM(大语言模型)的普及,我们现在能够以前所未有的规模将这些系统用于广泛的技术和商业问题”。
DPR Construction:AI驱动的施工前规划和现场机器人
DPR Construction是一家位于加利福尼亚州圣克拉拉的全国性承包商,业务范围包括数据中心等多种设施,该公司已加强AI的使用以帮助员工在建筑项目中做出更好的决策,DPR项目执行官Max Lares表示。
在过去的两到三年里,该公司在早期施工前阶段使用AI进行数据分析,利用过去项目的基准数据(如场地条件、成本模型和施工顺序)来预测人员配置需求、项目持续时间以及新项目的施工顺序,并帮助租户预测成本和价值。
Lares说,团队运行模拟以规划从地基和钢结构安装到机械、电气和消防系统的施工顺序。这有助于DPR确定是从建筑中部开始还是从一端到另一端进行施工。

DPR还在试点机器人,它们在夜间步行工地拍照,以便客户跟踪进度。部署机器人后,施工人员不再需要在工作时间内移动摄像头和自行拍照。
Lares说,机器人还能生成更好的图像。“机器人可以在工地没人的时候为我们行走并拍照”。“由于没有施工活动,它能更好地观察整个施工区域”。
Lares补充说,目标是更高效、更有效地为客户提供服务,但公司不会取代人类的判断。“AI对我们来说是一个很好的工具,但我们仍然对自己的决策负责”。
施耐德电气:数字孪生、DCIM和大规模治理下的AI
施耐德电气提供电力、冷却和其他数据中心基础设施,在其产品和内部运营中都使用了AI。
该公司表示,数据中心运营商可以使用其ETAP电力系统建模软件和AVEVA工业运营软件,结合Nvidia技术,创建电力和冷却基础设施的数字孪生。
AI和数字孪生使运营商能够运行模拟,并在现实世界中做出变更之前预测系统将如何表现。
施耐德电气的EcoStruxure IT软件还允许运营商持续监控基础设施,利用AI进行远程诊断、主动建议和预测性维护。
该公司在其EcoCare服务中使用AI进行服务调度,推荐合适的技术人员、可能需要的备件和紧急程度,而人类调度员则做出最终决定,该公司数据中心和AI首席倡导者Steven Carlini表示。“有人类参与其中”。
“目前,与大多数AI一样,它并非完全代理化或自主化”。

在业务方面,施耐德电气的AI之旅可以追溯到八年前,但相关工作在很大程度上停留在试点阶段,直到大约一年半前,该公司开始推动在其业务中规模化应用AI,施耐德运营卓越与AI副总裁Jennifer Swen表示。
例如,该公司推出了一个处理客户报价请求的代理系统,将流程从62个步骤减少到14个,并将周转时间缩短了约95%,Swen说。
该公司还使用AI帮助其销售团队为客户会议做准备,将账户历史、未完成机会和管道数据汇总到一份摘要中。
所有内部AI工具都在一个集中治理的云平台上运行,并接受公司首席AI官的严格监督。“我们让AI解决方案经过非常稳健的风险和治理流程”。
下一步:IT/OT融合与智能化控制
Illsley表示,AI在数据中心的IT侧(包括服务器、存储和应用)比在运营侧(涵盖配电、冷却和其他设施基础设施)更为成熟。
在IT侧,AI主要通过AIOps工具部署,这些工具摄取日志、跟踪记录和遥测数据以检测问题。“所有这些信息都在被写入和输出”。
“这些工具正在从所有噪音中提取信号,并将其呈现给操作员,以便操作员可以进一步处理”。他说,这可能意味着在工程师发现问题之前就标记出数据库损坏、磁盘已满或网络问题。
运营侧正在迎头赶上。他说,施耐德电气和西门子等供应商正在将AI构建到其数据中心基础设施管理(DCIM)系统中,以监控配电、冷却、泵、阀门和冷水机组,并诊断异常情况,例如冷水机组过滤器堵塞。
在Illsley看来,下一个合乎逻辑的步骤是将IT和OT数据整合到一个共享层中,以便AI能够看到双方,并帮助操作员做出比任何一方单独决策都更明智、更全面的决策。IT和OT工具将保持独立。IT和OT之间的桥梁正在开始形成。
S&P Global旗下451 Research的高级研究分析师Zoe Roth表示,一类新的“代理分析”初创公司位于现有冷却和电力系统之上,协调冷却和热优化以减少能源使用。
一家名为Phaidra的初创公司还从IT系统传输遥测数据,使运营商能够了解建筑管理、电力、冷却和IT的全面情况。Roth解释说,其强化学习智能体随后使用这些数据为冷却基础设施生成命令,帮助设备保持更稳定、更高效的温度。

数据中心会完全自主吗?
即使AI能力不断进步,分析师表示,完全自主的数据中心仍然是一个遥远的想象——不是因为技术不够强大,而是因为信任问题。
“AI能否完全胜任运行数据中心的工作?几乎可以肯定——能”。“但我们是否会信任它?大概不会”。
451 Research的研究总监Dan Thompson表示,对于位于人们不易到达的地方(如阿拉斯加北坡)的数据中心,情况则有所不同。
他说,这些拟议中的设施将必须自主运行,或者至少与人类团队保持强大的连接以便进行故障排除。太空中的数据中心也是如此。“每次出现问题都派宇航员去太空并不太现实”。然而,对于普通的数据中心,人类很可能会在可预见的未来保持参与。
“我的看法是,至少目前,普通的数据中心运营商只是想获得更好的信息,了解该做什么,或许还有最佳的行动方案”。即使AI智能体承担更多具体任务,仍然必须有人对现场发生的情况负责。“你要对那个数据中心负责,而不是那个以500万英里时速飞行的AI智能体”。
作者:Wylie Wong,芯片与硬件资深撰稿人
(智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
