在大规模的部署场景中,数据是如何被管理的才是决定人工智能是否能够持续展现商业价值的关键,而不是部署了多少算力资源。过去的几年间,人工智能基础设施性能主要被算力设备定义,例如GPU、CPU、内存和大模型的基准测试指标等。这些在早期是很合理的,因为当初的目标仅仅是简单的成规模的运行模型。但是随着人工智能系统逐步投入生产环境,这一视角正在逐渐转变。
这些变革,不只是关乎更强的处理能力,更关乎数据的规模,这其中最重要的是数据的动态特征。与可以重复利用和重新配置的算力基础设施不同,训练数据是无法被重置。训练数据会随着每次训练、推理、交互,逐渐调和,随着时间的推移,逐渐定义系统本身。
当你注意AI环境如何在生产过程中演变,它不再表现得像一个计算系统,更像一个数据系统,这也就彻底改变了其设计、运行和扩展的方式。
从计算周期到数据生命周期
一旦人工智能系统开始走出实验节点,进入实际应用,一个清晰的分化趋势就开始显现。计算资源呈现间歇性的特征,然而数据却在持续的增长。训练工作负载会根据需要扩容或缩容。算力基础设施可以在不同任务之间重复利用。随着时间推移效率在逐渐提高,因此就使得相同的算力资源获得更多的训练产出。
然而,数据的表现却大不相同。
每一次推理都会产生新的数据,例如日志文件、元数据、中间输出的临时结果,这些都需要被存储保留。甚至仅仅是一条单一的AI生成内容也会产生出与生成内容一个数量级大小的运行数据。在大规模运行过程中,这种数据的累积量会变成结构性问题,而不是偶发事件。
传统系统一般依靠人工判断哪些数据值得保留。然而AI系统恰恰相反。数据被保存下来是因为未来仍可能具备价值。信号和上下文会反复积累产生复利,并持续推动改进优化,使得系统能够从过去的交互中学习。
因此,曾经定义基础设施的这种关系已经被打破了。算力资源需求扩展呈现波浪式增长,而数据量却不断在增长。这也改变了问题本身的性质。目前不再是高效的运行模型,而是持续支持围绕模型的一切系统。
算力能够创造出智能的瞬间,但数据才是让这些时刻得以长期留存、并在未来被反复利用。
被存储的内容也在发生变化。除了训练数据以外,还涌现出一个快速增长的生成数据输出层——包括生成的数据、嵌入向量、日志以及嵌入于系统中的机构知识。这一层面往往被低估,然而在真实的生产环境中,它正成为规模扩展面临的首要挑战。
这正是存储开始成为基础能力的节点。现代的AI基础设施本质上是多层级的。高性能的存储层用于支撑实时的工作负载,而容量优化层用于存放不断增长的留存数据。在大规模运行时,单层存储方案很快会变得低效。因此,跨不同存储层进行设计,是在性能、成本和数据持久性之间取得平衡的关键。
基础设施模型失效之处
在AI 基础设施规划中,一个常见的假设是:存储容量应当与算力按比例同步扩展。这一规划在初期的规划部署阶段中是有效的,但是在实际生产过程中会越发不可靠。
原因在于:这两者的增长模式从根本上完全不一样。算力的投入是阶段性的,且受到效率驱动。而存储规模的扩增,则是随着数据的增长、保留政策和治理要求而变化的。随着时间推移,存储会成为最主要的成本驱动因素。当存储被视为一个次要问题时,随后便会暴露出两项挑战。
第一,存在系统架构的缺陷。存储环节位于流程上的下游位置,尽管它担负着数据长期的可持续性和可用性的职责。第二,存在一个经济层面的缺口,成本会随着数据的持续积累而扩大,而不是硬件的更新周期,从而使得TCO总拥有成本变成了大规模应用中的成本关键。
这些问题往往会逐渐显现。系统在早期可能运行良好,但随着数据量不断增加,系统压力开始出现。原因并不在于算力受限,而在于数据层在设计之初并没有具备可扩展性。
到了那个阶段,“性能”的定义就要被重构了
面向大规模数据进行设计
在AI 环境中,性能不再仅仅取决于速度,还取决于可用性、持久性和韧性。若数据无法被可靠地访问,无论具备多少可用的算力容量,系统都无法正常运行
因此,耐用性和韧性成为了核心设计要求。在大规模部署的AI中,故障不是例外,而是一种持续存在的状态。系统必须被设计成能够吸收连续不断的干扰,而不影响性能或可靠性。
这进而改变了对性能这一概念本身的认知。性能不在再绑定于任何一个单一的组件。相反,它涌现于数据如何在分布式架构中被存储、传输和管理。当前,整个行业正在经历一场更为深刻的转型。AI正从实验性环境逐步迈向持续的生产系统。在这个阶段所做的假设将会塑造长期的结果。
那些成功驾驭这一转型的组织将会认识到,AI数据中心的扩展是基于数据,而不仅仅是算力。它们将围绕数据从生成到留存的全过程的全生命周期来构建基础设施,从而确保系统能够支持增长、成本效益和长期可靠性。
这同时也要求一种前瞻性的视角。基础设施的决策必须反映数据资产在三到五年后的状态,而不仅仅是当前的需求。一旦系统完成大规模部署,再想要回过头去更改底层的架构设计,必将面临极高的复杂性与成本代价。
算力还将继续见证定义AI的高光时刻。但数据决定了这些时刻能否被持续维系,并在其基础上进一步发展。从这个意义上说,成功的 AI 基础设施,其决定性特征并不只是算力性能。从这个意义上说,成功的 AI 基础设施,其决定性特征并不仅仅在于算力性能。
它在于长期有效管理数据的能力——将数据中心存储视为基础性能力,将架构视为天然需要分层的体系,并将数据能否被留存完好、访问和利用的多好视为规模化的决定因素。
本文由智算芯能前沿网编辑整理,转载请注明出处。
