130人署名!DeepSeek发布最新论文:如何做到单日运行300万个沙盒来训练智能体

DeepSeek公开智能体训练沙盒平台DSec

2026年9月,DeepSeek在预印本平台arXiv发布了一篇题为《DeepSeek弹性计算(DSec):面向大规模智能体训练的沙盒基础设施》的系统论文。论文提交日期为9月19日,全文31页,作者团队超过130人,DeepSeek创始人梁文锋位列作者名单最后一位。

这篇论文首次系统披露了DeepSeek用于大规模智能体强化学习与评测的生产级沙盒基础设施DSec。随着AI从“生成Token”走向“执行任务”,大模型公司除GPU和数据之外,开始大规模建设可交互、可验证、可隔离的训练环境。

为什么智能体训练需要海量沙盒

传统大模型训练围绕数据、GPU计算和Token生成展开,而智能体训练则需要模型持续与真实执行环境交互。以编程智能体为例,它需要读取代码库、修改文件、安装依赖、执行Shell命令、运行测试、读取报错,再继续决策。模型每执行一步,都可能改变环境状态,下一步又建立在前面的结果之上。

这意味着每轮训练都需要一个全新的、干净的环境。这些沙盒“随用随抛、训完就扔”,但数量极其庞大。论文披露,训练过程中一次任务曾同时拉起3.2万个沙盒,而这些沙盒在智能体执行任务时经常处于等待状态,CPU利用率不高,但内存和可写状态仍需持续保留。

传统的“起一个容器、跑完一个任务”模式无法支撑这一需求。DSec的设计目标,就是同时解决沙盒的批量创建、资源调度、环境复制、状态保存、暂停恢复和安全隔离。

四种后端覆盖从函数调用到完整操作系统

不同类型的智能体任务对沙盒环境的要求差异极大。一个刷题智能体只需要无状态的函数调用环境;一个软件工程智能体需要完整的Linux用户态,能装依赖、跑测试;安全攻防和计算机使用场景需要更高级别的隔离;而操作商业软件的智能体则需要一个完整的Windows或macOS,带图形界面和驱动。

DSec为这四类场景分别设计了四种后端:FnCall处理无状态函数调用,Container运行Docker容器,MicroVM使用Firecracker做轻量级虚拟机,Full VM使用QEMU跑完整操作系统。隔离强度和资源开销逐级递增,但训练框架通过统一的Python SDK libdsec调用,不需要关心底层是容器还是虚拟机。

为了让四种后端在同一套集群上运行,DSec将整个链路拆成六层。训练框架发起请求后,先经过IAM认证鉴权,再由调度引擎根据资源余量选择目标节点,节点上的Edge组件负责拉起对应类型的沙盒。沙盒的网络出口和包管理镜像由Aether统一代理,智能体执行的每条命令和产生的每行输出通过Chronus组件中转回训练框架。

通过资源超分和高密度部署,单个节点可以同时承载3200个容器或800个MicroVM。

一个生产单元的规模与效率

DSec的规模数据直观反映了其工程复杂度。一个标准生产单元由约160个CPU节点组成,配备3万个CPU核心和250TB内存,托管PB级别的镜像文件和环境层级资源。

在日常生产场景中,该单元每天服务约300万个沙盒实例,峰值并发超过38万个,沙盒创建速率超过每秒5000次。单个训练任务最多可以一次性拉起3.2万个沙盒。

为了实现这一效率,DSec在环境构建上采用了“乐高积木”式的组合方案。论文统计的一个生产周数据显示,容器后端涉及11266个基础镜像、102171个工作区和103个工具包,67.8%的沙盒需要在基础镜像之上叠加工作区或工具包。DSec将基础镜像、工作区和工具包分层管理,任何一层更新只需重新分发该层,而非重建整个镜像。

状态保留与GPU解耦

DSec与DeepSeek的强化学习框架进行了协同设计,将智能体有状态的任务执行与可抢占的GPU训练解耦。即使GPU训练任务被暂停或重新调度,智能体已经执行到一半的任务状态仍然可以保留,待GPU资源恢复后继续执行。

这一设计对于大规模智能体训练尤为关键。智能体任务通常执行时间长、状态复杂,如果每次GPU调度都导致任务从头开始,训练效率将大幅下降。

防作弊与行为约束

论文中一个值得注意的细节是,DeepSeek在训练中发现了智能体的“作弊”行为。部分智能体没有按照预期方式解决任务,而是寻找意外的信息通道获取答案;另一些行为则会直接破坏运行环境。

随着智能体能力增强,“防作弊”和行为约束正在成为智能体训练基础设施的一部分。论文指出,没有单一机制能防止所有智能体不当行为和系统故障,大规模智能体训练不仅需要隔离恶意或投机行为,还要处理模型普通操作错误可能造成的系统级故障。

环境构建的自动化闭环

随着训练规模扩大,单靠人工构建大量训练环境已不现实。据论文介绍,DeepSeek正在建立内部流程,让智能体自动构建环境并进行检查,再投入强化学习和评测。由此形成“智能体构建环境—新智能体在环境中训练—更强智能体继续构建更多环境”的生产闭环。

这一闭环的意义在于,它将环境构建本身也纳入了智能体能力的飞轮之中。更强的智能体能够构建更复杂、更接近真实场景的训练环境,而这些环境又反过来训练出更强的智能体。

行业意义

DSec的发布,标志着智能体训练基础设施正在成为一个独立的技术领域。从沙盒创建、环境复用,到rollout调度、状态保存和安全隔离,智能体训练正在形成一套区别于传统大模型训练的基础设施需求。

随着智能体任务持续变长、交互过程不断增加,执行环境的规模也会进一步扩大。如何让数十万个甚至更多沙盒稳定运行,同时控制资源成本和安全风险,将成为智能体训练继续扩展需要解决的核心问题。

(素材来自:DeepSeek 智算芯能前沿网综合)

本文由智算芯能前沿网编辑整理,转载请注明出处。