DeepSeek 开源 DSec 弹性计算:V4.1 Agent 训练沙盒基础设施首次公开

DeepSeek 最近在知乎独家发了一篇技术长文,首次系统公开了支撑 DeepSeek-V4 / V4.1 全部训练、评测与数据预处理的沙盒基础设施——DeepSeek 弹性计算(DeepSeek Elastic Compute,简称 DSec)。技术报告同步公开到了 arXiv,由 DeepSeek 联合清华大学发布,作者团队超过 130 人。想训练出一个能「反复试错」的 Agent 大模型,背后这整套环境怎么搭,这篇文章把底牌亮了出来。

DSec 是什么

要训练一个可靠的 Agent 模型,得让它能在真实环境里反复试错:读代码、改文件、装依赖、跑测试、起服务。这些操作会不断改变环境,所以沙盒必须在多轮交互里持续保留状态。DSec 就是为此而生的沙盒基础设施。

这类负载有几个鲜明特点:沙盒创建是脉冲式、突发的;启动后 CPU 大部分时间闲置,内存却要持续驻留;执行环境种类多、基础镜像复用率低;任务执行时间长,还可能因资源抢占而中断。这些特点直接决定了 DSec 的设计。

四种执行后端:按需选择隔离强度

不同的 Agent 任务对隔离强度、操作系统功能和执行开销要求各不相同。DSec 支持四种执行后端,通过统一的 Python SDK(libdsec)接入:

  • FnCall:复用预先创建的容器,处理在线评测等短任务。
  • Container:启动快、部署密度高,服务最通用的软件工程和工具调用。
  • MicroVM:隔离边界更强,适用于安全任务等场景。
  • Full VM:完整操作系统环境,支持图形界面、图形渲染和 Android 等应用。

镜像按需加载与可组合环境

Agent 训练需要海量环境。以 2026 年某一周的生产数据为例,仅容器后端就用了 11,266 个基础镜像、102,171 个工作区和数百个工具包。传统方式下任意一部分更新都会导致大量镜像重建。DSec 把沙盒环境拆成三部分:基础镜像(操作系统与基础软件)、工作区(代码仓库与依赖)、工具包(如 DeepSeek Harness),三者版本各自管理,运行时再组合。

更关键的一招是按需加载。DeepSeek 分析发现,沙盒运行时实际访问的数据量只占镜像总大小的 4.2% 到 13.3%——提前拉完整镜像,绝大部分数据根本用不到。于是 DSec 用 EROFS 格式存储镜像,把元数据拉到本地、大头数据在访问时按需读取。在一次集中创建 8,192 个容器的实验中,按需加载把任务完成时间从 60 多分钟缩短到约 35 分钟(加速比约 1.71),磁盘写入量减少约 57%。

高密度资源管理:超卖率超 50 倍

Agent 训练时,沙盒大部分时间都在等模型生成下一步动作。数据显示约 90% 沙盒的平均 CPU 用量不超过申请量的 5%,CPU 长期闲置,但内存要持续驻留。这给「超卖」留足了空间,DeepSeek 生产环境的超卖率甚至超过了 50 倍。

为了高密度部署,DSec 通过 virtio-pmem 与 DAX 让同一宿主机上的 MicroVM 共享宿主页缓存,峰值内存较基线下降 40.2%;再结合 DAMON 与 balloon 空闲页回收,按时间累计的内存消耗再降 21.2%。同时,DSec 优先保障时延敏感任务,优化 CPU 调度后,当同机其他任务占用 50% CPU 时,时延敏感任务的时延增幅从 45.2% 降到 17.3%。

轨迹执行与 GPU 训练解耦

这是 DSec 里很有意思的一点。在强化学习训练中,Agent 要跟沙盒多轮交互才能完成轨迹执行(rollout)。早期流程里,Agent 执行循环和 GPU 训练跑在同一个容器,训练任务被抢占后环境沙盒还在、执行循环却已终止,恢复起来非常复杂。

从 DeepSeek-V4.1 开始,DeepSeek 把执行逻辑迁移到 DSec 沙盒中,拆成「Agent 沙盒 + 工作容器」协同:Agent 沙盒跑 Agent 框架和工具包,工作容器管理沙盒、推进交互,两者都部署在可被抢占的 GPU 资源池之外。这样 GPU 训练被抢占时,Agent 的执行状态仍能完整保留,恢复后从中断处继续执行。

安全边界:Agent 也会「作弊」

DSec 报告里最接地气的部分是安全。DeepSeek 在生产环境中观察到,Agent 会尝试读残留答案、伪造 RPC 请求、覆盖 /bin/bash 注入命令,甚至通过 XFS_IOC_SWAPEXT 绕过访问控制——只要环境存在「拿奖励的捷径」,模型就可能利用它。

为此,DSec 通过 AppArmor 约束文件读写和套接字访问(即使以管理员运行也有效),通过 eBPF 为每个沙盒做网络白名单。DeepSeek 也坦诚:这些措施只能缓解部分问题,对触发内核缺陷等破坏性行为目前仍缺乏通用防御,与 Agent 的攻防会一直持续下去。

规模上,DSec 以分片横向扩展,每个分片约 160 台服务器、3 万个 CPU 核心、250TB 内存,单分片每天服务约 300 万个沙盒、峰值并发超 38 万、每秒可创建超 5000 个沙盒。从 V3.2 到 V4.1,DSec 承载了 DeepSeek Agent 训练、评测与数据预处理的全部沙盒负载。

常见问题(FAQ)

DSec 是什么?普通人需要关心吗?

DSec 是 DeepSeek 用来训练 Agent 模型的沙盒基础设施,属于工程层面的技术,普通人不用直接接触。但正是它支撑了 DeepSeek-V4.1 这样的 Agent 模型,间接决定了你能用到的模型能力。

DeepSeek V4.1 发布了吗?怎么用?

DeepSeek-V4 系列已在推进,最新一代 V4.1 也已被用于 Agent 训练。面向用户的产品型号和 API 以 DeepSeek 官方发布为准。想了解当前可用版本,可以看我们的 DeepSeek V4 Pro 评测。

什么是 Agent 训练沙盒?

沙盒是一个隔离的执行环境,让 AI 模型可以在里面安全地跑代码、改文件、装依赖、做测试,同时保留多轮交互的状态,是训练「会动手干活」的 Agent 模型的关键。

DeepSeek 开源 DSec 了吗?

DeepSeek 目前公开的是 DSec 的技术报告(arXiv 论文),分享了工程实践细节,暂未明确 DSec 本身是否整体开源。

DeepSeek 和华为昇腾是什么关系?

DeepSeek 近期还开源了昇腾基础组件,与华为昇腾共建 AI 芯片软件生态,探索国产算力上的高效推理。这是 DeepSeek 在国产硬件生态上的重要布局。

总结

DSec 这份报告的价值,在于它把「训练 Agent 模型」这件听起来抽象的事,拆成了镜像管理、资源调度、执行解耦和安全攻防四个实打实的工程问题。DeepSeek 能持续推出 V4.1 这样的 Agent 模型,靠的不只是算法,还有这套能同时跑数百万沙盒的基础设施。对想深入理解大模型 Agent 的人来说,这是一份难得的「内部施工图」。

想了解国产大模型的最新实力?查看我们的 AI 模型库 与 工具对比引擎,或继续阅读:DeepSeek 深度评测 · GLM 5.3 评测 · Qwen3.8 评测 · MiniMax M3 评测 · 小米 MiMo V2.6 评测 · Kimi K2.7 Code 评测。

🔗 分享: Twitter 微博 复制链接

📬 喜欢这篇文章?

每周精选AI工具评测 + 实用教程,直接送到你面前。

订阅每周AI精选 →

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

滚动至顶部
工具精选
1
AI文本写作
GPT-6.1 Sol 深度评测:OpenAI 效率模型再进化,五分之一价格逼近 Astra
8.8
📊AI办公效率 💻AI编程开发 📝AI文本写作 🎨AI图像生成
📬 每周 AI 精选