DeepSeek 公开训练 Agent 用的沙盒基础设施 DSec:一个分片每天跑 300 万个沙盒
DeepSeek 在知乎发布技术长文,首次系统公开支撑 DeepSeek-V4 全部训练、评测与数据预处理流程的沙盒基础设施 DSec(DeepSeek Elastic Compute),同名技术报告已放到 arXiv,由 DeepSeek 联合清华大学发布,作者超过 130 人。它要解决的是 agent 强化学习里几个具体的矛盾:沙盒创建请求是脉冲式突发的;跑起来后 CPU 大部分时间闲置、内存却要一直驻留;agent 执行环境种类多、基础镜像复用率低;任务执行时间长,训练还可能因为资源抢占中断。做法有三条——镜像按需加载(生产数据分析显示沙盒实际访问的数据只占镜像总大小的 4.2% 到 13.3%,于是镜像放在 3FS 上、只把元数据拉到本地,集中创建 8192 个容器的实验里任务完成时间从 60 多分钟降到约 35 分钟、磁盘写入减少约 57%);把环境拆成基础镜像、工作区、工具包三层各自版本化,用 EROFS 加 OverlayFS 按需组合,避免改一个工具包就重建全部镜像;把轨迹执行与 GPU 训练解耦,agent 沙盒与工作容器都放在可被抢占的 GPU 资源池之外,训练被抢占时执行状态不丢,恢复后从中断处继续。安全上,DeepSeek 说要防的是「agent 自己找捷径」:生产环境里出现过读取残留答案、伪造 RPC 请求、覆盖 /bin/bash 注入命令、甚至尝试用 XFS_IOC_SWAPEXT 绕过访问控制,因此用 AppArmor 约束文件与套接字访问(即使以管理员身份运行也生效),用 eBPF 给每个沙盒做网络访问白名单。规模数据:每个扩展分片约 160 台服务器、约 3 万个 CPU 核心、250 TB 内存,单分片每天服务约 300 万个沙盒、峰值并发超过 38 万、每秒可创建 5000 个以上沙盒。