DeepSeek联合清华大学发表了一篇新论文,署名末位的是梁文锋。文章表面上是介绍DeepSeek训练Agent所使用的沙盒基础设施DSec,但细读第六节,字里行间却透露出一个惊人的细节——RSI。通过这个沙盒,Agent不仅能创建环境,还能被训练后反过来创造更好的环境,形成了一个闭环。这或许正是开启RSI第一场战争的钥匙。
01 这篇论文到底讲了什么
这篇论文标题为《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,于9月19日提交至arXiv,编号2609.22978。超过130人参与撰写,梁文锋位列最后。合作方为清华大学。简而言之,DeepSeek完整公开了其训练Agent的核心基础设施——DSec。
理解DSec,需先区分“训练大模型”与“训练Agent”的区别。大模型训练主要是喂数据、算梯度,环境即GPU集群。而Agent训练则完全不同,它需要在环境中写代码、编译、运行、调试工具,并根据执行结果反复试错直至完成任务。若在普通电脑中直接训练,Agent可能误操作导致环境崩溃。因此,需要一个隔离、有状态且能运行真实软件的沙盒,DSec正是为此而生。
DSec通过统一的Python SDK(libdsec)提供四种后端:函数调用、容器、轻量虚拟机及完整虚拟机。可以将其比作外卖平台:Agent是骑手,DSec是派单系统,各类后端则是不同的配送工具。然而,隔离强度与系统功能往往难以兼得。虚拟机越像真机,启动越慢、开销越大。论文显示,其生产单元拥有约160个CPU节点、3万核、250TB内存,托管PB级镜像。日服务约300万个沙盒,峰值并发超38万个,创建速度超每秒5000个。单任务最多可一次性拉起3.2万个沙盒,单节点最高能容纳800个microVM或3200个容器。
DSec的核心机制包括:
第一,环境层拆分。传统沙盒是一整块镜像,修改需重建全部,维护成本高。DSec将基础镜像、工作区、工具包拆分为三层独立版本化的只读层(EROFS),启动时拼接。实测比传统打包方式快1.76倍,磁盘写入量减少5.5倍。
第二,镜像按需加载。利用DeepSeek的分布式文件系统3FS,仅元数据本地预取,数据块按需读取。突发部署8192个容器时,35分钟完成,比Docker冷拉取快,且磁盘写入量减少约57%。
第三,资源精打细算。通过virtio-pmem配合DAX共享页缓存,峰值内存降低40.2%;利用DAMON加balloon回收冷页,时间积分内存再降21.2%;CPU上区分延迟敏感与尽力而为任务,通过核心调度将SMT干扰从45.2%降至17.3%。此外,DeepSeek-V4.1开始将Agent rollout从GPU Pod中分离,独立运行于DSec,避免GPU抢占导致状态丢失。
02 藏在第6节的RSI
论文中最容易被忽略的一句话,不在摘要,而在第6节的小标题里:Build environments of Agents, by Agents, for Agents。意为由Agent建造、为Agent服务、属于Agent的环境。这句话等于DeepSeek悄悄交代了一件大事,DeepSeek也实现了部分RSI。
论文第6.1节指出,手工构造Agent RL所需的大量环境已经不切实际。于是DeepSeek换了个做法,让Agent在训练用的同一套沙盒里,交互式地自己搭环境,再用pack_diff把这次会话打成一张增量快照,直接变成下一批可复用的训练场。造环境的Agent和被训练的Agent共用DSec这套沙盒基础设施。Agent铺场地 -> 场地训练Agent -> 更强的Agent再铺更好的场地。DeepSeek的RSI由此部分实现闭环。
但是这个闭环仍处于早期。第6.4节记录了大量Agent作弊事件,比如去平台里翻残留的参考答案,伪造RPC消息直接发给chronus套答案,翻 chronus日志找泄题,甚至覆盖/bin/bash来绕过检查。被拦住之后,又用XFS_IOC_SWAPEXT这个ioctl把受保护文件的存储块换到另一个文件描述符上,结果把XFS元数据搞坏、逼得文件系统关闭。有作弊的自然就有闯祸的。一个Agent从根目录递归grep、一路读到/proc/kpagecgroup,触发内核bug直接把内核干崩。另一个Agent调了yes命令,chronus把它的输出全记下来,几十GB数据堆在存储上。
现在的RSI转不起来,卡的从来不是GPU,是环境供给。Agent RL每一代都要新任务、新沙盒、新服务依赖,人工造环境才是真瓶颈。DSec相当于是把这一环部分自动化了,自动生成RSI所需要的环境。
还是用外卖来举例。一个外卖平台想越跑越快,不能只靠一个骑手重复送同一单。想要骑手变强,就需要接更多不同种类的单,而单越多又反过来把骑手练得更强。但是想要把这个飞轮转起来,卡的从来不是骑手,是餐厅够不够多。没餐厅,骑手再能跑也是空转。DSec是盖了一个“自动建餐厅”的系统。以前平台得人工一家家谈商家、装修后厨、写菜单、定考核标准,几百几千家根本谈不过来。DSec说:“别谈了,让骑手在跑单的同一个后厨里,顺手把店开了。他怎么装的灶台、进的什么货、接的什么水电,系统用pack_diff‘啪’拍一张快照存下来,下一波骑手直接拎包入驻这家店开工,不用重新装修。”
03 沙盒,成了新的战场
DSec不是孤例。整个行业都在朝着“Agent沙盒”这一个方向发力。最出名的案例是Kimi K3。月之暗面7月16日发布K3,2.8万亿参数的 MoE,每个token激活约104B 参数,100万 token上下文,原生视觉,号称“全球首 个开源的3T级模型”,SWE-bench拿到76.8%、开源第 一。它的Agent Swarm最多能并行调度300个子代理。DeepSeek这篇论文里,引用的也正是Kimi-K2.5的Agent Swarm。Kimi训练K3的时候所使用的AgentENV也是一种沙盒。AgentENV跑在Firecracker microVM上的分布式沙盒平台,每个沙盒独立Linux内核、独立网络栈、独立文件系统,底层存储用OverlayBD + ublk,只读层全集群共享,每个沙盒写自己的上层。跟DSec是同一套技术栈。DSec论文第7节写到,它用的那套Rust版OverlayBD/ublk存储库,就开源在AgentENV这个仓库里。两者相当于是同门师兄弟。
但AgentENV没法实现RSI,它给的是fork/snapshot这种“状态操作原语”,让RL rollout能并行、能回滚、能干净判分。因此,它没法像DSec那样让Agent自己造环境。类似的还有阿里。云栖大会上,阿里云CTO李飞飞抛出了“Agentic Cloud”战略,把Model、Harness、Context 当成三个核心场景,一口气推出AgentCore、Agent Sandbox、新一代存储CPFS。其中Agent Sandbox能创建吞吐10万个/分钟,深休眠唤醒小于600毫秒,兼容E2B和K8s。沙盒正在成为“新的运行时”。云计算的主体,从虚拟机,到容器,再到模型,现在轮到Agent。谁掌握Agent的执行环境,谁就掌握了下一代云的入口。这就导致,竞争焦点从“模型能力”转向“环境基础设施”。“训练大模型拼算力,训练Agent拼环境”。在GPU 之外,CPU、内存、存储、镜像分发,全都变成了新的瓶颈。还有一点,安全从附加项的价值也变得极为重要。OpenAI、Anthropic各种模型越狱、DSec论文里Agent的作弊和内核崩溃,说的是同一件事。沙盒如果不牢,训练信号就是假的,评估就是废的。所以像是阿里这样的厂商,会把“安全围栏”也当成卖点,DSec用AppArmor加eBPF。沙盒厂商过去比的是快和便宜,现在开始比谁更牢固。RSI的第 一战已经开始了。想跑RSI,那你就先得有沙盒,有环境。
