DeepSeek公开Agent训练沙盒系统细节

IT时代网9月23日消息,DeepSeek发布新论文,公开Agent训练基础设施DSec的完整技术细节,论文由梁文锋署名。该系统的定位是给Agent训练批量制造沙盒环境:每秒可产生5000个以上沙盒,单日产能约300万个,峰值同时运行38万个,支撑这一规模的集群约有160个节点、3万核CPU和250TB内存。

Agent训练与大模型训练的工况截然不同。Agent要在沙盒里写代码、跑编译、打开浏览器甚至安装操作系统,每执行一步都会改变环境状态,随时可能把环境搞崩。每轮训练都需要一个全新的干净沙盒,随用随抛、训完即扔,环境构建本身成了基础设施级的挑战。

不同任务对环境的要求差异极大。刷题的Agent只需要无状态的函数调用环境;做软件工程的Agent需要完整Linux用户态,要装依赖、改代码、跑测试;安全攻防场景要求更强的隔离,得上虚拟机;最极端的情况是训练操作商业软件的Agent,需要一个带图形界面的完整操作系统。DSec为此准备四种后端:FnCall处理无状态函数调用,Container运行Docker容器,MicroVM用Firecracker做轻量虚拟机,Full VM用QEMU跑完整操作系统,训练框架则通过统一的Python SDK调用,无需关心底层差异。

镜像构建是规模化的关键。DSec累计使用了11266个基础镜像和102171个工作区,67.8%的沙盒需要在基础镜像上叠加至少一层工作区或工具包。方案是把环境拆成基础镜像、工作区、工具包三层独立的EROFS只读镜像,各自版本化,沙盒启动时按需组合,工具包更新只需重建自身那一层。

按需加载同样重要。运行数据显示Python容器镜像6.0GB,Agent实际只读取其中6.0%的数据;Java镜像12.1GB只有9.2%被访问。镜像数据块只在真正读取时才从分布式文件系统拉取,8192个容器的突发部署35分钟即可完成,Docker冷拉取则需要60分钟以上。

几十万沙盒并发的内存争抢靠虚拟化技巧化解:MicroVM通过virtio-pmem配合DAX让虚拟机直接映射宿主机物理内存,多机共享同一份映射,峰值内存占用降低40.2%;对可写磁盘则用DAMON定期回收冷页,进一步压缩需求。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

编辑:林一舟

THE END