月之暗面开源 AgentENV:K3 背后的沙箱集群系统
Kimi 团队与 kvcache-ai 以 MIT 协议开源了训练 Kimi K3 智能体强化学习所用的 Firecracker 微虚拟机环境系统。
智能体强化学习缺的另一半
月之暗面 Kimi 团队与 kvcache-ai 于 7 月 27 日开源 AgentENV——为 Kimi K3 的智能体强化学习提供执行环境的分布式沙箱系统,已在 GitHub 以 MIT 协议发布并配文档。
用强化学习训智能体,就得真把模型写出来的东西跑起来,跑上百万次,而且环境必须隔离、用完即弃、快到不至于把训练循环饿住。AgentENV 用 Firecracker 微虚拟机而非容器构建每个环境,提供内核级隔离与独立的文件系统和网络命名空间——前提假设很直接:模型生成的代码天然不可信。存储采用 overlaybd 分层镜像,共享只读基础层加每沙箱写入层,成千个沙箱共用一份镜像而不必复制。客户机内的 envd 守护进程负责命令执行与健康上报。
真正让它能当 RL 底座用的是公布的延迟数字:启动或恢复低于 50 毫秒,暂停低于 100 毫秒,增量快照低于 100 毫秒,单个父沙箱可 fork 出最多 16 个子沙箱。fork 对搜索式 rollout 尤其关键——大量轨迹从同一前缀状态分叉,若每条都重跑一遍环境准备,成本会被这一项吃掉。
把权重周边也补上
月之暗面这次放出的不只是 K3 的 2.8 万亿参数权重,还有围绕它的训练基础设施。这与开源发布的惯例相反:多数实验室交出 checkpoint,但把 RL 训练框架留在手里——那恰恰是重建最贵、也最难从模型卡里逆推的部分。
为何重要
环境基础设施已悄然成为智能体训练的瓶颈。手握不错 RL 配方的团队常常卡在沙箱吞吐上,而搭一套 fork 与快照都在 100 毫秒以内的微虚拟机集群,是几个月与机器学习无关的系统工程。以 MIT 协议把这块交出去,等于把做智能体 RL 的门槛压到接近纯算力成本——也延续了一个趋势:中国实验室不只在开放权重上竞争,还在比谁把让权重可复现的工具链交得更彻底。