⚡ AI专注速报
模型Agent开源

快手发布 KAT-Coder-V2.5,十万真实仓库环境练出编码智能体

快手 KwaiKAT 团队发布 KAT-Coder-V2.5:在 10 万+可验证真实仓库环境中强化学习训练,PinchBench 反超 Claude Opus 4.8,并开源 3B 激活的 Dev 版。

7 月 26 日,快手 KwaiKAT 团队发布了智能体编码模型 KAT-Coder-V2.5。它最大的卖点在训练方式:在超过 10 万个可验证的真实代码仓库环境中做强化学习,覆盖 12 种编程语言,技术路线是非对称 actor-critic 的 PPO,加上多教师蒸馏和三层奖励结构。团队把智能体编码更多当作一个基础设施问题而非建模问题——把可执行的仓库环境做到足够大的规模,让每一个训练信号都能对着真实代码验证。

成绩单:有长板,也不藏短板

KAT-Coder-V2.5 以 94.9 登顶 PinchBench,小胜 Claude Opus 4.8 的 93.5;SWE-Bench Pro 拿到 65.2,次于 Opus 4.8 的 69.2;SciCode 50.3 与 GLM-5.2 持平;Terminal-Bench 2.1 只有 60.7,在同档模型中垫底。在各家惯于只晒赢面数据的行情下,这份不回避短板的成绩单反而显得可信。

开源 Dev 版:本地智能体栈的"执行器"

旗舰之外,快手同步在 Hugging Face 以 Apache-2.0 协议放出了 KAT-Coder-V2.5-Dev:总参数 35B、激活仅 3B 的 MoE,基于 Qwen3.6-35B-A3B 后训练。这个体量小到可以本地部署,天然契合编码智能体产品正在收敛的"规划者-执行者"分工——前沿模型做规划,便宜的开源模型干活。

这次发布值得关注有两层原因。其一,可验证的仓库级 RL 环境正在成为编码智能体竞赛的核心生产资料,谁的环境多、验证严,谁的模型进步就快,而快手刚刚展示了十万量级的建设能力。其二,它延续了一个趋势:以可灵视频模型闻名海外的快手,如今也端出了有竞争力的编码模型——中国消费互联网大厂几乎全数下场,本已拥挤的国产编码智能体赛道又添一员。

信源