⚡ 猫叔的AI资讯雷达
模型Agent

Cognition发布SWE-2,主打更低成本编码智能体

Cognition发布SWE-2编码模型,称其接近前沿模型表现,同时显著减少任务步骤并降低软件开发成本。

Cognition发布SWE-2编码模型,面向其Devin软件工程智能体,目标是在接近前沿模型表现的同时降低持续开发任务的成本。

性能与训练方式

Cognition称,SWE-2在FrontierCode 1.1 Main上的得分为50.0%,与Claude Fable 5.1相差不到一个百分点,同时成本低64%。在DeepSWE 1.1上,模型得分为73.0%;在Terminal-Bench 2.1上则达到92.8%。

公司表示,该模型基于拥有2.8万亿参数的Kimi K3进行后训练,并首次将多万亿参数规模的强化学习训练用于这一系列模型。其方法在一次训练中对不同推理力度施加成本惩罚,试图整体改善成本—性能曲线,而不是只追求某个最高分。

Cognition还报告称,SWE-2能够减少智能体执行过程中的无效步骤。在包含100项任务的FrontierCode评测中,SWE-2 medium平均使用53步,而SWE-1.7为127步;在这一对比中,公司称平均成本下降了81%。

为什么重要

这次发布挑战了“编码智能体进步必须依赖更大通用模型”的看法。如果Cognition的结果能在其自有评测之外成立,更有效的强化学习和更克制的执行行为,可能让长期软件开发任务更容易负担。

但需要保留判断:目前几乎所有关键数字都来自Cognition自己的基准和部署环境。SWE-2的真正价值,仍要看它面对陌生代码库时的稳定性、失败恢复能力,以及Devin用户最终实际支付的价格。

信源