Cognition 发布了其迄今最强的编程模型 SWE-2,该模型基于 Moonshot AI 的 2.8 万亿参数开源模型 Kimi K3 进行强化学习后训练。在 FrontierCode 1.1 Main 基准上,SWE-2 取得 50.0% 的成绩,与 Fable 5.1 仅差 1 个百分点,成本却低 64%。这是 Cognition 首个支持可选推理强度等级的模型,三个等级在单次强化学习训练中完成,每个等级带有独立的成本惩罚,从而同步推进成本与性能的边界。相比前代 SWE-1.7,SWE-2 在多数基准上提升 5 至 6 分,并在 Terminal-Bench 2.1 上领先所有对比模型。不过其短板同样明显:Terminal-Bench 4 上落后 Fable 5.1 和 GPT-6 Astra 约 30 分。此外,SWE-2 不开放权重,也无独立 API,仅能在 Devin 平台内使用。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅