🔥 今日值得一读 编程模型SWE-2发布:成本直降64%,性能仅差Fable 5.1一分!
Cognition Releases SWE-2: A Kimi K3 Post-Trained Coding Model That Matches Fable 5.1 on FrontierCode at 64% Lower Cost
MarkTechPost 🔥 重点 大模型代码生成开源论文方法 🕐 09-13 07:56

📖 AI 总结

Cognition 发布了其迄今最强的编程模型 SWE-2,该模型基于 Moonshot AI 的 2.8 万亿参数开源模型 Kimi K3 进行强化学习后训练。在 FrontierCode 1.1 Main 基准上,SWE-2 取得 50.0% 的成绩,与 Fable 5.1 仅差 1 个百分点,成本却低 64%。这是 Cognition 首个支持可选推理强度等级的模型,三个等级在单次强化学习训练中完成,每个等级带有独立的成本惩罚,从而同步推进成本与性能的边界。相比前代 SWE-1.7,SWE-2 在多数基准上提升 5 至 6 分,并在 Terminal-Bench 2.1 上领先所有对比模型。不过其短板同样明显:Terminal-Bench 4 上落后 Fable 5.1 和 GPT-6 Astra 约 30 分。此外,SWE-2 不开放权重,也无独立 API,仅能在 Devin 平台内使用。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅