🔥 今日值得一读 Anthropic新模型Agent编程成功率从10%飙到70%,开发者却问:我啥时候才用得上?
Agent 编程能力从 10% 飙到 70%,Anthropic 新模型却遭遇灵魂拷问:我什么时候才会用它?
InfoQ 中文 🔥 重点 Agent大模型论文方法 🕐 09-30 02:07

📖 AI 总结

Anthropic 发布 Claude Sonnet 5.5,距 Opus 5.5 上线不到一周,主打编程 Agent 能力的大幅提升。在 Terminal-Bench 4.0 测试中,其成绩从上一代的 10.3% 跃升至 70.6%,甚至超过 Opus 5.5;在贴近真实开发场景的 CursorBench 上得分 55.5%,与 Opus 5.5 仅差约两个百分点。早期测试还显示,它完成任务所需的工具调用减少约三分之一,Shell 执行次数减半,迭代轮数明显下降,说明提升不只体现在速度上。价格延续 Sonnet 5 水平,约为 Opus 5.5 的一半,官方称多数任务成本最高可降 30%。但 Artificial Analysis 测试发现,推理强度拉满时其输出 Token 消耗为同类最高,单任务成本反而上升约 50%,且 Max 设置下部分基准成绩不升反降。更核心的争议在于定位:对已订阅 Max 套餐、额度充足且 Opus 5.5 已够用的用户而言,何时需要切换到 Sonnet 5.5 仍缺乏清晰答案。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅