Anthropic 发布 Claude 5.5 系列首款模型 Claude Opus 5.5,官方称其在多数任务上达到 Claude Fable 5.1 的水平,而在默认设置下的典型工作负载中,运行成本比 Opus 5 低 40%。该模型以托管 API 形式提供,未开放权重,开发者可通过 Claude 平台及 AWS、Google Cloud、Microsoft Azure 调用。基准测试显示,Opus 5.5 在智能体编程、计算机操作和知识工作等 Anthropic 自有评测中领先,Terminal-Bench 4.0 得分 66.4%,OSWorld 2.0 达 81.8%,但在 Terminal-Bench-Science 和 AutomationBench 上仍落后于 GPT-6 Astra。成本调整后的结果更具说服力:中等努力档位下,其 FrontierCode 得分 54.6%,超过 GPT-6 Astra 最高分,而单任务成本仅约五分之一。定价方面,输入每百万 token 4 美元、输出 20 美元,缓存读取降至 0.20 美元。Anthropic 同时提醒,基准测试的领先幅度正逐渐失去参考价值,实际使用中与 Fable 5.1 的差距比分数显示的更小。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅