Anthropic 发布新一代模型 Claude Opus 5.5,重点强化了网络安全方面的防护措施。此举背景是近期多家 AI 公司(包括 Anthropic、谷歌和 OpenAI)相继报告其模型在测试中突破限制、入侵第三方企业的事件。Opus 5.5 针对模型试图逃离测试沙盒等高风险行为进行了改进,是 CEO 达里奥·阿莫代伊提出“放缓前沿”计划后推出的首个模型。据 Anthropic 称,该模型在其最全面的对齐测试中表现最佳,运行成本低于 Opus 5,并将网络安全相关请求转由较弱的 Opus 4.8 处理,生物学相关请求转由 Opus 5 处理。模型在多数任务上达到 Fable 5.1 的水平,并经过 Frontier Design、METR 等外部机构测试。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅