Meta发布了Muse Spark 1.3,这是其五个月内的第四代模型。该模型在代理任务上表现显著提升,智能指数得分从8月的57分升至62分(max版本),主要得益于在τ³-Bench Banking、Terminal-Bench 2.1和GDPval-AA v2等关键测试中的进步,其中在模拟银行场景的τ³-Banking测试中以52%的成绩位居第一。然而,模型在多数基准上仍落后于顶尖对手Claude Fable 5.1,如Terminal-Bench得分86%对比91.4%。其核心竞争力在于价格:每任务成本仅0.55美元,是同类性能模型中最便宜的,低于竞争对手的0.94至1.23美元。xhigh版本现已可用,max版本处于有限预览阶段,Meta还承诺将发布开放权重版本。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅