Epoch AI 的家具组装基准测试(FAB)通过拍摄三件宜家家具的组装过程并故意植入错误,考察 AI 模型能否对照说明书找出并描述问题。2025 年 11 月,表现最好的 Claude Opus 4.5 仅得 28 分;十个月后,OpenAI 的 GPT-6 Astra 达到 80%,每张照片耗时三分钟,Claude Fable 5.1 和 Claude Opus 5 分别以 70% 和 61% 紧随其后,而 Kimi K3 等中国开源权重模型落后领先者至少七个月。这一跃升意义显著:模型不久前还在更简单的视觉任务上失败,如今已能胜任精细的装配错误识别。研究者指出,该技术目前尚不足以支撑实时组装指导,但未来有望用于汽车维修和家电检修,Astra 在视觉机器人任务上的表现同样突出。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅