AhaBench是一个用于评估语言代理在长时程任务中持续学习能力的基准测试套件。其核心问题是:当模型获得有用经验后,在支持条件被移除、改变或延迟的相关场景中,其后续行为是否真正得到改善。该套件包含三个组件:Aha-Puzzle测试无提示探索能力,Aha-Euler将数学问题转化为生成式教学任务,Aha-Vending模拟自动售货代理在延迟反馈下的盈利能力。基准采用三部分评分卡:初始分数、经验后分数及两者的差值“学习提升”。对八款主流模型的评估显示,Claude Opus 4.6在经验后总分(64.3)和学习提升(+25.8)上均领先,Gemini 3.1 Pro紧随其后。关键发现是:善于利用显性支持的模型、最终表现优异的模型和运行中提升最大的模型往往不是同一批,说明现有模型在将经验转化为长期行为改进方面仍存在明显短板。
| AhaBench | 一个用于评估语言代理在长时间跨度内从经验中学习能力的基准测试套件。 |
| Learning Lift | 经验后分数与初始分数之间的差异,衡量代理在运行过程中从经验中提升的程度。 |
| Aha-Puzzle | AhaBench的组成部分,测试代理在解决隐藏状态谜题后是否能在无提示情况下进行探索。 |
| Aha-Euler | AhaBench的组成部分,将Project-Euler风格的数学问题转化为生成的教学和保留任务,以测试知识迁移。 |
| Aha-Vending | AhaBench的组成部分,模拟售货代理在延迟反馈和运营事件中保持盈利能力的测试。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅