这篇论文提出“智能体可塑性”这一新指标,用于衡量AI智能体将过往经验转化为未来在未见环境中性能提升的效率。研究在受控设定下让智能体把经验固化为可复用产物并传递给后续实例,在多个检查点同时评估训练内与留出交互的表现并计入学习成本。结果显示,尽管学习机会相当,前沿模型的改进轨迹差异显著:部分模型取得持续且可观的提升,另一些则停滞甚至低于初始水平,且训练内的收益往往只能部分迁移到分布外场景。研究还发现,最终表现最好的智能体未必是学习效率最高的,二者出现分离。通过追踪改进循环中的失败,作者识别出不同瓶颈:低可塑性智能体常无法复用相关产物,而高可塑性智能体即便复用了产物仍可能失败,指向产物质量、泛化或应用层面的局限。该工作表明,评估自我改进型智能体不仅要看其能力上限,更要看其通过经验变强的效率。
| Agent Plasticity | 智能体将经验转化为未来留出性能增益的效率,衡量自我改进能力。 |
| Self-Improvement | 智能体通过诊断失败并利用经验提升自身性能的过程。 |
| Held-out Performance | 在未参与学习的留出环境交互上评估的性能,反映泛化能力。 |
| Amortize Experience | 将过往经验转化为可复用制品,供未来实例继承以降低学习成本。 |
| Out-of-distribution | 与训练分布不同的条件,用于测试智能体泛化到新情境的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅