AREX-2 是一项旨在提升大语言模型智能体自我改进能力的研究,作者将这一能力定义为在测试阶段迭代优化解决方案的能力,并认为其依赖两个互补要素:反思(生成优于当前解的新方案)与长时程执行(在多轮迭代中保持有效性)。研究假设这两种能力与领域无关,因而可在便于监督的场景中习得。为此,团队从机器学习与算法编程任务中合成长期改进轨迹,这两类任务均能提供可验证反馈并支持持续迭代。基于 Qwen3.8-27B 训练的智能体在 MLE-bench Lite 上取得 81.8 分,在 Frontier-CS 上取得 70.7 分,并迁移至深度研究任务,在 BrowseComp、HLE、GAIA 和 DeepSearchQA 上分别达到 84.0、52.6、92.2 和 93.8 分,且随迭代轮数预算增加而持续提升。结果表明,长时程反思数据是通往自我改进智能体的有效路径。
| AREX-2 | 本文提出的 LLM 智能体系统,旨在通过长时程反思任务提升智能体的自我改进能力。 |
| Self-Improving Agents | 能够在测试时迭代优化自身解决方案、无需外部干预即可持续提升性能的智能体。 |
| Long-Horizon Reflective Tasks | 需要多轮迭代反思与执行、在较长时程内保持改进效果的任务类型。 |
| MLE-bench Lite | 一个用于评估机器学习工程能力的基准测试精简版,强调可验证的迭代改进。 |
| Frontier-CS | 一个面向计算机科学前沿算法编程任务的基准测试,用于评估智能体的长时程执行与反思能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅