🔥 今日值得一读 AREX-2让AI智能体自我进化,GAIA飙到92.2分,多轮迭代越跑越强!
AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
arXiv AI (cs.AI) 🔥 重点 #Agent#自我改进#长时程推理 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
让智能体在推理时反复反思并优化答案,开发者可用来构建能自我迭代提升的任务执行Agent。

📖 AI 总结

AREX-2 是一项旨在提升大语言模型智能体自我改进能力的研究,作者将这一能力定义为在测试阶段迭代优化解决方案的能力,并认为其依赖两个互补要素:反思(生成优于当前解的新方案)与长时程执行(在多轮迭代中保持有效性)。研究假设这两种能力与领域无关,因而可在便于监督的场景中习得。为此,团队从机器学习与算法编程任务中合成长期改进轨迹,这两类任务均能提供可验证反馈并支持持续迭代。基于 Qwen3.8-27B 训练的智能体在 MLE-bench Lite 上取得 81.8 分,在 Frontier-CS 上取得 70.7 分,并迁移至深度研究任务,在 BrowseComp、HLE、GAIA 和 DeepSearchQA 上分别达到 84.0、52.6、92.2 和 93.8 分,且随迭代轮数预算增加而持续提升。结果表明,长时程反思数据是通往自我改进智能体的有效路径。

🔑 关键词速览

AREX-2本文提出的 LLM 智能体系统,旨在通过长时程反思任务提升智能体的自我改进能力。
Self-Improving Agents能够在测试时迭代优化自身解决方案、无需外部干预即可持续提升性能的智能体。
Long-Horizon Reflective Tasks需要多轮迭代反思与执行、在较长时程内保持改进效果的任务类型。
MLE-bench Lite一个用于评估机器学习工程能力的基准测试精简版,强调可验证的迭代改进。
Frontier-CS一个面向计算机科学前沿算法编程任务的基准测试,用于评估智能体的长时程执行与反思能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅