🔥 今日值得一读 49行代码起步,同一模型自当优化器,跨5领域任务平均涨4.48分!
Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer
arXiv AI (cs.AI) 🔥 重点 #Agent#自演化#多任务 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
让Agent自己改写提示与工具调用框架,开发者可跨多任务自动优化Agent执行流程。

📖 AI 总结

本文提出一种接近递归自我改进的智能体框架:同一个冻结模型在同一版本harness上先作为求解器执行任务,再作为提议者读取完整运行记录并直接修改harness本身。每次进化批次从五个不同领域的基准中抽取任务,训练与留出任务严格分离,并额外在五个进化过程中从未使用的分布外基准上评估泛化能力。作者将进化过程类比深度学习训练,分为多任务预训练与持续训练两个阶段。从49行种子harness出发,第一阶段结束后的harness在分布内基准平均提升4.48分,在分布外基准提升12.64分,前者超越Codex,后者与Codex持平;第二阶段在Claw-Eval上继续进化,得分从66.17升至68.06,超过Codex。文章还分析了进化中涌现的机制,包括输出截断、历史压缩与独立审查。

🔑 关键词速览

Harness围绕语言模型智能体的代码框架,负责组织提示词、调用工具、管理上下文和控制执行流程。
Self-Evolving Harness让智能体自动改进自身 harness 的研究方向,无需人工重新设计。
Recursive Self-Improvement系统利用自身能力改进自身组件,从而形成持续自我提升的循环。
Out-of-Distribution (OOD) Benchmarks在进化过程中从未使用过的基准测试,用于评估模型在陌生任务上的泛化能力。
Continual Training在预训练之后,于新任务或新数据上继续训练模型,以进一步提升性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅