预算全砸这里!拆解AI智能体框架,仅控制槽位增益+0.119,集中火力性能飙至0.761
Where Does Harness-Optimization Value Live? Localized Gains and the Budget-Splitting Trap in Self-Evolving LLM Agents
arXiv CL (cs.CL) 重要 Agent论文方法 🕐 09-04 12:00

📖 AI 总结

该研究探讨了自进化大语言模型智能体中“框架优化”的价值分布问题。作者提出HARNESSEVO方法,将智能体的文本框架分解为角色、任务策略、工具/格式规则和反思/控制四个独立可进化槽位,并在等预算条件下对比扁平字符串优化。实验发现,在ALFWorld任务中,整体成功率提升不显著,但槽位分析显示几乎所有优化价值集中在反思/控制槽位,其单独增益达+0.119,其余槽位贡献为零。研究进一步揭示均匀分配预算的弊端:将64次回滚分至四槽会使每槽仅16次,低于优化器的有效搜索下限,导致所有槽位停滞;而将预算集中于高价值控制槽位,即使预算减半也能将成功率提升至0.761。该效应具有任务依赖性,在WebShop上所有方法表现持平,表明不存在可言语化的控制失败。研究结论强调,框架优化价值具有局部性,均匀分配预算可能有害,应先进行信用分配再进行结构化进化。

🔑 关键词速览

HARNESSEVO一种将智能体框架分解为多个可分别演化槽位的方法,用于定位优化价值。
harness围绕语言模型的文本脚手架,包括角色、策略、格式规则和控制启发式,用于指导智能体行为。
leave-one-in / leave-one-out attribution归因技术,通过分别保留或移除某个组件来评估其对整体性能的贡献。
iso-budget setting在总计算预算(如展开次数)固定的条件下进行比较的设置。
budget-splitting trap将有限预算均匀分配到多个组件时,因每个组件预算不足而导致的性能损失现象。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅