该研究探讨了自进化大语言模型智能体中“框架优化”的价值分布问题。作者提出HARNESSEVO方法,将智能体的文本框架分解为角色、任务策略、工具/格式规则和反思/控制四个独立可进化槽位,并在等预算条件下对比扁平字符串优化。实验发现,在ALFWorld任务中,整体成功率提升不显著,但槽位分析显示几乎所有优化价值集中在反思/控制槽位,其单独增益达+0.119,其余槽位贡献为零。研究进一步揭示均匀分配预算的弊端:将64次回滚分至四槽会使每槽仅16次,低于优化器的有效搜索下限,导致所有槽位停滞;而将预算集中于高价值控制槽位,即使预算减半也能将成功率提升至0.761。该效应具有任务依赖性,在WebShop上所有方法表现持平,表明不存在可言语化的控制失败。研究结论强调,框架优化价值具有局部性,均匀分配预算可能有害,应先进行信用分配再进行结构化进化。
| HARNESSEVO | 一种将智能体框架分解为多个可分别演化槽位的方法,用于定位优化价值。 |
| harness | 围绕语言模型的文本脚手架,包括角色、策略、格式规则和控制启发式,用于指导智能体行为。 |
| leave-one-in / leave-one-out attribution | 归因技术,通过分别保留或移除某个组件来评估其对整体性能的贡献。 |
| iso-budget setting | 在总计算预算(如展开次数)固定的条件下进行比较的设置。 |
| budget-splitting trap | 将有限预算均匀分配到多个组件时,因每个组件预算不足而导致的性能损失现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅