LLM智能体自演化新突破:SAGE统计门控精准过滤不可靠编辑,杜绝性能退化!
SAGE: A Statistical Acceptance Gate for Self-Evolving Agents
arXiv AI (cs.AI) 重要 Agent论文方法安全对齐 🕐 今天 12:00

📖 AI 总结

本文关注基于大语言模型的智能体通过编辑持久化技能文档实现自我进化的机制,该机制由提出候选编辑的优化器和决定是否采纳的门控两部分组成。作者指出,现有门控采用"只要聚合验证分数提升就接受"的朴素规则,存在两大缺陷:一是可能引入永久性退化,即编辑虽提高平均分却破坏了技能原本已能解决的任务;二是易受"优化器诅咒"影响,因为在有限且含噪声的验证集上观测到的最优分数存在向上偏差。为此,作者提出统计接受门控SAGE,其核心是逐项配对比较,在相同验证样本上对比当前技能与编辑后技能,从而暴露被聚合分数掩盖的退化并施加非对称惩罚;同时采用单侧配对检验,仅当编辑的收益相对损失具有统计可靠性时才提交,否则弃权。SAGE可视为标准门控的保守改进,在边界设置下能精确还原基线。在五个基准和四个骨干模型、等预算协议下,SAGE在20种设置中的19种降低了退化率,另一种与基线持平,例如在DeepSeek-V4上LiveMath退化率从36.5%降至0%,OfficeQA从42.8%降至0%,并在全部20种设置中取得最高最终分数,LiveMath从34.15提升至48.78。该工作为自我进化智能体提供了更稳健的编辑采纳准则。

🔑 关键词速览

SAGE一种统计接受门控机制,通过逐条目配对比较和单侧配对检验,仅在接受编辑的收益具有统计可靠性时才提交,否则弃权。
Optimizer's Curse在有限且含噪的验证集上,观测到的最佳分数存在向上偏差,导致基于该分数做出的选择过于乐观。
per-item paired comparison在完全相同的验证条目上分别评估当前技能与编辑后技能,逐条比较其表现,以暴露聚合分数所掩盖的退化。
one-sided paired test一种统计检验方法,仅当编辑的胜出相对于失败在统计上显著可靠时,才接受该编辑。
self-evolving agents能够通过编辑自身持久化技能文档(包含工作流程、工具使用规则和决策逻辑)来迭代改进自身能力的 LLM 智能体。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅