局部改提示,工作流成功率飙升23.1%!
Local Edits, Global Ripples: Replay-Informed Policy Adaptation for Workflow Synthesis
arXiv CL (cs.CL) 重要 #Agent#提示工程#工作流 🕐 09-14 12:00

📖 AI 总结

本文研究如何在不更新底层模型的前提下,通过编辑提示策略来提升智能体合成可执行工作流的能力。作者指出,持续性的提示编辑存在两个相互关联的问题:一是编辑的局部性并不等于效果的局部性,局限于某一策略片段的修改可能沿下游执行链路扩散,改变编辑范围之外的行为;二是编辑效果具有组合敏感性,单独有效的编辑在组合后可能相互干扰,导致收益消失甚至产生危害。为此,作者提出RIPPLE方法,将“在哪里编辑”与“编辑组合后是否仍然安全”两个决策分离:先诊断失败轨迹并将可操作的失败映射到预定义策略片段,再在相同迭代起始策略下比较候选编辑的独立增益,并在已接受的更新基础上重放有潜力的编辑,以暴露下游影响和交互作用,仅保留组合后仍安全的编辑。在合成基准Flow-HO上,该方法将验证成功率最高提升23.1%,并在另外两个冻结语言模型骨干上取得正向收益,同时保持编辑效率和较低的执行成本。交互分析进一步验证了上述两个性质:一个片段局部的工具使用编辑会改变下游资源解析与验证结果,而一个单独有益的编辑在组合后反而变得有害。

🔑 关键词速览

Prompt-policy editing提示策略编辑:通过修改提示来调整智能体行为,而不更新底层模型参数。
Edit locality编辑局部性:编辑仅局限于策略的某个片段,但效果可能不局限于该片段。
Composition-sensitive组合敏感:编辑效果在与其他编辑组合后可能发生变化,甚至相互干扰。
RIPPLE回放信息持久策略定位与编辑:一种将编辑位置与组合安全性分离的持久适应方法。
Flow-HO用于可执行工作流合成的合成留出基准,用于评估策略编辑方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅