本文研究如何在不更新底层模型的前提下,通过编辑提示策略来提升智能体合成可执行工作流的能力。作者指出,持续性的提示编辑存在两个相互关联的问题:一是编辑的局部性并不等于效果的局部性,局限于某一策略片段的修改可能沿下游执行链路扩散,改变编辑范围之外的行为;二是编辑效果具有组合敏感性,单独有效的编辑在组合后可能相互干扰,导致收益消失甚至产生危害。为此,作者提出RIPPLE方法,将“在哪里编辑”与“编辑组合后是否仍然安全”两个决策分离:先诊断失败轨迹并将可操作的失败映射到预定义策略片段,再在相同迭代起始策略下比较候选编辑的独立增益,并在已接受的更新基础上重放有潜力的编辑,以暴露下游影响和交互作用,仅保留组合后仍安全的编辑。在合成基准Flow-HO上,该方法将验证成功率最高提升23.1%,并在另外两个冻结语言模型骨干上取得正向收益,同时保持编辑效率和较低的执行成本。交互分析进一步验证了上述两个性质:一个片段局部的工具使用编辑会改变下游资源解析与验证结果,而一个单独有益的编辑在组合后反而变得有害。
| Prompt-policy editing | 提示策略编辑:通过修改提示来调整智能体行为,而不更新底层模型参数。 |
| Edit locality | 编辑局部性:编辑仅局限于策略的某个片段,但效果可能不局限于该片段。 |
| Composition-sensitive | 组合敏感:编辑效果在与其他编辑组合后可能发生变化,甚至相互干扰。 |
| RIPPLE | 回放信息持久策略定位与编辑:一种将编辑位置与组合安全性分离的持久适应方法。 |
| Flow-HO | 用于可执行工作流合成的合成留出基准,用于评估策略编辑方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅