🔥 今日值得一读 工具缓存竟能反转策略更新!540种配置验证边际有效≠训练等价
Marginally Correct Tool Caches Can Reverse Group-Normalized Policy Updates
arXiv LG (cs.LG) 🔥 重点 Agent强化学习论文方法 🕐 今天 12:00

📖 AI 总结

该研究探讨了智能体训练中工具结果缓存对策略更新的影响。作者构建了一个双动作模型,其中独立执行与共享执行均能保持每次 rollout 的条件奖励分布不变,即边际分布一致。然而研究发现,尽管边际分布相同,每组共享一个随机结果仍可能逆转期望的组归一化策略更新方向。通过推导精确的有限组表达式,作者表明在常数替代方案下,共享更新取决于获胜概率与失败概率之差,而非期望奖励之差。伯努利特化情形揭示了一个错误方向区域,且随组规模增大,更新方差存在非消失的下界。研究还发现,仅做中心化而不进行组标准差缩放可保持期望回报方向。作者通过540种配置和3240次估计器评估的穷举验证,以及在TVCache栈上256次脚本化rollout的实现审计,证实了上述结论。该工作表明,仅凭边际输出有效性不足以证明随机缓存与训练等价。

🔑 关键词速览

Tool-result caching工具结果缓存,指在智能体训练中缓存工具执行结果以减少重复计算。
Group-normalized policy update组归一化策略更新,一种在策略梯度方法中按组对奖励进行归一化以更新策略的技术。
Rollout轨迹采样,指智能体在环境中执行策略生成交互序列的过程。
Bernoulli specialization伯努利特例,指将一般模型具体化为伯努利分布以分析特定性质。
TVCache一种具体的工具结果缓存系统,具有确定性输出契约。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅