该研究探讨了智能体训练中工具结果缓存对策略更新的影响。作者构建了一个双动作模型,其中独立执行与共享执行均能保持每次 rollout 的条件奖励分布不变,即边际分布一致。然而研究发现,尽管边际分布相同,每组共享一个随机结果仍可能逆转期望的组归一化策略更新方向。通过推导精确的有限组表达式,作者表明在常数替代方案下,共享更新取决于获胜概率与失败概率之差,而非期望奖励之差。伯努利特化情形揭示了一个错误方向区域,且随组规模增大,更新方差存在非消失的下界。研究还发现,仅做中心化而不进行组标准差缩放可保持期望回报方向。作者通过540种配置和3240次估计器评估的穷举验证,以及在TVCache栈上256次脚本化rollout的实现审计,证实了上述结论。该工作表明,仅凭边际输出有效性不足以证明随机缓存与训练等价。
| Tool-result caching | 工具结果缓存,指在智能体训练中缓存工具执行结果以减少重复计算。 |
| Group-normalized policy update | 组归一化策略更新,一种在策略梯度方法中按组对奖励进行归一化以更新策略的技术。 |
| Rollout | 轨迹采样,指智能体在环境中执行策略生成交互序列的过程。 |
| Bernoulli specialization | 伯努利特例,指将一般模型具体化为伯努利分布以分析特定性质。 |
| TVCache | 一种具体的工具结果缓存系统,具有确定性输出契约。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅