这篇论文提出了一种名为Tail-Likelihood Reinforcement Learning(TailRL)的新强化学习方法。传统强化学习优化平均奖励,但可能掩盖生成策略在稀有高奖励结果上的概率差异。TailRL直接优化策略覆盖高奖励结果的可能性,通过考虑所有奖励阈值上的超额概率,将连续奖励转化为二元成功事件族。其核心创新在于最大化超过随机选择奖励阈值的对数概率,梯度会赋予稀有高奖励轨迹更多权重,可视为Best-of-k梯度的混合。TailRL仅需对优势函数做简单修改,即可兼容现有强化学习流程。在目标定位、迷宫导航、GUI定位和代码优化等任务中,TailRL利用稀有高奖励训练样本避免次优解,并让模型在推理时从额外采样中获益更多。
| Tail-Likelihood Reinforcement Learning (TailRL) | 一种强化学习方法,通过最大化超过随机奖励阈值的对数概率来优化策略,重点关注罕见高奖励结果。 |
| average reward | 强化学习中常用的优化目标,即所有可能轨迹奖励的期望值。 |
| rollout | 从策略中采样生成的完整轨迹,包括状态、动作和奖励序列。 |
| Best-of-(k) | 一种采样策略,从k个样本中选择奖励最高的一个,常用于推理时提升性能。 |
| advantage function | 衡量某个动作相对于平均水平的优势,用于指导策略更新。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅