🔥 今日值得一读 强化学习新招TailRL:专抓罕见高奖励,采样越多越赚,性能直接起飞!
Tail-Likelihood Reinforcement Learning
arXiv LG (cs.LG) 🔥 重点 #强化学习#生成模型#训练方法 🕐 09-04 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此方法训练生成策略,提升采样时发现高奖励输出的概率,适用于需要探索稀有成功案例的场景。

📖 AI 总结

这篇论文提出了一种名为Tail-Likelihood Reinforcement Learning(TailRL)的新强化学习方法。传统强化学习优化平均奖励,但可能掩盖生成策略在稀有高奖励结果上的概率差异。TailRL直接优化策略覆盖高奖励结果的可能性,通过考虑所有奖励阈值上的超额概率,将连续奖励转化为二元成功事件族。其核心创新在于最大化超过随机选择奖励阈值的对数概率,梯度会赋予稀有高奖励轨迹更多权重,可视为Best-of-k梯度的混合。TailRL仅需对优势函数做简单修改,即可兼容现有强化学习流程。在目标定位、迷宫导航、GUI定位和代码优化等任务中,TailRL利用稀有高奖励训练样本避免次优解,并让模型在推理时从额外采样中获益更多。

🔑 关键词速览

Tail-Likelihood Reinforcement Learning (TailRL)一种强化学习方法,通过最大化超过随机奖励阈值的对数概率来优化策略,重点关注罕见高奖励结果。
average reward强化学习中常用的优化目标,即所有可能轨迹奖励的期望值。
rollout从策略中采样生成的完整轨迹,包括状态、动作和奖励序列。
Best-of-(k)一种采样策略,从k个样本中选择奖励最高的一个,常用于推理时提升性能。
advantage function衡量某个动作相对于平均水平的优势,用于指导策略更新。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅