🔥 今日值得一读 优先回放竟扭曲结果分布!兄弟感知修正让学习效率飙升
Correcting Within-Group Self-Selection Bias in Prioritized Replay
arXiv LG (cs.LG) 🔥 重点 #强化学习#经验回放#偏差修正 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
用优先经验回放的RL开发者可借此修正随机环境下的样本分布偏差,提升训练稳定性与收敛质量。

📖 AI 总结

本文研究优先经验回放(PER)在随机环境中的一种偏差,作者将其命名为“组内自选择”:当同一状态-动作对对应多种随机结果时,PER依据绝对时序差分误差挑选样本,会扭曲被回放结果的频率分布,并改变平均贝尔曼目标。为量化并纠正这一问题,作者将PER分解为组间分配与组内条件选择两部分,提出三种固定缓冲区修正方法:SAMPLE(按PER选组、在组内均匀采样兄弟样本)、AVG(对兄弟贝尔曼目标取平均)和MODEL(从经验全结果模型采样)。实验表明,在存在稀有高幅结果的环境中,兄弟感知回放比PER学习效率更高;在MinAtar的五个游戏中,有四个游戏借助近似VQ-VAE分组与SAMPLE缓解了均值保持奖励尾部带来的性能退化。该工作表明,兄弟感知回放能在保持对高优先状态-动作区域关注的同时,恢复其经验结果频率。

🔑 关键词速览

优先经验回放 (Prioritized Experience Replay, PER)一种强化学习技术,根据转移样本的优先级(如时序差分误差)进行回放,以提高样本效率。
组内自选择 (Within-Group Self-Selection)指在相同状态-动作对的转移中,PER 优先回放某些结果,导致回放的实际结果分布发生扭曲的现象。
贝尔曼目标 (Bellman Target)在时序差分学习中,用于更新价值函数的目标值,通常由即时奖励和折扣后的下一状态价值组成。
兄弟选择 (Sibling Selection)在 PER 中,从同一状态-动作对的不同转移(兄弟样本)中选择一个进行回放的过程。
VQ-VAE (Vector Quantized Variational Autoencoder)一种生成模型,用于学习离散的潜在表示,在文中用于近似分组状态-动作对。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅