离线GCRL被分割坑惨?新基准揭示:朴素处理成功率暴跌至0.27%!
SegBench-GC: Testing Segmentation Invariance in Multi-Step Offline Goal-Conditioned Reinforcement Learning
arXiv LG (cs.LG) 重要 #评测基准#强化学习#离线学习 🕐 08-31 12:00

📖 AI 总结

本文提出 SegBench-GC,一个用于测试离线目标条件强化学习(GCRL)中分割不变性的受控基准。研究动机在于:实际日志轨迹常因管理原因被分割,而这种分割与任务终止无关,可能影响多步目标学习。作者在保持转移、目标采样、优化设置和评估完全一致的前提下,仅改变人工备份边界及其是否保留延续价值,设计了三种处理方式:无分割、延续有效目标(CVT)和朴素吸收处理。在 PointMaze 实验中,35,000 个人工切割下,无分割成功率为 50.5%,CVT 为 39.1%,而朴素处理仅 19.1%;不同分割实现下朴素均值成功率波动达 4.8% 至 31.9%。独立基线在 Puzzle-4x5 任务上复现了类似失败模式。诊断实验验证了目标差异的数值精度,并显示朴素处理导致批评者出现大幅乐观偏移,而 CVT 与无分割批评者保持对齐。该研究贡献在于提供了受控基准、故障隔离方法,并证明行政性分割会实质影响多步离线 GCRL 的性能。

🔑 关键词速览

Offline Goal-Conditioned Reinforcement Learning (GCRL)离线目标条件强化学习,一种在固定数据集上学习策略以达成特定目标的方法。
SegBench-GC一个用于测试分割不变性的受控压力测试基准,通过仅改变轨迹分割边界来评估算法性能。
Continuation-Valid Targets (CVT)延续有效目标,一种处理分割边界的方法,在人工切割处停止奖励累积但自举到存储的后继状态。
Absorbing吸收态,在强化学习中指终止状态,此处指将人工切割视为终止导致目标值被截断。
Decoupled Q-Chunking解耦Q分块,一种离线强化学习算法,用于多步目标条件学习,此处作为独立基线。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅