该研究提出了一种名为QDOS(Quality-Diversity Offline Skill learning)的离线到在线强化学习统一框架,旨在解决分层技能策略学习中低层策略质量过度依赖数据集质量的问题。传统方法通常先通过无监督学习(如轨迹VAE)从预收集数据中提取多样化技能,再训练高层策略完成特定任务,但这种方式在数据集质量不佳时效果受限。QDOS引入优势加权质量-多样性预训练目标,根据每个轨迹片段的估计优势对技能提取和多样性目标进行加权,从而提取既多样又高价值的技能表征。此外,该方法采用双重数据集复用策略,将离线数据同时用于技能预训练和通过伪标签填充在线回放缓冲区。实验表明,QDOS在结构化操作任务和非结构化运动任务中均显著优于强基线方法,在稀疏奖励的挑战性环境中能加速探索并提升最终回报。
| Quality-Diversity (QD) | 一种优化方法,旨在同时追求解决方案的质量和多样性,常用于进化计算和强化学习。 |
| Offline Reinforcement Learning | 一种强化学习范式,仅从预先收集的静态数据集中学习策略,不与环境进行在线交互。 |
| Skill Extraction | 从数据中提取可复用的行为模式或技能,通常作为低级策略,用于支持高级任务的学习。 |
| Advantage-Weighted | 一种加权技术,根据动作或轨迹的优势估计值(即相对于平均水平的改进)来调整训练目标。 |
| Pseudo-labeling | 一种利用模型预测为未标记数据生成标签的方法,此处用于将离线数据标记以填充在线回放缓冲区。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅