这篇综述探讨了最优传输(OT)与强化学习(RL)的交叉融合。强化学习算法常需比较策略诱导的状态访问分布、离线数据集中的动作分布或模型与环境的转移分布,但当分布间重叠较弱时,传统散度度量往往失效,这在模仿学习、离线强化学习和分布偏移场景中尤为常见。最优传输通过在地面代价下度量概率质量从一个分布“移动”到另一个分布的成本,提供了替代方案。文章系统梳理了OT在RL目标与算法中的使用方式,针对每种方法分析了OT所扮演的角色、所比较的分布、采用的OT形式及对时间结构的处理,并讨论了不同OT选择背后的动机、代价设计与计算挑战等实践问题,最后指出可扩展的轨迹级传输、质量不匹配的原则化处理以及OT正则化RL的理论分析等开放问题。
| Optimal Transport (OT) | 最优传输,一种度量两个概率分布之间差异的方法,通过计算将概率质量从一个分布移动到另一个分布的最小成本。 |
| Reinforcement Learning (RL) | 强化学习,一种机器学习范式,智能体通过与环境交互并根据奖励信号学习最优策略。 |
| State Visitation Distribution | 状态访问分布,描述在给定策略下智能体访问各状态的概率分布。 |
| Imitation Learning | 模仿学习,一种通过模仿专家示范来学习策略的强化学习设置。 |
| Offline RL | 离线强化学习,一种仅从预先收集的静态数据集中学习策略而不与环境交互的强化学习设置。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅