🔥 今日值得一读 离线策略评估新突破:从估计MDP重生成轨迹,置信区间更紧、方差估计更准!
Model-based Bootstrap for Offline Policy Evaluation in Tabular Reinforcement Learning
arXiv ML (stat.ML) 🔥 重点 #离线策略评估#强化学习#不确定性量化 🕐 09-18 12:00
👨‍💼 主理人解读 · 为什么值得关注
为离线RL策略评估提供置信区间与方差估计,帮助开发者在部署前可靠评估新策略风险。

📖 AI 总结

本文针对离线策略评估(OPE)中的不确定性量化问题,提出了一种基于模型的Bootstrap框架。在高风险强化学习应用中,仅靠点估计不足以支撑安全决策,需要置信区间和方差估计等可靠的不确定性度量。现有方法在鲁棒性、可扩展性或有限样本有效性方面存在不足。该研究面向有限时域、时间非齐次马尔可夫决策过程,不同于依赖重采样完整轨迹的经典Bootstrap方法,新方法从估计的MDP中重新生成轨迹,因而能兼容完整轨迹、转移级观测和轨迹片段等多种离线数据格式,并提升了有限样本统计效率。作者证明了Bootstrap分布一致性、渐近有效的置信区间以及目标策略值的相合方差估计。大量仿真表明,该方法能准确刻画OPE估计量的抽样分布,在多数情形下给出更紧的置信区间和更精确的方差估计。

🔑 关键词速览

Offline Policy Evaluation (OPE)离线策略评估,指在不与环境交互的情况下,仅利用预先收集的离线数据来评估目标策略的性能。
Model-based Bootstrap基于模型的bootstrap方法,通过从估计的MDP模型中重新生成轨迹来进行重采样,而非直接重采样原始数据。
Markov Decision Process (MDP)马尔可夫决策过程,是强化学习中描述序贯决策问题的标准数学模型,包含状态、动作、转移概率和奖励。
Finite-horizon Time-inhomogeneous MDP有限时域时间非齐次MDP,指决策过程在有限步内结束,且转移概率和奖励函数可能随时间步变化。
Bootstrap Distributional Consistencybootstrap分布一致性,指bootstrap方法得到的分布收敛于真实抽样分布的理论性质。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅