本文针对离线策略评估(OPE)中的不确定性量化问题,提出了一种基于模型的Bootstrap框架。在高风险强化学习应用中,仅靠点估计不足以支撑安全决策,需要置信区间和方差估计等可靠的不确定性度量。现有方法在鲁棒性、可扩展性或有限样本有效性方面存在不足。该研究面向有限时域、时间非齐次马尔可夫决策过程,不同于依赖重采样完整轨迹的经典Bootstrap方法,新方法从估计的MDP中重新生成轨迹,因而能兼容完整轨迹、转移级观测和轨迹片段等多种离线数据格式,并提升了有限样本统计效率。作者证明了Bootstrap分布一致性、渐近有效的置信区间以及目标策略值的相合方差估计。大量仿真表明,该方法能准确刻画OPE估计量的抽样分布,在多数情形下给出更紧的置信区间和更精确的方差估计。
| Offline Policy Evaluation (OPE) | 离线策略评估,指在不与环境交互的情况下,仅利用预先收集的离线数据来评估目标策略的性能。 |
| Model-based Bootstrap | 基于模型的bootstrap方法,通过从估计的MDP模型中重新生成轨迹来进行重采样,而非直接重采样原始数据。 |
| Markov Decision Process (MDP) | 马尔可夫决策过程,是强化学习中描述序贯决策问题的标准数学模型,包含状态、动作、转移概率和奖励。 |
| Finite-horizon Time-inhomogeneous MDP | 有限时域时间非齐次MDP,指决策过程在有限步内结束,且转移概率和奖励函数可能随时间步变化。 |
| Bootstrap Distributional Consistency | bootstrap分布一致性,指bootstrap方法得到的分布收敛于真实抽样分布的理论性质。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅