本文研究有限折扣马尔可夫决策过程在递归熵风险偏好下的样本复杂度问题,风险参数β非零,且假设可访问MDP的生成模型。作者对已有的基于模型的风险敏感Q值迭代方法(MB-RS-QVI)进行了更精细的分析,针对学习最优Q值函数和ε最优策略分别给出了(ε,δ)-PAC保证。核心发现是:新导出的样本复杂度上界在有效时域1/(1-γ)上的指数依赖较此前最优结果显著改进,在|β|/(1-γ)的指数依赖以及S、A、ε、|β|等参数上均与已有下界匹配(仅差对数因子),从而消除了此前上下界之间的指数级差距,仅在有效时域上保留多项式级差距。这一结果使递归熵风险强化学习的样本复杂度分析接近最优,为该风险敏感设定下的理论理解提供了重要推进。
| 递归熵风险 | 一种风险敏感偏好模型,通过递归方式定义熵风险度量,用于刻画决策中的风险态度。 |
| 生成模型 | 在强化学习中,指可以查询任意状态-动作对的下一状态和奖励的模拟器,用于采样。 |
| MB-RS-QVI | 基于模型的风险敏感 Q 值迭代算法,是一种插件式方法,用于求解风险敏感 MDP。 |
| PAC 保证 | Probably Approximately Correct 保证,指以高概率获得近似最优解的理论保证。 |
| 有效视界 | 折扣因子 \(\gamma\) 下,\(1/(1-\gamma)\) 称为有效视界,衡量决策问题的长期影响范围。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅