该研究聚焦强化学习中的离线最优价值推断问题,提出了一种新的统计推断方法。作者通过将最大贝尔曼算子近似为其softmax对应形式,推导出两个作为自诱导贝尔曼方程不动点的新干扰参数,并基于Neyman正交性构建了去偏估计量。理论分析表明,即便在行为策略随时间变化、时间跨度发散的情形下,该估计量仍具有渐近正态性,且对干扰参数仅要求许多机器学习方法即可达到的统计收敛速率。作者给出了具体的估计流程,并通过合成实验验证了数值表现,同时将该方法应用于共享单车调度和AI智能体工具使用等真实决策场景。这项工作为强化学习最优价值的可信推断提供了理论保障与实用工具,推动了离线强化学习在需要统计置信度的实际决策中的应用。
| 最优价值推断 | 在强化学习中,对最优策略所对应的价值函数进行统计推断的过程。 |
| 自诱导贝尔曼方程 | 一种通过softmax近似最大贝尔曼算子而构造的方程,其不动点定义了所需的干扰参数。 |
| Neyman正交性 | 一种统计性质,使得估计量对干扰参数的微小扰动不敏感,从而保证去偏估计的稳健性。 |
| 渐近正态性 | 当样本量或视界趋于无穷时,估计量的分布收敛于正态分布的性质。 |
| 行为策略 | 在离线强化学习中,用于生成观测数据的策略,可能与目标策略不同。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅