该论文提出了一种面向无限时域强化学习的离策略评估新框架,采用稀疏加性结构对Q函数进行非线性建模,兼顾灵活性与可解释性。研究推导了目标策略价值函数估计的高概率有限样本误差界,证明该误差界仅随环境维度呈对数增长,有效缓解了维度灾难问题。与多数现有理论假设大量轨迹可用不同,该分析保证在轨迹数量或时间跨度足够大时即可实现准确估计,更贴合实际应用场景。此外,论文还设计了一种基于组稀疏性的特征筛选程序,能够以高概率识别出包含所有相关协变量的精简特征集。数值实验验证了该方法的有效性。这一工作为数据有限条件下的强化学习评估提供了理论保障,对提升策略评估的实用性和可靠性具有重要意义。
| Off-Policy Evaluation | 离策略评估,指在目标策略与行为策略不同的情况下,评估目标策略的价值函数。 |
| Sparse Additive Structure | 稀疏加性结构,一种模型形式,其中函数表示为多个单变量函数的和,且大部分系数为零,有助于可解释性和高维处理。 |
| Curse of Dimensionality | 维度灾难,指在高维空间中,数据稀疏和计算复杂度随维度增加而急剧增长的问题。 |
| Group-Sparsity | 组稀疏性,一种正则化技术,将特征分组并鼓励整组特征同时被选择或忽略,用于特征筛选。 |
| Q-function | Q函数,强化学习中表示在给定状态下采取特定动作的期望回报的函数。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅