该论文针对分布强化学习中的分位数时序差分学习(QTD)算法,首次建立了同步表格设定下的全局有限样本保证。作者通过分离两种稳定性机制完成证明:一是利用奖励累积分布函数的序单调性和分布贝尔曼算子的W∞收缩性,构造全局比较论证,使任意初始化的迭代进入局部邻域;二是在邻域内对QTD均值场线性化,其雅可比矩阵为非奇异M-矩阵,结合正半群性质进行方差敏感的鞅分析。对于步长α_t=c(t+1)^{-a}(a∈(1/2,1)),算法最后迭代的波动主项为Õ(T^{-a/2}/√(1-γ)),且不随分位数数量产生多项式依赖。然而,确定性瞬态和所需预热时间仍依赖于最小贝尔曼目标密度,最坏情况下为m^{-1}阶。该结果清晰区分了局部随机波动与全局样本复杂度,为理解QTD的收敛行为提供了理论支撑。
| Quantile Temporal Difference Learning (QTD) | 一种分布强化学习算法,通过学习回报分布的分位数来更新价值估计。 |
| Distributional Reinforcement Learning | 强化学习的一个分支,旨在学习回报的完整分布而非仅期望值。 |
| Distributional Bellman Operator | 分布强化学习中用于更新回报分布估计的算子,具有压缩性。 |
| M-matrix | 一类具有非正非对角元素且特征值实部为正的矩阵,在稳定性分析中常用。 |
| Finite-sample guarantee | 在有限样本数量下,算法性能的理论保证,区别于渐近分析。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅