🔥 今日值得一读 分布强化学习QTD算法首获全局有限样本保证!波动阶仅T^{-a/2},摆脱分位数数量依赖
A Finite Sample Analysis for Quantile Temporal Difference Learning in Distributional Reinforcement Learning
arXiv ML (stat.ML) 🔥 重点 #强化学习#分布强化学习#收敛性分析 🕐 08-28 12:00
👨‍💼 主理人解读 · 为什么值得关注
用于分布强化学习算法,提供理论保证,帮助开发者理解QTD算法的收敛行为,优化实现。

📖 AI 总结

该论文针对分布强化学习中的分位数时序差分学习(QTD)算法,首次建立了同步表格设定下的全局有限样本保证。作者通过分离两种稳定性机制完成证明:一是利用奖励累积分布函数的序单调性和分布贝尔曼算子的W∞收缩性,构造全局比较论证,使任意初始化的迭代进入局部邻域;二是在邻域内对QTD均值场线性化,其雅可比矩阵为非奇异M-矩阵,结合正半群性质进行方差敏感的鞅分析。对于步长α_t=c(t+1)^{-a}(a∈(1/2,1)),算法最后迭代的波动主项为Õ(T^{-a/2}/√(1-γ)),且不随分位数数量产生多项式依赖。然而,确定性瞬态和所需预热时间仍依赖于最小贝尔曼目标密度,最坏情况下为m^{-1}阶。该结果清晰区分了局部随机波动与全局样本复杂度,为理解QTD的收敛行为提供了理论支撑。

🔑 关键词速览

Quantile Temporal Difference Learning (QTD)一种分布强化学习算法,通过学习回报分布的分位数来更新价值估计。
Distributional Reinforcement Learning强化学习的一个分支,旨在学习回报的完整分布而非仅期望值。
Distributional Bellman Operator分布强化学习中用于更新回报分布估计的算子,具有压缩性。
M-matrix一类具有非正非对角元素且特征值实部为正的矩阵,在稳定性分析中常用。
Finite-sample guarantee在有限样本数量下,算法性能的理论保证,区别于渐近分析。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅