震惊!强化学习核心不等式被证伪,错误藏在停时论证里!
Time-Uniform Self-Normalized Concentration for Discounted Least Squares: Limits and Corrections
arXiv ML (stat.ML) #强化学习#置信界#非平稳 🕐 08-21 12:00
👨‍💼 主理人解读 · 为什么值得关注
揭示折扣最小二乘自归一化浓度不等式的缺陷,给出修正,适用于非平稳强化学习分析。

📖 AI 总结

该论文指出,在强化学习和多臂老虎机分析中广泛使用的加权自归一化浓度不等式存在缺陷。作者通过一个固定参数的标量高斯反例证明,该不等式声称的时间一致有界半径实际上以概率1被穿越,即其结论不成立。进一步分析表明,在固定折扣和正则化参数下,当δ≤1/2且T/δ足够大时,任何在条件次高斯模型类上均匀有效的确定性任意时间边界,在时间T之前某时刻必须达到R√log(T/δ)量级;对于非递减边界,该量级在时间T即被要求。论文定位了证明错误:不同终止时间使用不同高斯混合分布,导致固定时间混合不构成单一鞅,停止时间论证无法修复此问题。最后,作者证明该加权不等式在固定确定性时间仍有效,并给出了有限与无限时域的有效修正,同时讨论了其对下游分析的影响。

🔑 关键词速览

Self-normalized concentration inequalities自归一化集中不等式,用于控制随机变量偏离其均值的概率,无需知道方差。
Discounted least-squares estimators折扣最小二乘估计器,在强化学习中用于估计价值函数,对近期数据赋予更高权重。
Time-uniform guarantee时间一致保证,指在任意时间点都有效的概率边界,适用于在线学习分析。
Supermartingale超鞅,一种随机过程,其条件期望不超过当前值,常用于构造集中不等式。
Stopping-time argument停时论证,利用停时定理将固定时间的不等式推广到随机时间。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅