CVaR强化学习突破!无需连续性假设,遗憾界直接砍到√(SAK/τ),主项对齐极小极大下界!
Continuity-Free Near-Minimax Leading-Order Regret for CVaR-UCBVI
arXiv LG (cs.LG) 重要 #强化学习#CVaR#遗憾界 🕐 09-01 12:00

📖 AI 总结

该研究针对有限时域表格型条件风险价值(CVaR)强化学习问题,提出了一种无需连续性假设即可实现近最优遗憾界的方法。以往研究在任意归一化收益分布下仅能证明较宽松的遗憾界,而在密度下界假设下才能获得更优速率。本文证明,伯恩斯坦CVaR-UCBVI算法在无连续性假设时同样能达到该更优速率,其关键在于引入“选定预算自界”技术,将每集短fall的条件方差限制在τ加价值估计宽度内。通过将该自界代入原始伯恩斯坦分解,算法在任意收益分布(包括原子、混合及连续分布)下均能以高概率实现约O(√(SAK/τ))的遗憾,其主项与理论极小化下界在对数因子内匹配。这表明伯恩斯坦CVaR-UCBVI在完整收益分布类别中达到极小化最优,而低阶项仍保留τ⁻¹依赖。

🔑 关键词速览

CVaR条件风险价值(Conditional Value at Risk),衡量损失分布尾部风险的指标,此处用于强化学习中的风险敏感目标。
UCBVI基于上置信界(UCB)的值迭代算法,用于有限时域强化学习中的探索与利用权衡。
Bernstein不等式一种概率集中不等式,利用方差信息给出更紧的遗憾界,此处用于构造算法分析。
极小极大最优指算法在最坏情况下的性能与理论下界匹配,即无法被本质上改进。
遗憾界算法累积奖励与最优策略期望奖励之间的差距,用于衡量学习算法的性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅