ETD恒定步长发散反例曝光!新算法RETD用正则化修复,1万次实验验证稳定收敛
Regularized Emphatic Temporal-Difference Learning: Stability under Constant Stepsizes
arXiv AI (cs.AI) 论文方法 🕐 09-18 12:00

📖 AI 总结

本文研究强化学习中强调时序差分学习(ETD)在恒定步长下的稳定性问题。作者指出,ETD虽能稳定离策略TD更新的期望并改变其投影几何,但这两点均无法决定恒定步长下的采样动态。为此,他们构造了一个遍历两状态反例,其中ETD均值映射收缩,而采样乘积却具有正的最大Lyapunov指数,并通过再生周期分析将该符号与后续迹的无限方差区分开来。为解决这一问题,作者提出正则化强调TD(RETD),一种归一化的一阶冲击后修复方法,保持迹和重要性比率不变,将强调TD信号存储于泄漏标量状态并释放延迟修正。理论证明其在调和递减步长下几乎必然收敛,并在马尔可夫随机乘积界下给出条件性恒定步长矩收缩结果。实验验证了固定点恢复、非单调稳定区域及任务依赖性,表明RETD改变了冲击后动态,但未降低共享的后续迹方差。

🔑 关键词速览

Emphatic Temporal-Difference Learning (ETD)一种离策略强化学习算法,通过强调因子稳定TD更新的期望并改变其投影几何。
Lyapunov Exponent描述动力系统中相邻轨迹分离或收敛速率的指标,正指数表示混沌或发散。
Regenerative-Cycle Analysis一种随机过程分析方法,通过将过程分解为独立同分布的再生周期来研究其长期行为。
Regularized Emphatic TD (RETD)本文提出的ETD改进算法,通过归一化一阶冲击后修复和延迟校正来改善恒定步长下的稳定性。
Baird Point强化学习中一个经典的反例状态,用于展示某些TD算法在离策略学习中的不稳定性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅