本文研究强化学习中强调时序差分学习(ETD)在恒定步长下的稳定性问题。作者指出,ETD虽能稳定离策略TD更新的期望并改变其投影几何,但这两点均无法决定恒定步长下的采样动态。为此,他们构造了一个遍历两状态反例,其中ETD均值映射收缩,而采样乘积却具有正的最大Lyapunov指数,并通过再生周期分析将该符号与后续迹的无限方差区分开来。为解决这一问题,作者提出正则化强调TD(RETD),一种归一化的一阶冲击后修复方法,保持迹和重要性比率不变,将强调TD信号存储于泄漏标量状态并释放延迟修正。理论证明其在调和递减步长下几乎必然收敛,并在马尔可夫随机乘积界下给出条件性恒定步长矩收缩结果。实验验证了固定点恢复、非单调稳定区域及任务依赖性,表明RETD改变了冲击后动态,但未降低共享的后续迹方差。
| Emphatic Temporal-Difference Learning (ETD) | 一种离策略强化学习算法,通过强调因子稳定TD更新的期望并改变其投影几何。 |
| Lyapunov Exponent | 描述动力系统中相邻轨迹分离或收敛速率的指标,正指数表示混沌或发散。 |
| Regenerative-Cycle Analysis | 一种随机过程分析方法,通过将过程分解为独立同分布的再生周期来研究其长期行为。 |
| Regularized Emphatic TD (RETD) | 本文提出的ETD改进算法,通过归一化一阶冲击后修复和延迟校正来改善恒定步长下的稳定性。 |
| Baird Point | 强化学习中一个经典的反例状态,用于展示某些TD算法在离策略学习中的不稳定性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅