该论文探讨持续强化学习中的稳定性—可塑性权衡问题。作者基于Abel等人(2025)提出的新形式化框架,将可塑性定义为智能体观测到动作的广义有向信息,将赋能定义为动作到观测的广义有向信息,从而把传统权衡重新表述为赋能—可塑性权衡。尽管赋能优化已有大量研究,但在该定义下如何优化可塑性尚属空白。本文作为初步工作,研究马尔可夫决策过程中的可塑性优化问题,证明存在一个用于优化可塑性的贝尔曼最优方程,其形式与先前赋能优化的工作类似。这一结果为在持续强化学习中系统性地优化可塑性提供了理论基础,有望推动稳定性与可塑性之间更优平衡策略的发展。
| 持续强化学习 | 一种强化学习设置,智能体在非平稳环境中连续学习多个任务,需要平衡旧知识的保持与新知识的学习。 |
| 稳定性-可塑性权衡 | 指学习系统在保持已有知识(稳定性)与适应新信息(可塑性)之间需要权衡的核心矛盾。 |
| 广义有向信息 | 一种信息论度量,用于量化两个随机变量之间的有向依赖关系,是互信息的推广。 |
| 赋权 | 在强化学习中,指智能体通过其动作影响环境观测的能力,通常定义为从动作到观测的广义有向信息。 |
| 贝尔曼最优方程 | 动态规划中的核心方程,用于描述最优价值函数满足的递归关系,是强化学习算法的基础。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅