该论文重新审视了强化学习中世界模型的基本分类问题,提出应首先区分模型所建模的通道类型,而非仅关注预测变量。作者将世界模型划分为三类:环境通道、智能体通道以及二者耦合的联合过程,并利用计算力学中的ε-转换器和ε-机器为这三类分别定义了规范预测模型。核心结构发现是,在闭环耦合下,受支持约束的环境状态可分解为联合因果状态,其转移结构直接由联合模型诱导,而智能体侧构造则具有对偶性。论文通过一个POMDP/控制器实例证明,无约束环境模型可能需要无限状态,而耦合诱导的受支持约束模型却可以是有限的。这一框架厘清了不同世界模型究竟在建模什么,以及耦合与支持约束如何改变其规范预测结构与复杂度,为模型基强化学习提供了更精确的理论基础。
| World models | 世界模型,指对环境或系统动态进行建模的预测模型,常用于强化学习中。 |
| ε-transducers | ε-转换器,计算力学中用于描述带输入和输出的随机过程的规范模型。 |
| ε-machines | ε-机器,计算力学中用于描述随机过程的规范因果状态模型。 |
| Predictive state representations | 预测状态表示,基于未来观测预测的充分统计量来表示系统状态的方法。 |
| POMDP | 部分可观测马尔可夫决策过程,一种在部分可观测环境下进行决策的框架。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅