本文提出 StarWM,一种用于构建鲁棒世界模型的自监督注意力路由方法,旨在解决现有方法在忠实建模环境动态与抽象无关内容之间的权衡难题。基于重建的世界模型虽能提供可靠监督,却按像素面积而非动态相关性分配表征容量,导致任务无关内容主导学习到的表征;无重建方法虽避免了这一偏差,却可能丢弃潜在有用信息。StarWM 通过一个在自监督动态任务上训练的交叉注意力模块决定重建位置,并利用双流解码器将重建限制在注意力区域,同时以停止梯度屏障防止两个目标相互干扰,从而在不污染潜在表征的前提下监督关注区域的视觉内容。在 DeepMind Control 的动态视频背景任务中,默认无奖励版本在随机帧干扰下表现最佳,在连续视频场景中显著优于基于重建的基线;加入奖励的变体在连续视频上达到或超过无重建方法,在所有干扰条件下取得最高总回报。机制探测表明,StarWM 在长时程想象中近乎完美地保留状态属性,并系统性地丢弃干扰因素。
| 世界模型 | 一种学习环境动态并预测未来状态的模型,常用于基于模型的强化学习。 |
| 交叉注意力 | 一种注意力机制,允许一个序列关注另一个序列的信息,用于决定重建区域。 |
| 自监督学习 | 一种无需人工标注标签,利用数据自身结构生成监督信号的学习范式。 |
| 停止梯度 | 在反向传播中阻止梯度流经某些变量,用于隔离不同训练目标。 |
| DeepMind Control | DeepMind推出的连续控制基准测试套件,常用于评估强化学习算法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅