离线视觉控制新突破:DTRC在10个任务上实现强目标条件控制,测试时直接行动无需迭代搜索!
Directed Temporal Representations for Offline Visual Control
arXiv LG (cs.LG) 重要 #世界模型#离线强化学习#视觉控制#表征学习 🕐 今天 12:00

📖 AI 总结

本文提出一种面向离线视觉控制的有向时间表征方法DTRC。研究指出,控制任务所需的潜在空间几何结构应与时间可达性对齐,而非仅依赖预测相似性。DTRC在冻结的LeWorldModel特征之上,从离线视觉轨迹中学习有向时间准度量:利用短程时间偏移校准距离尺度,通过自举目标扩展长时域可达性,并以动作条件一致性对齐局部转移动态。由此得到的距离可估计时间到达成本,其变化定义目标相对的时间进度,进而作为时间评判信号用于直接的目标条件策略学习。在十项视觉控制任务中,DTRC相较规划与直接策略基线表现更优;在四项LeWM任务的诊断中,方法展现出一致的短程时间校准、任务相关的长程与方向结构,以及正向的转移级进度。时间监督在四项任务上均改善了同一流策略参数化,且测试时策略直接行动,无需迭代轨迹搜索。

🔑 关键词速览

DTRCDirected Temporal Representations for Control,一种从离线视觉轨迹中学习有向时间准度量以用于目标条件控制的表示学习方法。
LeWorldModel (LeWM)一种预测性世界模型,提供冻结的视觉特征作为DTRC的基础表示。
有向时间准度量一种非对称的距离度量,用于量化状态之间的时间到达成本,反映时间方向性。
目标条件策略学习一种强化学习设定,策略以目标状态为条件,学习如何从当前状态到达目标。
时间评论家利用时间进展信号作为评论家来指导策略学习,评估动作在时间维度上的进展。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅