SimpleMemVLA提出了一种无需专用记忆模块的视觉-语言-动作模型(VLA)新方法。针对长时程操控任务中历史信息难以有效利用的问题,该模型直接保留采样历史,并以带时间戳的视频格式输入给预训练的VLM骨干网络,子任务生成的隐藏状态作为连接历史与动作头的唯一通道。由于连续决策共享大部分历史,执行时预填充共享前缀使延迟接近单帧VLA。在四个记忆基准上,SimpleMemVLA达到新最优水平,且不牺牲通用控制性能;在固定骨干和训练设置下,其表现大幅优于检索、压缩和循环状态等既有记忆机制,因果干预实验证实策略确实有效读取历史信息。该方法表明,现代VLM骨干已具备直接处理分钟级历史的能力,无需复杂记忆设计。
| Vision-Language-Action Models (VLA) | 视觉-语言-动作模型,结合视觉和语言理解来生成机器人动作的模型。 |
| Long-horizon manipulation | 长时程操作,指需要长时间跨度内多个步骤才能完成的任务。 |
| Retrieval banks | 检索库,一种存储历史经验并在需要时检索相关信息的记忆机制。 |
| Learned compressors | 学习型压缩器,通过训练学习将历史信息压缩成紧凑表示的方法。 |
| Recurrent states | 循环状态,循环神经网络中用于传递历史信息的隐状态。 |
| Flow-matching action head | 流匹配动作头,一种基于流匹配生成连续动作输出的神经网络模块。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅