🔥 今日值得一读 VLA告别记忆模块!SimpleMemVLA直接吃满分钟级历史,延迟逼近单帧,四大基准全破纪录!
SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models
arXiv CV (cs.CV) 🔥 重点 #VLA#机器人#长时程记忆 🕐 09-09 12:00
👨‍💼 主理人解读 · 为什么值得关注
这篇论文简化了视觉-语言-动作模型的设计,开发者可直接用长视频输入提升机器人长时程任务的决策能力,无需复杂记忆机制。

📖 AI 总结

SimpleMemVLA提出了一种无需专用记忆模块的视觉-语言-动作模型(VLA)新方法。针对长时程操控任务中历史信息难以有效利用的问题,该模型直接保留采样历史,并以带时间戳的视频格式输入给预训练的VLM骨干网络,子任务生成的隐藏状态作为连接历史与动作头的唯一通道。由于连续决策共享大部分历史,执行时预填充共享前缀使延迟接近单帧VLA。在四个记忆基准上,SimpleMemVLA达到新最优水平,且不牺牲通用控制性能;在固定骨干和训练设置下,其表现大幅优于检索、压缩和循环状态等既有记忆机制,因果干预实验证实策略确实有效读取历史信息。该方法表明,现代VLM骨干已具备直接处理分钟级历史的能力,无需复杂记忆设计。

🔑 关键词速览

Vision-Language-Action Models (VLA)视觉-语言-动作模型,结合视觉和语言理解来生成机器人动作的模型。
Long-horizon manipulation长时程操作,指需要长时间跨度内多个步骤才能完成的任务。
Retrieval banks检索库,一种存储历史经验并在需要时检索相关信息的记忆机制。
Learned compressors学习型压缩器,通过训练学习将历史信息压缩成紧凑表示的方法。
Recurrent states循环状态,循环神经网络中用于传递历史信息的隐状态。
Flow-matching action head流匹配动作头,一种基于流匹配生成连续动作输出的神经网络模块。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅