🔥 今日值得一读 VLA模型集体翻车?新方法把动作拆成“乐高积木”,长任务性能飙升!
REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs
Apple ML Research 🔥 重点 论文方法机器人多模态 🕐 09-02 08:00

📖 AI 总结

REFACTOR-VLA提出了一种无监督的技能学习方法,旨在解决现有视觉-语言-动作(VLA)模型在长时程任务中表现不佳且缺乏可解释性的问题。该方法采用“唤醒/睡眠”架构:睡眠阶段通过行为等价核(BEK)在潜在世界模型中聚类动作片段,唤醒阶段则生成类型化的lambda表达式作为结构化技能,并经由库条件解码器输出动作。只有通过最小描述长度和回报保持双重标准的抽象才被保留为技能。在LIBERO基准测试中,研究发现单纯扩大世界模型参数(从1.88亿增至4.3亿)反而导致性能全面下降,而引入InfoNCE辅助对比损失则显著提升技能聚类的质量,归一化互信息在目标、空间和任务套件上分别达到0.462、0.867和0.915。这一结果强调了训练目标设计比模型规模更关键,为VLA模型的模块化与可解释性发展提供了新思路。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅