提出DeCAL,基于接触感知的灵巧操作视觉语言动作模型,融合触觉与物理建模。
| DeCAL | 一种基于物理的灵巧视觉-语言-动作模型,通过接触感知潜在协同想象统一理解、想象和动作生成。 |
| Vision-Language-Action (VLA) models | 视觉-语言-动作模型,结合视觉、语言和动作生成,用于机器人操作任务。 |
| Mixture-of-Transformers (MoT) | Transformer混合体架构,使用多个专家模块处理不同能力,并实现高效信息流动。 |
| Adaptive Visuo-Tactile Fusion | 自适应视觉-触觉融合,通过接触感知门控策略动态调节触觉信息的使用。 |
| Visuo-Tactile Latent Co-Imagination | 视觉-触觉潜在协同想象,联合建模视觉和触觉动力学,为策略提供隐式物理知识。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅