🔥 今日值得一读 灵巧操作新SOTA!DeCAL融合视觉触觉,成功率71%还能泛化到未见场景
DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination
arXiv AI (cs.AI) 🔥 重点 #具身智能#VLA模型#触觉感知 🕐 09-08 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用DeCAL框架训练机器人灵巧手,结合视觉、语言和触觉信息,提升在遮挡和复杂接触场景下的精细操作能力。

📖 摘要

提出DeCAL,基于接触感知的灵巧操作视觉语言动作模型,融合触觉与物理建模。

🔑 关键词速览

DeCAL一种基于物理的灵巧视觉-语言-动作模型,通过接触感知潜在协同想象统一理解、想象和动作生成。
Vision-Language-Action (VLA) models视觉-语言-动作模型,结合视觉、语言和动作生成,用于机器人操作任务。
Mixture-of-Transformers (MoT)Transformer混合体架构,使用多个专家模块处理不同能力,并实现高效信息流动。
Adaptive Visuo-Tactile Fusion自适应视觉-触觉融合,通过接触感知门控策略动态调节触觉信息的使用。
Visuo-Tactile Latent Co-Imagination视觉-触觉潜在协同想象,联合建模视觉和触觉动力学,为策略提供隐式物理知识。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅