提出TANGO,首个全身视觉语言导航框架,实现人形机器人在杂乱环境中按语言指令行动。
| TANGO | 一种用于人形机器人在杂乱环境中导航的全身视觉-语言-动作模型,直接预测关节空间动作。 |
| whole-body vision-language-action model | 一种结合视觉、语言和动作的模型,能够根据语言指令和视觉输入生成全身关节动作。 |
| 29-DoF joint-space actions | 29个自由度的关节空间动作,指人形机器人全身关节的控制指令。 |
| zero-shot deployment | 零样本部署,指模型在未见过的真实环境中直接应用,无需额外训练。 |
| obstacle-aware motion editing | 障碍物感知运动编辑,一种根据障碍物信息调整运动轨迹的技术,确保无碰撞通行。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅