该研究针对视觉语言模型在可供性预测上的失败原因展开分析,将任务拆解为两个环节:识别物体上应被作用的部位,以及判断该部位需要何种动作。作者在19个铰接物体上测试了来自三家开发者的八个模型。结果显示,在开放提示下,模型几乎无法正确输出"推"这一动作,64次评估中仅命中一次,尽管该动作对19个物体中的8个都成立。检查输出后发现,模型往往描述的是与评分目标不同的部位,例如讲解如何拿起相机而非按下按钮。当提示中直接点名目标部位后,所有模型的动作准确率从0.158至0.474提升到0.684至0.947,推的召回率从0至八分之一升至七至八分之八。开放提示下没有任何模型能超过忽略图像的常数基线,而点名部位后八个模型全部超越。作者据此认为,瓶颈不在动作知识缺失,而在部位定位,且这一模式跨模型家族稳定存在,不随能力提升而缓解。研究还报告了两处自身的测量误差,均由与平凡基线的对照测试发现。
| 可供性预测 | 预测物体上可执行动作(如推、拉、按)的能力,是机器人操作中的关键任务。 |
| 部分接地 | 将语言或动作指令与物体的特定部分(如按钮、把手)关联起来的过程。 |
| 视觉语言模型 | 能同时处理视觉和文本信息的模型,如GPT-4V、LLaVA等,用于多模态推理。 |
| 铰接物体 | 由多个通过关节连接的部件组成的物体,如门、抽屉、相机等,其部件可相对运动。 |
| 动作知识 | 模型关于特定动作(如推、拉)所需运动模式的内在知识。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅