本文针对视觉语言模型(VLM)与视觉语言动作模型(VLA)在真实部署中的鲁棒性问题展开研究。现有基准仅通过采样扰动进行评估,无法保证未测试区域内不存在失败情形。作者基于验证框架H²V提出H²V-M,引入边界感知收敛规则,使验证在320亿参数规模下可行,查询效率较H²V提升一个数量级,并能比随机采样更快找到反例,同时提供可靠性保证。研究对六个VLM和五个VLA在亮度偏移、相机旋转及其组合的连续扰动区域内进行验证,发现鲁棒性主要取决于扰动类型而非具体模型,VLM对大幅相机旋转的鲁棒性强于VLA,而VLA在仅±1°扰动下动作指令即可能改变,且鲁棒性更多与模型家族相关而非模型规模。
| 视觉语言模型(VLM) | 能够同时处理视觉和语言信息,并完成跨模态理解与生成任务的模型。 |
| 视觉语言动作模型(VLA) | 在视觉语言模型基础上进一步输出动作指令,用于机器人控制等具身决策任务的模型。 |
| 鲁棒性验证 | 在连续扰动区域内形式化地证明模型不存在失败,而非仅通过采样测试。 |
| H²V-M | 一种边缘感知的收敛规则,扩展自H²V验证框架,使大规模模型(如32B参数)的鲁棒性验证变得可行。 |
| 光度与几何扰动 | 光度扰动指亮度等像素值变化,几何扰动指相机旋转等空间变换,二者可组合。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅