🔥 今日值得一读 仅需±1°扰动就能改变VLA动作,我们首次验证了VLM和VLA的连续区域鲁棒性!
Validating, Not Sampling: Region-Level Robustness of Vision-Language and Vision-Language-Action Models
arXiv CV (cs.CV) 🔥 重点 #视觉语言模型#鲁棒性验证#VLA 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
可对VLM/VLA做区域级鲁棒性验证,帮助开发者发现未采样扰动下的潜在决策失败。

📖 AI 总结

本文针对视觉语言模型(VLM)与视觉语言动作模型(VLA)在真实部署中的鲁棒性问题展开研究。现有基准仅通过采样扰动进行评估,无法保证未测试区域内不存在失败情形。作者基于验证框架H²V提出H²V-M,引入边界感知收敛规则,使验证在320亿参数规模下可行,查询效率较H²V提升一个数量级,并能比随机采样更快找到反例,同时提供可靠性保证。研究对六个VLM和五个VLA在亮度偏移、相机旋转及其组合的连续扰动区域内进行验证,发现鲁棒性主要取决于扰动类型而非具体模型,VLM对大幅相机旋转的鲁棒性强于VLA,而VLA在仅±1°扰动下动作指令即可能改变,且鲁棒性更多与模型家族相关而非模型规模。

🔑 关键词速览

视觉语言模型(VLM)能够同时处理视觉和语言信息,并完成跨模态理解与生成任务的模型。
视觉语言动作模型(VLA)在视觉语言模型基础上进一步输出动作指令,用于机器人控制等具身决策任务的模型。
鲁棒性验证在连续扰动区域内形式化地证明模型不存在失败,而非仅通过采样测试。
H²V-M一种边缘感知的收敛规则,扩展自H²V验证框架,使大规模模型(如32B参数)的鲁棒性验证变得可行。
光度与几何扰动光度扰动指亮度等像素值变化,几何扰动指相机旋转等空间变换,二者可组合。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅