本文提出GaugeVLM,旨在解决视觉语言模型在同一空间关系的不同视角下自相矛盾、且对关系变化缺乏响应的问题。作者认为,现有基于单一答案或序数偏好的训练方式无法显式刻画误差大小与跨观测的几何依赖关系。为此,GaugeVLM在显式三维场景中通过受控的物体与相机干预,生成具有可测空间关系差异和跨视角共享真值的关联观测,其核心目标函数GaugeDPO将测量误差转化为偏好边际,直接监督跨视角的正确规范排序,并将干预引起的答案几率对比与实测关系变化以视角特定尺度关联。理论分析给出了规范预测误差的界,并证明跨视角与干预约束可同时满足。实验上,GaugeVLM在三种VLM骨干网络上于全部10项空间指标上优于监督微调,主模型7B在MSMU距离和QSpatial+上分别提升15.0和18.9个百分点,且增益可迁移至自动驾驶与具身推理,显示出跨领域的稳健泛化能力。
| GaugeVLM | 一种通过显式3D场景中的受控干预来结构化空间监督的视觉语言模型。 |
| GaugeDPO | GaugeVLM的核心训练目标,将测量误差转化为偏好边际以直接监督空间关系排序。 |
| 视觉语言模型 (VLM) | 能够同时处理视觉和语言信息的多模态模型,用于跨模态理解和推理。 |
| 空间关系 | 物体之间在三维空间中的相对位置或方向关系,如距离、方位等。 |
| 偏好边际 | 在偏好优化中,表示一个答案相对于另一个答案的优势程度,用于指导模型学习。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅