本文关注视觉语言模型在图像发生细微变化时推理结果不稳定的问题。研究发现,日常图像采集与处理带来的微小扰动,即便图像看起来几乎相同,也可能改变模型的推理轨迹;在长序列生成中,激活偏移会逐步累积,最终导致答案翻转。为此,作者提出FlipDir,一种无需训练的推理时方法,通过对比原始输入与引发答案翻转的输入,估计出低秩的翻转诱导激活子空间,并在解码过程中选择性地干预隐藏状态,同时用基于间隔的门控将干预限制在不确定的解码步骤,从而恢复原本正确的预测并保留稳定输出。为评估鲁棒性,作者还构建了VisFlip基准,覆盖科学推理、机器人场景理解和医学视觉问答等九个数据集与扰动组合,可分别衡量原预测的恢复与稳定预测的保持。在18种设置下,FlipDir在综合指标上均优于现有方法。
| Vision-language models (VLMs) | 视觉语言模型,能够同时处理图像和文本信息并进行跨模态推理的AI模型。 |
| Answer flips | 答案翻转,指模型对几乎相同的输入图像因细微变化而给出不同最终答案的现象。 |
| FlipDir (Flip-Direction Steering) | 翻转方向引导,一种无需训练的推理时方法,通过引导隐藏状态来减少答案翻转。 |
| Low-rank flip-inducing activation subspace | 低秩翻转诱导激活子空间,从对比样本中估计出的导致答案翻转的隐藏状态变化方向。 |
| VisFlip | 一个评估视觉语言模型鲁棒性的基准框架,通过构建评估组来分别衡量预测恢复和稳定保留。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅