该研究探讨了多模态大语言模型(MLLMs)中任务无关文本对视觉判断任务的影响。通过设计受控干预实验,作者在保持提示结构不变的情况下改变辅助文本输入,发现无关文本会持续性地使模型预测产生偏差。研究引入基于二元候选对数概率差的决策边际来量化这种敏感性,并揭示了一个稳健的几何规律:上下文条件下的决策边际与无上下文边际之间存在一致的仿射变换关系。这表明无关文本的影响并非随机噪声,而是可估计的模型偏好扭曲。拟合的仿射参数可分别解释为视觉承诺保持度和方向性答案偏差指标。该发现为理解MLLMs中无关上下文效应提供了边际层面的诊断视角,并为后续噪声鲁棒性研究奠定基础。
| Multimodal Large Language Models (MLLMs) | 多模态大语言模型,能够同时处理文本和图像等多种模态信息的模型。 |
| Affine transformation | 仿射变换,一种线性变换加平移的数学操作,此处用于描述上下文对决策边界的系统性影响。 |
| Decision margin | 决策边界,基于二元候选对数概率差异定义的度量,用于量化模型预测的置信度或偏好强度。 |
| Visual commitment preservation | 视觉承诺保持,衡量模型在无关文本干扰下维持基于视觉信息判断的能力。 |
| Directional answer bias | 方向性答案偏差,指无关文本导致模型预测向特定答案方向偏移的系统性倾向。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅