无关文本竟能稳定扭曲多模态大模型判断!仿射规律揭示预测偏差可量化
When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models
arXiv CL (cs.CL) 重要 #多模态#上下文干扰#鲁棒性分析 🕐 08-21 12:00
👨‍💼 主理人解读 · 为什么值得关注
研究无关文本对多模态LLM视觉判断的影响,通过仿射边界偏移量化干扰,提升模型鲁棒性。

📖 AI 总结

该研究探讨了多模态大语言模型(MLLMs)中任务无关文本对视觉判断任务的影响。通过设计受控干预实验,作者在保持提示结构不变的情况下改变辅助文本输入,发现无关文本会持续性地使模型预测产生偏差。研究引入基于二元候选对数概率差的决策边际来量化这种敏感性,并揭示了一个稳健的几何规律:上下文条件下的决策边际与无上下文边际之间存在一致的仿射变换关系。这表明无关文本的影响并非随机噪声,而是可估计的模型偏好扭曲。拟合的仿射参数可分别解释为视觉承诺保持度和方向性答案偏差指标。该发现为理解MLLMs中无关上下文效应提供了边际层面的诊断视角,并为后续噪声鲁棒性研究奠定基础。

🔑 关键词速览

Multimodal Large Language Models (MLLMs)多模态大语言模型,能够同时处理文本和图像等多种模态信息的模型。
Affine transformation仿射变换,一种线性变换加平移的数学操作,此处用于描述上下文对决策边界的系统性影响。
Decision margin决策边界,基于二元候选对数概率差异定义的度量,用于量化模型预测的置信度或偏好强度。
Visual commitment preservation视觉承诺保持,衡量模型在无关文本干扰下维持基于视觉信息判断的能力。
Directional answer bias方向性答案偏差,指无关文本导致模型预测向特定答案方向偏移的系统性倾向。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅