该研究挑战了多模态大语言模型(MLLM)中对象幻觉主要源于语言先验的既有观点,提出并验证了“视觉起源幻觉”这一互补性成因——即错误视觉特征提取及图像与文本嵌入错配导致幻觉。通过余弦相似度分析和Smooth Grad-CAM熵测量,研究发现幻觉样本的图像-文本相似度显著偏低(平均0.158对比-0.122),且注意力模式反转:目标存在时注意力分散,目标缺失时反而集中。基于此,作者提出对抗性对比微调(ACFT)方法,利用对抗性幻觉属性翻转(AHAF)生成精准对齐的正负样本对进行对比学习,同时揭示MLLM视觉表征接近幻觉决策边界。ACFT仅需COCO数据集0.9%的样本,零推理开销,在POPE、MME及四个描述级幻觉基准上达到SOTA性能,适用于LLaVA、MiniGPT-4和Qwen2.5-VL等多种模型。
| 多模态大语言模型 (MLLMs) | 能够同时处理文本和图像等多种模态信息的大型语言模型。 |
| 视觉起源幻觉 (Visual-Origin Hallucination) | 由于视觉特征提取错误或图像与文本嵌入错位导致的幻觉现象。 |
| 对抗性对比微调 (ACFT) | 一种利用对抗性扰动构建正负样本对进行对比学习的微调方法,用于减少幻觉。 |
| 对抗性幻觉属性翻转 (AHAF) | 通过最小化对抗扰动翻转图像的幻觉属性,以生成训练样本并诊断模型边界的方法。 |
| 平滑梯度加权类激活映射 (Smooth Grad-CAM) | 一种用于可视化模型注意力区域的技术,通过平滑梯度增强类激活映射的稳定性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅