🔥 今日值得一读 多模态大模型幻觉真凶找到了!不是语言先验,是视觉错位,新方法只用0.9%数据性能全面碾压!
Beyond Language Priors: Diagnosing and Fixing Visual-Origin Hallucinations in Multimodal LLM
arXiv CV (cs.CV) 🔥 重点 #多模态#幻觉#诊断方法 🕐 09-02 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮助开发者识别和修复多模态模型中的视觉幻觉,提升图像文本对齐的可靠性。

📖 AI 总结

该研究挑战了多模态大语言模型(MLLM)中对象幻觉主要源于语言先验的既有观点,提出并验证了“视觉起源幻觉”这一互补性成因——即错误视觉特征提取及图像与文本嵌入错配导致幻觉。通过余弦相似度分析和Smooth Grad-CAM熵测量,研究发现幻觉样本的图像-文本相似度显著偏低(平均0.158对比-0.122),且注意力模式反转:目标存在时注意力分散,目标缺失时反而集中。基于此,作者提出对抗性对比微调(ACFT)方法,利用对抗性幻觉属性翻转(AHAF)生成精准对齐的正负样本对进行对比学习,同时揭示MLLM视觉表征接近幻觉决策边界。ACFT仅需COCO数据集0.9%的样本,零推理开销,在POPE、MME及四个描述级幻觉基准上达到SOTA性能,适用于LLaVA、MiniGPT-4和Qwen2.5-VL等多种模型。

🔑 关键词速览

多模态大语言模型 (MLLMs)能够同时处理文本和图像等多种模态信息的大型语言模型。
视觉起源幻觉 (Visual-Origin Hallucination)由于视觉特征提取错误或图像与文本嵌入错位导致的幻觉现象。
对抗性对比微调 (ACFT)一种利用对抗性扰动构建正负样本对进行对比学习的微调方法,用于减少幻觉。
对抗性幻觉属性翻转 (AHAF)通过最小化对抗扰动翻转图像的幻觉属性,以生成训练样本并诊断模型边界的方法。
平滑梯度加权类激活映射 (Smooth Grad-CAM)一种用于可视化模型注意力区域的技术,通过平滑梯度增强类激活映射的稳定性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅