🔥 今日值得一读 LLaVA幻觉率直降38%!揪出32个关键注意力头,精准修复图像描述错误
Targeting the Attention Heads Behind Object Hallucination in LLaVA
arXiv CV (cs.CV) 🔥 重点 #多模态#安全对齐 🕐 08-27 12:00
👨‍💼 主理人解读 · 为什么值得关注
这篇论文定位了视觉语言模型幻觉的根源,开发者可据此调整注意力头,减少错误描述。

📖 AI 总结

该研究针对视觉语言模型LLaVA-1.5-7B在图像描述中产生对象幻觉的问题,提出了一种从可解释性诊断到定向干预的完整流程。研究者通过分析注意力头在幻觉对象词出现时的图像注意力下降情况,筛选出32个关键注意力头,并对其施加两种干预:头切片LoRA适配器和推理时接地控制器。在400张COCO图像上的实验显示,该方法将CHAIRs从0.370降至0.230,CHAIRi从0.156降至0.096,且通过随机头对照实验证实了头部选择的有效性而非LoRA容量作用。值得注意的是,幻觉减少效果随解码预算增加而增强,排除了截断伪影的可能,但同时也导致对象召回率从0.78降至0.70。该研究不仅提供了诊断到干预的实用管线,更通过受控实验揭示了干预位点的真实杠杆作用,为理解多模态模型幻觉机制提供了行为层面的细致刻画。

🔑 关键词速览

LLaVA一种视觉语言模型,结合视觉编码器和语言模型,用于图像描述等任务。
CHAIRs衡量包含幻觉物体的描述比例的指标。
CHAIRi衡量幻觉物体提及次数的比例的指标。
LoRA一种参数高效的微调方法,通过低秩矩阵适配器调整模型权重。
注意力头多头注意力机制中的独立注意力单元,每个头关注输入的不同方面。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅