该研究针对视觉语言模型LLaVA-1.5-7B在图像描述中产生对象幻觉的问题,提出了一种从可解释性诊断到定向干预的完整流程。研究者通过分析注意力头在幻觉对象词出现时的图像注意力下降情况,筛选出32个关键注意力头,并对其施加两种干预:头切片LoRA适配器和推理时接地控制器。在400张COCO图像上的实验显示,该方法将CHAIRs从0.370降至0.230,CHAIRi从0.156降至0.096,且通过随机头对照实验证实了头部选择的有效性而非LoRA容量作用。值得注意的是,幻觉减少效果随解码预算增加而增强,排除了截断伪影的可能,但同时也导致对象召回率从0.78降至0.70。该研究不仅提供了诊断到干预的实用管线,更通过受控实验揭示了干预位点的真实杠杆作用,为理解多模态模型幻觉机制提供了行为层面的细致刻画。
| LLaVA | 一种视觉语言模型,结合视觉编码器和语言模型,用于图像描述等任务。 |
| CHAIRs | 衡量包含幻觉物体的描述比例的指标。 |
| CHAIRi | 衡量幻觉物体提及次数的比例的指标。 |
| LoRA | 一种参数高效的微调方法,通过低秩矩阵适配器调整模型权重。 |
| 注意力头 | 多头注意力机制中的独立注意力单元,每个头关注输入的不同方面。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅