LLM幻觉检测新突破:单遍方法性能碾压现有基线!
Detecting Hallucination in LLMs: Tracing the Topological Signatures of Impaired Context Sharing
arXiv AI (cs.AI) 重要 安全对齐可解释性论文方法 🕐 今天 12:00

📖 AI 总结

该研究从注意力图的信息流拓扑结构入手,探索区分大语言模型幻觉与非幻觉回答的方法。作者利用Forman-Ricci曲率识别注意力图中的信息瓶颈,并提出一种同时捕捉注意力头半局部与全局信息流特征的单次推理检测方法。在多个大语言模型和两个幻觉检测基准上的实验表明,该方法相较现有基于注意力和多响应基线取得一致提升,并在不同模型架构上保持竞争力。分析进一步揭示,因果生成过程中词元间上下文共享受损与幻觉高度相关:幻觉回答往往过度依赖自注意力、对早期词元的上下文检索分散,或在最终Transformer层出现信息过度压缩。该工作为理解幻觉的机制成因提供了拓扑视角,也为高效检测提供了新思路。

🔑 关键词速览

Forman-Ricci曲率一种离散曲率度量,用于分析图结构中的几何特性,此处用于识别注意力图中的信息瓶颈。
注意力图表示Transformer模型中注意力权重的图结构,节点为令牌,边为注意力连接。
信息瓶颈指信息流动受阻或压缩的区域,可能导致模型无法有效利用上下文信息。
信息过度压缩指在信息传递过程中,过多信息被压缩,导致关键细节丢失的现象。
单遍方法指仅需一次前向传播即可完成检测的方法,无需多次生成响应。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅