不用标注数据,让模型自己“喊停”!免费置信度信号竟和人工标注效果持平,1B-8B模型实测无差异!
Can a Model Catch Its Own Hallucinations for Free?: Label-Free Doubt Signals Hold Their Own Against a Labelled Dataset for Abstention
arXiv CL (cs.CL) 重要 大模型幻觉论文方法 🕐 08-28 12:00

📖 AI 总结

该研究探讨了大语言模型能否利用自身内部置信度信号(即模型对自己答案的把握程度)来识别幻觉,而无需依赖标注数据。传统方法需要构建包含正确与错误答案的标注数据集来训练模型学会弃答,而该研究提出仅凭模型自身置信度即可实现类似效果。研究者使用LoRA微调六个开源模型(1B-8B参数规模),在短事实问答任务上,让模型在高置信度时作答、低置信度时输出"不确定"。结果显示,这种无标签方法在覆盖率匹配时与基于标签监督的弃答训练表现无统计显著差异。对照实验表明,强化训练困难样本而非弃答并无帮助,说明效果来自校准而非死记硬背。该方法的局限在于无法识别模型自信但实际错误的情况。研究结论是模型自身的不确定性信号可作为标注数据集的近乎免费替代方案。

🔑 关键词速览

LoRA低秩适配,一种参数高效的微调方法,通过更新少量额外参数来适应新任务。
abstention弃权,指模型在不确定时选择不回答而非给出可能错误的答案。
label-free无标签,指不使用人工标注的正确/错误答案数据。
calibration校准,指模型预测的置信度与其实际正确率之间的一致性。
open-weights models开放权重模型,指权重公开可获取的大语言模型,如Llama、Mistral等。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅