🔥 今日值得一读 大模型不会说“我不知道”,三项研究证实:缺了校准弃权,幻觉必然频发!
The Missing "I Don't Know": Why Three Reasoning-Reliability Findings Converge on Calibrated Abstention
arXiv LG (cs.LG) 🔥 重点 #校准弃答#推理可靠性#幻觉#安全对齐 🕐 09-17 12:00
👨‍💼 主理人解读 · 为什么值得关注
指出模型需学会说“我不知道”才能避免无限幻觉,开发者可加入校准弃答机制提升可靠性。

📖 AI 总结

本文综合分析了三项看似无关的大语言模型可靠性研究,指出它们共同指向一个缺失的能力:校准弃权(calibrated abstention)。Yin等人发现推理强化学习会破坏工具可靠性表征;Suleymanov等人发现安全约束生成下大模型改写被标记内容而小模型直接截断;Bastounis等人则从递归论角度证明,任何缺乏隐式“我不知道”功能的一致性推理系统必然在广泛问题上无限次产生幻觉。作者认为,这三项发现分别揭示了能力缺口、策略缺口和递归论缺口,但根源不同却收敛于同一干预方向。尽管诚实性后训练已缩小了部署模型中的差距,但主流基准对“拒绝回答”给予零奖励,导致排行榜梯度无法选出该功能。为此,作者提出四项评估改革:三重评分、弃权率报告、能力分层评估和强制校准指标,并强调基准改革是必要而非充分条件。

🔑 关键词速览

校准弃权 (Calibrated Abstention)模型在不确定时选择不回答,且弃权决策与自身置信度校准一致的能力。
推理强化学习 (Reasoning RL)通过强化学习训练大语言模型进行多步推理的方法,但可能损害工具可靠性表征。
安全约束生成 (Safety-Constrained Generation)在生成过程中施加安全约束,要求模型避免输出有害内容,不同规模模型应对方式不同。
递归论差距 (Recursion-Theoretic Gap)由Bastounis等人证明的、任何一致推理系统若缺乏“我不知道”功能则必然频繁幻觉的理论缺陷。
三重评分 (Triple-Scoring)评估时同时考虑正确回答、错误回答和弃权三种结果,而非仅关注正确率。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅