本文综合分析了三项看似无关的大语言模型可靠性研究,指出它们共同指向一个缺失的能力:校准弃权(calibrated abstention)。Yin等人发现推理强化学习会破坏工具可靠性表征;Suleymanov等人发现安全约束生成下大模型改写被标记内容而小模型直接截断;Bastounis等人则从递归论角度证明,任何缺乏隐式“我不知道”功能的一致性推理系统必然在广泛问题上无限次产生幻觉。作者认为,这三项发现分别揭示了能力缺口、策略缺口和递归论缺口,但根源不同却收敛于同一干预方向。尽管诚实性后训练已缩小了部署模型中的差距,但主流基准对“拒绝回答”给予零奖励,导致排行榜梯度无法选出该功能。为此,作者提出四项评估改革:三重评分、弃权率报告、能力分层评估和强制校准指标,并强调基准改革是必要而非充分条件。
| 校准弃权 (Calibrated Abstention) | 模型在不确定时选择不回答,且弃权决策与自身置信度校准一致的能力。 |
| 推理强化学习 (Reasoning RL) | 通过强化学习训练大语言模型进行多步推理的方法,但可能损害工具可靠性表征。 |
| 安全约束生成 (Safety-Constrained Generation) | 在生成过程中施加安全约束,要求模型避免输出有害内容,不同规模模型应对方式不同。 |
| 递归论差距 (Recursion-Theoretic Gap) | 由Bastounis等人证明的、任何一致推理系统若缺乏“我不知道”功能则必然频繁幻觉的理论缺陷。 |
| 三重评分 (Triple-Scoring) | 评估时同时考虑正确回答、错误回答和弃权三种结果,而非仅关注正确率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅