这篇论文重新审视了大语言模型推理中token级确定性(certainty)与正确性之间的关系。作者通过跨模型、跨任务的受控实验发现,确定性在判断“某问题模型是否更可能答对”方面表现较好,但在区分“同一问题下正确与错误回答”方面能力较弱。确定性还随token类型及词内位置呈现系统性变化:问题难度的信息在生成早期出现,而关于答案正确性的较弱信息则集中在生成末尾。这些结果表明,确定性所提供信息的价值取决于预测目标、模型、确定性度量方式以及聚合时所纳入的token位置。基于此,作者提出在生成早期用确定性分配回答数量、在生成末尾用确定性为答案投票加权,相比固定采样多数投票基线,整体准确率从78.71%提升至79.54%,同时生成token成本降低82.4%。
| Token-level certainty | 指模型对每个生成token的置信度分数,常被用作正确性的代理指标。 |
| LLM reasoning | 大型语言模型在推理任务中生成逐步解答的过程。 |
| Test-time compute | 在推理阶段(而非训练阶段)分配的计算资源,用于提升模型输出质量。 |
| Majority voting | 一种集成方法,通过让模型生成多个答案并取多数结果来提高准确性。 |
| Certainty metric | 用于量化模型确定性的具体度量方式,如概率、熵或边际分数。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅