🔥 今日值得一读 LLM推理确定性大反转:准确率仅提0.83%,token成本却暴降82.4%!
Certainty Is Not Just Correctness: Rethinking Token-Level Certainty in LLM Reasoning
arXiv CL (cs.CL) 🔥 重点 #不确定性量化#推理#评测基准 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮助开发者正确理解和使用token置信度,避免误把确定性当正确性做筛选。

📖 AI 总结

这篇论文重新审视了大语言模型推理中token级确定性(certainty)与正确性之间的关系。作者通过跨模型、跨任务的受控实验发现,确定性在判断“某问题模型是否更可能答对”方面表现较好,但在区分“同一问题下正确与错误回答”方面能力较弱。确定性还随token类型及词内位置呈现系统性变化:问题难度的信息在生成早期出现,而关于答案正确性的较弱信息则集中在生成末尾。这些结果表明,确定性所提供信息的价值取决于预测目标、模型、确定性度量方式以及聚合时所纳入的token位置。基于此,作者提出在生成早期用确定性分配回答数量、在生成末尾用确定性为答案投票加权,相比固定采样多数投票基线,整体准确率从78.71%提升至79.54%,同时生成token成本降低82.4%。

🔑 关键词速览

Token-level certainty指模型对每个生成token的置信度分数,常被用作正确性的代理指标。
LLM reasoning大型语言模型在推理任务中生成逐步解答的过程。
Test-time compute在推理阶段(而非训练阶段)分配的计算资源,用于提升模型输出质量。
Majority voting一种集成方法,通过让模型生成多个答案并取多数结果来提高准确性。
Certainty metric用于量化模型确定性的具体度量方式,如概率、熵或边际分数。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅