该研究由苹果机器学习团队发表,探讨了大语言模型在概率信念更新上是否具备贝叶斯一致性。作者将LLM视为信息处理规则,通过衡量其更新过程与贝叶斯更新的偏差,系统评估了模型内部的一致性。实验覆盖多种证据整合方式,发现部分方法接近最优贝叶斯更新,而另一些则依赖学习启发式。令人意外的是,非贝叶斯启发式更新在下游任务表现上往往优于精确贝叶斯更新,这暗示LLM对世界的概率模型存在设定偏差。此外,该测量方法可作为诊断工具,帮助识别基于LLM的推理系统中的潜在问题。研究为理解LLM不确定性推理机制提供了新视角,对提升模型在医疗、科学等复杂领域的可靠性具有重要意义。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅