这篇论文针对大语言模型在高风险决策中难以判断自身答案是否可信的问题,提出了一种名为 U-Space 的可解释不确定性量化方法。现有方法多依赖重复生成或额外训练组件,且仅给出标量分数,无法揭示不确定性在推理过程中何时出现、如何演变;同时,生成文本长度本身也可能与不确定性估计和正确性高度相关,削弱了估计器的实际价值。作者借助机制可解释性,识别出表达“怀疑”与“确定”的语义锚点,将其反嵌入方向映射回残差空间并构造正交基,再通过 U-Lens 把每个 token 状态投影到该基上,得到可解释的 token 级不确定性图,并可聚合成标量置信分数。该方法无需正确性标签、重复生成或训练。在推理基准测试中,其置信分数在标准与长度控制两种评估下均优于已有基线,且比监督式估计器具有更好的迁移性。
| U-Space | 一种低维子空间,用于使语言模型在推理过程中不断演变的不确定性变得可测量和可解释。 |
| U-Lens | 一种将每个 token 状态投影到 U-Space 基向量上的方法,生成可解释的 token 级不确定性图。 |
| 不确定性量化 | 估计单个预测可靠性的技术,旨在解决语言模型自信地给出错误答案的问题。 |
| 机制可解释性 | 将人类可解释的概念与模型内部中间状态联系起来的研究方向,用于理解模型行为。 |
| 残差空间 | 语言模型内部表示的空间,U-Space 通过将语义锚点的反嵌入方向映射到此空间来构建。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅