该研究探讨了大语言模型在语言不确定性量化方面与人类的差异。人类通过"可能""很可能"等语言标记表达不确定性,这种能力反映元认知监控,即对自身知识边界的认知。然而,现有大模型不确定性量化方法多依赖概率或一致性信号,忽视了语言标记的作用。研究者从心理学和决策科学文献中整理出人类不确定性标记语料库,将大模型与之对比,发现大模型为语言不确定性标记赋予的数值水平与人类存在显著差异。为此,研究提出一种基于优化的算法,直接从模型输出中学习各不确定性标记的最优概率映射,无需重复采样即可揭示每个标记应传达的概率质量。该方法实现了人类与大模型在标记层面的置信语义直接比较,分离出二者之间的错配,并揭示语言表达中系统性的置信度差异。
| 不确定性量化 (UQ) | 量化模型预测中不确定性的过程,通常用于评估模型可靠性。 |
| 口头不确定性标记词 | 如“可能”、“很可能”等词语,用于自然语言中表达不确定程度。 |
| 元认知监控 | 个体对自身认知过程的监控和调节,包括知道自己知道什么或不知道什么。 |
| METHODNAME | 本文提出的一种基于优化的算法,用于从LLM输出中学习不确定性标记词的最优不确定性映射。 |
| 置信语义 | 语言表达中所蕴含的关于置信程度或不确定性的意义。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅