这篇论文提出了一种关于大语言模型(LLM)如何整合外部证据的分布性理论。作者认为,证据的引入会改变接收者(模型)对初始答案的分布,其效果取决于接收者的先验权重和候选证据的倾斜度。基于此,研究得出三个核心预测:模型更倾向于接受其本身认为更可能的候选答案;模型更容易整合自身特征性错误而非外部来源的陌生错误;以及相同的证据可能提升较弱模型的表现,却反而损害较强模型。研究通过超过一千万次试验、涵盖四个家族的十二种LLM及八个领域(包括量子力学、物理学、遗传学和分子生物学等科学发现任务)验证了这些预测。关键发现是,证据整合是一种由接收者特性决定的控制策略,而非对证据源的简单信任。因果干预实验表明,该过程发生在网络后期,且验证的神经表征与实际的答案整合在因果上可分离。
| LLMs | 大型语言模型,如GPT系列,用于处理和生成自然语言。 |
| retrieval-augmented generation | 检索增强生成,一种结合外部知识检索的生成方法。 |
| receiver prior weight | 接收者先验权重,指模型对初始答案的偏好程度。 |
| candidate evidence tilt | 候选证据倾斜,指证据对答案分布的影响方向。 |
| J-lens decomposition | 一种分析工具,用于分解模型内部状态,以区分不同功能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅