🔥 今日值得一读 大模型藏了个“无知方向”:一句话暴露它靠猜还是靠推理!
The Geometry of Ignorance: LLMs Know When to Temper Bayesian Priors
arXiv LG (cs.LG) 🔥 重点 #Transformer#可解释性#LLM 🕐 09-04 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可借此理解模型在低信息场景下的预测行为,用于改进不确定性估计或设计更合理的默认输出策略。

📖 AI 总结

该研究揭示了大语言模型在信息不足时如何依赖训练语料的词频分布作为贝叶斯先验。作者发现,在Llama、Qwen、Gemma和Pythia四个模型家族(参数规模从0.4B到405B)的解嵌入矩阵中,存在一个统一的“无知方向”,编码了语料库的单字分布。通过将最终预测状态投影到该方向,可得到逐词元的先验载荷因子λ,该因子随上下文信息量增加而稳定下降。这一投影将预测状态分解为两个正交向量,恰好对应温度化贝叶斯更新的两个因子:以λ为指数的单字先验和上下文驱动的似然。研究还表明,该方向具有因果活性,调整λ可有效引导预测结果在KL散度上趋近或偏离先验。这一几何-概率框架使λ在不同模型间具有可比性,并发现更大模型在高上下文情境下对先验的依赖更低。

🔑 关键词速览

unembedding geometry解嵌入几何,指语言模型输出层中解嵌入矩阵的结构特性,用于解释预测行为。
direction of ignorance无知方向,解嵌入矩阵中编码训练语料单字分布的方向,代表模型在不确定时的先验。
prior loading factor (λ)先验加载因子,衡量模型预测状态对单字先验依赖程度的标量,通过投影计算。
tempered Bayesian update温度调节的贝叶斯更新,一种将先验和似然以指数形式结合的更新规则,此处用于解释模型预测的组成。
KL divergenceKL散度,衡量两个概率分布差异的指标,用于评估预测分布与先验分布的接近程度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅