概率视角揭秘大模型:幻觉竟源于KL散度不对称!
The Probabilistic Structure of Large Language Models
arXiv LG (cs.LG) 重要 论文方法大模型理论 🕐 今天 12:00

📖 AI 总结

这篇论文从概率论视角对大型语言模型进行了系统性阐述,旨在将文献中通常分散讨论的工具整合为一个自洽的理论框架。作者将语言模型描述为token序列集合上的概率测度,通过自回归条件分布加以刻画;训练过程被形式化为最大似然估计问题,并以随机梯度方法求解,而文本生成则被视为对所得随机过程的序贯模拟。文章重点考察了KL散度不对称性在文本生成中的作用,并将其与幻觉现象以及统计合理性与真实性之间的区分联系起来。作为同一视角的补充说明,论文还讨论了基于得分函数的扩散模型,将生成过程理解为将噪声转化为数据的反向时间随机过程模拟,涵盖离散与连续时间两种情形。该研究为理解LLM的概率结构提供了统一的概念基础。

🔑 关键词速览

自回归条件分布描述序列中每个令牌基于之前所有令牌的条件概率分布,是LLM生成文本的核心机制。
最大似然估计一种统计方法,通过最大化观测数据出现的概率来估计模型参数,常用于LLM训练。
Kullback-Leibler散度衡量两个概率分布差异的非对称度量,在文本生成中用于分析模型分布与真实分布的偏差。
扩散模型一类生成模型,通过模拟逆向随机过程将噪声逐步转化为数据,与LLM的顺序生成方式不同。
得分函数对数概率密度的梯度,用于扩散模型中指导逆向过程从噪声恢复数据。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅