这篇论文从概率论视角对大型语言模型进行了系统性阐述,旨在将文献中通常分散讨论的工具整合为一个自洽的理论框架。作者将语言模型描述为token序列集合上的概率测度,通过自回归条件分布加以刻画;训练过程被形式化为最大似然估计问题,并以随机梯度方法求解,而文本生成则被视为对所得随机过程的序贯模拟。文章重点考察了KL散度不对称性在文本生成中的作用,并将其与幻觉现象以及统计合理性与真实性之间的区分联系起来。作为同一视角的补充说明,论文还讨论了基于得分函数的扩散模型,将生成过程理解为将噪声转化为数据的反向时间随机过程模拟,涵盖离散与连续时间两种情形。该研究为理解LLM的概率结构提供了统一的概念基础。
| 自回归条件分布 | 描述序列中每个令牌基于之前所有令牌的条件概率分布,是LLM生成文本的核心机制。 |
| 最大似然估计 | 一种统计方法,通过最大化观测数据出现的概率来估计模型参数,常用于LLM训练。 |
| Kullback-Leibler散度 | 衡量两个概率分布差异的非对称度量,在文本生成中用于分析模型分布与真实分布的偏差。 |
| 扩散模型 | 一类生成模型,通过模拟逆向随机过程将噪声逐步转化为数据,与LLM的顺序生成方式不同。 |
| 得分函数 | 对数概率密度的梯度,用于扩散模型中指导逆向过程从噪声恢复数据。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅