该论文提出一个统计框架,系统解释语言模型中“预测下一个词”这一预训练目标为何能产生广泛有用的表征。作者证明,在softmax预测头下,准确的token预测会依据不同token类型出现上下文分布的Hellinger距离来组织嵌入几何,误差受预测精度和token频率控制。同时,上下文表征为目标token的条件分布提供了低维坐标。论文引入自一致性原则,表明共享表征块的重复应用可逐步精炼上下文表征,且无需新增参数,并偏好那些能从上下文中稳定重建的表征。最后,作者建立了token生成、token社区恢复和线性探针分类的下游保证,展示预测精度和恢复的几何结构如何转化为预训练目标之外的性能。该研究从理论上解释了简单的token预测目标如何恢复语义几何并产生通用表征,并通过受控模拟验证了理论机制。
| Token Prediction | 令牌预测,指预测序列中下一个或缺失令牌的任务,是语言模型预训练的核心目标。 |
| Representation Geometry | 表示几何,指学习到的嵌入向量在空间中的结构关系,如距离和相似性。 |
| Hellinger Distance | Hellinger距离,一种衡量两个概率分布之间差异的度量,用于量化上下文分布相似性。 |
| Self-Consistency Principle | 自一致性原则,指通过重复应用共享表示块来细化表示,无需额外参数,强调表示的稳定重建。 |
| Linear Probe | 线性探针,一种简单分类器,用于评估预训练表示在下游任务中的线性可分性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅