🔥 今日值得一读 令牌预测如何重塑语言模型?新框架揭示其几何与下游性能的惊人关联!
Learning Representations through Token Prediction: Geometry, Approximation, and Downstream Guarantees
arXiv ML (stat.ML) 🔥 重点 #表示学习#Token预测#理论分析 🕐 09-01 12:00
👨‍💼 主理人解读 · 为什么值得关注
理解语言模型预训练原理,指导设计更有效的表示学习方法,提升下游任务性能。

📖 AI 总结

该论文提出一个统计框架,系统解释语言模型中“预测下一个词”这一预训练目标为何能产生广泛有用的表征。作者证明,在softmax预测头下,准确的token预测会依据不同token类型出现上下文分布的Hellinger距离来组织嵌入几何,误差受预测精度和token频率控制。同时,上下文表征为目标token的条件分布提供了低维坐标。论文引入自一致性原则,表明共享表征块的重复应用可逐步精炼上下文表征,且无需新增参数,并偏好那些能从上下文中稳定重建的表征。最后,作者建立了token生成、token社区恢复和线性探针分类的下游保证,展示预测精度和恢复的几何结构如何转化为预训练目标之外的性能。该研究从理论上解释了简单的token预测目标如何恢复语义几何并产生通用表征,并通过受控模拟验证了理论机制。

🔑 关键词速览

Token Prediction令牌预测,指预测序列中下一个或缺失令牌的任务,是语言模型预训练的核心目标。
Representation Geometry表示几何,指学习到的嵌入向量在空间中的结构关系,如距离和相似性。
Hellinger DistanceHellinger距离,一种衡量两个概率分布之间差异的度量,用于量化上下文分布相似性。
Self-Consistency Principle自一致性原则,指通过重复应用共享表示块来细化表示,无需额外参数,强调表示的稳定重建。
Linear Probe线性探针,一种简单分类器,用于评估预训练表示在下游任务中的线性可分性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅