该研究揭示了Transformer训练中权重规模增长与数据可预测性之间的定量关系。作者发现,训练后Transformer的权重幅度可用双参数Weibull分布概括,其中形状参数k≈1.2在不同层和模型间保持稳定,而尺度参数λ承载了大部分训练引起的变动。通过使用训练前即可计算的二元条件熵D作为数据统计量,研究建立了学习率条件化的增长定律:λ²-λ₀² = C₀(η) + C₁(η)(H_r-D)^0.59,其中凸指数0.59源自独立测量的数据侧饱和关系。去除每学习率两个系数后,跨越一个数量级学习率的23次运行数据均坍缩到(H_r-D)^0.59曲线上(R²=0.941)。由于D在训练前即可获得,该定律可作为前向预测器,端到端验证显示对保留数据的权重增长预测相对误差仅5.7%。该框架在模型级和逐层分辨率下均成立,并适用于两种架构,但跨语料预测对代码数据存在过度预测,暗示冗余性构成数据到权重框架的第二维度。
| Weibull distribution | 一种概率分布,常用于描述寿命或强度数据,此处用于概括Transformer权重的幅度分布。 |
| bigram conditional entropy | 基于相邻词对的统计量,衡量给定前一个词时下一个词的不确定性,用于刻画语料的可预测性。 |
| learning-rate-conditioned law | 一种依赖于学习率的经验规律,描述权重增长与语料属性之间的关系。 |
| shuffle baseline | 通过打乱语料顺序得到的基准值,用于对比原始语料的统计特性。 |
| data-to-weight framework | 一个理论框架,旨在建立语料属性(如可预测性、冗余性)与训练后模型权重之间的映射关系。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅