该研究揭示了语言模型预训练中的一个关键现象:有效学习率(ELR)崩溃。作者发现,学习率与参数范数的比值——即有效学习率——才是真正主导损失动态的核心变量。当不同训练运行的有效学习率保持一致时,尽管学习率和参数范数差异显著,其损失轨迹仍会在整个训练过程中高度重合。这一发现在不同优化器、架构、数据集和模型规模下均成立,平均崩溃误差仅为10^-3量级,低于随机种子带来的波动。研究进一步表明,权重衰减和超球形状主要通过其诱导的有效学习率调度来影响损失动态。基于有效学习率的函数缩放定律还能跨范数控制方法迁移,并解释了范数控制引发的延迟加速现象。这些结果确立了有效学习率作为连接学习率调度、范数控制与损失动态的统一坐标,为理解和优化语言模型预训练提供了新视角。
| ELR (Effective Learning Rate) | 有效学习率,即学习率与参数范数的比值,是控制损失动态的关键量。 |
| ELR collapse | ELR坍缩,指当不同运行的有效学习率匹配时,损失轨迹在训练中趋于一致的现象。 |
| FSL (Functional Scaling Law) | 函数缩放定律,一种描述模型性能随训练参数变化的数学关系,此处基于ELR进行拟合。 |
| Weight decay | 权重衰减,一种正则化技术,通过惩罚大权重来影响训练动态和ELR调度。 |
| Norm control | 范数控制,指对参数范数进行调节的方法,如权重归一化或超球约束,影响ELR和损失动态。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅