🔥 今日值得一读 发现预训练核心规律:学习率与参数范数比值ELR主导损失动态,跨模型误差低至千分之几!
Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining
arXiv ML (stat.ML) 🔥 重点 #训练方法#学习率#语言模型 🕐 09-02 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可通过匹配有效学习率来预测和优化预训练损失,减少调参成本。

📖 AI 总结

该研究揭示了语言模型预训练中的一个关键现象:有效学习率(ELR)崩溃。作者发现,学习率与参数范数的比值——即有效学习率——才是真正主导损失动态的核心变量。当不同训练运行的有效学习率保持一致时,尽管学习率和参数范数差异显著,其损失轨迹仍会在整个训练过程中高度重合。这一发现在不同优化器、架构、数据集和模型规模下均成立,平均崩溃误差仅为10^-3量级,低于随机种子带来的波动。研究进一步表明,权重衰减和超球形状主要通过其诱导的有效学习率调度来影响损失动态。基于有效学习率的函数缩放定律还能跨范数控制方法迁移,并解释了范数控制引发的延迟加速现象。这些结果确立了有效学习率作为连接学习率调度、范数控制与损失动态的统一坐标,为理解和优化语言模型预训练提供了新视角。

🔑 关键词速览

ELR (Effective Learning Rate)有效学习率,即学习率与参数范数的比值,是控制损失动态的关键量。
ELR collapseELR坍缩,指当不同运行的有效学习率匹配时,损失轨迹在训练中趋于一致的现象。
FSL (Functional Scaling Law)函数缩放定律,一种描述模型性能随训练参数变化的数学关系,此处基于ELR进行拟合。
Weight decay权重衰减,一种正则化技术,通过惩罚大权重来影响训练动态和ELR调度。
Norm control范数控制,指对参数范数进行调节的方法,如权重归一化或超球约束,影响ELR和损失动态。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅