本文提出Temperon训练策略,针对锐度感知最小化(SAM)使每步训练成本翻倍、但收益主要集中在训练末期的问题,重新分配昂贵训练模式的使用时机。方法为:前43%的训练预算使用普通SGD探索,随后一次性切换,将整个最终余弦退火阶段交给SAM包装的Muon精炼器。在CIFAR-10/100、SVHN和Tiny ImageNet上(五个随机种子),Temperon在所有数据集上达到与全程SAM相当的精度,并在其中三个数据集上分别提前35%、34%和32%达到最难目标。消融实验表明,Muon精炼器单独贡献+0.85个百分点,而探索器的形状与重启机制无实际价值,作者据此撤回相关贡献声明。与最接近的晚期SAM方法对比显示,后者在中级目标上更快,但无法达到Muon精炼器带来的精度层级,在Tiny ImageNet上Muon无增益时对手直接胜出,界定了方法的适用边界。该分配规律可迁移至GPT-2预训练(节省29%墙钟时间)和GLUE微调。
| Sharpness-Aware Minimization (SAM) | 一种优化方法,通过同时最小化损失和损失曲面的锐度来提高泛化能力,但会使每步训练成本翻倍。 |
| Muon | 一种基于矩阵正交化的优化器,用于神经网络训练,在实验中表现出比 SGD 更好的性能。 |
| Cosine Annealing | 一种学习率调度策略,学习率按余弦函数从初始值逐渐降至零,常用于训练后期。 |
| Epoch Budget | 训练过程中计划的总 epoch 数,代表计算资源的分配。 |
| Wall-Clock Time | 实际经过的挂钟时间,用于衡量训练过程的真实耗时。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅