🔥 今日值得一读 SAM训练省三成时间,精度不降反升!
Temperon: Full-Time SAM Quality at a Third Less Wall-Clock
arXiv LG (cs.LG) 🔥 重点 #训练方法#SAM#优化器#效率 🕐 09-17 12:00
👨‍💼 主理人解读 · 为什么值得关注
把昂贵的SAM训练只用在最后退火阶段,开发者可省约三分之一训练时间且精度不降。

📖 AI 总结

本文提出Temperon训练策略,针对锐度感知最小化(SAM)使每步训练成本翻倍、但收益主要集中在训练末期的问题,重新分配昂贵训练模式的使用时机。方法为:前43%的训练预算使用普通SGD探索,随后一次性切换,将整个最终余弦退火阶段交给SAM包装的Muon精炼器。在CIFAR-10/100、SVHN和Tiny ImageNet上(五个随机种子),Temperon在所有数据集上达到与全程SAM相当的精度,并在其中三个数据集上分别提前35%、34%和32%达到最难目标。消融实验表明,Muon精炼器单独贡献+0.85个百分点,而探索器的形状与重启机制无实际价值,作者据此撤回相关贡献声明。与最接近的晚期SAM方法对比显示,后者在中级目标上更快,但无法达到Muon精炼器带来的精度层级,在Tiny ImageNet上Muon无增益时对手直接胜出,界定了方法的适用边界。该分配规律可迁移至GPT-2预训练(节省29%墙钟时间)和GLUE微调。

🔑 关键词速览

Sharpness-Aware Minimization (SAM)一种优化方法,通过同时最小化损失和损失曲面的锐度来提高泛化能力,但会使每步训练成本翻倍。
Muon一种基于矩阵正交化的优化器,用于神经网络训练,在实验中表现出比 SGD 更好的性能。
Cosine Annealing一种学习率调度策略,学习率按余弦函数从初始值逐渐降至零,常用于训练后期。
Epoch Budget训练过程中计划的总 epoch 数,代表计算资源的分配。
Wall-Clock Time实际经过的挂钟时间,用于衡量训练过程的真实耗时。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅