🔥 今日值得一读 Polyak动量让大批量训练临界批量翻倍,Nesterov竟更省数据!
Momentum in large-batch training: Polyak enlarges the critical batch size, Nesterov improves data efficiency
arXiv ML (stat.ML) 🔥 重点 #优化算法#训练方法#理论分析 🕐 09-03 12:00
👨‍💼 主理人解读 · 为什么值得关注
这篇论文帮你理解如何选择动量方法:若用大批量训练,Polyak动量可稳定训练;若数据有限,Nesterov动量能提高数据利用率。

📖 AI 总结

该研究探讨了在大批量训练中,动量方法如何影响模型性能,以幂律核回归作为分析框架。作者通过定义临界学习率来刻画训练稳定性,发现SGD、Polyak动量和Nesterov动量各有不同的稳定边界,其中Nesterov的临界学习率受容量指数影响。在稳定区域内,研究推导了风险动态的标度律,涵盖早期瞬态、幂律衰减和噪声平台三个阶段。通过固定数据预算优化最终风险,论文给出了批次大小的三相图,揭示动量作用随批次规模的变化。关键发现是:Polyak动量能扩大临界批次大小,即在保持数据效率的同时允许更大并行度;而Nesterov动量凭借前瞻机制抑制噪声累积,在大批量场景下数据效率更优。数值实验验证了理论预测的稳定性边界、风险动态和相图划分。

🔑 关键词速览

Polyak momentum一种动量方法,通过累积历史梯度方向来加速收敛,其更新规则简单,常用于标准动量优化。
Nesterov momentum一种改进的动量方法,通过前瞻一步计算梯度,能更好地抑制噪声,提高数据效率。
critical batch size在保持最佳数据效率(即数据缩放指数)的前提下,可以使用的最大批量大小。
power-law kernel regression一种使用核方法进行回归分析的模型,其学习曲线遵循幂律衰减,用于理论分析训练动态。
one-pass regime训练过程中每个样本仅被使用一次的场景,常见于大规模数据流或在线学习。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅