AdamW换新动量,训练步数狂减46%!方向感知更新,即插即用零负担
DeltaMomentum: A Key-Value based Anisotropic Momentum Update via Delta Rule
arXiv LG (cs.LG) #优化器#动量更新#深度学习 🕐 08-21 12:00
👨‍💼 主理人解读 · 为什么值得关注
提出DeltaMomentum优化器,基于Delta规则实现各向异性动量更新,适应梯度方向分布不均。

📖 AI 总结

DeltaMomentum提出了一种基于键值结构和delta规则的新型动量更新方法,旨在解决传统指数移动平均(EMA)动量在深度网络训练中忽视梯度方向异质性的问题。该方法利用线性层梯度可分解为输入键和输出误差值的特性,通过delta规则动态调整每个方向的遗忘速率,使频繁出现的梯度方向被更慢遗忘,而罕见方向被更快清除。理论证明该方法无需矩阵求逆即可实现输入侧曲率校正,并在固定或漂移最优解下均能比EMA更快清除过时方向。实验显示,在FineWeb-Edu预训练中,DeltaAdamW相比标准AdamW在67M和370M参数规模下分别节省最多46.39%和22.12%的训练步数,且优势在1B规模下持续存在;在CIFAR-10上的SGD、ResNet-18和ViT-Tiny实验中同样表现优异。该方法可作为任意优化器的即插即用组件,额外计算开销仅为门控MLP线性成本的22.2%至25.0%,且无需持久内存。

🔑 关键词速览

DeltaMomentum一种新的动量更新方法,利用键值结构通过增量规则实现方向感知的动量更新。
Anisotropic各向异性,指训练中不同方向被查询的频率差异大,导致梯度分布不均匀。
Delta rule增量规则,一种基于误差调整权重的学习规则,此处用于更新动量缓冲区。
μP (Maximal Update Parametrization)最大更新参数化,一种超参数转移方法,使模型宽度变化时超参数保持有效。
EMA (Exponential Moving Average)指数移动平均,一种常用的动量更新方式,以固定速率平均历史梯度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅