DeltaMomentum提出了一种基于键值结构和delta规则的新型动量更新方法,旨在解决传统指数移动平均(EMA)动量在深度网络训练中忽视梯度方向异质性的问题。该方法利用线性层梯度可分解为输入键和输出误差值的特性,通过delta规则动态调整每个方向的遗忘速率,使频繁出现的梯度方向被更慢遗忘,而罕见方向被更快清除。理论证明该方法无需矩阵求逆即可实现输入侧曲率校正,并在固定或漂移最优解下均能比EMA更快清除过时方向。实验显示,在FineWeb-Edu预训练中,DeltaAdamW相比标准AdamW在67M和370M参数规模下分别节省最多46.39%和22.12%的训练步数,且优势在1B规模下持续存在;在CIFAR-10上的SGD、ResNet-18和ViT-Tiny实验中同样表现优异。该方法可作为任意优化器的即插即用组件,额外计算开销仅为门控MLP线性成本的22.2%至25.0%,且无需持久内存。
| DeltaMomentum | 一种新的动量更新方法,利用键值结构通过增量规则实现方向感知的动量更新。 |
| Anisotropic | 各向异性,指训练中不同方向被查询的频率差异大,导致梯度分布不均匀。 |
| Delta rule | 增量规则,一种基于误差调整权重的学习规则,此处用于更新动量缓冲区。 |
| μP (Maximal Update Parametrization) | 最大更新参数化,一种超参数转移方法,使模型宽度变化时超参数保持有效。 |
| EMA (Exponential Moving Average) | 指数移动平均,一种常用的动量更新方式,以固定速率平均历史梯度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅