本文提出一种名为R-iKFAD的优化器,用于降低Transformer预训练中的优化器显存开销。iKFAD此前以自适应摩擦力替代自适应学习率,性能可与Adam媲美,但其摩擦力张量每层需占用与Adam二阶矩缓冲相同的O(mn)内存。作者将摩擦力张量替换为由行、列动量统计量构成的秩1外积分解,使每层摩擦力内存从O(mn)降至O(m+n),优化器总状态约减半。在GPT2-Nano、TinyViT、DistilBERT和GPT2-S上的实验表明,R-iKFAD性能与iKFAD持平或更优,同时内存占用近乎减半,且对超参数保持相近的鲁棒性。理论分析方面,作者在两种阻尼机制下研究连续时间动力学:线性阻尼下证明强凸条件下的指数收敛;在实验中更优的零阻尼情形下,虽无法证明几何收敛,但证明了收敛到极小值点,并给出能量上下界,正则化尺度为零时约为t^{-1}阶,为正时约为t^{-1/2}阶。这是首个针对秩1分解优化器的连续时间收敛速率结果,也是首个不要求正阻尼的此类结果。
| iKFAD | 一种用自适应摩擦替代自适应学习率的优化器,性能与 Adam 相当。 |
| Rank-1 iKFAD (R-iKFAD) | 通过秩-1 外积分解摩擦张量,将每层内存从 O(mn) 降至 O(m+n) 的优化器变体。 |
| friction tensor | iKFAD 中控制动量动力学阻尼的完整张量 ξ,每层占用 O(mn) 内存。 |
| continuous-time dynamics | 将优化过程建模为连续时间微分方程,用于分析收敛性。 |
| geometric convergence | 误差按指数速率衰减的收敛类型,通常需要强凸性和正阻尼。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅