🔥 今日值得一读 iKFAD内存砍半性能不减!秩-1分解让优化器状态直接省一半
Low-Rank Friction for Memory-Efficient Transformer Pretraining
arXiv ML (stat.ML) 🔥 重点 #优化器#Transformer#显存优化 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
可替换Adam降低Transformer预训练优化器显存开销,适合大模型训练时节省内存。

📖 AI 总结

本文提出一种名为R-iKFAD的优化器,用于降低Transformer预训练中的优化器显存开销。iKFAD此前以自适应摩擦力替代自适应学习率,性能可与Adam媲美,但其摩擦力张量每层需占用与Adam二阶矩缓冲相同的O(mn)内存。作者将摩擦力张量替换为由行、列动量统计量构成的秩1外积分解,使每层摩擦力内存从O(mn)降至O(m+n),优化器总状态约减半。在GPT2-Nano、TinyViT、DistilBERT和GPT2-S上的实验表明,R-iKFAD性能与iKFAD持平或更优,同时内存占用近乎减半,且对超参数保持相近的鲁棒性。理论分析方面,作者在两种阻尼机制下研究连续时间动力学:线性阻尼下证明强凸条件下的指数收敛;在实验中更优的零阻尼情形下,虽无法证明几何收敛,但证明了收敛到极小值点,并给出能量上下界,正则化尺度为零时约为t^{-1}阶,为正时约为t^{-1/2}阶。这是首个针对秩1分解优化器的连续时间收敛速率结果,也是首个不要求正阻尼的此类结果。

🔑 关键词速览

iKFAD一种用自适应摩擦替代自适应学习率的优化器,性能与 Adam 相当。
Rank-1 iKFAD (R-iKFAD)通过秩-1 外积分解摩擦张量,将每层内存从 O(mn) 降至 O(m+n) 的优化器变体。
friction tensoriKFAD 中控制动量动力学阻尼的完整张量 ξ,每层占用 O(mn) 内存。
continuous-time dynamics将优化过程建模为连续时间微分方程,用于分析收敛性。
geometric convergence误差按指数速率衰减的收敛类型,通常需要强凸性和正阻尼。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅