🔥 今日值得一读 剪枝前先“增肥”再瘦身!新流程让大模型训练省下50%算力
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
Apple ML Research 🔥 重点 论文方法大模型算力 🕐 08-26 08:00

📖 AI 总结

本文介绍了苹果研究团队提出的IDEA Prune方法,一种集成“扩大再剪枝”流程的生成式语言模型预训练方案。传统结构化剪枝虽比从头训练目标规模模型更具token效率,但常忽略扩大模型预训练的价值。该研究系统探讨了两个关键问题:扩大模型即使不部署是否值得预训练,以及如何优化整个流程以得到更优的剪枝模型。IDEA Prune将扩大模型训练、剪枝和恢复整合在单一余弦退火学习率调度下,并引入新颖的迭代式结构化剪枝方法,实现参数逐步移除。这有助于缓解朴素流程中学习率上升导致的知识损失,并促进幸存神经元间模型容量的有效再分配,实现平滑压缩和性能提升。在将2.8B模型压缩至1.3B、预训练token数高达2T的实验中,该方法不仅揭示了扩大模型预训练的token效率,还显著提升了剪枝模型的性能表现。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅