本文介绍了苹果研究团队提出的IDEA Prune方法,一种集成“扩大再剪枝”流程的生成式语言模型预训练方案。传统结构化剪枝虽比从头训练目标规模模型更具token效率,但常忽略扩大模型预训练的价值。该研究系统探讨了两个关键问题:扩大模型即使不部署是否值得预训练,以及如何优化整个流程以得到更优的剪枝模型。IDEA Prune将扩大模型训练、剪枝和恢复整合在单一余弦退火学习率调度下,并引入新颖的迭代式结构化剪枝方法,实现参数逐步移除。这有助于缓解朴素流程中学习率上升导致的知识损失,并促进幸存神经元间模型容量的有效再分配,实现平滑压缩和性能提升。在将2.8B模型压缩至1.3B、预训练token数高达2T的实验中,该方法不仅揭示了扩大模型预训练的token效率,还显著提升了剪枝模型的性能表现。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅