本文提出一种面向大语言模型压缩的逐层课程学习方法,旨在高效实现教师模型到学生模型的知识迁移。该方法将整个模型划分为由若干层组成的多个片段,使知识迁移在计算上更为高效,并基于对累积误差现象的理论分析,采用由易到难的课程式优化策略,在加速收敛的同时稳定迁移过程。为应对层间特征错位问题,作者还设计了结合多线程策略的特征缓存方法,以最大化GPU利用率。实验表明,该方法在BERT和GPT-2上达到当前最优压缩性能,同时将GPU内存占用和训练时间均降低50%以上;在相同训练时长下,其在LLaMA系列和Qwen模型上的表现也优于其他剪枝方法,且GPU内存占用更低。该研究为LLM压缩提供了一种兼顾性能与计算效率的新思路。
| 逐层课程学习 (Layer-wise Curriculum Learning) | 一种将课程学习思想与逐层压缩结合的训练策略,从易到难分阶段进行知识迁移,以提升大语言模型压缩的效率和稳定性。 |
| 知识蒸馏 (Knowledge Transfer/Distillation) | 将教师模型的知识迁移到学生模型的过程,通常通过模仿教师模型的输出或中间特征来实现模型压缩。 |
| 累积误差现象 (Cumulative Error Phenomenon) | 在逐层压缩或量化中,各层误差逐层传播并累积,导致模型整体性能下降的现象。 |
| 特征缓存与多线程策略 (Feature Caching with Multi-threading) | 一种通过缓存中间层特征并利用多线程并行处理来减少跨层特征错位、提升GPU利用率的方法。 |
| 模型剪枝 (Model Pruning) | 通过移除模型中冗余的参数或结构来减小模型规模、降低计算开销的压缩技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅