深度剪枝通过移除Transformer块来降低大语言模型的推理成本,但会破坏下游层所依赖的隐藏状态分布,导致显著的精度损失。SHIFT-LLM提出了一种无需训练的剪枝后校正框架,在每个剪枝位置插入线性残差适配器(LRA),保留原始残差块的恒等路径,并添加轻量仿射残差校正。该校正通过闭式最小二乘回归在少量保留集上校准,无需梯度计算,即可近似被剪枝块产生的缺失残差更新,从而缓解层移除带来的分布失配,同时避免被移除块的注意力与前馈计算开销。LRA支持低秩分解和跨连续剪枝层的精确合并以进一步压缩,并能与参数高效微调自然结合。在五个模型家族、六种层选择标准和七个零样本基准上的实验表明,SHIFT-LLM在多数配置下持续恢复深度剪枝造成的精度损失,在Llama-3.1-8B-Instruct上最高提升15.7个百分点,且仅需数百个校准样本,无需梯度计算。
| Depth Pruning | 深度剪枝,一种模型压缩技术,通过移除Transformer中的整个层来减少计算量。 |
| Linear Residual Adapter (LRA) | 线性残差适配器,一种轻量级模块,用于在剪枝后校正隐藏状态分布。 |
| Closed-form Least-squares Regression | 闭式最小二乘回归,一种无需迭代优化的直接求解方法,用于校准适配器参数。 |
| Zero-shot Benchmarks | 零样本基准,评估模型在未见任务上的泛化能力的测试集。 |
| Parameter-efficient Fine-tuning | 参数高效微调,一种只更新少量额外参数来适应新任务的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅