该研究提出了一种针对视觉与语言Transformer的结构化剪枝方法,将单元选择问题建模为“损伤感知的多臂老虎机”问题,在固定评估预算下,通过临时掩蔽注意力头和MLP通道组来测量配对损伤,并采用UCB策略或分数Beta汤普森采样驱动选择过程。实验覆盖GPT-2、OPT、Pythia、Qwen2.5、SmolLM2及ViT-B/16、DeiT-Tiny、Swin-Tiny等模型,在WikiText-2、LAMBADA和Imagenette数据集上与随机、幅度、静态显著性和预算贪心方法对比。结果显示,基于老虎机的方法通常比预算贪心造成更低的性能退化,28项重点比较中23项置信区间排除零,11项配对检验p值小于0.05。该方法的优势并非仅来自更大的评估预算,为Transformer结构化剪枝提供了更有效的单元选择思路。
| structured post-training pruning | 一种剪枝方法,在训练后移除整个功能单元(如注意力头或MLP通道组),而非单个权重。 |
| damage-aware multi-armed bandit | 一种多臂老虎机问题,其中每个臂(候选单元)的奖励基于其被掩蔽后造成的性能损伤,以指导选择。 |
| paired damage | 在同一校准批次上,掩蔽模型与基础模型的损失之差,用于减少批次间方差。 |
| fractional-Beta Thompson Sampling | 一种使用分数Beta分布进行采样的汤普森采样变体,用于在有限预算下平衡探索与利用。 |
| calibration batches | 用于评估剪枝效果的小批量数据,通常来自训练集或验证集,以指导剪枝决策。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅