本文提出了一种名为ALRA的自适应局部关系对齐方法,用于改进自回归语言模型在预训练阶段的基于logit的知识蒸馏。传统方法通常在整个词汇表上对齐教师和学生的下一词分布,忽略了候选词之间的相对偏好;而现有局部方法仅从教师或学生单方选择候选词,存在覆盖不全或初期排序不准的问题。ALRA在每个预测位置结合学生提出的高概率词与教师最可能的锚定词,并根据教师在该候选集上的概率分布广度自适应调整选词数量。其损失函数包含两个关键部分:自适应局部散度保留质量匹配项并分别匹配选中与剩余词汇区域内的相对分布;学生加权成对关系对齐则侧重高概率且学生概率差距小的词对。在The Pile数据集上,使用随机初始化的200M和500M参数学生模型进行九项零样本基准测试,平均准确率分别达36.62%和37.40%,较最强蒸馏基线提升0.94和0.83个百分点,较无蒸馏预训练提升2.31和2.91个百分点。
| Logit-based knowledge distillation | 一种知识蒸馏方法,通过匹配教师和学生模型输出的logit(未归一化的预测分数)来传递知识。 |
| Autoregressive language models | 自回归语言模型,按顺序预测下一个词元,如GPT系列模型。 |
| Adaptive Local Relational Alignment (ALRA) | 本文提出的新方法,自适应地选择候选词元并调整对齐策略,以改进蒸馏效果。 |
| Mass-matching term | 用于匹配教师和学生模型在特定词汇区域上的总概率质量的项。 |
| Zero-shot benchmarks | 零样本基准测试,评估模型在未见过的任务上的泛化能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅