该研究探讨了一个在模型微调中颇具现实意义的问题:即便教师示范在语义上完全正确,为何监督微调(SFT)比强化微调(RFT)导致更严重的遗忘。作者在分类任务上构建理论框架,其中同一语义类别内的词元以不同风格表达相同答案,任务共享底层语义规则但提示分布与教师风格偏好各异。借助可处理的线性-softmax策略,研究将参数更新精确分解为语义与风格两个分量,发现SFT与RFT在语义更新上平行,差异在于风格动态:从无类内风格偏好的策略出发,RFT的精确策略梯度保持对称性,而SFT在非均匀教师下会沿非零任务均值产生偏离轴线的风格漂移。基于该漂移,作者在显式条件下证明了分离性:从共同完美拟合检查点做群体更新时,SFT的遗忘在有限训练区间内存在严格正下界,而RFT保持零语义误差,仿真结果支持理论预测。
| 监督微调 (SFT) | 一种使用标注数据对预训练模型进行微调的方法,通过最小化预测与标签之间的差异来更新模型参数。 |
| 强化微调 (RFT) | 一种使用强化学习信号(如策略梯度)对预训练模型进行微调的方法,通过最大化奖励来优化模型行为。 |
| 线性-softmax策略 | 一种策略参数化形式,其中动作概率由线性函数的softmax给出,常用于理论分析。 |
| 风格漂移 | 指模型在训练过程中,其输出风格(如表达方式)逐渐偏离初始状态,而语义内容可能保持不变的现象。 |
| 语义误差 | 模型预测的语义答案与真实语义答案不一致的比例,衡量模型在任务上的语义正确性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅