🔥 今日值得一读 SFT为何比RFT遗忘更多?新研究揭示风格漂移导致严格正遗忘下界,RFT保持零语义误差!
Learning Style, Forgetting Semantics: A Case Study of SFT and RFT on Classification Tasks
arXiv ML (stat.ML) 🔥 重点 #SFT#RFT#灾难性遗忘 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
解释为何SFT比RFT更易遗忘语义,指导开发者选择微调方式以保留模型通用能力。

📖 AI 总结

该研究探讨了一个在模型微调中颇具现实意义的问题:即便教师示范在语义上完全正确,为何监督微调(SFT)比强化微调(RFT)导致更严重的遗忘。作者在分类任务上构建理论框架,其中同一语义类别内的词元以不同风格表达相同答案,任务共享底层语义规则但提示分布与教师风格偏好各异。借助可处理的线性-softmax策略,研究将参数更新精确分解为语义与风格两个分量,发现SFT与RFT在语义更新上平行,差异在于风格动态:从无类内风格偏好的策略出发,RFT的精确策略梯度保持对称性,而SFT在非均匀教师下会沿非零任务均值产生偏离轴线的风格漂移。基于该漂移,作者在显式条件下证明了分离性:从共同完美拟合检查点做群体更新时,SFT的遗忘在有限训练区间内存在严格正下界,而RFT保持零语义误差,仿真结果支持理论预测。

🔑 关键词速览

监督微调 (SFT)一种使用标注数据对预训练模型进行微调的方法,通过最小化预测与标签之间的差异来更新模型参数。
强化微调 (RFT)一种使用强化学习信号(如策略梯度)对预训练模型进行微调的方法,通过最大化奖励来优化模型行为。
线性-softmax策略一种策略参数化形式,其中动作概率由线性函数的softmax给出,常用于理论分析。
风格漂移指模型在训练过程中,其输出风格(如表达方式)逐渐偏离初始状态,而语义内容可能保持不变的现象。
语义误差模型预测的语义答案与真实语义答案不一致的比例,衡量模型在任务上的语义正确性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅