该研究探讨了一个实际问题:能否在不损害基础能力的前提下,用小型纠错模块修正冻结语言模型的输出错误。作者提出CRN v2,一种轻量级logit层纠错模块,仅含约3400万可训练参数,占4.65B文本模块的0.73%,叠加在完全冻结的Gemma 4 E2B模型之上。基础模型始终不更新,仅纠错模块通过监督微调与无参考DPO在83400对纠错数据上学习。在60题领域考试中,CRN v2纠正了53.3%的基础模型错误,且在能力基准测试中未见退化。相比之下,同等预算的LoRA基线虽纠错率达83.3%,却造成30%至75%的能力损失,凸显纠错与能力保持之间的权衡。消融实验表明KL保持项至关重要,降低其权重会使纠错率降至35.0%。研究强调这是一种设计原则的验证,而非架构创新,并开源了代码、权重与评估脚本。
| CRN v2 | 一种轻量级logit级校正模块,用于修正冻结语言模型的输出错误,同时保持基础模型能力。 |
| Frozen-Base Adjustment | 冻结基础模型参数,仅训练附加校正模块的调整策略,以避免损害基础模型能力。 |
| DPO | 直接偏好优化,一种无需参考模型的强化学习微调方法,用于优化模型输出偏好。 |
| KL Preservation Term | KL散度保持项,用于约束校正模块输出分布与基础模型分布接近,防止能力退化。 |
| Logit-Level Correction | 在模型输出的logit层面进行校正,通过调整最终概率分布来修正错误。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅