3400万参数修正模块,冻结46.5亿模型,纠错53%且能力零退化!
Safe Error Correction for Language Models: Frozen-Base Adjustment with Capability Preservation
arXiv AI (cs.AI) 重要 安全对齐论文方法大模型 🕐 09-16 12:00

📖 AI 总结

该研究探讨了一个实际问题:能否在不损害基础能力的前提下,用小型纠错模块修正冻结语言模型的输出错误。作者提出CRN v2,一种轻量级logit层纠错模块,仅含约3400万可训练参数,占4.65B文本模块的0.73%,叠加在完全冻结的Gemma 4 E2B模型之上。基础模型始终不更新,仅纠错模块通过监督微调与无参考DPO在83400对纠错数据上学习。在60题领域考试中,CRN v2纠正了53.3%的基础模型错误,且在能力基准测试中未见退化。相比之下,同等预算的LoRA基线虽纠错率达83.3%,却造成30%至75%的能力损失,凸显纠错与能力保持之间的权衡。消融实验表明KL保持项至关重要,降低其权重会使纠错率降至35.0%。研究强调这是一种设计原则的验证,而非架构创新,并开源了代码、权重与评估脚本。

🔑 关键词速览

CRN v2一种轻量级logit级校正模块,用于修正冻结语言模型的输出错误,同时保持基础模型能力。
Frozen-Base Adjustment冻结基础模型参数,仅训练附加校正模块的调整策略,以避免损害基础模型能力。
DPO直接偏好优化,一种无需参考模型的强化学习微调方法,用于优化模型输出偏好。
KL Preservation TermKL散度保持项,用于约束校正模块输出分布与基础模型分布接近,防止能力退化。
Logit-Level Correction在模型输出的logit层面进行校正,通过调整最终概率分布来修正错误。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅