该研究从谱分析视角揭示了持续学习(CL)与模型合并(MM)中的共同难题——任务干扰,即一个任务的参数更新会改变模型在另一任务上的输出。作者将其形式化为逐层的Frobenius内积,并推导出上界,指出优化器可通过控制谱范数来调节干扰强度。研究发现,Muon优化器天然具备这种谱范数调控能力,从而同时缓解灾难性遗忘和权重解缠误差。实验验证了理论分析:在八个任务的模型合并基准上,Muon相比AdamW在三个CLIP骨干网络上最高提升5.02个准确率点;在持续学习的十个类增量、三个任务增量及11任务MTIL协议中,也均获得一致的正向收益。该工作首次将优化器选择提升为应对任务干扰的原则性手段,为CL与MM提供了统一的优化器中心视角,补充了现有方法。
| Continual Learning (CL) | 持续学习,指模型在不遗忘旧知识的情况下连续学习新任务的能力。 |
| Model Merging (MM) | 模型合并,指将多个针对不同任务训练好的模型合并为一个多任务模型的技术。 |
| Task Interference | 任务干扰,指一个任务的参数更新对另一个任务输出产生负面影响的现象。 |
| Muon Optimizer | 一种优化器,通过控制参数更新的谱范数来减少任务干扰,提升持续学习和模型合并性能。 |
| Spectral Norm | 谱范数,矩阵的最大奇异值,用于衡量参数更新的幅度,是任务干扰上界的关键因素。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅