🔥 今日值得一读 Muon优化器一招破解AI遗忘难题!理论+实验双证实,任务干扰上界直降
When Muon Meets Task Interference: A Spectral Perspective on Continual Learning and Model Merging
arXiv LG (cs.LG) 🔥 重点 #持续学习#模型合并#优化器 🕐 08-31 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮助开发者理解任务干扰,改进多任务模型训练与合并策略。

📖 AI 总结

该研究从谱分析视角揭示了持续学习(CL)与模型合并(MM)中的共同难题——任务干扰,即一个任务的参数更新会改变模型在另一任务上的输出。作者将其形式化为逐层的Frobenius内积,并推导出上界,指出优化器可通过控制谱范数来调节干扰强度。研究发现,Muon优化器天然具备这种谱范数调控能力,从而同时缓解灾难性遗忘和权重解缠误差。实验验证了理论分析:在八个任务的模型合并基准上,Muon相比AdamW在三个CLIP骨干网络上最高提升5.02个准确率点;在持续学习的十个类增量、三个任务增量及11任务MTIL协议中,也均获得一致的正向收益。该工作首次将优化器选择提升为应对任务干扰的原则性手段,为CL与MM提供了统一的优化器中心视角,补充了现有方法。

🔑 关键词速览

Continual Learning (CL)持续学习,指模型在不遗忘旧知识的情况下连续学习新任务的能力。
Model Merging (MM)模型合并,指将多个针对不同任务训练好的模型合并为一个多任务模型的技术。
Task Interference任务干扰,指一个任务的参数更新对另一个任务输出产生负面影响的现象。
Muon Optimizer一种优化器,通过控制参数更新的谱范数来减少任务干扰,提升持续学习和模型合并性能。
Spectral Norm谱范数,矩阵的最大奇异值,用于衡量参数更新的幅度,是任务干扰上界的关键因素。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅