本文针对低秩适配(LoRA)在持续学习中的动力学机制展开理论分析,构建了一个可解析的双任务教师—学生模型,并在高维在线学习极限下推导出关于有限个宏观序参量的常微分方程组,从而精确刻画了任务一学习阶段及随后在任务二上进行LoRA微调时的泛化误差演化。理论结果与有限维模拟定量吻合,揭示出LoRA的两个特征效应:低秩适配减少了对第一任务所学特征的干扰,但其初始化会拖慢对第二任务的适应速度。基于这一机制,作者提出一种状态依赖的掩码策略,冻结承载最强第一任务表征的隐藏单元,将适配限制在互补子空间,显著降低遗忘并保持新任务的可塑性。研究还澄清了适配器秩的作用:迁移能力仅在目标任务的固有维度范围内随秩提升,超出后趋于饱和,而遗忘则随秩持续增长。相关结论在序列MNIST基准上得到定性验证。
| Low-Rank Adaptation (LoRA) | 一种参数高效微调方法,通过低秩矩阵分解来更新预训练模型权重,减少可训练参数数量。 |
| Continual Learning | 持续学习,指模型按顺序学习多个任务而不遗忘先前任务知识的学习范式。 |
| Catastrophic Forgetting | 灾难性遗忘,指神经网络在学习新任务时严重遗忘旧任务知识的现象。 |
| Teacher-Student Model | 教师-学生模型,一种理论分析框架,其中教师网络生成数据,学生网络进行学习以逼近教师。 |
| Order Parameters | 序参量,在统计物理和高维学习中用于宏观描述系统状态的少量关键变量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅