该研究探讨了一个核心问题:受生物约束的局部学习规则训练的网络,能否完全无需离线阶段就实现持续学习中的记忆巩固。作者提出三项机制:隔离规则将回放更新限制在当前输入不可见的隐藏突触上,优化器状态仅在掩码内推进;不应期轮换规则让刚激活的单元跳过下一轮竞争,扩大可巩固集合;稳态压力与相对新颖性门控决定回放爆发的时机。这一思路反转了通常的非干扰持续学习方向:保持当前输入的隐藏计算不变,同时将过去记忆写入当前批次未使用的自由度中。在类增量split-MNIST上,系统无需离线阶段即达到91.6%±0.3%,在两个留出划分上达到或超过最佳离线夜间调度,与DER++持平并优于经验回放、ER-ACE、A-GEM等方法;单遍学习中领先DER++(91.8%对90.1%)。优势在小缓冲区时最明显,大缓冲区时让位于反向传播参考方法。轮换贡献了大部分增益,隔离则提供不变性保证。该机制不限于局部规则,在相同调度下,带k-WTA隐藏层的反向传播网络同样受益。
| 持续学习 | 一种机器学习范式,模型按顺序学习多个任务而不遗忘先前知识。 |
| 回放 | 通过重新播放过去样本或生成伪样本以巩固记忆、缓解灾难性遗忘的技术。 |
| k-赢家通吃 | 一种竞争性学习机制,只有激活值最高的k个单元被保留,其余被抑制。 |
| 灾难性遗忘 | 神经网络在学习新任务时严重遗忘旧任务的现象。 |
| 局部睡眠 | 大脑中单个神经回路短暂、依赖使用的停歇期,被认为参与记忆巩固。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅