该论文提出了一种用于持续学习的快速权重注意力框架,将循环快速权重记忆与选择性状态空间模型统一为在线学习规则。研究推导了基于平方误差回归和负内积目标的归一化一阶更新,构建了Falcon系列模型,包括标量NLMS更新的Falcon-1、逐列扩展的Falcon-2及滑动窗口小批量更新的Falcon-3,并提供了对应的内积变体。该框架支持循环、掩码并行和分块并行三种计算形式,并引入数值稳定的正衰减重归一化方法。实验表明,代表性变体在语言建模任务中保持竞争力,并在变长数字加法任务中显著改善长度外推能力。该工作为循环序列模型中的时间对齐、可塑性、遗忘和有界回放提供了统一视角,对持续学习场景下的模型设计具有理论参考价值。
| Fast Weight Attention | 一种通过快速更新的权重矩阵实现注意力机制的方法,用于处理序列数据。 |
| Continual Learning | 持续学习,指模型在不遗忘旧知识的情况下不断学习新任务的能力。 |
| NLMS | 归一化最小均方算法,一种自适应滤波更新规则,用于在线学习。 |
| State-space models | 状态空间模型,用隐藏状态表示序列信息,并随时间更新。 |
| Length extrapolation | 长度外推,指模型在推理时处理比训练时更长的序列的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅