本文研究一种面向深度学习的通用层设计:不再将任意规模的训练数据压缩进固定大小的权重矩阵,而是为每个数据点存储一对键值表示,并在推理时通过注意力机制检索和重组这些表示,从而形成不断增长的非参数化神经网络。作者指出,此前基于线性注意力与梯度下降对偶关系提出的思路,在将线性注意力替换为更强注意力函数时并不平凡,直接套用原有学习规则无法实现有原则的优化。为此,他们基于径向基函数和类softmax核,推导出核化注意力层的函数梯度学习规则,确立了“以检索为中心的深度学习”范式。实验在图像分类和合成师生学习任务上展示了该方法的性能与学习效率,并揭示将线性注意力替换为MesaNet/DeltaNet等变体后,可与近期针对固定规模网络的优化器建立形式联系,为深度学习优化提供了新视角。
| Growing Nonparametric Neural Networks | 一种神经网络,其参数数量随训练数据点增加而增长,而非固定大小。 |
| Linear Attention (LA) | 一种注意力机制,将线性层表示为对训练数据点的线性注意力,用于对偶形式。 |
| Retrieval-Centric Deep Learning (RCDL) | 本文提出的范式,以检索为中心,通过注意力机制检索和重组存储的键值表示进行深度学习。 |
| Functional Gradient-Based Learning Rules | 基于函数梯度的学习规则,用于优化核化注意力层,确保有原则的优化。 |
| MesaNet/DeltaNet | 高级线性注意力变体,用于替换对偶形式中的 LA,与固定大小 NN 优化器建立联系。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅