这篇论文将线性注意力在上下文学习中的理论分析从线性回归扩展到非线性单指标目标函数,即 y=f(x^⊤w)+ε。其核心发现是一条“非线性—噪声等价”原理:线性注意力只能提取目标函数 f 的线性 Hermite 分量,而其余非线性结构在泛化误差中表现为有效噪声。这一归约使得已有的线性理论结果可以直接迁移到非线性任务上。作者据此分析了有限预训练数据的影响,以及随着任务多样性增加,模型从任务记忆向任务泛化转变的过程。该结果揭示了简化线性注意力模型的内在局限,同时为研究非线性上下文学习提供了一个可处理的起点。
| 线性注意力 | 一种简化的注意力机制,用线性核替代softmax,便于理论分析Transformer的上下文学习行为。 |
| 上下文学习 | 模型无需更新参数,仅根据输入序列中的示例(上下文)即可完成新任务的能力。 |
| 单指标模型 | 一种非线性回归模型,目标值仅通过输入的一个线性组合(指标)再经过非线性函数变换得到。 |
| Hermite分量 | 函数在Hermite多项式基下的展开系数,此处特指与线性项对应的部分。 |
| 任务多样性 | 预训练阶段所接触任务分布的丰富程度,影响模型从记忆任务到泛化到新任务的转变。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅