该研究探讨了Transformer模型中"顿悟"(grokking)现象——即模型从记忆训练数据突然转向泛化——在功能上究竟发生在何处。作者提出"过渡博弈"方法,通过行为对齐的精确激活博弈与配对的非泛化对照组,发现顿悟表现为分布式效用增益,并伴随一个前瞻性的block-0注意力偏置。在替换博弈中,选定的二阶模式贡献了该偏置67%至92%的加法对比;一条独立的精确路径研究进一步确认,block-1 MLP在12对样本中均比所有其他下游路径更多地中介了这些模式的效果。值得注意的是,更常见的"MLP负责记忆、注意力负责泛化"的预测被反转(记忆锚点处为-.331比特/样本,12对中0对符合预测方向),路由起始、全局秩坍缩以及素数不变架构脊等假设也均告失败。这些结果共同表明,此处的顿悟是既有分布式电路的频谱重编码,而非模块切换。
| Grokking | 指神经网络在训练中突然从记忆训练数据转变为泛化到未见数据的一种现象。 |
| Transition Games | 一种行为对齐的精确激活博弈方法,用于分析Transformer中从记忆到泛化的功能转变。 |
| Fourier Recoding | 指模型将信息重新编码为傅里叶频谱模式的过程,本文中用于解释grokking现象。 |
| Distributed Utility | 指模型功能由多个组件分布式贡献,而非集中于单一模块。 |
| MLP | 多层感知机,Transformer中的前馈网络模块,通常被认为与记忆功能相关。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅