该研究系统刻画了神经网络中“记忆到泛化”转变(grokking)在超参数空间中的定量结构。作者在模运算任务上训练384组双隐层MLP配置,拟合出泛化起始时间的幂律标度关系,其中数据复杂度(指数-2.04)是驱动机制转变的主导因素,远超模型容量(指数-0.27):数据量翻倍可使泛化加速约4倍,而宽度翻倍仅加速约1.2倍。研究还发现权重衰减约1.0处存在明显相边界,区分grokking与非grokking配置,且转变过程中权重范数单调压缩,与隐式正则化选择低复杂度解一致。该工作为预测和控制过参数化网络中的机制转变提供了定量基础。
| Grokking | 神经网络在训练中先记忆训练数据,经过延迟后突然泛化到测试数据的现象。 |
| Memorization-to-Generalization Transition | 模型从记忆训练样本到泛化到未见样本的转变过程。 |
| Scaling Law | 描述模型性能或行为随规模(如数据量、模型大小)变化的幂律关系。 |
| Phase Structure | 在超参数空间中,系统行为发生定性变化的区域划分,如顿悟与非顿悟的边界。 |
| Implicit Regularization | 优化算法本身隐含的对模型复杂度的惩罚,倾向于选择简单解。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅