🔥 今日值得一读 数据量翻倍,顿悟加速4倍!384种配置揭示神经网络泛化相变规律
Quantifying the Memorization-to-Generalization Transition: Scaling Laws and Phase Structure in Grokking
arXiv AI (cs.AI) 🔥 重点 #Grokking#缩放定律#训练动力学#泛化理论 🕐 09-12 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可据此预测模型何时从死记硬背转向泛化,帮助判断训练该跑多久、调哪些超参。

📖 AI 总结

该研究系统刻画了神经网络中“记忆到泛化”转变(grokking)在超参数空间中的定量结构。作者在模运算任务上训练384组双隐层MLP配置,拟合出泛化起始时间的幂律标度关系,其中数据复杂度(指数-2.04)是驱动机制转变的主导因素,远超模型容量(指数-0.27):数据量翻倍可使泛化加速约4倍,而宽度翻倍仅加速约1.2倍。研究还发现权重衰减约1.0处存在明显相边界,区分grokking与非grokking配置,且转变过程中权重范数单调压缩,与隐式正则化选择低复杂度解一致。该工作为预测和控制过参数化网络中的机制转变提供了定量基础。

🔑 关键词速览

Grokking神经网络在训练中先记忆训练数据,经过延迟后突然泛化到测试数据的现象。
Memorization-to-Generalization Transition模型从记忆训练样本到泛化到未见样本的转变过程。
Scaling Law描述模型性能或行为随规模(如数据量、模型大小)变化的幂律关系。
Phase Structure在超参数空间中,系统行为发生定性变化的区域划分,如顿悟与非顿悟的边界。
Implicit Regularization优化算法本身隐含的对模型复杂度的惩罚,倾向于选择简单解。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅