本文研究局部学习中的深度鲁棒性问题。局部学习让每层使用独立辅助损失、无需全局反向传播,但长期受困于精度随深度下降和超参数脆弱。作者将Muon风格的谱更新几何(动量正交化与谱步长缩放)引入逐层局部更新,这一组合此前未被研究。在CIFAR-10的MLP基准上,单一固定步长设置在宽度128至2048、深度12至48的测试网格中均为最优;而局部Adam需沿两个维度重新调参,且在深度48时崩溃(逐深度重调为31.3%,沿用深度12设置为19%,谱更新在不变设置下为42.7%)。五个随机种子、宽度512时,谱更新明显领先(48.9±0.5对46.6±0.3)。对照实验表明,迁移性与大部分深度鲁棒性源于谱几何本身,而非附加的步长规则。作者进一步提出“漂移契约”步长公式lr=ε/RMS(input),为每层提供输入条件下的权重诱导预激活变化上界,兼具可解释性与小幅增益。一个负面结果是:当主干含RMSNorm与权重衰减时,谱更新的稳定性收益转向全局训练,说明其局部优势集中在缺乏归一化的场景。
| Local Learning | 一种神经网络训练范式,每一层使用独立的辅助损失进行训练,无需全局反向传播,从而实现层更新的结构并行化。 |
| Spectral Updates | 指 Muon 风格的谱更新几何,包括动量正交化和谱步长缩放,用于改善优化过程的稳定性和深度鲁棒性。 |
| Drift Contract | 一种步长设定规则,lr = epsilon / RMS(input),通过限制每层权重引起的预激活变化来提供输入条件化的漂移界。 |
| Muon-style | 指借鉴 Muon 优化器的方法,其核心是对动量进行正交化处理并结合谱步长缩放,以提升训练效果。 |
| RMSNorm | 均方根归一化,一种神经网络归一化技术,通过输入向量的均方根进行缩放,常用于稳定训练。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅