该研究探讨了谱梯度下降(SpecGD)在带噪声标签的过参数化矩阵分类任务中的泛化行为。作者构建了一个理论框架:每个输入由共享的低秩信号与一个秩一的样本特定扰动(即“捷径”)叠加而成,捷径可被记忆但无法泛化。关键发现是,捷径的几何结构——即其奇异方向是坍缩于同一方向还是分散于不同方向——能够逆转梯度下降(GD)与SpecGD的相对泛化表现:坍缩捷径有利于SpecGD,而分散捷径则有利于GD。在分散情形下,捷径的精确正交性会从SpecGD后期方向中消除信号,但随机相关性的消失通过二阶效应汇聚出微弱却对泛化有意义的信号。为确定SpecGD所选择的方向,作者结合了对偶问题的精细分析与归一化损失权重的指数梯度动力学。研究进一步表明,单步SpecGD即可实现插值并获得良好泛化,而持续训练反而收敛至泛化显著更差的方向。这一结果揭示了矩阵几何结构在隐式偏差与泛化中的核心作用。
| 谱梯度下降 (SpecGD) | 一种在矩阵参数空间中利用谱范数或奇异值结构进行优化的梯度下降变体。 |
| 捷径 (shortcut) | 数据中与标签虚假相关但无泛化能力的特征,模型可能依赖其进行记忆。 |
| 塌缩捷径 (collapsed shortcuts) | 所有样本的捷径扰动共享同一个奇异方向的几何结构。 |
| 分散捷径 (dispersed shortcuts) | 不同样本的捷径扰动占据不同奇异方向的几何结构。 |
| 隐式偏差 (implicit bias) | 优化算法在训练过程中隐含地偏好某些解(如最小范数解)的倾向。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅