本文在广义光滑性与重尾噪声(仅假设有界条件二阶矩)条件下,分析了原始同步坐标级 AdaGrad 的收敛行为。作者发现,不加裁剪的 AdaGrad 会出现“各向异性失准”:自适应分母可能学到的不是目标函数的局部曲率,而是稀有噪声冲击的几何结构,从而产生持续的方向性扭曲,阻碍有限时域内的欧氏空间进展。文章进一步证明裁剪能够修复这一失效模式,并给出原始非滞后 AdaGrad 更新的有限时域高概率收敛保证,其梯度平方均值上界为 O(d(√log T + log(1/δ))/√T),对应 Õ(ε⁻²) 的复杂度。该结果表明,在重尾噪声下,裁剪并非单纯的鲁棒性启发式技巧,而是维持自适应几何结构稳定的关键机制。
| AdaGrad | 一种自适应梯度优化算法,根据历史梯度平方和调整每个坐标的学习率。 |
| 广义光滑性 | 一种比传统L-光滑更宽松的条件,允许局部曲率随梯度范数增长。 |
| 重尾噪声 | 指随机梯度噪声的分布具有比高斯更厚的尾部,可能产生极端异常值。 |
| 裁剪 | 对梯度或更新量进行截断,以限制异常值的影响,提高算法稳定性。 |
| 各向异性失准 | 指自适应分母错误地学习了噪声的几何结构,导致更新方向出现持续偏差。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅