重尾噪声下AdaGrad竟会方向失准?裁剪一招修复,复杂度直降至ε的负二次方!
Why Clipping Matters in AdaGrad? Toward a High-Probability Theory under Generalized Smoothness
arXiv LG (cs.LG) 重要 #优化器#理论分析#训练方法 🕐 今天 12:00

📖 AI 总结

本文在广义光滑性与重尾噪声(仅假设有界条件二阶矩)条件下,分析了原始同步坐标级 AdaGrad 的收敛行为。作者发现,不加裁剪的 AdaGrad 会出现“各向异性失准”:自适应分母可能学到的不是目标函数的局部曲率,而是稀有噪声冲击的几何结构,从而产生持续的方向性扭曲,阻碍有限时域内的欧氏空间进展。文章进一步证明裁剪能够修复这一失效模式,并给出原始非滞后 AdaGrad 更新的有限时域高概率收敛保证,其梯度平方均值上界为 O(d(√log T + log(1/δ))/√T),对应 Õ(ε⁻²) 的复杂度。该结果表明,在重尾噪声下,裁剪并非单纯的鲁棒性启发式技巧,而是维持自适应几何结构稳定的关键机制。

🔑 关键词速览

AdaGrad一种自适应梯度优化算法,根据历史梯度平方和调整每个坐标的学习率。
广义光滑性一种比传统L-光滑更宽松的条件,允许局部曲率随梯度范数增长。
重尾噪声指随机梯度噪声的分布具有比高斯更厚的尾部,可能产生极端异常值。
裁剪对梯度或更新量进行截断,以限制异常值的影响,提高算法稳定性。
各向异性失准指自适应分母错误地学习了噪声的几何结构,导致更新方向出现持续偏差。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅