🔥 今日值得一读 Adam在神经网络中偏离自然梯度达1000倍,却仍能稳定达到低损失!
How Far is Adam from Natural Gradient Descent?
arXiv LG (cs.LG) 🔥 重点 #优化器#自然梯度#训练方法 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮助理解Adam与自然梯度的差距,为设计更优优化器提供理论依据。

📖 AI 总结

本研究考察了深度学习标准优化器 Adam 与自然梯度下降(NGD)之间的几何关系。作者将 Adam 的完整更新规则(含动量项)建模为对角经验 Fisher 近似,并引入对角截断、经验标签替换和时间滞后三种偏差来源,采用尺度不变的 γ(Δθ) 度量,在良态线性回归、病态线性回归、逻辑回归及非凸小型神经网络四类损失景观上量化 Adam 相对真实 NGD 的几何偏离。结果显示,Adam 的几何轨迹依赖具体情境:良态条件下偏离较小,病态条件下显著上升,在神经网络中错位程度可达约 10³。几何漂移越大,初始优化越慢,但最终目标最小化并未受损,Adam 始终能达到较低损失。此外,改进经验 Fisher(iEF)比标准经验 Fisher(EF)路径更稳定,后者常出现振荡或发散。研究据此提出,Adam 的实际优化能力可能源于结构近似误差与动量平滑之间的平衡,而非对自然梯度路径的紧密跟踪。

🔑 关键词速览

Adam一种自适应学习率优化算法,结合了动量和RMSProp,广泛用于深度学习训练。
自然梯度下降 (NGD)一种利用Fisher信息矩阵进行预条件的优化方法,考虑参数空间的几何结构。
经验Fisher (EF)基于训练数据估计的Fisher信息矩阵,用于近似自然梯度中的曲率信息。
尺度不变度量 γ(Δθ)一种衡量参数更新几何偏差的度量,对参数缩放不敏感。
对角截断将Fisher信息矩阵近似为对角矩阵,忽略非对角元素以降低计算复杂度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅