宽度和参数量竟能互换!神经网络逼近精度提升有捷径
Optimal Tradeoffs Between Network Size and Parameter Magnitude in Neural Approximation and Minimax Regression
arXiv ML (stat.ML) 重要 #逼近理论#统计学习理论#网络规模 🕐 今天 12:00

📖 AI 总结

该研究探讨神经网络规模与参数幅度之间的最优权衡关系,指出统计精度同时取决于网络的逼近能力与拟合模型类的复杂度。作者采用单一有界1-Lipschitz二元三角激活函数,在固定深度下建立了精确的宽度-幅度权衡理论。对于单位β-Hölder球上的逼近问题,当网络宽度N≥2d+3且参数幅度上界为T≥1时,最优L^p逼近误差阶为[N²log(eNT)]^{-β/d},且该下界对任意全局Hölder激活函数均成立。在统计回归方面,深度23的近似最小二乘估计在适当条件下可达到经典Hölder极小极大风险率,且无对数损失。研究进一步表明,固定网络规模下四层隐藏层即可实现近最优参数半径,六层则可达到最优阶。该工作为神经网络设计中规模与参数幅度的联合优化提供了理论依据。

🔑 关键词速览

Dyadic-Triangular Activation一种有界1-Lipschitz激活函数,用于建立宽度-幅度权衡。
Hölder BallHölder空间中的单位球,用于描述函数的光滑性。
Minimax Risk在统计决策理论中,最坏情况下的最小风险,用于衡量估计的最优性。
Sub-Gaussian Noise一种轻尾噪声分布,其尾部衰减速度至少与高斯分布一样快。
Approximate Least Squares一种回归方法,通过最小化近似平方误差来拟合模型。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅