本文研究宽贝叶斯神经网络中高斯平均场变分推断的“先验主导”问题:随着网络宽度增大,ELBO中的KL正则项压过期望对数似然,导致变分预测分布退化为先验预测。作者通过对似然进行温度调节(即按1/T次幂缩放,等价于将KL项乘以T)来探讨温度随宽度M下降的速度应如何设定,才能抵消这种退化。针对单隐层线性网络和各向同性高斯先验,作者推导了温度调度T=τ/M^c下预测分布的极限形式,并与未调节的NNGP后验进行比较。核心发现是预测期望与方差在不同尺度上发生相变:期望在c=1/2处脱离先验值,当τ低于显式阈值后,在c>1/2时等于最小二乘预测;而方差在c<1时保持先验值,c=1时与NNGP一致,c>1时消失。通过适当选取τ和c,可分别恢复NNGP后验的期望或方差。该结果为温度调节在宽网络变分推断中的尺度选择提供了明确的理论边界。
| 先验主导 | 在变分推断中,KL正则化项过强导致后验近似坍缩为先验的现象。 |
| 似然退火 | 通过将似然函数提高到$1/T$次幂来调整其强度,以平衡先验与似然的影响。 |
| 神经网络高斯过程 | 无限宽神经网络等价于高斯过程,其核函数由网络结构决定。 |
| 相变 | 系统参数变化时,宏观行为发生突然定性改变的现象。 |
| 变分预测矩 | 在变分贝叶斯框架下,预测分布的期望和方差等矩。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅