本文研究贝叶斯神经网络中哪些参数需要保持随机性这一开放问题。作者提出对参数先验标准差(即先验尺度)施加深度权重分解,并以最大均值差异目标将函数先验拟合到高斯过程,从而学习随机与确定性的划分:当某参数的先验尺度低于阈值时,该参数转为确定性并在推断中优化,因此正则化稀疏化的是随机性而非模型容量。作者给出了可在多项式时间内验证的通用条件密度逼近证书,以及失败时的最小修复方案;同时证明常见的“部分采样、部分优化”混合方案实为第二类最大后验目标的随机逼近,且耦合步长会留下不随步长缩小而消失的跟踪误差。在双峰目标上,学习到的划分在各预算下均接近无约束参考且对阈值不敏感,而随机掩码方案误差最高可差两个数量级;在UCI基准上,该方法性能与全随机网络相当,却使约一半参数保持确定性。
| 贝叶斯神经网络 | 一种将网络权重视为概率分布的神经网络,通过贝叶斯推断进行训练,能提供预测不确定性。 |
| 深度权重因子分解 | 一种对神经网络权重进行低秩或结构化分解的技术,用于减少参数数量或引入正则化。 |
| 最大均值差异 | 一种用于衡量两个概率分布差异的统计量,常用于训练生成模型或拟合分布。 |
| 类型-II最大后验 | 一种贝叶斯估计方法,通过最大化边际似然来估计超参数,而非直接估计参数。 |
| 条件密度逼近 | 指模型能够逼近给定输入下输出变量的条件概率密度函数的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅