加一层就废!新门梯度恒为零,Iris暴跌19.6个点,一行断言即可修复
Four Ways to Grow a Classifier and Why One of Them Cannot Learn
arXiv LG (cs.LG) 重要 #构造式学习#软决策树#理论分析 🕐 今天 12:00

📖 AI 总结

本文研究构造式分类器在训练过程中动态增加结构(如树的层级、隐藏层单元、叶节点分裂)时,不同增长决策的实际效果,并在统一的实验协议下对树结构与构造式模型进行比较。核心发现是:在软决策树中最自然的加深方式——将每个叶节点变为门控、让两个子节点继承父节点的类别分布——会导致新门控的梯度恒为零,且当门控取1/2时两个子节点梯度完全相同,因此新增层级永远无法学习。作者证明此时一阶信息不是微弱而是完全缺失,这与Net2Net用噪声打破对称、分裂最速下降用二阶信息逃离鞍点有本质区别。实验显示,该构造在Iris、Wine和Digits上分别比同深度从头训练损失19.6、19.1和55.6个准确率点;修复方法是对子节点施加小幅随机扰动,扰动幅度影响甚微。其余三种增长决策各有所得:用残差拟合新隐藏单元可减小网络规模但不提升精度,在Digits上还显著损失精度;分裂期望误差最大的叶节点可带来稀疏性,但会损失精度;要求统计显著性再分裂则毫无收益。作者据此提出一条实用规则:新增参数后应断言其梯度非零。

🔑 关键词速览

构造性分类器在训练过程中动态添加结构(如树层、隐藏单元、叶分裂)的机器学习模型。
软决策树一种决策树变体,其中节点使用软(概率)决策而非硬阈值,通常可微分。
梯度消失在神经网络训练中,梯度变得非常小或为零,导致参数无法有效更新。
Net2Net一种通过添加新单元或层来加速训练的方法,通常使用噪声打破对称性。
分裂最速下降一种优化方法,通过分裂节点来逃离鞍点,利用二阶信息。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅