本文研究构造式分类器在训练过程中动态增加结构(如树的层级、隐藏层单元、叶节点分裂)时,不同增长决策的实际效果,并在统一的实验协议下对树结构与构造式模型进行比较。核心发现是:在软决策树中最自然的加深方式——将每个叶节点变为门控、让两个子节点继承父节点的类别分布——会导致新门控的梯度恒为零,且当门控取1/2时两个子节点梯度完全相同,因此新增层级永远无法学习。作者证明此时一阶信息不是微弱而是完全缺失,这与Net2Net用噪声打破对称、分裂最速下降用二阶信息逃离鞍点有本质区别。实验显示,该构造在Iris、Wine和Digits上分别比同深度从头训练损失19.6、19.1和55.6个准确率点;修复方法是对子节点施加小幅随机扰动,扰动幅度影响甚微。其余三种增长决策各有所得:用残差拟合新隐藏单元可减小网络规模但不提升精度,在Digits上还显著损失精度;分裂期望误差最大的叶节点可带来稀疏性,但会损失精度;要求统计显著性再分裂则毫无收益。作者据此提出一条实用规则:新增参数后应断言其梯度非零。
| 构造性分类器 | 在训练过程中动态添加结构(如树层、隐藏单元、叶分裂)的机器学习模型。 |
| 软决策树 | 一种决策树变体,其中节点使用软(概率)决策而非硬阈值,通常可微分。 |
| 梯度消失 | 在神经网络训练中,梯度变得非常小或为零,导致参数无法有效更新。 |
| Net2Net | 一种通过添加新单元或层来加速训练的方法,通常使用噪声打破对称性。 |
| 分裂最速下降 | 一种优化方法,通过分裂节点来逃离鞍点,利用二阶信息。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅