该研究提出一种逐层解耦的结构化稀疏化方法,用于压缩预训练神经网络的全连接层。与对所有层联合施加惩罚不同,该方法将网络拆解为浅层双线性子网络,对内层权重归一化,并对每个子网络的外层权重矩阵施加结构化组惩罚,逐层剪枝神经元以缩减各层宽度。作者证明,在任意正齐次激活函数下,该解耦约束目标在最优解处等价于对内外权重的特定联合惩罚,因而具备清晰的投影与近端求解形式。核心发现是解耦重构比耦合方法更稳健:数值实验中,它提供更宽的正则化强度可用区间,灾难性过度剪枝的发生率低于所测试的联合基线,同时保持相当精度。该结论在受控分类与稀疏恢复实验中确立,并在高维PINN压力测试及OPT-1.3B前馈层中得到验证。
| 结构化稀疏化 | 通过移除整个神经元或通道等结构单元来压缩神经网络,而非随机删除单个权重。 |
| 逐层解耦 | 将网络各层的稀疏化问题分开独立处理,而不是对所有层联合优化。 |
| 组惩罚 | 一种正则化项,对权重矩阵的整组元素(如一行或一列)施加惩罚,促使整组为零。 |
| 正齐次激活 | 满足 f(αx)=αf(x) 对任意 α≥0 成立的激活函数,如 ReLU。 |
| 灾难性过度剪枝 | 剪枝过程中移除过多神经元导致模型性能急剧下降的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅