本文提出一种可微、可认证的算法复杂度估计器,将算法信息动力学引入学习过程,用以研究并调控神经网络中的“顿悟”现象。作者以该估计器作为控制器,通过施加瞬态损失扰动来加速顿悟,其效果在Levin的描述长度—时间意义下得到验证,并受制于一个数据依赖的奥卡姆边界,其有限尺度趋势与优惠券收集者模型一致。消融实验显示,复杂度门控在挽救失败随机种子时比训练损失门控减少约27%的干预;在测试信号中,仅映射复杂度能标记顿悟转变的完成。研究还发现,认证先验与逐参数梯度归因可被替代,而直接场扰动呈现类成核响应。该估计器的独特贡献在于决定干预时机,而非归因,且该机制可迁移至稀疏奇偶任务与Transformer。
| Algorithmic Information Dynamics (AID) | 通过扰动系统并测量算法复杂度变化来研究系统行为的框架。 |
| Grokking | 神经网络在训练损失收敛后,测试性能突然从随机水平跃升至完美泛化的现象。 |
| Block Decomposition Method | 一种常用的算法复杂度估计方法,通过分块分解计算复杂度,但结果是分段常数。 |
| K^{CDM}_{sF} | 一种经过认证的可微算法复杂度估计量,用于将微积分引入学习动力学。 |
| Occam boundary | 数据依赖的奥卡姆边界,表示在描述长度与时间权衡下模型复杂度的限制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅