🔥 今日值得一读 可微复杂度控制器让grokking提速,干预减少27%!
Algorithmic Information Dynamics of Learning: A Certified, Differentiable Complexity Controller for Grokking
arXiv LG (cs.LG) 🔥 重点 #训练方法#算法信息论#可解释性#优化 🕐 09-15 12:00
👨‍💼 主理人解读 · 为什么值得关注
把可微复杂度估计器当作训练控制器来加速grokking,开发者可尝试用它调控训练动力学。

📖 AI 总结

本文提出一种可微、可认证的算法复杂度估计器,将算法信息动力学引入学习过程,用以研究并调控神经网络中的“顿悟”现象。作者以该估计器作为控制器,通过施加瞬态损失扰动来加速顿悟,其效果在Levin的描述长度—时间意义下得到验证,并受制于一个数据依赖的奥卡姆边界,其有限尺度趋势与优惠券收集者模型一致。消融实验显示,复杂度门控在挽救失败随机种子时比训练损失门控减少约27%的干预;在测试信号中,仅映射复杂度能标记顿悟转变的完成。研究还发现,认证先验与逐参数梯度归因可被替代,而直接场扰动呈现类成核响应。该估计器的独特贡献在于决定干预时机,而非归因,且该机制可迁移至稀疏奇偶任务与Transformer。

🔑 关键词速览

Algorithmic Information Dynamics (AID)通过扰动系统并测量算法复杂度变化来研究系统行为的框架。
Grokking神经网络在训练损失收敛后,测试性能突然从随机水平跃升至完美泛化的现象。
Block Decomposition Method一种常用的算法复杂度估计方法,通过分块分解计算复杂度,但结果是分段常数。
K^{CDM}_{sF}一种经过认证的可微算法复杂度估计量,用于将微积分引入学习动力学。
Occam boundary数据依赖的奥卡姆边界,表示在描述长度与时间权衡下模型复杂度的限制。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅