深度平衡模型训练崩了?新方法让98%场景误差直降5%!
Response Renormalization for Critical Deep Equilibrium Models
arXiv LG (cs.LG) 重要 论文方法深度学习 🕐 08-26 12:00

📖 AI 总结

该研究针对深度平衡模型(DEQ)在训练中因残差雅可比矩阵近奇异导致梯度放大、优化不稳定的问题,提出了一种名为“响应重整化”的后向传播框架。该方法通过提升选定的近极点分母,同时保持未提升响应通道不变,在低维临界子空间内实施校正,并衍生出集体模式响应重整化(CMR)及基于正磁化率规则的Phi自适应CMR两种变体。研究在涵盖偏微分方程、三维场、算子映射、复杂几何及粒子系统的23个多物理场家族中进行了验证,结果显示在超过98%的静态和95%的瞬态对比中,测试误差仅比精确隐式微分训练高出不超过5%。实验还表明该方法能向静态伴随收敛,并在物理时间推进中保持预测保真度。该工作的意义在于证明选择性响应重整化能有效控制近临界伴随放大,而无需全局抑制良态敏感性,从而在提升参数更新可靠性的同时保留学习所需的有效梯度信息。

🔑 关键词速览

Deep Equilibrium Models (DEQs)深度平衡模型,一种通过隐式方程求解隐藏表示平衡点的神经网络架构。
Response Renormalization响应重整化,一种后向传播框架,用于修正伴随系统中近奇异雅可比矩阵引起的梯度放大问题。
Collective Mode Response Renormalization (CMR)集体模式响应重整化,在低维临界子空间中应用响应重整化的方法。
Phi-adaptive CMRPhi自适应CMR,根据正磁化率规则计算有界响应质量的CMR变体。
Structured Implicit Layers and Vector Attractors (SILVA)结构化隐式层和向量吸引子,一种扩展隐式层架构的框架。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅