🔥 今日值得一读 小网训练大网直接用!性能稳到42倍宽度,还给出理论保证
Transferable Graph Metanetworks
arXiv ML (stat.ML) 🔥 重点 #元学习#图神经网络#权重空间 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
想用小模型训练、大模型推理?本文的图元网络能跨规模泛化,节省大模型训练成本。

📖 AI 总结

本文提出了一种可迁移图元网络(Transferable Graph Metanetworks),旨在解决权重空间网络在不同规模神经网络间泛化能力不足的问题。传统元网络通常仅在固定或少量规模的输入网络上训练和评估,跨规模泛化尝试效果有限,导致“小网络训练、大网络评估”的效率优势难以实现。作者通过引入两项设计原则对图元网络范式进行改进:一是对不同宽度网络表示同一函数的方式保持不变性,二是保证表示相似函数的权重获得相似预测,从而实现跨宽度迁移。实验表明,这些改进在各项任务上均显著提升了规模泛化能力,尤其在最大更新参数化(μP)训练的输入网络上表现最佳,可稳定泛化至训练宽度的42倍。理论方面,作者借助无限宽度极限理论证明了该模型在μP训练输入上的规模泛化保证,并解释了其他参数化下失效的原因。该工作为元网络的高效训练与跨规模部署提供了新思路。

🔑 关键词速览

权重空间网络一种以其他神经网络的权重为输入并预测其性质的神经网络模型。
图元网络一种将神经网络权重表示为图结构并进行元学习的模型范式。
大小泛化模型在训练时使用较小网络,但在评估时能泛化到较大网络的能力。
最大更新参数化一种神经网络参数化方法,旨在使超参数在不同宽度下保持最优,并促进宽度上的泛化。
无限宽度极限理论研究神经网络在宽度趋于无穷大时的理论性质,常用于分析泛化和训练动态。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅