循环语言模型只重复混合器,性能保留41.5%却省45.9%算力!
Allocating Recurrent Compute in Looped Language Models
arXiv LG (cs.LG) 重要 #循环模型#计算分配 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
研究循环语言模型中混合器和前馈网络的不同循环策略,优化重复计算分配以提升推理和知识操作。

📖 AI 总结

该研究探讨了循环语言模型中应重复计算哪些模块的问题。传统方法通常重复整个层堆栈,但混合器(mixer)与稠密前馈网络(FFN)功能与成本各异。作者提出迭代传输秩(ITR)概念,用以衡量循环应用带来的非冗余影响力,并据此设计MixerLoop架构——仅重复Gated DeltaNet混合器,而FFN只执行一次。实验在15M和110M参数规模下对比无循环、全块循环与MixerLoop,结果显示MixerLoop在15M规模下综合性能超越全块循环,在110M规模下保留了41.5%的性能提升,同时将循环骨干投影的FLOPs降低45.9%。这证明循环深度的收益无需通过重复执行稠密FFN即可获得,为高效循环架构设计提供了新思路。

🔑 关键词速览

Looped Language Models循环语言模型,一种通过重复应用共享计算来增强推理和知识操作能力的模型架构。
MixerLoop一种循环策略,重复混合器层但仅应用一次密集前馈网络,以节省计算资源。
Iterative Transport Rank (ITR)迭代传输秩,用于描述循环应用中累积影响轨迹的度量。
Marginal ITR边际迭代传输秩,衡量连续循环应用贡献的非冗余影响。
Gated DeltaNet门控DeltaNet,一种混合器架构,用于循环语言模型中的状态更新。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅