该研究探讨了循环语言模型中应重复计算哪些模块的问题。传统方法通常重复整个层堆栈,但混合器(mixer)与稠密前馈网络(FFN)功能与成本各异。作者提出迭代传输秩(ITR)概念,用以衡量循环应用带来的非冗余影响力,并据此设计MixerLoop架构——仅重复Gated DeltaNet混合器,而FFN只执行一次。实验在15M和110M参数规模下对比无循环、全块循环与MixerLoop,结果显示MixerLoop在15M规模下综合性能超越全块循环,在110M规模下保留了41.5%的性能提升,同时将循环骨干投影的FLOPs降低45.9%。这证明循环深度的收益无需通过重复执行稠密FFN即可获得,为高效循环架构设计提供了新思路。
| Looped Language Models | 循环语言模型,一种通过重复应用共享计算来增强推理和知识操作能力的模型架构。 |
| MixerLoop | 一种循环策略,重复混合器层但仅应用一次密集前馈网络,以节省计算资源。 |
| Iterative Transport Rank (ITR) | 迭代传输秩,用于描述循环应用中累积影响轨迹的度量。 |
| Marginal ITR | 边际迭代传输秩,衡量连续循环应用贡献的非冗余影响。 |
| Gated DeltaNet | 门控DeltaNet,一种混合器架构,用于循环语言模型中的状态更新。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅