这篇文章报道了智谱AI与阿里巴巴Qwen团队在几乎同一时间分别发布的两款前沿开源模型——GLM-5.3-Flash和Qwen3.8-Flash-Next,并指出两者在架构设计上出现了惊人的独立趋同。GLM-5.3-Flash是一个320B参数的多模态MoE模型,激活18B参数;而Qwen3.8-Flash-Next是125B参数、激活6B的Qwen4架构预览版。文章核心发现是,两个团队在互不知情的情况下,均采用了3:1的线性与全注意力混合机制、压缩至2048令牌的索引器、4门控分支的残差流扩展,以及Muon优化器。唯一分歧在于线性注意力层的具体实现方式。这一现象表明,当前大模型架构的演进可能正收敛于一个共同的最优解,对行业具有重要参考意义。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅