本文对比了稠密模型与混合专家(MoE)模型在参数使用、吞吐量和部署选择上的差异。核心区别在于:稠密模型对每个token激活全部参数,而MoE模型虽存储多个专家网络,但每个token仅路由至部分专家。以Nemotron 3.5 Lightning为例,该模型总参数300亿,每token仅激活30亿,说明MoE能将内存成本与计算成本解耦——全部专家加载至显存,但每次只激活子集,而稠密模型中两者同步增长。在总参数量相当时,MoE模型(如Nemotron 3.5 Lightning)的token吞吐量高于稠密模型(如Gemma 4 31B),但在高并发场景下延迟优势会收窄。此外,MoE微调需注意路由失衡问题,量化对路由层和循环投影层的影响也不同于稠密模型组件。文章指出,部署选择应综合考量内存预算、并发需求、微调计划和量化行为,而非仅看参数总量。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅