Ai2发布了面向大语言模型开发的新框架Olmo-core 3,重点解决混合专家(MoE)模型训练中的效率瓶颈。MoE模型每次生成token时只激活部分专家,总参数量大但计算量小,然而完整模型仍需占用大量GPU显存,专家间的协同也带来额外开销。Olmo-core 3通过专家并行、模型层分组切分和分布式优化器,将专家池从8个扩展到128个,同时每个token仅选择4个专家,使模型规模可扩展至超过一万亿参数。基准测试显示,在英伟达B3000 GPU上训练470亿参数模型时,其吞吐量达到每秒5.2万token,约为英伟达Megatron-core的2.7倍。该框架还支持MXFP8数值格式,进一步降低显存占用。这一进展意味着大规模MoE模型的训练门槛和成本有望显著下降。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅