🔥 今日值得一读 Ai2发布Olmo-core 3,万亿参数MoE大模型训练成本直降!
Ai2 releases Olmo-core 3 to make developing large mixture-of-experts LLMs more efficient
SiliconANGLE 🔥 重点 开源大模型论文方法算力 🕐 今天 00:15

📖 AI 总结

Ai2发布了面向大语言模型开发的新框架Olmo-core 3,重点解决混合专家(MoE)模型训练中的效率瓶颈。MoE模型每次生成token时只激活部分专家,总参数量大但计算量小,然而完整模型仍需占用大量GPU显存,专家间的协同也带来额外开销。Olmo-core 3通过专家并行、模型层分组切分和分布式优化器,将专家池从8个扩展到128个,同时每个token仅选择4个专家,使模型规模可扩展至超过一万亿参数。基准测试显示,在英伟达B3000 GPU上训练470亿参数模型时,其吞吐量达到每秒5.2万token,约为英伟达Megatron-core的2.7倍。该框架还支持MXFP8数值格式,进一步降低显存占用。这一进展意味着大规模MoE模型的训练门槛和成本有望显著下降。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅