🔥 今日值得一读 阿里开源Qwen3.8-Flash-Next:180B参数仅激活6B,训练成本暴降9倍!
Alibaba’s Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture
MarkTechPost 🔥 重点 大模型多模态开源论文方法 🕐 08-26 23:20

📖 AI 总结

阿里巴巴Qwen团队发布Qwen3.8-Flash-Next,这是一款面向低成本推理的多模态混合专家模型。模型总参数量达125B,配合51B的N-gram嵌入表和4B的多token预测模块,但每个token仅激活6B参数。该模型被视为Qwen4架构的早期预览,其核心创新包括四项:混合注意力机制(每四层中三层使用Gated DeltaNet线性注意力,一层使用Qwen稀疏注意力)、门控残差结构、N-gram嵌入以及Muon优化器。据团队报告,训练成本约为Qwen3.7-Plus的九分之一。模型支持部署,但需较高硬件配置,FP8版本需172.78 GiB存储,推荐在GB300上使用TP2配置或8×H200节点上使用TEP8。该发布延续了Qwen系列通过稀疏激活降低计算成本的技术路线,为下一代架构奠定基础。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅