🔥 今日值得一读 训练成本砍到1/9!阿里125B大模型每token只激活6B,性能还更强了!
Qwen3.8-Flash 发布:125B MoE,激活 6B,训练成本仅前代的 1/9
开源中国 🔥 重点 大模型开源算力 🕐 08-27 11:39

📖 AI 总结

阿里通义千问团队发布Qwen3.8-Flash,这是一款采用混合专家架构的大语言模型,总参数达125B,但通过稀疏激活机制,每个token仅激活6B参数,显著降低推理成本。模型原生支持262K上下文,并可扩展至1M。相比前代Qwen3.7-Plus,训练开销降至1/9,同时在编码和办公任务上表现更强。架构上引入四项关键改进,包括N-gram Embedding(51B参数)等设计,旨在平衡性能与效率。该模型发布标志着大模型训练成本与能力权衡的新进展,为高性价比AI应用提供了可能。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅