阿里巴巴发布Qwen3.8-Flash-Next,这是一款面向极致成本效率的多模态混合专家模型,也是Qwen4架构的预览版。模型总参数达1250亿,但每个Token仅激活60亿参数,并引入51亿参数的N-gram嵌入层,该层作为“短语词典”存储常见词组,可运行于系统内存而非GPU,显著降低硬件成本。据团队称,该模型以约九分之一的训练成本实现优于Qwen3.7-Plus的性能,尤其在编码和办公任务上表现突出。在基准测试中,Flash-Next在多数任务上领先于参数规模更大的DeepSeek-V4-Flash和Claude Opus 4.6,例如在CoWorkBench上得分73.9,远超DeepSeek的45.1。模型原生支持262,144 Token上下文窗口,可扩展至百万Token,生产版本通过QwenCloud以极低价格提供API服务。这一发布展示了通过架构创新实现高性能与低成本并行的可能性,为AI模型部署提供了新方向。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅