Z.ai发布了GLM-5.3-Flash,这是GLM-5系列首款原生多模态模型,采用混合专家架构,总参数量320B,每token激活18B参数,支持104.8万token上下文窗口,可处理图像和视频输入,并以MIT许可证开源。据Z.ai报告,该模型在基准测试和实际任务中超越GLM-5.2,价格约为其十分之一,内部编码基准得分与Claude Opus 4.8差距在0.5分以内。模型在发布首周以匿名身份运行于OpenCode和OpenRouter,完全部署在中国国产AI芯片上。部署方面,FP8检查点约306GiB,需NVIDIA Hopper及以上GPU,适合中型和大型组织自托管,其余用户可通过API使用。架构创新包括首次在GLM系列中结合线性和稀疏注意力,基于30T token多模态语料库训练。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅