智谱于8月26日上线并开源了GLM-5.3-Flash(320B-A18B),这是GLM-5系列的首个原生多模态模型,总参数达320B,能力超越前代,在AA综合智能指数中获得57分,与Claude Opus 4.8持平,进入全球前沿模型区间。该模型架构专为极低成本设计,结合30T Token多模态预训练语料,以更少计算资源实现更强性能。商汤大装置为其提供国产算力支持,通过异构混推技术实现规模化商用。在正式发布前,该模型以匿名形式在OpenCode和OpenRouter上完成62T Token的大规模测试,全部由国产芯片支撑,端到端服务性能较基线提升3倍,硬件效率和单Token成本已接近英伟达GPU水平。商汤大装置通过“Token工厂”体系整合多元算力,7月日均Token服务量达2.42万亿,预计年底突破日均10万亿。这一合作标志着国产算力已能高效支撑前沿大模型的大规模真实业务推理需求,从“单点可用”走向“大规模商用”。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅