智谱推出 GLM-5.3 的加速版本 GLM-5.3-FlashX,最高推理速度达到 200 tokens/s。此前 GLM-5.3 以匿名身份上线时,已是 OpenCode 和 OpenRouter 两大平台调用量最大的模型,此次新版本在此基础上进一步强化了响应速度。值得关注的是其底层算力背景:上一代 GLM 上线时,团队在由 10 万张国产芯片组成的集群上从零搭建推理服务,面临诸多工程难点。这意味着该模型的高速推理能力建立在国产算力基础之上,而非依赖海外芯片。此举既展示了国产芯片集群支撑大规模模型推理服务的可行性,也表明国产大模型在推理效率优化上取得实质进展,对推动国产算力与大模型协同落地具有参考意义。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅