🔥 今日值得一读 智谱GLM-5.3-FlashX上线,国产卡推理飙到200 token/s!
GLM-5.3-FlashX 上线,智谱把国产卡上的推理速度顶到 200 token/s
开源中国 🔥 重点 大模型算力开源 🕐 09-18 15:26

📖 AI 总结

智谱推出 GLM-5.3 的加速版本 GLM-5.3-FlashX,最高推理速度达到 200 tokens/s。此前 GLM-5.3 以匿名身份上线时,已是 OpenCode 和 OpenRouter 两大平台调用量最大的模型,此次新版本在此基础上进一步强化了响应速度。值得关注的是其底层算力背景:上一代 GLM 上线时,团队在由 10 万张国产芯片组成的集群上从零搭建推理服务,面临诸多工程难点。这意味着该模型的高速推理能力建立在国产算力基础之上,而非依赖海外芯片。此举既展示了国产芯片集群支撑大规模模型推理服务的可行性,也表明国产大模型在推理效率优化上取得实质进展,对推动国产算力与大模型协同落地具有参考意义。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅