🔥 今日值得一读 谷歌TPU跑Kimi比英伟达GPU快57%,用的还是DeepSeek推理框架!
谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架
量子位 🔥 重点 算力推理框架大模型 🕐 今天 15:12

📖 AI 总结

AI总结性摘要: 推理创业公司Inferact(vLLM原班人马创立)在16块谷歌TPU v7上运行Kimi K3,实现每秒709个Token的推理速度,比同配置的英伟达GB200快57%。测试中双方使用相同的模型、推理引擎和芯片数量,唯一变量是芯片及底层kernel实现。这一优势并非来自硬件规格——GB200的HBM带宽实际更高——而是源于软件层面的优化:Inferact用Pallas语言手写了名为megakernel的推理内核,将原本需调度的数百个独立小程序合并为一个大程序,消除了kernel切换时的带宽空转,并利用TPU可软件管理的片上内存实现跨层权重预取。配合DeepSeek提出的DSpark推测解码框架,TPU在关闭推测解码的裸速测试中同样领先近一倍,且精度无损。该方案目前针对Kimi K3定制,代码已开源。这一结果表明,在推理效率的竞争中,软件编排能力可能比硬件参数更具决定性。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅