AI总结性摘要: 推理创业公司Inferact(vLLM原班人马创立)在16块谷歌TPU v7上运行Kimi K3,实现每秒709个Token的推理速度,比同配置的英伟达GB200快57%。测试中双方使用相同的模型、推理引擎和芯片数量,唯一变量是芯片及底层kernel实现。这一优势并非来自硬件规格——GB200的HBM带宽实际更高——而是源于软件层面的优化:Inferact用Pallas语言手写了名为megakernel的推理内核,将原本需调度的数百个独立小程序合并为一个大程序,消除了kernel切换时的带宽空转,并利用TPU可软件管理的片上内存实现跨层权重预取。配合DeepSeek提出的DSpark推测解码框架,TPU在关闭推测解码的裸速测试中同样领先近一倍,且精度无损。该方案目前针对Kimi K3定制,代码已开源。这一结果表明,在推理效率的竞争中,软件编排能力可能比硬件参数更具决定性。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅