研究团队将Helion集成到vLLM的线性后端,探索用自动调优的高层内核DSL提升大模型推理性能并降低内核实现复杂度。核心发现是:单一Helion通用矩阵乘法实现即可覆盖标准GEMM、Split-K和Swap-AB等多种算法变体,并通过按形状自动调优自动选出最优变体与配置。在NVIDIA Hopper GPU上,该后端结合按形状调优与混合调度,在所评估模型中超越了vLLM默认的CUTLASS和DeepGEMM后端,带来一致的端到端性能提升,部分工作负载吞吐量提升超过10%。这一结果表明,高层抽象与系统化自动调优的结合,能在减少手工内核特化工作的同时实现更优推理性能,为推理引擎的内核开发提供了可移植的新路径。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅