本文以教程形式深入解析了 NVIDIA cuDNN Frontend 的 Graph API,展示如何绕过框架直接以计算图方式描述算子、由 cuDNN 自动选择执行引擎,并进一步手动接管引擎选择。所有内核均采用统一流程构建:按维度和步长声明张量、串联操作、执行“验证—构建操作图—创建执行计划—检查支持—构建计划”五步流水线,最后通过指针变体包执行。教程在单块 Colab GPU 上运行,并将每个结果与 PyTorch 参考实现对比,以验证融合的正确性并衡量其开销。内容层层递进,从单一融合卷积扩展到跨引擎配置的自动调优、FP8 风格尾声、注意力机制、计划序列化、动态形状以及 CUDA 图捕获,系统呈现了 cuDNN 图 API 在算子融合、自动调优与计划复用方面的能力与代价。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅