NVIDIA 团队开发了一种基于智能体的 AI 翻译方案,将 TileGym 库中原本用 cuTile Python 和 Triton-TileIR 编写的 GPU 内核迁移到 Rust。cuTile Rust 将 Rust 的所有权模型扩展到基于 tile 的 GPU 内核,把可变输出拆分为互不重叠的部分,并在内核启动间保持主机端所有权约定。翻译流程采用有界多智能体工作流,每个阶段都设有可机器校验的判定,包括与参考 Tile IR 做 IR 差异比对以验证结构等价性。团队据此移植了全部 24 个公开 TileGym 算子,涵盖约 40 个 GPU 内核,从逐元素操作到 flash-attention 解码、MLA 和 MoE 模型。在 DGX B200 上的基准测试显示,所有算子均通过 0.95 的几何平均加速阈值,整体性能达到 cuTile Python 的 99.5%。转换后的内核通过 C-ABI 层与 TileGym 集成,无需拷贝或分配即可传递张量描述符,支持惰性编译。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅