NVIDIA 在 TensorRT 11.0 中正式支持多设备推理,使单个 TensorRT 网络能够借助 NCCL 分布式集合通信跨多块 GPU 执行,同时保留 TensorRT 的推理优化。Dynamo-Triton 26.07 版本进一步开放了 TensorRT 后端的这一能力,让一个 KIND_MODEL 实例即可拥有多块 GPU,并对外暴露单一 gRPC 端点,应用无需自行协调各 GPU rank。文章以 Cosmos 3 Nano 视频生成为例,通过 Ulysses 上下文并行将 44,160 个视频 token 分配到最多八块 GPU,端到端生成延迟从单卡的 156.6 秒降至八卡的 34.2 秒,Transformer RPC 加速比达 6.09 倍,且输出质量符合预设阈值。该集成弥合了多 GPU 加速与实际可消费推理服务之间的差距,团队可在保持应用接口与工作流稳定的前提下,用更多 GPU 换取更低延迟,并将引擎打包为带版本的 Triton 模型。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅