NVIDIA 发布开源 C++ 示例项目 DIN Deploy,结合 ONNX Runtime 与 TensorRT RTX 执行提供程序,帮助开发者在 Windows 和 Linux 上构建本地硬件加速 AI 应用。每个示例采用 Python 导出器将 Hugging Face 模型转换为 ONNX 格式,再通过原生 C++ CLI 调用 ONNX Runtime 会话与张量 API 完成推理,实现模型转换与部署逻辑分离。项目覆盖语音识别(Whisper、Parakeet TDT、Nemotron ASR Streaming)、交互式分割(SAM 2.1)和图像生成(FLUX.2-klein-4B)等场景。在 DGX Spark 上的测试显示,GPU 加速效果显著:Nemotron ASR 流式识别达 39 倍实时,Parakeet TDT 达 206 倍,SAM 2.1 在 GPU 上为 38.3 FPS,而 CPU 仅 0.5 FPS。FLUX.2 示例还展示了 Vulkan 与 DirectX 图形互操作,以及通过 NVIDIA Model Optimizer 量化生成可直接替换的 ONNX 模型,无需修改应用代码。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅