NVIDIA 发布技术博客,介绍其 NIM 全栈推理优化在 Nemotron 3 Ultra 模型上的性能表现。在 4xB200 系统上,NIM 2.0.12 优化服务栈相比未优化的基线方案,系统吞吐量最高提升 2.5 倍,在每用户 50 TPS 的交互性目标下实现每秒 1997 个 token 的处理能力。这一提升来自多项优化的组合,包括自动调优内核、张量并行、前缀与状态复用、调度与内存调优,以及 MTP 投机解码。文章强调推理性能是系统性工程,各环节相互影响,NIM 的价值在于将模型与 GPU 感知的服务配置打包为可部署的微服务,提供经过验证的配置、标准 API 和企业级容器生命周期,开发者还可借助 AIPerf 回放真实流量进行基准测试,选择满足延迟目标的帕累托最优点。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅