NVIDIA 发布 AIPerf,作为 GenAI-Perf 的正式继任者,用于大规模 LLM 推理基准测试。该工具采用多进程架构,解决了单进程方案在高并发下受 Python GIL 限制、客户端自身成为瓶颈的问题。AIPerf 支持超过 15 种端点类型,以及 ShareGPT 和 Mooncake、Baseten、WEKA AgentX 等追踪回放格式的公开数据集,可模拟真实工作负载。它提供恒定、泊松和伽马分布等可配置的请求到达模式,并支持调节突发性以匹配生产流量特征。核心指标涵盖首令牌延迟、令牌间延迟、请求延迟和输出令牌吞吐量,均附带百分位分布,并在可用时结合 DCGM 或 pynvml 提供 GPU 遥测数据。该工具的意义在于让工程师能够以可信、可复现的方式评估推理系统在真实并发条件下的性能表现。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅