NVIDIA 在 MLPerf Inference v6.1 的 Edge Agentic 基准测试中,使用单台 Jetson AGX Thor 开发套件运行 TensorRT Edge-LLM 与 Qwen3.6-27B 模型,实现每秒 52.33 个 token 的生成速度,并在 24 分 36 秒内完成全部 1,007 轮性能负载,比 llama.cpp 参考实现的 2 小时 37 分钟快 6.4 倍。该结果依托 NVFP4 权重与激活量化、FP8 KV 缓存、基于树的多 token 预测以及跨智能体轮次的 KV 缓存复用,其中缓存复用使约 96% 的提示 token 命中热缓存,显著减少重复预填充计算;8 步、top-2、16 节点的验证树在函数调用负载上又带来约 40% 的解码性能提升。这一成果表明,智能体式 AI 正从云端走向车辆、机器人等边缘设备,而长上下文、多轮工具调用的推理需求可在受限功耗与内存条件下高效满足。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅