🔥 今日值得一读 英伟达Jetson AGX Thor跑智能体基准,TensorRT Edge-LLM提速6.4倍!
TensorRT Edge-LLM Completes the MLPerf Edge Agentic Benchmark 6.4x Faster on Jetson AGX Thor
NVIDIA Developer Blog 🔥 重点 算力Agent大模型 🕐 09-17 04:37

📖 AI 总结

NVIDIA 在 MLPerf Inference v6.1 的 Edge Agentic 基准测试中,使用单台 Jetson AGX Thor 开发套件运行 TensorRT Edge-LLM 与 Qwen3.6-27B 模型,实现每秒 52.33 个 token 的生成速度,并在 24 分 36 秒内完成全部 1,007 轮性能负载,比 llama.cpp 参考实现的 2 小时 37 分钟快 6.4 倍。该结果依托 NVFP4 权重与激活量化、FP8 KV 缓存、基于树的多 token 预测以及跨智能体轮次的 KV 缓存复用,其中缓存复用使约 96% 的提示 token 命中热缓存,显著减少重复预填充计算;8 步、top-2、16 节点的验证树在函数调用负载上又带来约 40% 的解码性能提升。这一成果表明,智能体式 AI 正从云端走向车辆、机器人等边缘设备,而长上下文、多轮工具调用的推理需求可在受限功耗与内存条件下高效满足。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅