🔥 今日值得一读 多模态推理提速新招:EPD分离技术让视觉编码与预填充各干各的!
When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model Serving
NVIDIA Developer Blog 🔥 重点 多模态算力论文方法 🕐 09-10 04:31

📖 AI 总结

NVIDIA Dynamo 实现了编码-预填充-解码(EPD)分离架构,将多模态推理中的视觉编码阶段与 LLM 的预填充、解码阶段解耦,以提升服务效率。文章指出,该方案在图像密集型提示、中短输出以及量化混合专家(MoE)模型场景下效果显著,可将首 token 延迟降低最多 5 倍、端到端响应时间缩短最多 7 倍。编码器部署有三种拓扑:聚合式服务、与预填充-解码工作节点共享 GPU 的同置部署,以及通过 NIXL 连接独立低成本 GPU 层的分离部署。收益大小取决于输入媒体负载、输出长度、模型规模与精度及流量构成;当解码主导延迟或大型稠密模型削弱视觉编码计算占比时,增益会明显收窄。在混合文本与多模态流量中,EPD 通过消除队头阻塞,使文本请求平均 TTFT 降低 42.2%,图像请求降低 30.8%。此外,将 LLM 权重量化为 NVFP4 而视觉编码器保持 BF16,可使同置 EPD 的有效吞吐从聚合服务的 1.78 倍提升至 2.64 倍。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅