本文提出一种名为解码延迟反馈预填充(DLFP)的无模型控制器,用于缓解并发自回归推理中长提示预填充对正在解码请求的干扰。该方法仅调整与活跃解码重叠的预填充工作量,通过受保护的调度周期观测到的间隔作为比例反馈,动态调整下一次预填充分块大小,而孤立预填充不受限制。作者在vLLM中实现DLFP,并在单张A100 80GB GPU上以BF16精度运行Qwen3-0.6B进行评测。三组各100请求的配对试验显示,P99令牌间延迟分别降低24.8%、30.1%和28.2%,平均降低27.7%,且输出完全一致、无失败、SLO合规性不变;代价是平均P99首令牌时间增加34.8%,但仍处于声明的SLO范围内。关键发现是该机制无法泛化到Qwen3-8B、Qwen3-32B及双GPU张量并行配置,原因在于异步调度器调用间隔仅是GPU迭代完成时间的代理指标。这一负面结果界定了该贡献的边界,并指向需要基于完成时间设计控制器,以适用于CPU与设备端并发推理场景。
| Decode-Latency Feedback Prefill (DLFP) | 一种无模型控制器,通过解码延迟反馈动态调整预填充块大小,以减少对正在解码请求的干扰。 |
| Prefill | 在自回归推理中,处理输入提示词并生成初始键值缓存的计算阶段。 |
| P99 inter-token latency | 第99百分位的令牌间延迟,衡量解码过程中相邻令牌生成时间间隔的尾部延迟。 |
| Time to first token (TTFT) | 从请求发出到生成第一个输出令牌所需的时间,是衡量预填充阶段延迟的关键指标。 |
| Tensor-parallel configuration | 一种将模型张量拆分到多个 GPU 上并行计算以加速推理的分布式部署方式。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅