本文研究分离式大语言模型服务中的请求路由问题,即在预填充与解码分别部署于不同GPU池的架构下,如何决定每个请求由哪个实例处理。作者设计了一个路由器,依据精确提示长度、预测输出长度、准入后KV缓存压力及SLO类别来估计各实例的额外完成时间,先在离散事件模拟器中开发策略,再在八块NVIDIA A40 GPU上以vLLM引擎和NIXL缓存传输进行验证,所有负载均运行于实测饱和状态。在三组混合突发到达轨迹上,经校准的路由器取得最高平均有效吞吐0.864,优于轮询、最少负载和长度启发式方法的0.835至0.847,且跨轨迹方差最低。研究强调硬件校准的重要性:使用模拟器推导的常数会损失4.5个有效吞吐点及约四成尾部延迟优势。收益随解码池规模和流量异构性增加而扩大,但在仅三个实例的池中消失;极端资源稀缺时,贪心最小化成本反而不如盲目分散。校准后,学习型路由器用六块GPU即可达到轮询用七块GPU的有效吞吐。
| 解耦式LLM服务 | 将LLM推理的预填充和解码阶段分离到不同GPU池的架构。 |
| KV缓存 | 键值缓存,用于存储注意力机制中的键和值,以加速自回归生成。 |
| 有效吞吐量 | 满足服务等级目标(SLO)的请求吞吐量,衡量系统有效处理能力。 |
| SLO类别 | 服务等级目标类别,定义请求的延迟或吞吐量要求。 |
| NIXL | 一种用于在GPU池之间高效传输KV缓存的通信库或协议。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅