这篇论文研究长生命周期会话场景下KV缓存在GPU显存、CPU内存和SSD之间的分层放置策略。作者构建了一个覆盖三层存储的离散事件模拟器,并用随机森林执行时间预测器进行校准,在聊天、智能体和文档问答三类负载上比较了最近使用、重用频率、预测重用和EWMA预测加预取等策略。核心发现是:分层带来的收益主要来自容量扩展而非放置策略本身,可实现单GPU并发会话数提升73.02倍、单会话成本降低62.04倍;在批大小为1时解码受算力限制,放置策略对吞吐影响甚微,主要影响PCIe迁移流量和首token延迟。聊天负载下最近使用策略的迁移流量比重用频率低2.30倍,而智能体和文档问答则适合重用频率策略。研究还指出,现有预测重用策略与最近使用策略字节级相同,真正的EWMA预测器表现仍不及重用频率,预取也无法证明其带宽成本合理,即便使用知晓未来请求的预言机也未能在迁移流量上胜过不预取。
| KV Cache | 键值缓存,在 Transformer 推理中存储注意力机制的键和值张量,避免重复计算,但会占用大量内存。 |
| GPU HBM | GPU 高带宽内存,一种高带宽、低延迟的显存,用于加速计算,但容量有限且成本高。 |
| Tiering | 分层存储,将数据分布在不同性能和容量的存储层级(如 GPU、CPU、SSD)中,以平衡成本和性能。 |
| EWMA | 指数加权移动平均,一种预测方法,给予近期数据更高权重,用于预测未来重用。 |
| Prefetching | 预取,提前将数据从慢速存储移动到快速存储,以减少访问延迟,但可能增加带宽开销。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅