分层KV缓存让单GPU并发会话暴涨73倍,成本直降62倍!
Where Should the KV Cache Live? Placement Policies Across GPU, CPU, and SSD for Long-Lived Sessions
arXiv AI (cs.AI) 重要 算力论文方法 🕐 09-16 12:00

📖 AI 总结

这篇论文研究长生命周期会话场景下KV缓存在GPU显存、CPU内存和SSD之间的分层放置策略。作者构建了一个覆盖三层存储的离散事件模拟器,并用随机森林执行时间预测器进行校准,在聊天、智能体和文档问答三类负载上比较了最近使用、重用频率、预测重用和EWMA预测加预取等策略。核心发现是:分层带来的收益主要来自容量扩展而非放置策略本身,可实现单GPU并发会话数提升73.02倍、单会话成本降低62.04倍;在批大小为1时解码受算力限制,放置策略对吞吐影响甚微,主要影响PCIe迁移流量和首token延迟。聊天负载下最近使用策略的迁移流量比重用频率低2.30倍,而智能体和文档问答则适合重用频率策略。研究还指出,现有预测重用策略与最近使用策略字节级相同,真正的EWMA预测器表现仍不及重用频率,预取也无法证明其带宽成本合理,即便使用知晓未来请求的预言机也未能在迁移流量上胜过不预取。

🔑 关键词速览

KV Cache键值缓存,在 Transformer 推理中存储注意力机制的键和值张量,避免重复计算,但会占用大量内存。
GPU HBMGPU 高带宽内存,一种高带宽、低延迟的显存,用于加速计算,但容量有限且成本高。
Tiering分层存储,将数据分布在不同性能和容量的存储层级(如 GPU、CPU、SSD)中,以平衡成本和性能。
EWMA指数加权移动平均,一种预测方法,给予近期数据更高权重,用于预测未来重用。
Prefetching预取,提前将数据从慢速存储移动到快速存储,以减少访问延迟,但可能增加带宽开销。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅