GrowPage提出了一种面向大语言模型推理服务的按需KV缓存预算管理框架。针对长输出推理任务中KV缓存成为内存瓶颈的问题,现有压缩方法通常预设固定请求预算,仅调整保留哪些KV状态,无法适应推理过程中注意力需求的动态变化。GrowPage将KV容量视为运行时资源,通过维护轻量级双时间尺度查询摘要来捕捉近期与长期注意力行为,并利用相对注意力工作集估计需求演变。在每个容量边界,系统可在当前分配内压缩KV状态,或在需求扩大时获取额外物理页。该框架与PagedAttention的页级内存抽象集成,保留了连续批处理和前缀缓存能力。在多个模型上的推理基准实验表明,GrowPage在性能与吞吐量的权衡上优于现有方法。
| KV cache | 键值缓存,存储注意力计算中的键和值,是LLM推理中的主要内存瓶颈。 |
| GrowPage | 本文提出的按需KV预算框架,动态调整KV缓存容量以适应推理需求变化。 |
| PagedAttention | 一种页面级内存管理技术,用于高效管理KV缓存,支持连续批处理和前缀缓存。 |
| dual-timescale query summaries | 双时间尺度查询摘要,用于捕获近期和长期注意力行为的轻量级统计信息。 |
| attention working set | 注意力工作集,指当前请求在注意力机制中活跃的键值对集合,用于估计需求演变。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅