🔥 今日值得一读 长输出推理的KV缓存瓶颈有解了!GrowPage按需分配内存,吞吐量性能双超现有方案
GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving
arXiv AI (cs.AI) 🔥 重点 推理优化算力 🕐 09-04 12:00

📖 AI 总结

GrowPage提出了一种面向大语言模型推理服务的按需KV缓存预算管理框架。针对长输出推理任务中KV缓存成为内存瓶颈的问题,现有压缩方法通常预设固定请求预算,仅调整保留哪些KV状态,无法适应推理过程中注意力需求的动态变化。GrowPage将KV容量视为运行时资源,通过维护轻量级双时间尺度查询摘要来捕捉近期与长期注意力行为,并利用相对注意力工作集估计需求演变。在每个容量边界,系统可在当前分配内压缩KV状态,或在需求扩大时获取额外物理页。该框架与PagedAttention的页级内存抽象集成,保留了连续批处理和前缀缓存能力。在多个模型上的推理基准实验表明,GrowPage在性能与吞吐量的权衡上优于现有方法。

🔑 关键词速览

KV cache键值缓存,存储注意力计算中的键和值,是LLM推理中的主要内存瓶颈。
GrowPage本文提出的按需KV预算框架,动态调整KV缓存容量以适应推理需求变化。
PagedAttention一种页面级内存管理技术,用于高效管理KV缓存,支持连续批处理和前缀缓存。
dual-timescale query summaries双时间尺度查询摘要,用于捕获近期和长期注意力行为的轻量级统计信息。
attention working set注意力工作集,指当前请求在注意力机制中活跃的键值对集合,用于估计需求演变。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅