KVBoost 提出了一种面向 Transformer 大语言模型的高效推理加速方案,针对传统前缀缓存只能复用连续前缀、无法处理任意位置共享内容的问题,引入了基于块级别的键值缓存复用机制。该系统采用双哈希键控方案,分别标识位置身份和内容身份,支持精确与近似缓存匹配,并通过选择性重计算和基于偏差引导的重计算两种策略修复独立缓存块带来的注意力边界误差。此外,KVBoost 还集成了非对称 KV 量化、自适应块边界切分和重要性加权淘汰机制,在固定内存预算下运行。在 Qwen2.5-3B 模型上的 1,000 个 bug 定位样本测试中,KVBoost 将首 token 延迟从 639.1 毫秒降至 142.4 毫秒,实现 4.49 倍加速,比前缀缓存提升 16%,且准确率保持 99.2% 不变。该系统无需修改模型架构,可作为兼容 RoPE 模型的实用推理加速层。
| KV cache | 键值缓存,存储注意力机制中的键和值张量,用于加速推理。 |
| prefix caching | 前缀缓存,一种缓存共享前缀的KV缓存以加速推理的技术。 |
| chunk-level reuse | 块级复用,将KV缓存按块划分并复用,不限于连续前缀。 |
| dual-hash keying | 双哈希键控,使用两个哈希分别标识位置和内容,支持灵活匹配。 |
| RoPE | 旋转位置编码,一种相对位置编码方法,常用于现代LLM。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅