Fathom 针对长上下文智能体场景下 KV 缓存卸载至主机内存后、键扫描成为解码瓶颈的问题,提出一种按查询自适应决定读取深度的稀疏解码方法。其核心是将 4 位 K 缓存按通道主序存储为位平面,使前 t 个位平面恰好构成该通道的 t 位量化器,查询再依据各通道方差加权重要性进行反向注水分配比特预算。在 Qwen3-8B 百万级 token 测试中,单步解码 GPU 时间比 Double Sparsity、Loki 和 SparQ r=32 的 136 位扫描快 1.67 倍;在与 SparQ 68 位读取相同的 GPU 时间内,Fathom 读取字节数减少 18%,且在七种模型与上下文设置中的六种取得更低注意力误差。RULER 类任务上每次 token 扫描均与精确 top-k 解码一致,真实编码智能体会话中仅需 92 位即达到最精确 136 位扫描的步骤一致率。该方法复用量化服务栈已有的 4 位 K 副本,无需额外存储,但在索引驻留 GPU 显存时不再具备速度优势。
| KV Cache | 键值缓存,在自回归生成中存储先前计算的键和值向量,以避免重复计算。 |
| Sparse Decoding | 稀疏解码,一种在解码时仅使用部分键或值进行计算以降低开销的技术。 |
| Bit Planes | 位平面,将数值的每一位分别存储为独立的平面,常用于量化数据的紧凑表示。 |
| Reverse Water-Filling | 反向注水,一种根据重要性分配资源(如比特预算)的优化策略,类似于信息论中的注水算法。 |
| Top-k | top-k选择,在注意力机制中选取分数最高的k个键或元素的操作。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅