🔥 今日值得一读 百万token解码瓶颈被打破!Fathom让每查询自选读取位数,GPU时间狂省1.67倍
Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches
arXiv LG (cs.LG) 🔥 重点 #KV缓存#稀疏解码#推理优化#长上下文 🕐 09-17 12:00
👨‍💼 主理人解读 · 为什么值得关注
让每个查询只读所需位数的KV缓存,开发者可显著降低百万token会话的解码内存带宽瓶颈。

📖 AI 总结

Fathom 针对长上下文智能体场景下 KV 缓存卸载至主机内存后、键扫描成为解码瓶颈的问题,提出一种按查询自适应决定读取深度的稀疏解码方法。其核心是将 4 位 K 缓存按通道主序存储为位平面,使前 t 个位平面恰好构成该通道的 t 位量化器,查询再依据各通道方差加权重要性进行反向注水分配比特预算。在 Qwen3-8B 百万级 token 测试中,单步解码 GPU 时间比 Double Sparsity、Loki 和 SparQ r=32 的 136 位扫描快 1.67 倍;在与 SparQ 68 位读取相同的 GPU 时间内,Fathom 读取字节数减少 18%,且在七种模型与上下文设置中的六种取得更低注意力误差。RULER 类任务上每次 token 扫描均与精确 top-k 解码一致,真实编码智能体会话中仅需 92 位即达到最精确 136 位扫描的步骤一致率。该方法复用量化服务栈已有的 4 位 K 副本,无需额外存储,但在索引驻留 GPU 显存时不再具备速度优势。

🔑 关键词速览

KV Cache键值缓存,在自回归生成中存储先前计算的键和值向量,以避免重复计算。
Sparse Decoding稀疏解码,一种在解码时仅使用部分键或值进行计算以降低开销的技术。
Bit Planes位平面,将数值的每一位分别存储为独立的平面,常用于量化数据的紧凑表示。
Reverse Water-Filling反向注水,一种根据重要性分配资源(如比特预算)的优化策略,类似于信息论中的注水算法。
Top-ktop-k选择,在注意力机制中选取分数最高的k个键或元素的操作。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅