这篇论文研究块扩散语言模型在规模化推理中的缓存机制。扩散模型并行解码的特性使其无法直接使用自回归模型中的KV缓存,块扩散虽通过逐块解码恢复了缓存能力,但现有方案依赖注意力机制,内存随序列长度线性增长,且作为免训练改造时仅为近似计算。作者提出利用序列混合器将已完成块压缩为可复用状态,并通过块因果训练目标使缓存精确化。研究在300B token上预训练了三个3B块扩散去噪器(注意力、Mamba及混合架构),统一通过单一缓存接口解码。结果显示,仅状态空间缓存保持常数级内存与延迟:在256k token上下文下,注意力缓存已增至82GB、每步29毫秒,而Mamba缓存延迟降低4.3倍、内存减少11倍、单流吞吐提升2.6倍,批量聚合吞吐可达14倍,且注意力在此规模下无法多流运行。此外,Mamba与混合架构的检索能力可延伸至训练长度的8至16倍,而注意力在2倍处即崩溃,且未观察到质量损失。
| Block Diffusion | 一种扩散语言模型解码方法,通过逐块解码来恢复缓存机制,提高推理效率。 |
| KV Cache | 键值缓存,自回归推理中用于存储先前计算的键和值以加速解码的技术。 |
| State-Space Cache | 状态空间缓存,基于状态空间模型(如 Mamba)的缓存机制,其内存占用与序列长度无关,为 O(1)。 |
| Sequence Mixer | 序列混合器,一种将已确定块总结为可重用状态的模型组件,支持块缓存。 |
| Block-Causal Training Objective | 块因果训练目标,一种训练目标,使块缓存能够精确地表示模型计算。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅