🔥 今日值得一读 恒定内存缓存让块扩散模型在256k令牌下延迟降4.3倍、内存省11倍,吞吐量飙升14倍!
Fixed State, Long Reach: What a Constant-Size Cache Buys Block Diffusion at Scale
arXiv LG (cs.LG) 🔥 重点 #扩散语言模型#KV缓存#推理优化 🕐 09-14 12:00
👨‍💼 主理人解读 · 为什么值得关注
做扩散语言模型推理的开发者可参考其恒定大小块缓存方案,降低内存并加速并行解码。

📖 AI 总结

这篇论文研究块扩散语言模型在规模化推理中的缓存机制。扩散模型并行解码的特性使其无法直接使用自回归模型中的KV缓存,块扩散虽通过逐块解码恢复了缓存能力,但现有方案依赖注意力机制,内存随序列长度线性增长,且作为免训练改造时仅为近似计算。作者提出利用序列混合器将已完成块压缩为可复用状态,并通过块因果训练目标使缓存精确化。研究在300B token上预训练了三个3B块扩散去噪器(注意力、Mamba及混合架构),统一通过单一缓存接口解码。结果显示,仅状态空间缓存保持常数级内存与延迟:在256k token上下文下,注意力缓存已增至82GB、每步29毫秒,而Mamba缓存延迟降低4.3倍、内存减少11倍、单流吞吐提升2.6倍,批量聚合吞吐可达14倍,且注意力在此规模下无法多流运行。此外,Mamba与混合架构的检索能力可延伸至训练长度的8至16倍,而注意力在2倍处即崩溃,且未观察到质量损失。

🔑 关键词速览

Block Diffusion一种扩散语言模型解码方法,通过逐块解码来恢复缓存机制,提高推理效率。
KV Cache键值缓存,自回归推理中用于存储先前计算的键和值以加速解码的技术。
State-Space Cache状态空间缓存,基于状态空间模型(如 Mamba)的缓存机制,其内存占用与序列长度无关,为 O(1)。
Sequence Mixer序列混合器,一种将已确定块总结为可重用状态的模型组件,支持块缓存。
Block-Causal Training Objective块因果训练目标,一种训练目标,使块缓存能够精确地表示模型计算。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅