🔥 今日值得一读 长上下文提速10.91倍!BF1稀疏注意力让32K输入秒开
BF1: A Causal Dyadic Sparse-Attention Retrofit for Efficient Long-Context Transformers
arXiv LG (cs.LG) 🔥 重点 #稀疏注意力#长上下文#推理优化 🕐 08-24 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此方法替换密集注意力,在保持准确性的同时大幅降低长上下文计算成本,适合部署到资源受限环境。

📖 AI 总结

本文提出了一种名为BF1的确定性稀疏注意力机制,用于提升长上下文Transformer的效率。BF1结合局部精确邻域、全局首块和对数间隔历史块,将每层复杂度降至O(n log n),并具备O(log n)的图通信深度。在RTX PRO 6000 GPU上,其BF16实现于2K至4K token间超越密集注意力,32K时实现10.91倍逐层预填充加速。对Qwen3-0.6B模型8层改造后,8K、16K、32K上下文的首词延迟分别降低7.7%、11.3%和15.3%。在匹配的适应训练协议下,BF1困惑度达1.68639,优于静态随机图、密集续训和局部滑动基线。研究验证了BF1作为可复现稀疏算子及选择性改造原语的实际系统价值,为长上下文模型效率优化提供了新路径。

🔑 关键词速览

BF1一种确定性的块对齐二元稀疏注意力模式,结合局部、全局和对数间隔的历史块。
Dyadic Sparse-Attention一种稀疏注意力机制,通过二元(成对)块结构减少计算量。
Retrofit将预训练模型的部分层替换为高效结构,以提升长上下文性能。
Prefill Speedup在生成首个令牌前的预填充阶段,计算速度的提升倍数。
Perplexity语言模型困惑度,衡量模型预测文本的准确性,值越低越好。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅