长文本推理提速20倍!RBS-Attention稀疏预填充让128K上下文不再卡顿
RBS-Attention: Radius-Bounded Sparse Prefill for Long-Context Large Language Models
arXiv AI (cs.AI) 重要 大模型论文方法算力 🕐 今天 12:00

📖 AI 总结

本文提出 RBS-Attention,一种无需训练的稀疏预填充方法,用于缓解长上下文大语言模型推理中密集自注意力带来的预填充瓶颈。作者指出,传统稀疏块选择以块质心衡量相关性,可能掩盖块内个别高度相关的 token,并将这一失效模式称为“均值稀释”。为此,方法设计了两条互补的选择分支:质心基分支捕捉平均相关性,救援分支则利用最大键块半径及其随提示、层和头变化的分布,识别可能被低估的块;两分支分别阈值化后合并掩码,在保留常规块稀疏 FlashAttention 执行的同时控制救援块的贡献。在 H100 GPU 上,该方法于 128K 上下文、Qwen3-30B-A3B-Instruct-2507-FP8 模型上实现 20.65 倍独立预填充注意力加速、11.92 倍 vLLM 预填充注意力加速和 5.97 倍端到端首 token 时间加速;在密集 Qwen3-32B 上取得 88.65 的 RULER 总体准确率,接近密集注意力的 89.52,并在 LongBench-v2、InfiniteBench 和 Video-MME 上提供额外质量评估。结果表明,半径自适应的双分支选择是提升长上下文预填充效率的有效途径。

🔑 关键词速览

RBS-Attention一种无需训练的稀疏预填充方法,通过质心基础分支和救援分支的双分支选择来加速长上下文推理。
均值稀释稀疏块选择中,块质心可能掩盖块内高度相关标记,导致相关标记被低估的失败模式。
稀疏预填充在预填充阶段仅处理部分关键块而非全部提示,以降低长上下文推理的计算成本。
块稀疏 FlashAttention一种结合块稀疏选择与 FlashAttention 的高效注意力执行方式,保持硬件友好的计算模式。
首令牌时间从输入提示到生成第一个输出令牌的端到端延迟,是衡量预填充效率的关键指标。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅