长上下文大语言模型在解码阶段面临注意力机制的内存带宽瓶颈和二次复杂度问题。本文提出Faster Flash Decoding(FFD),一种硬件-算法协同设计框架,通过将选择器与计算器融合为完全融合的内核,利用低比特量化实现内容感知扫描,替代传统的外部元数据索引。FFD引入top-delta策略,动态过滤数据块,实现无需全局同步的分布自适应稀疏性。该方法无需训练即可即插即用,并支持扫描结果复用,在核级实现最高11.6倍加速,可扩展至256K上下文长度,端到端吞吐量提升2.37倍。在RULER和LongBench上的实验验证表明,FFD在保持模型精度的同时实现了高比例稀疏性,为长上下文解码的效率优化提供了有效方案。
| Faster Flash Decoding (FFD) | 一种硬件-算法协同设计的解码框架,通过融合内核和稀疏性策略加速长上下文LLM解码。 |
| Attention Sparsity | 注意力机制中许多注意力权重接近零的现象,可利用此特性减少计算量。 |
| Memory Bandwidth Bottleneck | 内存带宽限制导致的数据传输速度瓶颈,影响长上下文解码性能。 |
| Top-delta Strategy | 一种动态过滤块的策略,实现分布自适应稀疏性,无需全局同步。 |
| Low-bit Quantization | 将数据用低比特数表示,以减少内存占用和计算开销的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅