这篇论文提出了一种名为 AdaptiveSpec 的无训练逐步骤投机解码方法,旨在加速大语言模型推理。传统方法如 EAGLE-3 通常固定使用严格的令牌匹配验证规则和静态草稿树结构,而 AdaptiveSpec 则通过解码过程中已有的内部信号,动态调整两个关键决策:一是基于边际规则,在目标模型对草稿令牌的概率与最高概率之比超过阈值时,接受不匹配的令牌,且不依赖草稿长度或架构;二是通过融合草稿置信度与滚动接受历史,实时调整草稿树的深度、宽度和节点数,使总草稿数可变。实验表明,在 SGLang 引擎上,AdaptiveSpec 相比 EAGLE-3 吞吐量提升最高达 56%,并在 GSM8K、MATH-500 和 HumanEval 等基准上恢复 93% 至完全无损的任务准确率。该方法在正交维度上结合两种自适应机制,显著提升了推理效率与准确率的平衡。
| Speculative Decoding | 投机解码,一种加速LLM推理的技术,通过草拟多个候选令牌并并行验证来减少串行生成步骤。 |
| Tree-Attention | 树注意力,一种草拟器架构,利用树形结构并行处理多个草拟令牌,提高验证效率。 |
| EAGLE-3 | 一种基于树注意力的自回归投机解码方法,作为基线模型,常用于对比性能。 |
| Training-Free | 免训练,指方法不需要额外训练模型,仅利用现有模型内部信号进行推理时调整。 |
| Margin Rule | 边际规则,一种决策准则,根据概率比值决定是否接受不匹配的草拟令牌,以平衡准确性和加速。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅