免训练提速56%!AdaptiveSpec让AI推理不再死板校验
Margins, Not Windows: Training-Free Per-Step Lossy Speculative Decoding
arXiv CL (cs.CL) 重要 推理优化论文方法 🕐 09-04 12:00

📖 AI 总结

这篇论文提出了一种名为 AdaptiveSpec 的无训练逐步骤投机解码方法,旨在加速大语言模型推理。传统方法如 EAGLE-3 通常固定使用严格的令牌匹配验证规则和静态草稿树结构,而 AdaptiveSpec 则通过解码过程中已有的内部信号,动态调整两个关键决策:一是基于边际规则,在目标模型对草稿令牌的概率与最高概率之比超过阈值时,接受不匹配的令牌,且不依赖草稿长度或架构;二是通过融合草稿置信度与滚动接受历史,实时调整草稿树的深度、宽度和节点数,使总草稿数可变。实验表明,在 SGLang 引擎上,AdaptiveSpec 相比 EAGLE-3 吞吐量提升最高达 56%,并在 GSM8K、MATH-500 和 HumanEval 等基准上恢复 93% 至完全无损的任务准确率。该方法在正交维度上结合两种自适应机制,显著提升了推理效率与准确率的平衡。

🔑 关键词速览

Speculative Decoding投机解码,一种加速LLM推理的技术,通过草拟多个候选令牌并并行验证来减少串行生成步骤。
Tree-Attention树注意力,一种草拟器架构,利用树形结构并行处理多个草拟令牌,提高验证效率。
EAGLE-3一种基于树注意力的自回归投机解码方法,作为基线模型,常用于对比性能。
Training-Free免训练,指方法不需要额外训练模型,仅利用现有模型内部信号进行推理时调整。
Margin Rule边际规则,一种决策准则,根据概率比值决定是否接受不匹配的草拟令牌,以平衡准确性和加速。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅