这篇论文提出了一种名为SSR(Self-Speculation for Reasoning Models)的训练无关自推测解码方法,旨在加速大语言模型在复杂推理任务中的生成速度。核心思路是利用同一模型在不同推理预算下的输出分布差异:以部分思维链(partial-CoT)作为草稿模型,完整思维链(full-CoT)作为验证模型。研究发现,后期部分思维链与完整预算响应在语义和词汇上高度重叠,因此SSR能一次性接受较长的草稿前缀,显著提升结构化与长文本生成任务的效率。此外,SSR引入后缀解码机制,通过草稿内容预填充后缀缓存,恢复被标准推测解码忽略的有用片段,进一步降低延迟。实验表明,在Qwen3.5和Gemma-4等开源模型上,SSR可将总生成延迟相对降低最高24.1%,为延迟敏感的交互式应用提供了有效优化方案。
| SSR (Self-Speculation for Reasoning Models) | 一种无需训练的自我推测解码方法,利用思维链作为推测源来加速推理模型的生成。 |
| Chain-of-Thought (CoT) | 思维链,指模型生成的一系列中间推理步骤,用于解决复杂问题。 |
| Speculative Decoding | 推测解码,一种加速生成的方法,通过草稿模型快速生成候选令牌,再由目标模型验证。 |
| Suffix Decoding | 后缀解码,一种利用草稿响应中的后缀片段来进一步减少延迟的技术。 |
| Latency-Sensitive Applications | 延迟敏感应用,指对响应时间有严格要求的应用,如语音助手和编码代理。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅