本文提出 TreeSpark,一种面向半自回归投机解码的校准式、负载自适应草稿树方法。现有块级草稿器虽能以近乎零成本生成整块草稿 token,但其草稿树构建依赖逐位置边缘概率排序,忽略了候选所延续的父节点,导致在半自回归草稿器上扩大树宽反而引入更多排序错误的节点;同时固定树规模无法适应不同解码轮次与服务负载的差异。TreeSpark 以极低开销从草稿器已有的马尔可夫头中读取父节点条件分布,将其校准为边接受概率估计,并以路径存活概率统一驱动最优优先扩展、逐轮停止与负载自适应服务策略。通过无放回采样兄弟节点并在递归拒绝中匹配残差,该方法在任意温度下保持无损解码。实验表明,自适应树在各温度下均优于同等固定预算方案;在相同草稿器上与调优链式方法相比,每轮多接受 15% 至 25% 的草稿 token,单请求墙钟时间提速 8% 至 14%,且在负载升高时能平滑收缩回链式结构。
| Speculative Decoding | 一种加速语言模型推理的技术,使用小型草稿模型生成候选令牌,再由大型目标模型并行验证。 |
| Draft Tree | 在推测解码中,由多个候选延续构成的树形结构,允许在一次目标模型前向传播中验证多条路径。 |
| Semi-Autoregressive Drafter | 一种草稿模型,能够以非完全自回归的方式(如块并行)生成多个令牌,提高草稿效率。 |
| Edge-Acceptance Estimate | 对草稿树中每条边(即父节点到子节点的转移)被目标模型接受的概率估计,用于指导树扩展。 |
| Load-Adaptive Serving Policy | 根据当前服务负载动态调整推测解码中草稿树大小的策略,以平衡延迟和吞吐量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅