TreeGraft提出了一种面向树结构投机解码的多草稿器自适应嫁接框架,旨在解决现有方法中单一草稿器在速度与树质量之间的两难困境。该框架让不同成本的草稿器协同构建共享草稿树:较强草稿器负责对较弱草稿器的候选路径重新评分、选择嫁接位置并恢复被遗漏的可行路径,同时以非破坏性方式扩展分支,保留目标模型可能接受的已有路径。为控制计算开销,TreeGraft通过从离线价值系统蒸馏出的轻量调度器,决定何时调用较强草稿器。实验覆盖10组模型和6个基准,结果显示TreeGraft相比两种固定单草稿器策略中较优者,平均提升15.1%,最高达26.6%。该方法为投机解码中多草稿器协作提供了有效方案,兼顾了推理速度与生成质量。
| Speculative Decoding | 一种加速大型语言模型推理的技术,通过先草拟多个候选然后由目标模型验证来减少生成步骤。 |
| Tree-Structured Methods | 在投机解码中,将多个候选组织成树状结构以增加接受长度的技术。 |
| Multi-Drafter Framework | 使用多个不同能力的草拟器共同生成草拟树的框架,以平衡速度和质量。 |
| Grafting | 在TreeGraft中,指将更强草拟器的扩展非破坏性地整合到共享草拟树中的过程。 |
| Scheduler | 一个轻量级组件,决定何时调用更强的草拟器以控制草拟成本。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅