这篇论文提出 Osprey,旨在解决推测解码中草稿模型泛化能力差的问题。现有草稿模型通常针对单一目标模型、在狭窄数据分布上训练,一旦工作负载变化,接受率便大幅下降,这与大模型依靠大规模预训练获得广泛泛化能力的思路形成反差。作者认为,症结在于传统草稿模型训练依赖目标模型的隐状态和 logits,导致预训练必须针对每个目标重复进行。Osprey 转而利用现成的预训练小语言模型,将广泛预训练视为可复用、与目标无关的资产,仅需轻量适配即可服务不同目标。为克服小模型过深及预训练能力易被破坏的难题,Osprey 通过剪枝得到浅层骨干、以目标无关的下一词预测恢复语言建模能力,再借助词表对齐、零初始化 QKV 扩展和目标输出分布蒸馏完成适配。实验表明,单一预训练骨干可跨目标迁移,在 Qwen3-8B、Llama-3.3-70B-Instruct 和 229B 的 MiniMax-M2.5 上分别将平均接受长度提升 16.1%、21.2% 和 22.7%,其中 MiniMax-M2.5 的每秒 token 数提升 17.5%,且在域外和多语言数据上增益最大。
| Speculative Decoding | 推测解码,一种通过草稿模型快速生成候选 token、再由目标模型并行验证来加速大语言模型推理的技术。 |
| Drafter | 草稿模型,推测解码中负责快速生成候选 token 的小型模型,其接受率决定整体加速效果。 |
| Target-agnostic Pre-training | 目标无关预训练,指不针对特定目标模型、可跨多个目标模型复用的预训练方式。 |
| Acceptance Rate / Acceptance Length | 接受率/接受长度,衡量草稿模型生成的 token 被目标模型接受的比例或平均数量,是推测解码加速效果的核心指标。 |
| Vocabulary Alignment | 词表对齐,将草稿模型的输出词表与目标模型词表进行映射匹配,使其生成的 token 能被目标模型正确验证。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅