🔥 今日值得一读 草稿模型不再绑定单一目标,Osprey用预训练实现跨模型加速!
Osprey: Target-agnostic Pre-training Makes Stronger Drafters in Speculative Decoding
arXiv CL (cs.CL) 🔥 重点 推理加速论文方法大模型 🕐 09-10 12:00

📖 AI 总结

这篇论文提出 Osprey,旨在解决推测解码中草稿模型泛化能力差的问题。现有草稿模型通常针对单一目标模型、在狭窄数据分布上训练,一旦工作负载变化,接受率便大幅下降,这与大模型依靠大规模预训练获得广泛泛化能力的思路形成反差。作者认为,症结在于传统草稿模型训练依赖目标模型的隐状态和 logits,导致预训练必须针对每个目标重复进行。Osprey 转而利用现成的预训练小语言模型,将广泛预训练视为可复用、与目标无关的资产,仅需轻量适配即可服务不同目标。为克服小模型过深及预训练能力易被破坏的难题,Osprey 通过剪枝得到浅层骨干、以目标无关的下一词预测恢复语言建模能力,再借助词表对齐、零初始化 QKV 扩展和目标输出分布蒸馏完成适配。实验表明,单一预训练骨干可跨目标迁移,在 Qwen3-8B、Llama-3.3-70B-Instruct 和 229B 的 MiniMax-M2.5 上分别将平均接受长度提升 16.1%、21.2% 和 22.7%,其中 MiniMax-M2.5 的每秒 token 数提升 17.5%,且在域外和多语言数据上增益最大。

🔑 关键词速览

Speculative Decoding推测解码,一种通过草稿模型快速生成候选 token、再由目标模型并行验证来加速大语言模型推理的技术。
Drafter草稿模型,推测解码中负责快速生成候选 token 的小型模型,其接受率决定整体加速效果。
Target-agnostic Pre-training目标无关预训练,指不针对特定目标模型、可跨多个目标模型复用的预训练方式。
Acceptance Rate / Acceptance Length接受率/接受长度,衡量草稿模型生成的 token 被目标模型接受的比例或平均数量,是推测解码加速效果的核心指标。
Vocabulary Alignment词表对齐,将草稿模型的输出词表与目标模型词表进行映射匹配,使其生成的 token 能被目标模型正确验证。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅