该研究提出了一种面向扩散语言模型(dLLMs)的轨迹级投机解码框架,旨在解决现有解码策略在低置信度下退化为单令牌生成、严重限制吞吐量的问题。与自回归模型中固定顺序的令牌投机不同,dLLMs需要对去噪轨迹(即多令牌更新序列及其位置和掩码顺序)进行投机。该方法通过置信度分层树探索构建草稿轨迹,并利用双向注意力掩码进行分块并行验证,同时引入跨块投机以利用扩散模型的双向结构实现前瞻。研究正式刻画了该方法的精确条件,并指出轨迹漂移是增加并行性的根本代价。基于Fast-dLLM的双缓存基础设施,该框架将去噪迭代减少30-40%,每步令牌数从2.6提升至4.3,在推理和代码基准上相比原始dLLMs实现7-14倍加速,相比Fast-dLLM提升1.3倍,且准确率变化小于1%。
| Diffusion-based language models (dLLMs) | 基于扩散的语言模型,通过迭代去噪过程生成文本,支持并行令牌生成。 |
| Speculative decoding | 投机解码,一种加速生成的技术,通过草稿模型预测多个令牌并并行验证。 |
| Trajectory-level speculation | 轨迹级投机,针对扩散模型去噪轨迹的投机解码方法,涉及多令牌更新序列。 |
| Confidence-stratified tree exploration | 置信度分层树探索,根据置信度分层构建草稿轨迹的树状搜索方法。 |
| Trajectory drift | 轨迹漂移,指投机草稿轨迹与真实去噪轨迹之间的偏差,是并行性增加的基本代价。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅