本文介绍了一种名为HB-SJD的批处理推测雅可比解码方法,用于加速视觉策略蒸馏(OPD)中的在线轨迹生成。视觉OPD通过学生模型自生成的轨迹来训练紧凑的视觉自回归模型,但传统自回归解码逐token生成,导致训练成本高昂。推测雅可比解码(SJD)虽能并行处理多个token且无需辅助草稿模型,但原方法仅适用于单序列推理。HB-SJD作为批处理SJD后端,允许每张图像根据自身解码进度独立推进,同时在不同序列位置间通过批量模型前向验证。当图像完成时,HB-SJD在完整与紧凑执行模式间切换,以降低后续轮次成本。该方法仅替换学生模型的rollout后端,不改变教师模型、蒸馏目标或优化流程。基于LlamaGen的实验表明,HB-SJD显著减少rollout和端到端训练时间,同时保持蒸馏学生的生成质量。
| Visual On-Policy Distillation (OPD) | 一种训练紧凑视觉自回归模型的方法,通过从当前学生模型生成的轨迹中学习来提升训练效率。 |
| Speculative Jacobi Decoding (SJD) | 一种无需辅助草稿模型即可并行处理多个token的解码方法,但原方法仅适用于单序列推理。 |
| HB-SJD | 本文提出的批量SJD轨迹生成后端,用于视觉OPD,支持多图像独立推进和批量验证。 |
| LlamaGen | 一种视觉自回归生成模型,用于实验验证HB-SJD的有效性。 |
| Rollout | 在强化学习或蒸馏中,指生成轨迹或样本序列的过程,此处指学生模型生成训练数据的过程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅