视觉OPD提速新招!批量推测解码让训练时间大减,生成质量不掉线!
Accelerating Visual On-Policy Distillation with Batched Speculative Jacobi Rollouts
arXiv LG (cs.LG) 重要 #蒸馏#推理加速 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
通过批量推测雅可比滚动加速视觉策略蒸馏,减少在线轨迹生成的逐token解码开销,提升训练效率。

📖 AI 总结

本文介绍了一种名为HB-SJD的批处理推测雅可比解码方法,用于加速视觉策略蒸馏(OPD)中的在线轨迹生成。视觉OPD通过学生模型自生成的轨迹来训练紧凑的视觉自回归模型,但传统自回归解码逐token生成,导致训练成本高昂。推测雅可比解码(SJD)虽能并行处理多个token且无需辅助草稿模型,但原方法仅适用于单序列推理。HB-SJD作为批处理SJD后端,允许每张图像根据自身解码进度独立推进,同时在不同序列位置间通过批量模型前向验证。当图像完成时,HB-SJD在完整与紧凑执行模式间切换,以降低后续轮次成本。该方法仅替换学生模型的rollout后端,不改变教师模型、蒸馏目标或优化流程。基于LlamaGen的实验表明,HB-SJD显著减少rollout和端到端训练时间,同时保持蒸馏学生的生成质量。

🔑 关键词速览

Visual On-Policy Distillation (OPD)一种训练紧凑视觉自回归模型的方法,通过从当前学生模型生成的轨迹中学习来提升训练效率。
Speculative Jacobi Decoding (SJD)一种无需辅助草稿模型即可并行处理多个token的解码方法,但原方法仅适用于单序列推理。
HB-SJD本文提出的批量SJD轨迹生成后端,用于视觉OPD,支持多图像独立推进和批量验证。
LlamaGen一种视觉自回归生成模型,用于实验验证HB-SJD的有效性。
Rollout在强化学习或蒸馏中,指生成轨迹或样本序列的过程,此处指学生模型生成训练数据的过程。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅