扩散模型在生成图像和视频时,常难以准确还原提示词中的组合细节,如物体数量、属性绑定、空间关系和时间动作。现有Best-of-N采样虽能通过增加测试时算力提升提示词满足度,但只能在完整输出中做最终选择,无法在生成中途修复有潜力的轨迹。为此,作者提出PreviewDiff,一种免训练的多模态评判引导搜索方法,将扩散采样从标量搜索转变为对中间潜变量的搜索。该方法在选定的去噪检查点解码部分预览,由多模态评判器打分并给出自然语言批评,据此在语义提示编辑和局部重新加噪的潜变量延续上进行分支,再对分支评分并选择性推进,使验证算力在样本仍可编辑时介入生成。在图像和视频生成基准上,PreviewDiff持续优于预算匹配的Best-of-N和强标量搜索基线。消融实验表明,更早干预和增大搜索宽度收益最大,更深搜索和额外语义变体则提供互补提升。该工作证明,多模态反馈不仅可作为最终验证器,更能成为去噪过程中的主动控制器。
| Diffusion Models | 扩散模型,一类通过逐步去噪从随机噪声生成图像或视频的生成模型。 |
| Best-of-N Sampling | Best-of-N采样,一种测试时策略,生成N个候选输出后选择最佳的一个。 |
| Multimodal Critic | 多模态评论家,能够同时处理文本和视觉信息并对生成内容进行评分与评论的模型。 |
| Latent Space | 潜空间,扩散模型中表示图像或视频的低维压缩特征空间,去噪过程在此进行。 |
| Test-time Search | 测试时搜索,在推理阶段通过额外计算探索多个生成路径以提升输出质量的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅