该论文研究离散扩散语言模型在推理阶段的文本生成控制问题,目标是在不重新训练模型的前提下,引导采样过程满足序列级奖励约束。现有粒子类方法如best-of-n采样和bootstrap序贯蒙特卡洛分别存在过度乐观和权重退化缺陷。作者提出嵌套序贯蒙特卡洛(NSMC)及其完全自适应版本(FA-NSMC),基于Feynman-Kac框架进行形式化推导,并修正了先前公式中导致最终估计偏差的错误。在毒性和流畅度控制任务上的实验表明,NSMC和FA-NSMC均稳定优于best-of-n和bootstrap SMC基线。该工作为离散扩散模型的推理时可控生成提供了更稳健的采样方案,对文本生成的安全性和质量调控具有实际意义。
| 离散扩散语言模型 | 一种基于离散扩散过程的生成模型,用于文本生成,通过逐步去噪生成序列。 |
| 推理时控制 | 在模型推理阶段通过采样策略引导生成结果,以满足特定奖励或约束,无需重新训练。 |
| 嵌套顺序蒙特卡洛 (NSMC) | 一种高级蒙特卡洛方法,通过嵌套粒子滤波结构提高采样效率,减少权重退化。 |
| 费曼-卡克引导 | 一种基于费曼-卡克公式的采样引导框架,用于将生成过程导向目标奖励分布。 |
| 权重退化 | 在粒子滤波中,粒子权重集中于少数粒子,导致采样多样性下降的问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅