本文提出 Representation-based Masked Diffusion Model(RMDM),针对现有掩码扩散模型在并行采样时独立更新多个掩码标记、忽略标记间相互依赖、缺乏全局协调从而导致输出不连贯的问题,引入文本表示作为全局语义引导。具体做法是先用预训练编码器将文本编码到连续语义空间,并学习可逆变换将表示分布归一化为高斯先验以便高效采样,再以该潜在语义表示为条件训练掩码扩散模型,使其在生成过程中协调并行标记更新、更准确地逼近目标分布。实验表明,RMDM 显著提升了生成质量,在激进的少步采样场景下优势尤为明显。该工作为并行文本生成提供了新的全局协调思路。
| Masked Diffusion Models (MDMs) | 一种语言建模范式,通过逐步去掩码实现并行文本生成。 |
| Representation-based Masked Diffusion Model (RMDM) | 本文提出的模型,利用文本表示编码全局语义以协调并行标记更新。 |
| Parallel sampling | 同时更新多个标记的采样方法,但可能忽略标记间依赖关系。 |
| Invertible transformation | 可逆变换,用于将表示分布归一化为高斯先验,便于采样。 |
| Few-step sampling | 少步采样,指在生成过程中使用较少的迭代步骤,对模型效率要求高。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅