本文提出Sigma,首个大规模(3B/8B)连续扩散语言模型,旨在突破离散扩散模型因非平滑、高维空间而难以进行轨迹引导的局限。Sigma基于可引导的低维ODE/SDE潜轨迹,采用分块似然优化训练,在联合去噪高斯扰动词嵌入的同时学习最优嵌入几何,并利用自回归模型预训练权重进行热启动以加速训练。研究发现,无分类器引导和分数温度对高保真推理与代码生成至关重要。在GSM8K、Minerva、HumanEval、MBPP等标准基准及MATH-500、AIME等挑战性推理任务上,Sigma经预训练和监督微调后达到与主流离散模型相当的性能。此外,该工作揭示了连续扩散模型的独特性质:嵌入空间引导可有效调控质量与多样性权衡,提升pass@k表现;连续轨迹在低NFE下具备优雅退化能力并支持高效蒸馏,表明连续扩散语言模型是高效语言生成的有前景范式。
| 连续扩散语言模型 (continuous dLM) | 一种在连续潜在空间中进行扩散过程以生成文本的语言模型,与离散扩散模型相对。 |
| Sigma | 本文提出的大规模连续扩散语言模型,基于可引导的低维 ODE/SDE 潜在轨迹。 |
| 无分类器引导 (classifier-free guidance) | 一种在扩散模型中用于提升生成样本质量与条件一致性的技术,无需额外分类器。 |
| ODE/SDE 潜在轨迹 | 常微分方程或随机微分方程描述的潜在状态演化路径,用于引导生成过程。 |
| NFE (Number of Function Evaluations) | 函数评估次数,衡量扩散模型采样效率的指标,越低表示采样越快。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅