🔥 今日值得一读 首个3B/8B连续扩散语言模型Sigma,推理提速还能优雅降级!
Large Language Continuous Diffusion Models
arXiv CL (cs.CL) 🔥 重点 #扩散模型#语言模型#推理优化 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
用连续扩散替代离散扩散做语言生成,潜空间更平滑可引导,适合需要并行解码和轨迹控制的推理加速场景。

📖 AI 总结

本文提出Sigma,首个大规模(3B/8B)连续扩散语言模型,旨在突破离散扩散模型因非平滑、高维空间而难以进行轨迹引导的局限。Sigma基于可引导的低维ODE/SDE潜轨迹,采用分块似然优化训练,在联合去噪高斯扰动词嵌入的同时学习最优嵌入几何,并利用自回归模型预训练权重进行热启动以加速训练。研究发现,无分类器引导和分数温度对高保真推理与代码生成至关重要。在GSM8K、Minerva、HumanEval、MBPP等标准基准及MATH-500、AIME等挑战性推理任务上,Sigma经预训练和监督微调后达到与主流离散模型相当的性能。此外,该工作揭示了连续扩散模型的独特性质:嵌入空间引导可有效调控质量与多样性权衡,提升pass@k表现;连续轨迹在低NFE下具备优雅退化能力并支持高效蒸馏,表明连续扩散语言模型是高效语言生成的有前景范式。

🔑 关键词速览

连续扩散语言模型 (continuous dLM)一种在连续潜在空间中进行扩散过程以生成文本的语言模型,与离散扩散模型相对。
Sigma本文提出的大规模连续扩散语言模型,基于可引导的低维 ODE/SDE 潜在轨迹。
无分类器引导 (classifier-free guidance)一种在扩散模型中用于提升生成样本质量与条件一致性的技术,无需额外分类器。
ODE/SDE 潜在轨迹常微分方程或随机微分方程描述的潜在状态演化路径,用于引导生成过程。
NFE (Number of Function Evaluations)函数评估次数,衡量扩散模型采样效率的指标,越低表示采样越快。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅