本文提出 ELF-REG,将全连续扩散语言模型 Embedded Language Flows(ELF)扩展至数学推理与代码生成任务,并在 GSM8K、MATH-500、HumanEval 和 MBPP 四个基准上进行评估。该方法引入表征对齐与纠缠机制(REPA+REG),由冻结的自回归教师模型监督中间去噪特征,并提供与响应联合去噪的全局表征。实验显示,ELF-REG-L 在 64 次网络函数评估下于 GSM8K 取得 55.96% 的 pass@1,在 128 次评估下于 MATH-500 和 HumanEval 分别达到 13.39% 和 22.56%,其中 MATH-500 较 ELF-L 基线的 10.55% 有明显提升,并在同规模扩散模型中领先。此外,无需少步训练,通过早停解码中间干净预测即可在低评估次数下保持较强性能,16 次评估时 HumanEval pass@10 达 41.21%。该工作为连续扩散模型在复杂推理任务上的可行性提供了实证支持。
| ELF (Embedded Language Flows) | 一种全连续扩散语言模型,直接在连续表示空间中进行去噪并并行解码所有响应词元。 |
| ELF-REG | 本文提出的改进方法,通过表示对齐与纠缠(REPA+REG)利用冻结自回归教师模型监督去噪器特征,提升连续扩散语言模型的推理能力。 |
| REPA+REG | 表示对齐与纠缠机制,其中冻结的 AR 教师模型监督中间去噪器特征,并提供与响应联合去噪的全局表示。 |
| NFE (Network Function Evaluations) | 网络函数评估次数,衡量扩散模型去噪过程中调用网络函数的次数,数值越低表示推理效率越高。 |
| pass@k | 代码生成与推理任务中常用的评估指标,表示模型生成 k 个样本中至少有一个通过测试用例的比例。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅