本文提出GoldiMask方法,用于改进离散扩散语言模型的监督微调。传统做法采用均匀随机掩码,未能兼顾上下文可见性与预测目标价值之间的相互作用。GoldiMask通过近似最大化子模目标来选择作为上下文揭示的token,利用模型信号在揭示收益与预测价值之间取得平衡,并根据剩余目标从所选上下文中获益的程度及学习潜力对其加权。在三种骨干模型和三个训练数据集上,该方法在多数评测设置中取得最高平均准确率,在推理与代码生成任务上均有提升;消融实验表明上下文选择与目标加权均有贡献。此外,在置信度阈值并行解码下,GoldiMask减少了GSM8K和MATH-500的解码迭代次数,并在较高置信度阈值下保持相当准确率。
| 离散扩散语言模型 | 一种基于离散扩散过程的语言模型,通过逐步去噪生成文本。 |
| 监督微调 | 在预训练模型基础上,使用标注数据进一步训练以适配特定任务。 |
| 掩蔽模式 | 在训练中决定哪些标记被隐藏、哪些作为上下文可见的策略。 |
| 子模目标 | 一种满足子模性质的集合函数优化目标,常用于最大化边际收益。 |
| 置信度阈值并行解码 | 一种并行解码策略,根据模型置信度阈值决定是否接受生成的标记。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅