本文提出一种名为DRY-SFT的后训练方法,旨在提升大语言模型在数学、编程等可验证任务中的输出多样性与覆盖率,即多次尝试中至少出现一个正确答案的概率。该方法分两步:先让模型在可见此前所有尝试的条件下依次生成K个不同解法,再将这些尝试独立用于微调,且整个过程不依赖奖励模型、验证器或正确性筛选。在HumanEval+、MBPP+和DS-1000三个基准上,DRY-SFT将pass@100分别提升10.8、12.5和12.4个百分点,代价是pass@1略有下降;同时通过抽象语法树编辑距离衡量的结构多样性显著上升,并在600道题中解决了基座模型200次尝试均未解决的244道。研究还发现,基座模型结构多样性越低,DRY-SFT带来的增益越大,说明该方法对模式坍缩较严重的模型尤为有效。
| DRY-SFT | 一种两阶段后训练方法,通过生成多样化解并独立微调来提高大语言模型输出的覆盖率和多样性。 |
| pass@k | 评估指标,表示在 k 次尝试中至少有一次成功的概率,常用于衡量代码生成等任务的覆盖率。 |
| 模式崩溃 | 模型输出集中在少数模式或重复内容的现象,导致生成多样性降低。 |
| 结构多样性 | 通过抽象语法树编辑距离等结构度量衡量的生成解之间的差异程度。 |
| 后训练 | 在预训练模型基础上进行的进一步训练,如监督微调,以调整模型行为或提升特定能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅