这篇论文提出了一种新思路:将大语言模型验证器的反馈从单纯的排序工具转变为改进候选方案的驱动力。现有基于验证器的选择方法通常只对固定候选池进行排序,评估完成后即丢弃验证反馈。作者提出“LLM即改进者”框架及“验证—修复—重选”(VRR)流程,在保留初始最优解的同时,有条件地生成三个互补候选:最优解与次优解的修复版本,以及基于新思路的解答,并利用推理阶段信息过滤无效和重复候选,最后按原标准重新选择。在多种模型及代码生成与推理基准上,VRR在多数场景下优于固定池验证选择方法,甚至能在初始候选全部错误时恢复出正确解。这表明验证反馈不仅能筛选已有方案,还能构建超越初始池的更强候选。
| LLM-as-an-Improver | 将大语言模型从单纯的候选排序者扩展为利用验证反馈生成更优候选的改进器。 |
| Verify–Repair–Reselect (VRR) | 一种利用验证反馈对候选解进行修复和重选,从而生成并筛选改进候选的方法。 |
| Verifier-based selection | 通过生成多个候选解并借助验证器挑选最优解的模型选择策略。 |
| Fixed candidate pool | 在验证前预先确定且不再扩充的候选解集合,传统方法通常在此集合内进行选择。 |
| Inference-time information | 仅在模型推理阶段可获取的信息,不依赖额外训练数据或外部标注。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅