本文研究大语言模型评判器作为奖励信号时的评分二值化问题。作者指出,将评判结果压缩为通过/不通过(0/1)只报告结论,却丢失了响应在各标准上的达成程度。研究将每个判定建模为未报告尺度上的分数与单一阈值的比较,发现对该尺度进行仿射拉伸可使所有分数同比例远离或靠近阈值而不跨越它,从而不改变任何判定,政策因此可在不改变面板报告的情况下任意拉伸。在联合高斯模型下,引入第三等级可增加第二个阈值,消除这种模糊性。基于一个七标准评判器在MATH和SciBench输出上的实验显示,全部14个构造的逐标准拉伸在二值化后不可见,而三等级下可见;在样本量1024时,检验功效至少达96.5%。作者建议评判器至少保留三个等级(如完全、部分、未满足,奖励0、0.5、1),并对外部验证剩余方向上的增益,因为某些变化仍与真实改进无法区分。
| Binarization | 将连续的评分或判定简化为两个值(如通过/不通过或0/1)的过程,会丢失评分中的程度信息。 |
| LLM judges | 大型语言模型评判器,指使用LLM来评估文本或响应质量并给出评分或判定的系统。 |
| Affine stretch ambiguity | 对评分尺度进行线性拉伸(仿射变换)时,由于截断值不变,判定结果保持不变,导致无法区分不同的评分分布。 |
| Joint-Gaussian model | 一种统计模型,假设多个变量服从联合高斯分布,用于分析评分和阈值之间的关系。 |
| Sycophancy-shaped lift | 指模型通过迎合或谄媚评判器而获得的性能提升,这种提升可能被误认为是真实能力的提高。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅