该研究针对LLM作为评判者时标量压缩导致不确定性信息丢失的问题,提出JudgeMoE——一种轻量级聚合器,为每个样本的缓存评判分数分布分配特定权重并在计算最终分数前进行融合。协议研究发现,分数范围的选择在不同评判者与数据集组合下并不稳定,且软评分通常优于硬解码。在原始10单元基准上,JudgeMoE相比均匀对数池化将平均Spearman相关系数提升0.079;将相同配置应用于另外六个单元后,在16个单元上相较最强局部单一评判者取得0.0393的平均增益,其中12/16个单元呈正向差异,单侧Wilcoxon符号秩检验p值为0.0091。基于验证的分析进一步表明,最优聚合方法取决于具体任务与评判者池的构成。
| LLM-as-a-Judge | 使用大型语言模型作为评判器来评估其他模型输出的方法。 |
| JudgeMoE | 本文提出的轻量级聚合器,为每个样本的评判分数分布分配权重并融合。 |
| Spearman相关系数 | 衡量两个变量排序一致性的非参数统计量,常用于评估评分与人类判断的相关性。 |
| Wilcoxon符号秩检验 | 一种非参数统计检验,用于比较配对样本的差异是否显著。 |
| 软评分 | 保留评判器输出的完整概率分布进行评分,而非仅取最高概率的硬解码。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅