🔥 今日值得一读 LLM评判器分数分布藏玄机,JudgeMoE聚合器平均相关性提升0.079!
JudgeMoE: Distributional Aggregation for LLM-as-a-Judge
arXiv CL (cs.CL) 🔥 重点 #LLM-as-a-Judge#评测方法#模型融合 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
做LLM评审打分时可用它融合多个judge的分数分布,提升与人类评分的一致性。

📖 AI 总结

该研究针对LLM作为评判者时标量压缩导致不确定性信息丢失的问题,提出JudgeMoE——一种轻量级聚合器,为每个样本的缓存评判分数分布分配特定权重并在计算最终分数前进行融合。协议研究发现,分数范围的选择在不同评判者与数据集组合下并不稳定,且软评分通常优于硬解码。在原始10单元基准上,JudgeMoE相比均匀对数池化将平均Spearman相关系数提升0.079;将相同配置应用于另外六个单元后,在16个单元上相较最强局部单一评判者取得0.0393的平均增益,其中12/16个单元呈正向差异,单侧Wilcoxon符号秩检验p值为0.0091。基于验证的分析进一步表明,最优聚合方法取决于具体任务与评判者池的构成。

🔑 关键词速览

LLM-as-a-Judge使用大型语言模型作为评判器来评估其他模型输出的方法。
JudgeMoE本文提出的轻量级聚合器,为每个样本的评判分数分布分配权重并融合。
Spearman相关系数衡量两个变量排序一致性的非参数统计量,常用于评估评分与人类判断的相关性。
Wilcoxon符号秩检验一种非参数统计检验,用于比较配对样本的差异是否显著。
软评分保留评判器输出的完整概率分布进行评分,而非仅取最高概率的硬解码。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅