这篇论文针对大语言模型(LLM)在开放式多轮对话场景中的评估难题,提出了新的解决方案。作者指出,现有评估框架多针对摘要、翻译等任务设计,难以衡量人类尺度对话的连贯性,且指标构建常依赖合成数据而非人类反馈。为此,他们推出了UPHELD基准,包含数百段由专业编剧撰写的人对人完整对话,以及超过3.6万条人工标注。研究发现,传统自动指标和无参考的LLM-as-a-judge方法与专家判断的相关性均不可靠。基于此,作者开发了Mixture-of-Judges框架,融合多种评估信号,将评估结果与人类判断的相关性提升了约30%。该研究为衡量对话智能提供了更扎实的人类基准,填补了现有数据集的关键空白。
| UPHELD | 一个大型基准数据集,包含由专业编剧编写的人-人对话及逐轮人类标注,用于评估人类规模对话能力。 |
| LLM-as-a-judge | 一种评估方法,使用大型语言模型作为评判者来评估其他模型的输出质量。 |
| Mixture-of-Judges | 一种框架,结合多个评估信号(如不同评判者)以提高与人类评估的相关性。 |
| reference-free | 指评估方法不依赖参考答案或标准输出,直接对模型生成内容进行评判。 |
| human-scale dialogue | 指模拟真实人类对话的长度、复杂性和轮次密度的对话,区别于短问答或简单任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅