对话评估大翻车!新基准UPHELD让AI评分相关性暴涨30%,3.6万条人类标注+专业编剧操刀,这才是真考验!
Evaluating Language Models in Realistic Conversational Contexts
arXiv CL (cs.CL) 重要 大模型评估对话系统 🕐 08-28 12:00

📖 AI 总结

这篇论文针对大语言模型(LLM)在开放式多轮对话场景中的评估难题,提出了新的解决方案。作者指出,现有评估框架多针对摘要、翻译等任务设计,难以衡量人类尺度对话的连贯性,且指标构建常依赖合成数据而非人类反馈。为此,他们推出了UPHELD基准,包含数百段由专业编剧撰写的人对人完整对话,以及超过3.6万条人工标注。研究发现,传统自动指标和无参考的LLM-as-a-judge方法与专家判断的相关性均不可靠。基于此,作者开发了Mixture-of-Judges框架,融合多种评估信号,将评估结果与人类判断的相关性提升了约30%。该研究为衡量对话智能提供了更扎实的人类基准,填补了现有数据集的关键空白。

🔑 关键词速览

UPHELD一个大型基准数据集,包含由专业编剧编写的人-人对话及逐轮人类标注,用于评估人类规模对话能力。
LLM-as-a-judge一种评估方法,使用大型语言模型作为评判者来评估其他模型的输出质量。
Mixture-of-Judges一种框架,结合多个评估信号(如不同评判者)以提高与人类评估的相关性。
reference-free指评估方法不依赖参考答案或标准输出,直接对模型生成内容进行评判。
human-scale dialogue指模拟真实人类对话的长度、复杂性和轮次密度的对话,区别于短问答或简单任务。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅