人类评审偏爱引用少而精,大模型却爱“花式引用”?揭秘偏好数据背后的真相!
On the Role of Citations in Preference Data
arXiv CL (cs.CL) 重要 大模型论文方法 🕐 08-25 12:00

📖 AI 总结

该研究探讨了引用在人类与大型语言模型(LLM)偏好判断中的作用,聚焦于科学问答场景。通过混合效应模型分析,作者比较了人类评审与四种开源LLM在成对输出比较时对引用的反应。关键发现包括:人类倾向于偏好引用来源更多样但总数更少的输出;而LLM虽无法直接访问引用源,仍表现出与人类不同的引用相关偏好,且这种偏好受数据和模型类型影响。研究揭示了引用在偏好数据收集中的复杂角色,为奖励建模和LLM后训练中的归因评估提供了实证依据,并强调了在偏好标注中考虑引用特征的必要性。

🔑 关键词速览

Attribution指模型输出中提供对支撑来源的引用,以增强可信度和可验证性。
Reward Modeling用于训练强化学习模型,通过人类偏好数据来学习奖励函数的过程。
Mixed Effects Models一种统计模型,用于分析固定效应和随机效应对结果的影响,适用于处理层次结构数据。
Pairwise Judgments成对比较,即对两个输出进行偏好判断,常用于收集人类或模型偏好数据。
Post-training指在预训练之后对大型语言模型进行的额外训练阶段,如微调或对齐,以优化特定任务表现。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅