该研究探讨了引用在人类与大型语言模型(LLM)偏好判断中的作用,聚焦于科学问答场景。通过混合效应模型分析,作者比较了人类评审与四种开源LLM在成对输出比较时对引用的反应。关键发现包括:人类倾向于偏好引用来源更多样但总数更少的输出;而LLM虽无法直接访问引用源,仍表现出与人类不同的引用相关偏好,且这种偏好受数据和模型类型影响。研究揭示了引用在偏好数据收集中的复杂角色,为奖励建模和LLM后训练中的归因评估提供了实证依据,并强调了在偏好标注中考虑引用特征的必要性。
| Attribution | 指模型输出中提供对支撑来源的引用,以增强可信度和可验证性。 |
| Reward Modeling | 用于训练强化学习模型,通过人类偏好数据来学习奖励函数的过程。 |
| Mixed Effects Models | 一种统计模型,用于分析固定效应和随机效应对结果的影响,适用于处理层次结构数据。 |
| Pairwise Judgments | 成对比较,即对两个输出进行偏好判断,常用于收集人类或模型偏好数据。 |
| Post-training | 指在预训练之后对大型语言模型进行的额外训练阶段,如微调或对齐,以优化特定任务表现。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅