该文章提出了一种基于评分标准的奖励框架,用于优化开放域问答系统的训练。传统方法依赖整体标量奖励,难以捕捉答案质量的多维度要求。新框架通过检索证据生成查询特定的评分标准,并将其分解为多个质量维度,提供细粒度监督。实验显示,该方法在构成、事实依据和指令遵循三个评估轴上,相比指令微调基线平均提升6.5%,比扁平评分标准变体提升4%,且在所有数据集上表现一致。关键发现是,基于检索证据的条件化评分标准能增强事实支持,而多维分解则改善连贯性、组织性和查询遵循度。研究意义在于,这种接地气的多维评分标准为复杂开放域问答提供了更有效的奖励监督机制,有望推动该领域后训练方法的进一步发展。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅