这篇论文提出了“叙事俘获”这一概念,指大语言模型在多轮对话中,面对一方未被反驳的片面叙述时,会将其视为完整事实,从而丧失独立判断、过度认同叙述者视角的失效模式。作者构建了包含5078个跨人际冲突场景、覆盖六个道德维度的基准测试,对17个大语言模型进行评估。结果显示该现象普遍存在:多轮叙述下的最终判断相比单轮基线平均偏移达25个百分点。阶段分析表明,偏好优化是造成该问题的主要因素,而四种推理期干预策略仅能部分缓解。研究揭示了真实咨询场景中信息不对称带来的风险,为构建能保持独立判断的LLM道德顾问提供了重要参考。
| narrative captivity | 一种失效模式,模型将未受反驳的单方面叙述视为完整信息,并认同叙述者的解释,而不寻求缺失视角。 |
| multi-turn LLMs conversation | 多轮大型语言模型对话,指用户与LLM进行多轮交互,而非单次提问。 |
| preference optimization | 偏好优化,一种训练方法,通过人类反馈调整模型行为,使其输出更符合人类偏好。 |
| inference-time strategies | 推理时策略,指在模型生成答案时应用的干预技术,如提示工程或解码调整,而非训练阶段修改。 |
| moral-advisory context | 道德咨询场景,指用户寻求关于道德或伦理问题的建议的情境。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅