LLM不信输入就更容易出错?实测反事实数据忠实度仅降0.05分!
Do LLMs Make More Mistakes If They Do Not Believe the Input Data?
arXiv CL (cs.CL) 重要 大模型安全对齐论文方法 🕐 09-10 12:00

📖 AI 总结

该研究探讨大语言模型对输入数据的“信任程度”是否影响其输出忠实度,即当模型认为上下文不合理时,是否更容易出错。作者利用非英语及低资源语言(英语、捷克语、斯洛伐克语和上索布语)生成难度更大的特点,让模型基于包含捷克和斯洛伐克本地知识的事实、反事实和虚构RDF三元组生成文本,以考察上下文与模型参数化记忆之间的冲突。与预期相反,在人工标注样本上仅观察到微弱的上下文—记忆冲突:以Kimi K3作为评判模型时,反事实输入相比事实输入的忠实度得分仅低约0.05(1—5分制)。研究还发现,若选用不合适的LLM评判模型,会高估这种冲突的强度。该结果提示,模型对输入可信度的敏感度可能被此前研究夸大,评判模型的选择本身也会显著影响结论。

🔑 关键词速览

上下文-记忆冲突指模型在生成时,其内部参数化记忆与外部提供的上下文信息之间产生矛盾,从而影响输出忠实度的现象。
忠实度衡量模型生成内容与给定上下文(如输入数据)保持一致、不歪曲或添加无依据信息的程度。
RDF三元组资源描述框架(RDF)中表示事实的基本单位,由主语、谓语和宾语构成,常用于结构化知识表示。
反事实输入与真实世界事实相矛盾或不符合常识的输入数据,用于测试模型是否盲目遵循上下文而非依赖自身知识。
LLM评判者使用大型语言模型作为自动评估工具,对生成文本的质量(如忠实度)进行打分或判断。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅