该研究探讨大语言模型对输入数据的“信任程度”是否影响其输出忠实度,即当模型认为上下文不合理时,是否更容易出错。作者利用非英语及低资源语言(英语、捷克语、斯洛伐克语和上索布语)生成难度更大的特点,让模型基于包含捷克和斯洛伐克本地知识的事实、反事实和虚构RDF三元组生成文本,以考察上下文与模型参数化记忆之间的冲突。与预期相反,在人工标注样本上仅观察到微弱的上下文—记忆冲突:以Kimi K3作为评判模型时,反事实输入相比事实输入的忠实度得分仅低约0.05(1—5分制)。研究还发现,若选用不合适的LLM评判模型,会高估这种冲突的强度。该结果提示,模型对输入可信度的敏感度可能被此前研究夸大,评判模型的选择本身也会显著影响结论。
| 上下文-记忆冲突 | 指模型在生成时,其内部参数化记忆与外部提供的上下文信息之间产生矛盾,从而影响输出忠实度的现象。 |
| 忠实度 | 衡量模型生成内容与给定上下文(如输入数据)保持一致、不歪曲或添加无依据信息的程度。 |
| RDF三元组 | 资源描述框架(RDF)中表示事实的基本单位,由主语、谓语和宾语构成,常用于结构化知识表示。 |
| 反事实输入 | 与真实世界事实相矛盾或不符合常识的输入数据,用于测试模型是否盲目遵循上下文而非依赖自身知识。 |
| LLM评判者 | 使用大型语言模型作为自动评估工具,对生成文本的质量(如忠实度)进行打分或判断。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅