该研究提出RENDER基准,用于控制大语言模型记忆评估中“面向读者的证据”呈现形式。作者发现,现有记忆与RAG评估常将模型输入视为实现细节,但同一历史内容以记忆条目、摘要、类型化记录或原始摘录等不同形式呈现时,可能显著影响模型表现。RENDER通过五级数据包阶梯和确定性模板,在500个LongMemEval问题及9个模型上验证了这一效应:匹配预算的数据包比截断原始对话高出42.4至72.6分;部署风格模板下,模型内最佳与最差表现差距达24.6至48.8分。尤其值得注意的是,三个在正式账本式数据包上得分为0的模型,面对自然语言条目时正确率可达45.4%至53.4%。该效应在检索噪声下依然存在,并迁移至HotpotQA数据集。研究建议记忆与RAG评估应明确报告或控制面向读者的证据形式,以确保结果可比性和有效性。
| RENDER | 一种基准控制方法,用于评估LLM记忆时固定对话内容而改变面向读者的呈现形式。 |
| RAG | 检索增强生成,一种结合检索外部信息与生成模型的技术。 |
| LongMemEval | 一个用于评估长对话记忆能力的基准数据集。 |
| MemGPT | 一种基于GPT的智能体框架,模拟操作系统内存管理来组织对话历史。 |
| HotpotQA | 一个多跳问答数据集,用于测试模型在复杂推理和证据整合上的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅