该研究针对AI个性化数字伴侣在长期记忆推理方面的评估瓶颈,指出现有基准多为合成文本数据,忽视日常记忆所依赖的视觉记录,缺乏真实且因果关联的纵向数据,因而只能停留在浅层事实回忆。为此,作者构建了ReaLMem——首个基于真实多年个人视觉档案并配以第一人称主观标注的长期多模态记忆基准,从事实回忆、人格推断和预测性个性化三个认知层级评估模型。同时提出时间加权画像模块ChronoProfiler,通过计算用户属性的时间稳定性得分作为显著性先验,缓解偏好冲突并支持多重偏好的复合决策。对前沿多模态大模型和记忆系统的评测显示,预测性个性化是普遍性能上限,两类系统间存在明显差距,而高质量、时间感知的表征能显著提升个性化效果。
| ReaLMem | 首个基于真实多年个人视觉档案构建的长期多模态记忆基准,用于评估模型对用户长期历史的推理能力。 |
| ChronoProfiler | 一种时间加权画像模块,通过计算用户属性的时间稳定性分数作为显著性先验,解决偏好冲突并支持复杂个性化决策。 |
| 预测性个性化 | 在长期个人历史推理中难度最高的认知层级,要求模型基于纵向数据预测用户未来的偏好或行为。 |
| 多模态大语言模型(MLLMs) | 能够同时处理文本、图像等多种模态信息的大规模语言模型,是当前个性化AI系统的重要基础。 |
| 时间稳定性分数 | ChronoProfiler中用于衡量用户属性随时间变化程度的指标,分数越高表示该属性越稳定,可作为显著性先验。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅