该论文提出了一种参数化多模态用户记忆方法,旨在弥补传统基于文本描述的记忆系统在捕捉感知信息(如声音特质、面部特征、疲劳状态)方面的不足。研究发现,在五个模态中,基于字幕的再识别器仅能恢复专用编码器召回率的0.11,对于不可命名信号几乎失效。为此,作者将感知记忆分解为两个子问题:视觉语言模型负责上下文指代定位,专用编码器提取身份特征,并以内联令牌形式存储,无需外部检索。实验表明,单独使用任一方法效果有限,但二者结合在PerceptMem基准(12个领域、1080个任务)上达到0.96的召回率,且识别核心无需训练,可适配任意冻结模型。该研究揭示了感知身份与事实信息在记忆容量上的本质差异,为构建更完整的个性化智能体提供了新思路。
| Parametric Multimodal User Memory | 一种将用户记忆以参数化形式存储的多模态记忆模型,区别于纯文本记忆。 |
| Vision-Language Model (VLM) | 视觉-语言模型,联合处理图像和文本,用于在上下文中定位指代对象。 |
| Identity Key | 由专用编码器提取的身份标识,用于唯一识别用户或对象。 |
| PerceptMem | 一个基准数据集,包含12个领域和1,080个任务,用于评估感知记忆能力。 |
| Training-free Recognition Core | 无需额外训练的识别模块,能在任意冻结模型上以O(1)注册成本复现编码器的召回性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅