该研究提出“空间记忆智能”(SMI)框架,旨在解决长视频生成与世界模型中长程空间上下文管理日益困难的问题。随着记忆序列增长、结构复杂化,传统记忆管理策略难以维持空间一致性。SMI首次系统性地利用多模态大语言模型的理解能力来管理空间记忆,设计了四项协同的原子操作:空间聚类、簇内稀疏化、动作感知检索和可靠性感知过滤。研究在多种基线、基准和世界模型主干上进行了广泛实验,结果表明SMI在记忆稀疏性、生成稳定性和空间一致性方面均取得全面提升,并展现出良好的通用性。该工作为世界模型引入理解驱动的长期记忆管理提供了新思路,对交互式娱乐和具身仿真等应用具有重要意义。
| Spatial Memory Intelligence (SMI) | 本文提出的首个利用理解模型进行长视频世界模型中空间记忆管理的框架。 |
| World Models | 能够预测未来观测并模拟环境动态的模型,常用于互动娱乐和具身模拟。 |
| Multimodal Large Language Models (MLLMs) | 能够处理文本、图像等多种模态信息的大规模语言模型,具备空间推理能力。 |
| Spatial Clustering | SMI中的原子操作之一,根据空间关系将记忆项分组以管理长程上下文。 |
| Action-aware Retrieval | SMI中的原子操作之一,根据用户动作检索相关记忆以支持未来预测。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅