何恺明团队提出视觉原生Harness框架VISTA,旨在解决多模态模型在交互任务中难以积累和调用视觉经验的问题。与传统将环境抽象为文字或代码的做法不同,VISTA将环境返回的每一帧原始画面完整保存于上下文之外,并按回合与帧号建立索引,模型可在推理时随时调取、放大和对比历史画面。该框架由视觉观测、无损视觉记忆和主动视觉检查三个组件构成,并辅以文字笔记维持长任务连贯性。在ARC-AGI-3评测中,搭配VISTA的Claude Opus 5.0通关全部25个公开游戏,动作效率得分达满分100,所用动作数比首次游玩的人类基线少57.4%,GPT-5.6 Sol同样全部通关,得分99。该工作无需额外训练模型,为多模态智能体围绕视觉记忆构建原生脚手架提供了新思路。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅