🔥 今日值得一读 何恺明团队发布多模态Harness框架,视觉原生方案来了!
何恺明团队发布多模态Harness框架
量子位 🔥 重点 多模态论文方法开源 🕐 今天 16:59

📖 AI 总结

何恺明团队提出视觉原生Harness框架VISTA,旨在解决多模态模型在交互任务中难以积累和调用视觉经验的问题。与传统将环境抽象为文字或代码的做法不同,VISTA将环境返回的每一帧原始画面完整保存于上下文之外,并按回合与帧号建立索引,模型可在推理时随时调取、放大和对比历史画面。该框架由视觉观测、无损视觉记忆和主动视觉检查三个组件构成,并辅以文字笔记维持长任务连贯性。在ARC-AGI-3评测中,搭配VISTA的Claude Opus 5.0通关全部25个公开游戏,动作效率得分达满分100,所用动作数比首次游玩的人类基线少57.4%,GPT-5.6 Sol同样全部通关,得分99。该工作无需额外训练模型,为多模态智能体围绕视觉记忆构建原生脚手架提供了新思路。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅