何恺明团队提出NAT-ARC,一种不依赖大语言模型的纯视觉ARC解题方案。该方法将MAE在ImageNet约130万张自然图像上预训练得到的编码器权重,迁移至ARC抽象格子推理任务,仅保留视觉特征提取能力并替换位置编码以适配64×64的格子输入。实验显示,最佳单模型(0.6B参数)在ARC-1上取得63.4%的pass@2分数,集成后达70.2%,以约四分之一参数量逼近8B专用LLM系统的71.6%水平。注意力可视化表明,ImageNet预训练使模型能自动聚焦格子中的有意义区域,其学到的前景背景分离、图案匹配与连通区域识别能力可直接迁移至抽象推理。该研究首次证明预训练能打通视觉路线在ARC上的scaling瓶颈,为抽象推理提供了语言模型之外的新路径。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅