何恺明团队提出NAT-ARC,一种纯视觉的ARC抽象推理方案,不依赖大语言模型。该方法先用MAE在ImageNet上预训练视觉编码器,再迁移到ARC格子推理任务,测试时对每题单独做LoRA微调。结果显示,最佳单模型(0.6B参数)在ARC-1上取得63.4%的pass@2分数,集成后达70.2%,以约四分之一参数量逼近8B专用LLM系统的71.6%。研究还发现,预训练能打通视觉路线的scaling瓶颈,使模型规模与性能恢复正相关;注意力可视化表明,ImageNet预训练让模型自动聚焦格子中的有效图案,其学到的物体分组、图案匹配与区域分割能力可直接迁移至抽象推理。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅