仅调0.01%参数就搞定ARC推理任务,两步微调让AI真正学会规则!
Implicit Rule Induction with Test-Time Task Embeddings in ARC-like Tasks
arXiv AI (cs.AI) 重要 推理论文方法评估 🕐 今天 12:00

📖 AI 总结

该研究针对ARC类推理基准中模型成功究竟源于规则推断还是捷径依赖这一模糊问题,提出了一种新的测试时训练协议。作者在VARC模型基础上,将原本联合微调的骨干网络与任务嵌入拆分为两步:先仅微调任务嵌入(Embed-TTT),再冻结嵌入微调骨干。在ARC-AGI-1、ConceptARC及两个已知规则的受控数据集上,Embed-TTT均产生更优的任务嵌入,与真实规则对齐更好,提升了基于嵌入的检索效果,并支持对已知规则的准确线性探测。实验还表明,仅优化占模型参数不到0.01%的任务嵌入,就能解决相当比例的任务,而完整两步流程进一步提升最终性能。此外,Embed-TTT能恢复参数化规则的几何结构并支持规则层面的插值,但无法外推。这些发现支持在ARC类评估中更清晰地区分规则归纳与规则执行,并推动能区分分布内与分布外规则的基准设计。

🔑 关键词速览

Abstraction and Reasoning Corpus (ARC)一个评估AI抽象推理能力的基准数据集,包含多种需要从少量示例中归纳规则的视觉推理任务。
Vision ARC (VARC)一种针对ARC任务的模型架构,使用预训练视觉主干网络和可训练的任务嵌入来表示变换规则。
Test-Time Training (TTT)在测试阶段对模型参数进行微调以适应特定任务的方法,通常用于提升模型在新任务上的表现。
Task Embedding一种低维向量表示,用于编码特定任务的变换规则,可被训练以捕捉任务的核心特征。
Linear Probing一种评估表示质量的方法,通过训练线性分类器从嵌入中预测目标属性,以检验嵌入是否包含相关信息。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅