该研究指出,现有系统性泛化研究依赖近似线性动作组合、基于产出性的测试和动作显式目标等简化设定,虽便于实验,却遗漏了该能力的关键维度。为揭示这些简化所掩盖的问题,作者以推理为核心视角提出TranSGrid测试平台,将演绎、归纳与溯因推理整合于统一任务中。对七种Transformer模型在4800个实例上的实验显示,模型表现显著低于常规留出测试集:最大模型在测试集上解决率为79.6%,在TranSGrid上仅55.3%,在最难子集上低至15.8%,且差距在训练长度范围内依然存在,说明仅靠产出性不足以评估系统性泛化。当分别重新引入线性动作组合或动作显式目标时,解决率均回升至测试集水平,表明任一简化都足以将任务退化为普通测试集。研究结论是,现有任务削弱了归纳或溯因需求,全面衡量系统性泛化需同时涵盖三种推理形式。
| Systematic Generalization | 系统泛化:通过重新组合已知的原子元素来解决新问题的能力,是人类智能的核心特征。 |
| TranSGrid | 一个测试平台,将演绎、归纳和溯因推理统一在一个任务中,用于评估系统泛化。 |
| Deductive Reasoning | 演绎推理:从一般前提出发,通过逻辑推导得出必然结论的推理方式。 |
| Inductive Reasoning | 归纳推理:从具体观察中概括出一般规律或模式的推理方式。 |
| Abductive Reasoning | 溯因推理:从观察到的结果出发,推断最可能解释该结果的假设或原因的推理方式。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅