该研究比较了标准思维链(CoT)与递归语言模型的学习特性,后者通过将每个子任务置于隔离上下文中求解来限制模型可见的信息范围。研究发现,在分布内,CoT能高效模拟递归规则,两者的泛化保证仅相差常数因子,递归并无明显优势;但在分布外,CoT可能依赖当前子任务之外的上下文进行拟合,形成一旦相关词元改变即失效的捷径,而递归的上下文隔离恰好排除了这一失效模式。值得注意的是,尽管CoT的假设类仍覆盖正确的递归规则,其 simplicity bias 却偏好捷径而非真解。这一结果说明,要超越分布精度、实现真正的推理,仅保证覆盖正确规则并不充分,这与经典学习理论的结论形成对比。
| Recursive Language Models | 递归语言模型:通过将任务分解为子任务并在孤立上下文中分别求解来限制模型可见信息的语言模型。 |
| Chain-of-Thought (CoT) | 思维链:一种让语言模型生成完整推理轨迹的提示或训练方法,模型可读取全部上下文。 |
| Out-of-Domain Generalization | 分布外泛化:模型在训练分布之外的数据上表现出的泛化能力。 |
| Simplicity Bias | 简单性偏差:学习算法倾向于选择更简单的假设,即使该假设并非真实规律。 |
| Context Isolation | 上下文隔离:将每个子任务的求解限制在独立的上下文中,防止模型利用跨子任务的捷径信息。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅