该论文提出了一种名为INSPIRE的训练方法,旨在提升大语言模型在数学推理中的示例驱动推理能力,特别是构造反例以检验定理边界的能力。现有方法多聚焦于最终答案的正确性,而忽略了模型是否真正内化数学概念。INSPIRE采用“内化-改进”两阶段框架:首先通过参考引导的学生内化机制,在策略模型自身分布下生成高质量偏好候选;随后采用分阶段的评分偏好训练策略,将学习过程分解为方法导向和正确性导向两个阶段。实验表明,该方法在多个模型规模和家族上均带来一致性提升,甚至超越更大的开源模型,且在分布外基准上的评估确认其不会损害通用数学推理能力。该研究为提升LLM的深层概念理解提供了新思路。
| INSPIRE | 一种结合内化和改进的数学推理增强方法,通过偏好优化提升模型的示例驱动推理能力。 |
| Reference-Guided Student Internalization (RGSI) | 一种在策略模型自身分布下生成高质量偏好候选的技术,用于训练模型内化示例推理策略。 |
| preference optimization | 一种通过偏好对(如好/坏示例)来优化模型行为的方法,常用于对齐模型输出与人类期望。 |
| counterexample | 用于反驳或测试定理边界的具体例子,是数学推理中体现深层理解的重要方式。 |
| out-of-distribution benchmarks | 用于评估模型泛化能力的测试集,其数据分布与训练数据不同,以检验模型是否真正掌握能力而非记忆。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅