不用完美答案!新方法让AI从错误中自学,AIME准确率暴涨7.5%!
Reflective Recovery: A Self-Supervised Method for Reasoning by Learning from Mistakes
arXiv CL (cs.CL) 重要 大模型论文方法 🕐 09-18 12:00

📖 AI 总结

该研究针对大语言模型推理能力微调中主流模仿学习方法的局限展开。现有方法仅依赖完美推理轨迹进行训练,当问题集有限时会出现“规模坍缩”现象,即增加正例无法带来持续的性能提升;同时模型在推理过程中一旦产生错误,往往难以自我恢复,并可能被累积的错误进一步误导。为此,作者提出“反思性恢复”这一自监督方法,将失败的推理尝试转化为恢复训练数据:提取失败轨迹的初始片段,与提示拼接后引导模型走向正确解法。由于这些片段很可能包含错误,该过程使模型学会在推理中识别并纠正错误,从而在无需外部评判器或奖励模型的情况下实现从错误状态中恢复。在多个基准测试上,该方法显著提升性能,例如在DeepSeek-R1-Distill-Qwen-7B上,AIME 2025准确率从30.0%提升至37.5%,Minerva从37.6%提升至47.8%。分析表明,该方法突破了规模坍缩瓶颈,并促使模型涌现出自我纠错行为,标志着从结果导向的记忆向过程导向的反思性推理的范式转变。

🔑 关键词速览

Scaling Collapse缩放崩溃:指在有限问题集下,增加正例数量无法持续提升模型性能的现象。
Reflective Recovery反思性恢复:一种自监督方法,将失败推理轨迹转化为训练数据,使模型学会从错误中恢复。
Self-Supervised自监督:一种无需人工标注标签,利用数据自身结构生成监督信号的学习范式。
Emergent Self-Correction涌现式自我纠正:模型在训练过程中自发发展出的识别并修正自身错误的能力。
Imitation Learning模仿学习:通过模仿专家示范(如完美推理轨迹)来训练模型的方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅