该研究探讨了大型推理模型(LRMs)与人类在溯因推理任务中的认知对齐问题。与标准大语言模型不同,LRMs通过可验证奖励的强化学习优化,追求正确答案而非偏好对齐。研究选择溯因推理作为测试场景,因其难度无法从形式结构推断,模型难以通过捷径伪装思考过程,为比较提供了更可靠基础。实验发现,LRMs与人类在推理努力程度上表现出显著一致性,且两者倾向于犯相似类型的错误。此外,研究还表明,采用允许多条推理路径的解码方法能进一步提升模型与人类在推理成本上的对齐水平,该效果在测试的三个模型中均得到验证。这一发现为理解推理模型与人类认知过程的相似性提供了新证据,也提示多路径探索可能是增强模型类人推理行为的关键方向。
| abductive reasoning | 溯因推理,从观察结果推断最佳解释的推理过程,与演绎推理相对。 |
| large reasoning models (LRMs) | 大型推理模型,通过强化学习优化以解决推理任务,强调正确性而非偏好对齐。 |
| cognitive modeling | 认知建模,用计算模型模拟人类认知过程的研究领域。 |
| reasoning effort | 推理努力,指在解决问题时投入的认知资源或计算成本,如思考时间或推理步骤。 |
| decoding methods | 解码方法,在生成模型中选择输出序列的策略,如束搜索或采样方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅