🔥 今日值得一读 前沿大模型竟不会可废止推理?ArgGYM用1440个实例一测便知!
ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning
arXiv AI (cs.AI) 🔥 重点 #评测基准#可废止推理#RL环境 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
提供可自动验证奖励的可废止推理环境,开发者可用于训练和评测LLM的不确定性推理。

📖 AI 总结

ArgGYM 是一个面向结构化可废止推理的程序化基准与训练环境,旨在弥补现有大模型推理评测过度依赖数学、代码和形式逻辑等固定问题设定、难以迁移到真实场景的不足。可废止推理的核心特征是结论可在信息不完整时被暂时支持、被反证推翻、再被新论据恢复或修正。ArgGYM 将该推理拆解为十二类任务,并借助符号论证引擎计算形式状态来对模型输出打分,从而保证评测的客观性与可验证性。基准包含 1440 个经校验实例,覆盖十五种课程配置、两种论证偏好排序和两种集合排序;其生成器与验证器还能持续产出新实例,既降低对静态测试集的依赖,也支持可验证奖励的强化学习训练。实验显示,前沿模型与开源权重模型呈现明显不同的推理特征:它们能部分还原结构化答案却难以完成完整任务,且随着课程配置中依赖链变长、结构交互增多,性能持续下降。该工作为可废止推理的可复现评测与 RLVR 训练提供了公开资源。

🔑 关键词速览

可废止推理 (Defeasible Reasoning)一种在信息不完整或可修正条件下进行的推理,结论可被反证推翻,也可因新证据而恢复或修正。
ArgGYM本文提出的过程性基准测试和兼容 RLVR 的训练环境,用于评估和训练结构化可废止推理能力。
RLVR (Reinforcement Learning with Verifiable Rewards)一种强化学习范式,使用可自动验证的奖励信号来训练模型,常见于数学、代码和形式逻辑任务。
符号论证引擎 (Symbolic Argumentation Engine)一种基于符号逻辑的计算引擎,用于形式化地计算论证状态,从而对模型输出进行客观评分。
课程配置 (Curriculum Configurations)指基准测试中按难度或结构复杂度分级的任务设置,用于系统评估模型在不同推理复杂度下的表现。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅