这篇论文提出 XiangqiBench,一个可执行的中国象棋基准,用于评估大语言模型智能体在闭环对抗中的真实能力,而非仅考察其能否指出正确着法。基准包含119个有强制杀法的战术残局,智能体需在与引擎对手的实际对弈中完成将死,并记录来自12个前沿模型的8568条多轮轨迹。研究揭示三种看似胜任的信号均高估了闭环成功率:转换缺口方面,模型在26.1%的可见试验中走出参考首着,但其中仅13.9%最终获胜;一致性缺口方面,领先模型pass@3达38.7%,而pass^3仅5.9%;模拟缺口方面,32.3%被接受的模拟调用终止于非法着法,49.3%的可比情形中真实对手的应对与模拟线路不同。结论是,找到着法不等于赢得棋局,智能体评估应关注闭环结果,并同时报告可靠性与覆盖度。
| XiangqiBench | 一个用于评估LLM智能体在中国象棋中闭环对弈能力的可执行基准测试。 |
| 闭环评估 | 评估智能体从计划到执行再到验证结果的完整过程,而非仅检查单步输出。 |
| 转化差距 | 模型能走出正确第一步却无法最终获胜的现象,反映静态正确性与实际胜利之间的落差。 |
| pass@3 / pass^3 | pass@3指三次尝试中至少成功一次的概率,pass^3指三次尝试全部成功的概率,用于衡量可靠性与一致性。 |
| 模拟差距 | 智能体在模拟中预测的对手回应与真实对手实际回应不一致的现象,表明模拟无法完全预判对手行为。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅