🔥 今日值得一读 中国象棋实测:12个顶尖大模型,找到杀招却赢不了棋,闭环胜率仅5.9%!
Finding the Move Is Not Winning the Game: XiangqiBench for Closed-Loop Evaluation of LLM Agents
arXiv CL (cs.CL) 🔥 重点 #Agent#评测基准#闭环评估 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
揭示静态评测与真实Agent能力的差距,可用于测试LLM在需要多轮交互和对手响应的任务中的表现。

📖 AI 总结

这篇论文提出 XiangqiBench,一个可执行的中国象棋基准,用于评估大语言模型智能体在闭环对抗中的真实能力,而非仅考察其能否指出正确着法。基准包含119个有强制杀法的战术残局,智能体需在与引擎对手的实际对弈中完成将死,并记录来自12个前沿模型的8568条多轮轨迹。研究揭示三种看似胜任的信号均高估了闭环成功率:转换缺口方面,模型在26.1%的可见试验中走出参考首着,但其中仅13.9%最终获胜;一致性缺口方面,领先模型pass@3达38.7%,而pass^3仅5.9%;模拟缺口方面,32.3%被接受的模拟调用终止于非法着法,49.3%的可比情形中真实对手的应对与模拟线路不同。结论是,找到着法不等于赢得棋局,智能体评估应关注闭环结果,并同时报告可靠性与覆盖度。

🔑 关键词速览

XiangqiBench一个用于评估LLM智能体在中国象棋中闭环对弈能力的可执行基准测试。
闭环评估评估智能体从计划到执行再到验证结果的完整过程,而非仅检查单步输出。
转化差距模型能走出正确第一步却无法最终获胜的现象,反映静态正确性与实际胜利之间的落差。
pass@3 / pass^3pass@3指三次尝试中至少成功一次的概率,pass^3指三次尝试全部成功的概率,用于衡量可靠性与一致性。
模拟差距智能体在模拟中预测的对手回应与真实对手实际回应不一致的现象,表明模拟无法完全预判对手行为。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅