这篇论文探讨了无搜索国际象棋网络的训练方法。传统方式通过模仿Leela Chess Zero等强引擎的蒙特卡洛树搜索(MCTS)访问计数来训练单次前向传播的棋力网络,但作者认为模仿搜索并非无搜索对弈的最佳代理。他们提出用自对弈强化学习微调网络,以网络自身MCTS先验的“前向KL散度”替代常见的“反向KL熵奖励”作为探索机制,并结合由价值头不确定性调节的自适应采样温度。实验显示,约两千步训练将谜题准确率从93.9%提升至94.9%,四步杀准确率从77%升至81%,同时保持基础棋力。研究还发现战术准确率与棋力可分离:仅用谜题微调的对照组战术提升最大却损失约260 Elo。分布级测量表明,前向KL先验能防止自对弈崩溃至单一走法,并保留关键胜着,在棋力排行榜上领先。
| Searchless chess | 无搜索国际象棋,指仅通过神经网络单次前向传播而不进行显式搜索的下棋方式。 |
| Prior-directed exploration | 先验引导探索,一种强化学习探索策略,使用网络自身的MCTS先验分布来引导探索方向。 |
| Kullback-Leibler (KL) divergence | KL散度,衡量两个概率分布差异的指标,分为前向(质量覆盖)和逆向(模式寻求)两种形式。 |
| Monte Carlo Tree Search (MCTS) | 蒙特卡洛树搜索,一种用于决策的启发式搜索算法,在AlphaZero等系统中用于评估走法。 |
| Self-play reinforcement learning | 自我对弈强化学习,通过与自身对弈来训练模型,无需外部标注数据。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅