本文探讨了大规模多智能体强化学习中的可扩展性问题。传统方法在广告拍卖、交通调度等场景中通常将其他智能体视为固定环境,忽略了群体动态。作者提出一个基于平均场理论的强化学习框架,假设奖励与转移动态仅依赖于群体未知的低维聚合统计量,而非个体身份。在离线环境下,该方法通过学习低维表示来逼近最优策略,从而避免直接建模高维群体分布的困难。为验证假设,作者设计了一个受供应链优化启发的单步路由博弈实验。结果表明,在固定神经网络参数数量和优化预算下,学习低维群体表示能显著提升奖励预测精度,并改善策略的纳什均衡质量。该研究为高维控制问题中大规模群体的策略学习提供了可行的表示学习方法。
| Mean-field RL | 平均场强化学习,一种利用群体分布作为环境状态的强化学习框架,适用于大规模多智能体系统。 |
| Representation learning | 表示学习,指学习数据或状态的低维特征表示,以提高学习效率和泛化能力。 |
| Aggregate statistic | 聚合统计量,指对群体整体特征的汇总度量,如平均值或分布参数,而非个体细节。 |
| Offline setting | 离线设置,指从预先收集的固定数据集中学习策略,而不与环境进行在线交互。 |
| Nash gap | 纳什差距,衡量当前策略与纳什均衡策略之间的性能差异,用于评估多智能体系统的均衡质量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅