本文提出了一种面向联邦在线强化学习的新算法 Fed-LSVI,旨在解决多智能体强化学习中通信成本高和隐私受限的问题。现有算法通常需要共享原始轨迹,导致通信成本随训练轮次线性增长,难以满足联邦学习场景的隐私要求。Fed-LSVI 通过引入基于行列式的事件触发同步机制和逐步反向更新策略,使各智能体仅需交换压缩后的充分统计量即可协同学习最优策略。理论证明,该算法在特征维度为 d、回合长度为 H、智能体数为 M、每智能体训练轮次为 T 的条件下,实现了与当前最优多智能体线性函数逼近算法相匹配的遗憾界(约 √(Md³H⁴T))。更重要的是,其通信成本仅随 T 呈对数增长,显著优于此前方法,为联邦强化学习在隐私约束下的高效训练提供了理论保障。
| Federated Reinforcement Learning | 联邦强化学习,一种在多个智能体间协作学习策略而不共享原始数据的分布式学习范式。 |
| Linear Function Approximation | 线性函数逼近,使用线性模型近似价值函数或策略,以处理大规模状态空间。 |
| Regret Bound | 遗憾界,衡量算法性能与最优策略之间差距的上界,用于评估学习算法的效率。 |
| Event-Triggered Synchronization | 事件触发同步,一种仅在特定条件满足时才进行通信的机制,以减少通信开销。 |
| Sufficient Statistics | 充分统计量,包含数据中与参数估计相关的所有信息的压缩表示,用于减少通信数据量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅