本文研究联邦强化学习场景下,多个智能体与同一马尔可夫决策过程交互并通过中央服务器协作学习最优状态-动作价值函数的问题,重点考察当部分智能体具有对抗性、传输任意损坏信息时,协作带来的样本效率优势能否保持。作者提出基于轮次的联邦学习算法Robust Async-Fed-Q,将智能体端的方差缩减贝尔曼最优算子估计与服务器端的鲁棒聚合相结合。理论分析给出了高概率有限时间保证,表明该方法在容忍对抗性损坏的同时保留了诚实智能体间的统计增益,且对抗智能体的影响随每个诚实智能体数据量增加而减小,在无限样本极限下趋于消失。作者进一步给出信息论下界,刻画对抗性损坏不可避免的统计代价,首次为对抗鲁棒联邦强化学习建立了近乎匹配的上界与下界。该框架还扩展到单轨迹马尔可夫采样和异构部分覆盖情形,并显著改善了异步采样下联邦Q学习已知的最佳通信复杂度。
| 联邦强化学习 | 多个智能体在各自环境中交互,通过中央服务器协作学习策略,同时保护数据隐私的强化学习范式。 |
| Q-Learning | 一种无模型的强化学习算法,通过迭代更新状态-动作值函数 Q(s,a) 来学习最优策略。 |
| 对抗鲁棒性 | 系统在部分参与者恶意行为或信息被任意篡改时,仍能保持学习性能的能力。 |
| 方差缩减 | 在随机优化中减少梯度或估计量方差的技术,以加速收敛并提高稳定性。 |
| 通信复杂度 | 分布式学习中智能体与服务器之间传输信息的总量或轮次,衡量算法通信效率的指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅