🔥 今日值得一读 联邦强化学习新算法:通信成本从线性暴降到对数级,隐私保护还更强!
Provably Efficient Federated Reinforcement Learning with Linear Function Approximation and Logarithmic Communication Cost
arXiv ML (stat.ML) 🔥 重点 #联邦学习#强化学习#通信优化 🕐 09-02 12:00
👨‍💼 主理人解读 · 为什么值得关注
用于隐私保护的多智能体强化学习,开发者可借此降低通信开销并保持性能。

📖 AI 总结

本文提出了一种面向联邦在线强化学习的新算法 Fed-LSVI,旨在解决多智能体强化学习中通信成本高和隐私受限的问题。现有算法通常需要共享原始轨迹,导致通信成本随训练轮次线性增长,难以满足联邦学习场景的隐私要求。Fed-LSVI 通过引入基于行列式的事件触发同步机制和逐步反向更新策略,使各智能体仅需交换压缩后的充分统计量即可协同学习最优策略。理论证明,该算法在特征维度为 d、回合长度为 H、智能体数为 M、每智能体训练轮次为 T 的条件下,实现了与当前最优多智能体线性函数逼近算法相匹配的遗憾界(约 √(Md³H⁴T))。更重要的是,其通信成本仅随 T 呈对数增长,显著优于此前方法,为联邦强化学习在隐私约束下的高效训练提供了理论保障。

🔑 关键词速览

Federated Reinforcement Learning联邦强化学习,一种在多个智能体间协作学习策略而不共享原始数据的分布式学习范式。
Linear Function Approximation线性函数逼近,使用线性模型近似价值函数或策略,以处理大规模状态空间。
Regret Bound遗憾界,衡量算法性能与最优策略之间差距的上界,用于评估学习算法的效率。
Event-Triggered Synchronization事件触发同步,一种仅在特定条件满足时才进行通信的机制,以减少通信开销。
Sufficient Statistics充分统计量,包含数据中与参数估计相关的所有信息的压缩表示,用于减少通信数据量。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅