NVIDIA FLARE 通过将持久化的联邦协调服务与动态启动的任务执行进程分离,解决了跨异构基础设施部署联邦学习的难题。其两层架构允许同一联邦中的不同站点分别采用 Docker、Kubernetes 或 Slurm 作为执行后端,各站点保留对计算资源分配及数据集、密钥、镜像和调度策略的本地控制权。父进程常驻但不占用 GPU,任务工作进程通过可移植的资源规范按需申请 GPU、CPU 和内存。研究(study)机制在单一部署内提供逻辑多租户边界。FLARE 2.8 引入 Docker 和 Kubernetes 部署支持,2.9 版本新增 Slurm 支持,面向 HPC 与共享 GPU 集群。这一设计降低了平台标准化门槛,使各机构无需统一基础设施即可参与协作。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅