该研究探讨联邦学习网络中的软聚类问题,其中每个设备持有私有本地数据集并拟合个性化高斯混合模型。作者采用广义全变差最小化方法,通过图正则项惩罚相连节点间的模型差异,从而耦合各本地最大似然问题。核心设计在于差异度量方式的选择:研究对比了需要组件匹配的模型参数间欧氏距离,以及两种无需匹配的直接分布比较度量——蒙特卡洛近似的KL散度和闭式最大均值差异。三种方案均通过同步投影梯度更新求解,其中光滑MMD实例具有收敛到稳定点的理论保证。研究刻画了各方法的计算成本,并评估了它们对数据异构性的鲁棒性。
| 联邦软聚类 | 在联邦学习框架下,对分布在多个设备上的私有数据进行软聚类(即每个样本以概率形式属于多个簇),同时保护数据隐私。 |
| 广义全变差最小化 (GTVMin) | 一种通过图正则化项耦合局部优化问题的框架,惩罚相连节点模型之间的差异,以促进网络中的模型一致性。 |
| 高斯混合模型 (GMM) | 一种概率模型,假设数据由多个高斯分布的混合生成,常用于聚类和密度估计。 |
| 最大均值差异 (MMD) | 一种用于比较两个概率分布的非参数度量,通过将分布映射到再生核希尔伯特空间并计算均值嵌入之间的距离。 |
| Kullback-Leibler (KL) 散度 | 一种衡量两个概率分布之间差异的度量,表示用近似分布编码真实分布时的信息损失。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅