本文提出USPLIT-VQA,一种面向视觉问答(VQA)的U型拆分学习框架,旨在解决VQA训练中用户数据隐私敏感的问题。该框架让客户端保留初始层和分类头,服务器仅承载计算量大的中间层,从而使原始输入和标签始终留在客户端设备上,兼顾隐私与计算负担的合理分配。作者同时提出贡献感知加权聚合(CAWA),基于梯度相似性对客户端评分,以抑制恶意更新。在VQA-RAD、SLAKE、PathVQA和VizWiz四个数据集及两种骨干网络上的实验显示,相比联邦学习,定制模型准确率提升,BiomedCLIP在固定拆分下准确率下降;客户端内存最多降低5.8倍,通信量最多降低10.8倍。在单个恶意客户端场景下,CAWA将攻击者影响降低逾98%,但更高污染水平下仍存在局限,重构实验也显示所评估攻击下的反演质量更低。
| USPLIT-VQA | 一种用于隐私保护视觉问答的U形拆分学习框架,客户端保留初始层和分类头,服务器托管中间层。 |
| Contribution-Aware Weighted Aggregation (CAWA) | 一种基于梯度相似度的客户端评分机制,用于降低恶意更新在聚合中的影响。 |
| Split Learning | 一种分布式机器学习范式,将模型拆分到客户端和服务器上,以保护数据隐私。 |
| Visual Question Answering (VQA) | 结合图像和自然语言问题生成答案的多模态任务。 |
| Federated Learning | 一种分布式学习方式,多个客户端协作训练模型而不共享原始数据。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅