仅凭汇总统计量就能预判私有数据值不值得买,高维迁移学习新理论帮你避开负迁移和隐私噪声的坑!
High-Dimensional Asymptotics and Dataset Selection for Private Transfer Learning
arXiv ML (stat.ML) 重要 #迁移学习#差分隐私#数据选择 🕐 今天 12:00

📖 AI 总结

本文研究私有迁移学习中的数据集选择问题:在决定是否购买外部数据或参与协作学习时,需判断新增数据能否带来足够的预测增益以抵消成本。作者指出该决策面临三重挑战:仅能依赖公开的聚合统计量而非个体数据;协变量与模型偏移可能引发负迁移,使额外数据反而损害性能;敏感数据需注入隐私噪声,可能抵消样本量扩大的收益。为此,作者将问题建模为多异构源下的高维回归与加权岭估计,仅使用汇总统计量,并在ρ-零集中差分隐私框架下分别对标签或特征与标签联合提供隐私保证。核心技术贡献是测试误差的确定性等价刻画,揭示了样本量、协方差结构、模型偏移、正则化与隐私噪声之间的交互作用。该理论可用于优化权重与岭正则化等超参数,并在不访问数据本身、仅依赖总体层面量的条件下判断私有外部数据集是否有用,为私有迁移学习提供了可理论分析的基础,并通过合成与真实数据实验加以验证。

🔑 关键词速览

高维渐近研究当特征维度与样本量以固定比例趋于无穷时,统计估计和预测误差的极限行为。
负迁移在迁移学习中,源域数据或模型反而导致目标域性能下降的现象。
ρ-零集中差分隐私一种差分隐私的变体,通过零集中差分隐私参数ρ来量化隐私保护强度,ρ越小隐私保护越强。
确定性等价在高维渐近分析中,用一个确定性量来近似随机测试误差,从而揭示各因素间的相互作用。
加权岭估计器一种结合了样本权重和L2正则化的回归估计方法,用于处理异质数据源并控制模型复杂度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅