该研究首次将PAC隐私框架从分类任务扩展到自回归文本生成场景,提出了一种基于集成分歧校准噪声的隐私保护方法。研究者构建了128个重叠世界,每条记录出现在其中64个世界中,并在冻结的公共模型上为每个世界训练适配器。在生成每个token时,各世界进行投票,其分歧程度决定所需添加的校准噪声——当预测完全一致时无需噪声。该方法证明了互信息界限,并引入了耦合解码策略以保持隐私核算同时避免贪婪退化。实验表明,在WikiText-103和GPT-2-small上,该方法在极低per-token预算下保留了74%的微调收益,经过10^6个token后成员推断成功率仅51.08%。与PMixED相比,在匹配的成员推断界限下保留了98%的非私有性能空间,显著优于对比方法的56%。研究还揭示了推理隐私与内容保护的本质区别。
| PAC privacy | 一种隐私框架,根据输出对秘密的敏感性校准噪声,预测稳定时添加较少噪声。 |
| PMixED | 一种私有预测方法,通过混合多个适配器的输出来保护隐私,但每次发布都产生隐私成本。 |
| autoregressive generation | 自回归生成,一种逐token生成序列的模型方法,当前输出依赖于先前生成的token。 |
| membership inference | 成员推断攻击,试图判断特定数据点是否在训练集中,是隐私泄露的度量方式。 |
| posterior-weighted disagreement | 后验加权分歧,根据各世界后验概率加权的输出不一致程度,用于确定噪声大小。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅