本文针对大语言模型隐私审计中的成员推断攻击(MIA)展开研究。现有方法大多依赖逐词元的对数概率或概率值,无法适用于仅提供文本续写的专有模型。为此,作者提出词级概率成员推断攻击(WPMIA),通过蒙特卡洛采样与局部核平滑估计词级生成概率,聚合成序列级似然估计,并利用不同前缀条件下的似然差异放大成员与非成员之间的分布差距。在多个开源模型上,WPMIA持续优于现有黑盒基线;在GPT-5-Chat、Gemini-2.5-Flash和Claude-4.5-Haiku等专有模型上,平均TPR@5%FPR达到42.0。该工作为严格黑盒场景下的成员推断研究提供了可行基础。
| Membership Inference Attacks (MIAs) | 成员推理攻击,一种通过分析模型输出判断特定数据是否属于其训练集的隐私审计技术。 |
| Word-level Probability MIA (WPMIA) | 词级概率成员推理攻击,本文提出的方法,通过估计词级生成概率并进行序列级聚合来实现严格黑盒场景下的成员推理。 |
| Monte Carlo sampling | 蒙特卡洛采样,一种通过随机采样来估计数值结果(如概率或期望)的统计方法。 |
| Local kernel smoothing | 局部核平滑,一种非参数估计技术,通过对邻近数据点加权平均来平滑估计概率分布。 |
| TPR@5%FPR | 在假阳性率(FPR)为5%时的真阳性率(TPR),是评估成员推理攻击性能的常用指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅