语言模型训练数据成员推断无需猜测,重复计数直接揭示真相!
Detectable Only Where It Is Confounded: What Verified Duplication Counts Say About Membership Evidence in Language Models
arXiv CL (cs.CL) 重要 大模型安全对齐论文方法 🕐 09-11 12:00

📖 AI 总结

这篇论文研究语言模型能否通过预测难度推断某句话是否出现在训练数据中,即“成员推断”问题。以往研究只能猜测哪些句子属于训练集,本文利用OLMo-2和Pythia两个公开预训练语料及其索引,获得每句话被复制的精确次数,从而直接检验这一推断。核心发现是:在普通文本常见的重复水平下,1B至13B参数的五个模型几乎不携带自身训练暴露的痕迹,秩相关仅约-0.08;只有当某句话被复制约一千次以上时,痕迹才变强,但此时两个语料库指向的是同一批“名句”,暴露与知名度无法区分。研究还揭示,将成员句改动一个词构造非成员句时,模型偏好原句源于作者用词而非记忆;而替换为语域不同的对照句,可使检测器AUC从0.83升至0.94。作者公开了句子库、计数与代码。该工作表明,现有成员证据大多出现在混杂因素无法排除之处,对模型记忆与数据溯源研究具有重要警示意义。

🔑 关键词速览

成员推断判断一个特定样本是否属于模型训练数据的过程。
重复计数句子在预训练语料库中出现的精确次数,用于量化暴露程度。
秩相关一种衡量两个变量之间单调关系强度的统计指标,取值在-1到1之间。
AUCROC曲线下的面积,用于评估二分类模型的性能,0.5表示随机猜测,1.0表示完美区分。
语域语言使用的场合或领域变体,如正式、非正式、学术等。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅