🔥 今日值得一读 合成数据有漏洞?31万选项审计发现代码部分AUROC仅0.416,模型竟没利用!
When a Data Artifact Isn't a Shortcut: Causal Auditing of Synthetic RLVR Corpora
arXiv CL (cs.CL) 🔥 重点 #RLVR#因果审计#合成数据 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮助开发者检测RLVR训练数据中正确性与来源的纠缠,避免模型走捷径。

📖 AI 总结

这篇论文对合成 RLVR 训练语料中“正确选项来自真实文本、干扰项由模型生成”这一构造方式进行了因果审计。作者以 GooseReason-0.7M 为对象,先检验这种来源不对称是否可被表面特征识别:一个仅依赖五项表面统计的分类器在 315,499 个选项上仅取得 0.562 的 AUROC,接近随机水平;但分领域看,代码数据低至 0.416,原因是代码干扰项实为对正确答案的单算子变异,两类样本在构造上几乎相同。随后作者构建改写匹配的对照语料,在训练集规模和预算一致的前提下训练两个策略,发现未修改数据一方的利用差距为 0.021,反而低于对照组的 0.027。这表明可检测的数据伪影在给定预算下未必被策略利用,检测到信号不等于模型真的依赖它。研究提示此类语料策展需区分可检测性与实际利用,并提供了以 CPU 为主的审计协议。

🔑 关键词速览

RLVR基于可验证奖励的强化学习,一种利用自动验证的奖励信号训练语言模型的方法。
AUROC接收者操作特征曲线下面积,衡量分类器区分正负类能力的指标,0.5为随机水平。
GooseReason-0.7M一个包含70万条样本的合成推理数据集,用于审计RLVR训练数据中的伪影。
干扰项在多项选择或对比学习中,与正确答案相似但错误的选项,用于增加任务难度。
释义匹配通过改写文本保持语义不变,以控制表面形式差异的实验设计方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅