🔥 今日值得一读 仅需标记分歧就能认证模型更新不降级,标签成本直降1/rho倍!
Pay Only for Disagreement: Certified No-Regression Verdicts for Model Updates with Matching Label-Complexity Bounds
arXiv LG (cs.LG) 🔥 重点 #模型更新#风险审计#无标签验证#部署安全 🕐 09-17 12:00
👨‍💼 主理人解读 · 为什么值得关注
可在无标签流量下认证模型更新不劣于旧版,开发者可用它安全上线重训或量化模型。

📖 AI 总结

该论文将生产环境中的模型更新(重训练、微调、量化或供应商替换)形式化为“配对风险差异审计”问题,其核心洞察是一个支撑恒等式:两个模型之间的风险差异只存在于它们预测不一致的输入上,且这一不一致性无需标签即可观测。作者提出DISCERN,一种顺序两层协议:零标签层仅凭无标签流量即可认证不一致率低于容差的良性更新;审计层则通过任意时刻有效的置信序列,仅对采样到的不一致样本进行标注,且在任意停止时间和任意标签路由规则(即便评审者具有对抗性)下均保持有效。理论证明给出有限样本有效性及阶为ρ²/ε²的匹配标签复杂度界,表明利用免费的不一致信息可比任何配对盲审计器节省1/ρ的标注量,且该保证可在单一误差预算下跨无限次更新序列复合。在785个更新对、逾14000条回放审计流(含最高14亿参数语言模型的LoRA微调)上的实验显示,误覆盖率仅0.0002(标称5%),功效0.986且零误报,56%的良性更新无需任何标签即获认证,每次审计还输出可供机器校验的证据记录以支持上市后监测。

🔑 关键词速览

DISCERN一种顺序的两层协议,用于认证模型更新是否无回归,第一层无需标签,第二层仅标记不一致样本。
配对风险差异审计通过比较两个模型在相同输入上的风险差异来评估更新是否比原模型更差的过程。
支持恒等式风险差异仅存在于两个模型预测不一致的输入上,且无需标签即可观测的数学性质。
标签复杂度界在给定精度和置信水平下,审计所需标记样本数量的理论下界,此处为 rho^2/eps^2 量级。
随时有效置信序列一种在任何停止时间都保持有效性的统计置信序列,适用于顺序审计。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅