功效暴涨11倍!ProxyGuard让数据可靠性从5.6%飙到64.2%
ProxyGuard: Direct Reliability Inference for Randomized Data Release Mechanisms with Shared Targets
arXiv ML (stat.ML) 重要 #统计推断#数据发布#风险控制 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
解决多数据集发布中代理选择导致的假阳性问题,通过密封目标集和预设风险界限控制两类错误,适用于数据发布可靠性验证。

📖 AI 总结

ProxyGuard提出了一种针对随机化数据发布机制的直接可靠性推断方法,解决研究者从多个代理数据集中选择时可能出现的统计误判问题。该方法通过预设风险界限和密封目标集,同时控制无效发布被误认为有效以及单个有效发布不足以证明机制可靠性的两类错误。论文设计了两种模式:命名发布模式校正多重比较并认证特定发布,直接共享目标模式则在共同目标上评估独立机制抽取,下限估计有利评分率并扣除无效发布贡献的评分。该方法无需独立目标批次或对发布级p值依赖性作假设,即可获得有限样本的机制可靠性保证。实验表明,在三要求注册研究中,直接模式在可靠性0.95时将统计功效从5.6%提升至64.2%,而命名模式在高信号证据下表现更强。研究还涵盖了对全流程Rice-TVAE及非表格文本机制的审计应用。

🔑 关键词速览

ProxyGuard一种用于控制随机数据发布机制可靠性评估中两类错误的方法。
named-release mode一种模式,用于校正多重比较问题并认证特定数据发布。
direct shared-target mode一种模式,直接在共同目标上评估独立机制抽取,提供可靠性保证。
finite-sample guarantee在有限样本下成立的统计保证,不依赖渐近近似。
Rice--TVAE一种全流水线生成模型,每次抽取时重新训练,用于数据发布。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅