ProxyGuard提出了一种针对随机化数据发布机制的直接可靠性推断方法,解决研究者从多个代理数据集中选择时可能出现的统计误判问题。该方法通过预设风险界限和密封目标集,同时控制无效发布被误认为有效以及单个有效发布不足以证明机制可靠性的两类错误。论文设计了两种模式:命名发布模式校正多重比较并认证特定发布,直接共享目标模式则在共同目标上评估独立机制抽取,下限估计有利评分率并扣除无效发布贡献的评分。该方法无需独立目标批次或对发布级p值依赖性作假设,即可获得有限样本的机制可靠性保证。实验表明,在三要求注册研究中,直接模式在可靠性0.95时将统计功效从5.6%提升至64.2%,而命名模式在高信号证据下表现更强。研究还涵盖了对全流程Rice-TVAE及非表格文本机制的审计应用。
| ProxyGuard | 一种用于控制随机数据发布机制可靠性评估中两类错误的方法。 |
| named-release mode | 一种模式,用于校正多重比较问题并认证特定数据发布。 |
| direct shared-target mode | 一种模式,直接在共同目标上评估独立机制抽取,提供可靠性保证。 |
| finite-sample guarantee | 在有限样本下成立的统计保证,不依赖渐近近似。 |
| Rice--TVAE | 一种全流水线生成模型,每次抽取时重新训练,用于数据发布。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅