该论文研究合成表格数据的因果保真度问题。作者指出,现有生成器通常只优化分布保真度,但统计相似并不保证因果效应得以保留。论文将因果保真度定义为真实数据与合成数据所得推断分布之间的差异,并从理论上证明高统计保真度一般不能推出高因果保真度。为此,作者提出一种因果保真度感知的训练框架,在生成目标中加入因果差异惩罚项,并以因果惩罚版TabDDPM实现,采用同策略得分函数估计器进行优化,同时给出因果正则化能提升期望因果保真度的条件。实验涵盖多种处理效应模拟和两个基准数据集,结果表明该方法在保持有竞争力的统计保真度的同时,能有效提升因果保真度。
| Causal Fidelity | 因果保真度,指合成数据与真实数据在因果效应推断分布上的一致程度。 |
| TabDDPM | 一种基于去噪扩散概率模型的表格数据生成方法。 |
| Distributional Fidelity | 分布保真度,衡量合成数据与真实数据在统计分布上的相似性。 |
| Score-Function Estimator | 得分函数估计器,一种用于优化生成模型目标函数的策略梯度方法。 |
| Target Estimand | 目标估计量,因果推断中需要估计的特定因果效应量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅