该研究提出了一种名为条件独立正则化分布自编码器的新框架,用于处理同时包含数值和分类变量的混合类型数据。现有方法往往只关注重建精度或无条件数据生成,难以在恢复完整条件分布的同时保持异质变量间的可解释结构关系。该方法通过能量分数目标函数处理数值变量、似然目标函数处理分类变量,并引入辅助条件独立正则化项来捕捉数值与分类成分间的依赖关系。理论分析表明,最优表示能够平衡未解释的数值变异性、分类变量的条件熵及残差条件依赖。实验结果显示,该方法在合成和真实数据集上均表现优异,显著提升了分类分布恢复能力,实现了具有竞争力的整体条件分布恢复效果,并保持了混合类型的依赖结构。
| Conditional-Independence-Regularized Distributional Autoencoders | 一种通过条件独立正则化来学习混合类型数据低维表示的自动编码器框架。 |
| Mixed-type data | 同时包含数值型和类别型变量的数据。 |
| Energy-score-based objective | 基于能量分数的目标函数,用于衡量数值变量预测的分布差异。 |
| Conditional distribution matching | 使学习到的表示能够匹配数据的条件分布的方法。 |
| Structural regularization | 通过正则化项保持变量之间结构关系的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅