本文针对现有表格数据生成方法仅优化分布拟合、却忽视表格模式与文本描述中弱语义约束的问题,提出语义一致的表格扩散框架。该方法利用大语言模型从元数据中提取列内语义与列间符号规则两类先验,并在真实训练集上验证,随后将其作为生成条件而非事后过滤。模型把异构列值、列标识与语义先验映射到统一语义空间,通过逐列前向加噪与先验条件反向去噪,同时保持边缘分布和跨列规则依赖。在六个真实表格基准上,该方法在分布保真度、语义一致性和下游任务效用上均优于VAE、GAN、LLM及扩散类基线,且在语义先验部分缺失时仍具稳健性。
| 表格扩散模型 | 一种基于扩散过程的生成模型,通过逐步加噪和去噪生成表格数据。 |
| 弱语义先验 | 从表格模式和文本描述中提取的不完整或非严格的语义约束,用于指导生成。 |
| 列内语义 | 描述单个列内数据含义和取值范围的语义信息。 |
| 列间符号规则 | 定义不同列之间逻辑或数学关系的符号化约束。 |
| 分布保真度 | 合成数据分布与真实数据分布之间的匹配程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅