该论文提出了一种针对合成数据增强统计推断的通用框架,核心问题是解决真实数据稀缺时直接混入合成样本所带来的偏差问题。作者引入“规模-权重前沿”概念,为每个合成样本权重确定最大可用样本量,以保证所有更小规模配置都能达到目标任务边际覆盖率。该前沿可从历史任务中估计,并具备有限样本覆盖保证,适用于所有位于估计前沿下方或之上的配置。实验基于大语言模型生成的回复增强民意调查数据,结果显示该方法在实现目标覆盖率的同时显著缩窄了置信区间。这一框架为跨相关任务的合成数据使用提供了理论保障和实用工具。
| synthetic-augmented inference | 一种利用合成数据增强真实数据以改进统计推断的方法。 |
| size-weight frontier | 描述合成样本大小与权重之间权衡的边界,用于确定满足覆盖率要求的最大样本量。 |
| task-marginal coverage | 针对每个任务边际的覆盖率,即推断区间包含真实值的概率。 |
| finite-sample coverage guarantee | 在有限样本下保证覆盖率满足目标水平的性质,而非仅渐近成立。 |
| large language model (LLM) | 大型语言模型,如GPT,用于生成合成数据以增强真实数据集。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅