该研究关注未来大语言模型训练数据中大量包含由现有模型生成的AI文本与图像这一趋势,将此类AI生成数据视为与主数据点相关联的“异常”,考察整体随机数据集的分解与欠采样特性。作者借助冗余图和迭代方法,给出了强相异分解最小规模的界,并揭示出一种相变现象:当异常数量较少时,最小规模基本由主数据点决定;一旦异常数量超过某一阈值,其主导权便转移至异常。此外,论文还建立了随机欠采样数据集强相似性的规模临界性结果,并通过类别型数据集示例加以说明,此类数据集的整体空间规模远大于数据集本身。该工作为理解AI生成数据混入对训练批次分解及后续模型性能的影响提供了理论视角。
| 强相异分解 (Strongly Dissimilar Decomposition) | 将数据集划分为若干子集,使得不同子集之间的数据点尽可能不相似的一种分解方式。 |
| 欠采样 (Undersampling) | 从数据集中随机抽取一个子集的过程,通常用于处理类别不平衡或减少数据规模。 |
| 相变现象 (Phase Transition Phenomena) | 系统参数变化时,其性质发生突然改变的现象,此处指最小分解尺寸的决定因素从主数据点转变为异常点。 |
| 冗余图 (Redundancy Graph) | 一种图结构,其中节点表示数据点,边表示数据点之间的冗余或相似关系,用于分析数据集的分解性质。 |
| 尺寸临界性 (Size Criticality) | 指在随机欠采样数据集中,强相似性成立与否存在一个临界尺寸,超过该尺寸则性质发生突变。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅