本文研究均匀离散扩散模型的统计泛化性质。针对文本、生物序列等离散数据虽处于极大状态空间、却因语义或物理约束集中于极小有效支撑集的特点,作者指出既有误差界随环境空间规模增长而近乎失效,无法刻画这一结构。为此,论文引入依赖样本量的有效支撑集大小作为分布复杂度度量,证明在适当网络规模与超参数下,期望总变差损失以根号下有效支撑集与样本量之比的速率收敛,KL散度亦有相应上界,并进一步给出下界,表明总变差速率达到极小极大最优,KL速率在忽略对数因子后同样最优。该结果说明均匀离散扩散能规避维数灾难,其误差仅通过有效支撑集依赖环境空间规模,为离散生成模型的统计理论提供了关键支撑。
| 离散扩散模型 | 一种在离散状态空间(如文本或生物序列)上进行生成建模的框架,通过逐步添加和去除噪声来学习数据分布。 |
| 均匀离散扩散 | 离散扩散模型的一种主要范式,其中噪声在离散状态上均匀分布,与掩码扩散并列。 |
| 有效支撑大小 $s_n(P_0)$ | 一种依赖于样本量的分布复杂性度量,表示数据分布实际集中的有效状态数量,用于捕捉分布的结构。 |
| 总变差(TV)损失 | 衡量生成分布与真实分布之间差异的统计距离,定义为两个概率分布之间概率质量最大差异的一半。 |
| 最小最大最优 | 在统计决策理论中,指一个估计量在所有可能分布上达到的最坏情况风险的最小可能值,即最优的收敛速率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅