苹果机器学习研究团队发表的论文《扩散模型中的置信度局限》探讨了离散扩散模型(包括重掩码和均匀态采样器)的生成机制。这类模型在每步生成时同时写入多个token位置,每个位置从各自的分布中采样,并依据这些分布决定写入哪些位置。研究指出,对于像素、音素或词语等具有内在依赖关系的领域,只有当写入位置在已固定token条件下相互独立时,单步生成才能匹配训练分布;任何逐位置分布的乘积都无法匹配存在依赖关系的组合,且逐位置分布本身无法判断一组位置是否依赖——两个联合分布可以拥有完全相同的逐位置边缘分布,却在取值组合上存在差异。在合成任务ScanAndAdd上,研究者验证了置信度排序写入的每一组两个及以上未确定位置均存在依赖关系,测得生成分布的总变差达到采样噪声下限的29倍,而单样本指标仍为1.0。该发现揭示了当前离散扩散采样策略在依赖结构建模上的根本性局限。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅