这篇论文从数学角度研究了Transformer所定义的测度到测度算子,旨在弥补其理论基础薄弱的现状。作者证明Transformer将次高斯输入映射为次高斯输出,从而保证任意长度softmax算子复合的良定义性;并进一步证明Transformer在次高斯输入空间上关于1-Wasserstein距离满足Hölder连续性,据此建立了输入与其经验近似之间沿Transformer传播的误差估计。研究还考察了交叉注意力机制的均值场类比,发现其在两个输入参数上表现出不同的Hölder正则性和样本复杂度。最后,作者将上述结果应用于推导测度到测度Transformer的逼近保证,为次高斯数据上的Transformer提供了较为完整的稳定性与有限样本理论。
| Measure-to-Measure Transformer | 将输入概率测度映射为输出概率测度的 Transformer 算子,用于刻画模型在分布层面的整体行为。 |
| Sub-Gaussian Data | 尾部衰减速度不慢于高斯分布的随机变量或数据,是本文稳定性与有限样本分析的核心假设。 |
| 1-Wasserstein Distance | 衡量两个概率测度之间最优传输代价的距离,本文用它来建立 Transformer 的 Hölder 连续性。 |
| Cross-Attention | Transformer 中让一个序列查询另一个序列的注意力机制,本文研究其均场版本作为测度到测度算子的性质。 |
| Hölder Continuity | 一种比 Lipschitz 连续性更一般的正则性条件,用于控制输入扰动对输出的影响程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅