该研究从数学与统计角度探讨了Transformer如何利用跨任务共享结构提升上下文学习(ICL)的样本效率。作者通过覆盖数刻画任务空间复杂度,在无需显式参数化表示的前提下量化任务空间的低维结构,并据此提出“任务识别与评估”流程:利用上下文观测将未见任务定位到锚函数集合中,再通过聚合锚函数的查询结果完成预测。研究显式构造了带Softmax注意力的Transformer来逼近该流程,并推导出泛化误差界,将预训练任务数量与提示长度的影响分离。结果表明,预训练任务数量的缩放由任务空间与输入域的内在维度决定;当任务数量足够多时,对提示上下文长度的依赖变为维度无关。这是首个针对一般非线性任务族量化跨任务复杂度并显式构造Transformer利用其低维结构实现ICL的工作,为联合预训练提升上下文泛化能力提供了定量解释。
| In-Context Learning (ICL) | 上下文学习,指模型无需更新参数,仅凭提示中的少量示例即可适应新任务的能力。 |
| Covering Numbers | 覆盖数,度量一个空间能被多少个半径不超过给定值的球覆盖,用于量化任务空间的复杂度。 |
| Anchor Functions | 锚函数,从任务空间覆盖中选出的一组代表性函数,用于定位和评估未见任务。 |
| Sample Complexity | 样本复杂度,指学习或泛化到目标性能所需的最少样本数量。 |
| Softmax Attention | Softmax 注意力,Transformer 中的核心机制,通过 Softmax 函数对注意力权重进行归一化。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅