该研究探讨了当同一批问题以两种互不兼容但均正确的约定呈现时,训练数据的排列顺序会在模型参数中写入什么。作者证明,学习率调度并非背景条件,而是决定排序效应的平均算子:排列仅以块周期形式进入,调度则决定端点对任一时刻可施加的权重。在恒定学习率下,十种排列在分配上跨度达0.2221,对比度下限为11.63,且随排列分块程度单调变化;而在常用的单一余弦调度下,同样的十种排列仅占据两个可区分状态。关键发现是,十二组实验中准确率之和在9.7%以内保持恒定,而分配份额从0.04到0.87大幅变动,说明论文测得的12.29σ排列效应在约定无关指标下恰好为零。这表明排序改变的是模型对某种约定的承诺,而非其能力,且任何精确匹配基准都无法察觉这一区别;在提示中标注约定可消除该切换效应,并达到并集上限的87.5%。
| 排列效应 (arrangement effect) | 指训练数据中样本顺序或分块方式对模型参数和性能产生的影响。 |
| 学习率调度 (learning-rate schedule) | 训练过程中学习率随时间变化的策略,如恒定、余弦衰减等,影响优化路径。 |
| 约定无关度量 (convention-agnostic metric) | 不依赖于特定数据标注或输出约定的评估指标,如精确匹配基准。 |
| 分配份额 (allocation share) | 模型在两种互不兼容约定之间分配其预测或参数资源的比例。 |
| 并集上限 (union ceiling) | 模型在同时满足两种约定时所能达到的性能上界。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅