该研究针对时间序列基础模型(TSFM)的预训练方法提出改进。当前主流做法是将模型输出与合成轨迹的实际未来值进行损失比较,而作者提出“合成数据蒸馏”(SDD),改为将模型输出与每条轨迹的条件预测分布进行比较。理论上,SDD 相当于训练目标的 Rao-Blackwell 化,在保持随机梯度期望不变的同时,可证明地降低了梯度的协方差。研究在参数量从 4M 到 2.5B 的模型家族上进行验证,发现各规模下验证损失的收敛均加快;在高斯过程数据上,SDD 在达到或优于原有损失水平的同时,所需训练迭代次数减少 10% 至 40%。该工作为利用已知数据生成过程的合成数据高效预训练时间序列基础模型提供了新的理论视角与实证支持。
| Time Series Foundation Models (TSFMs) | 时间序列基础模型,指在大规模时间序列数据上预训练、可迁移到多种下游任务的通用模型。 |
| Synthetic Data Distillation (SDD) | 合成数据蒸馏,本文提出的方法,通过将模型输出与条件预测分布而非实际未来值比较来训练模型。 |
| Rao-Blackwellization | Rao-Blackwell化,一种利用条件期望降低估计量方差的技术,本文用于降低随机梯度协方差。 |
| Loewner partial ordering | Loewner偏序,用于比较对称矩阵的偏序关系,本文用于证明协方差矩阵的降低。 |
| Gaussian Process data | 高斯过程数据,一种常用的合成时间序列生成模型,用于生成具有已知条件分布的数据。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅