🔥 今日值得一读 时间序列基础模型训练提速40%!新方法SDD用合成数据蒸馏,2.5B参数模型也验证有效
Distillation of Synthetic Data for Time Series Foundation Models
arXiv ML (stat.ML) 🔥 重点 #时间序列#基础模型#训练方法 🕐 09-10 12:00
👨‍💼 主理人解读 · 为什么值得关注
改进时序基础模型预训练目标,开发者可用SDD提升合成数据训练效率与泛化。

📖 AI 总结

该研究针对时间序列基础模型(TSFM)的预训练方法提出改进。当前主流做法是将模型输出与合成轨迹的实际未来值进行损失比较,而作者提出“合成数据蒸馏”(SDD),改为将模型输出与每条轨迹的条件预测分布进行比较。理论上,SDD 相当于训练目标的 Rao-Blackwell 化,在保持随机梯度期望不变的同时,可证明地降低了梯度的协方差。研究在参数量从 4M 到 2.5B 的模型家族上进行验证,发现各规模下验证损失的收敛均加快;在高斯过程数据上,SDD 在达到或优于原有损失水平的同时,所需训练迭代次数减少 10% 至 40%。该工作为利用已知数据生成过程的合成数据高效预训练时间序列基础模型提供了新的理论视角与实证支持。

🔑 关键词速览

Time Series Foundation Models (TSFMs)时间序列基础模型,指在大规模时间序列数据上预训练、可迁移到多种下游任务的通用模型。
Synthetic Data Distillation (SDD)合成数据蒸馏,本文提出的方法,通过将模型输出与条件预测分布而非实际未来值比较来训练模型。
Rao-BlackwellizationRao-Blackwell化,一种利用条件期望降低估计量方差的技术,本文用于降低随机梯度协方差。
Loewner partial orderingLoewner偏序,用于比较对称矩阵的偏序关系,本文用于证明协方差矩阵的降低。
Gaussian Process data高斯过程数据,一种常用的合成时间序列生成模型,用于生成具有已知条件分布的数据。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅