训练集一次冻结,无智能体无大模型,TW3Cast冲上GIFT-Eval第3名!
TW3Cast: A Frozen Router of Lightly Fine-Tuned Foundation Models for Time-Series Forecasting on GIFT-Eval, Selected Entirely on the Training Split
arXiv AI (cs.AI) 重要 #时间序列#基础模型#评测基准 🕐 今天 12:00

📖 AI 总结

TW3Cast 是一个面向时间序列预测的集成系统,在 GIFT-Eval 基准的 130 个条目中以平均 MASE 排名位列第三,且不使用任何智能体或语言模型。其核心是一个在训练集上一次性计算并冻结的路由表,为 97 种数据集、频率与预测跨度组合分别指定四种模式之一:经规则清洗与增强数据微调的 Chronos-2、TiRex 或 Toto 专家模型、包含专家的分位数混合、基础模型混合,或基于训练集回测的选拔赛。所有决策均在训练集回测上完成,并辅以准确率与校准双重标准、针对训练期见过序列的非对称边际以及逐窗口保守门控三重防护。结果显示,最佳单一基础模型平均排名为 33.8,全配置选拔赛为 38.0,而完整路由达到 19.4,表明冻结路由与轻量微调专家的组合能显著提升预测性能。

🔑 关键词速览

GIFT-Eval一个时间序列预测基准测试,用于评估模型在多个数据集和配置上的性能。
MASE平均绝对缩放误差,一种用于评估时间序列预测准确性的指标,对尺度不敏感。
LoRA低秩适应,一种参数高效的微调方法,通过注入低秩矩阵来适应大型预训练模型。
Chronos-2一个时间序列预测的基础模型,属于 Chronos 系列,用于生成预测。
TiRex一个时间序列预测的基础模型,可能基于 Transformer 架构,用于生成预测。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅