TimeThink 是一套旨在激发时间序列大语言模型组合推理能力的合成框架。针对现有多模态时间序列模型难以捕捉动态时序模式、仅提供缺乏解释的隐式推理,以及强化学习模型受限于分布内数据、难以应对分布外组合问题等缺陷,该研究提出利用趋势、季节性等与领域无关且可确定性生成的时序基元,构建合成数据生成器,产出带有推理轨迹和客观真值的原子与组合问答对,并采用可验证奖励的强化学习策略训练模型,使其学习组合背后的逻辑而非模仿模板。实验表明,仅用合成数据训练的 TimeThink 在合成与真实基准上均显著优于强基线,为医疗等高风险场景下的时序推理提供了新思路。
| TS-MLLMs | 时间序列多模态大语言模型,结合时间序列数据与多模态大语言模型进行推理和问答。 |
| RLVR | 可验证奖励的强化学习,一种利用可验证奖励信号训练模型进行显式推理的强化学习策略。 |
| 组合式推理 | 将复杂问题分解为原子推理步骤并组合这些步骤以得出答案的推理方式。 |
| 时间序列基元 | 时间序列的基本模式,如趋势、季节性等,与领域无关且可确定性生成。 |
| 分布外组合问题 | 训练数据分布之外的、需要组合多个概念或步骤才能解决的问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅