自 2024 年 TimesFM 发布以来,该系列时间序列基础模型已在零售、金融、制造、医疗和自然科学等领域落地。此前版本(包括 2025 年 9 月发布的 TimesFM-2.5)仅支持单变量预测,即只依赖单一时间序列的历史数据推断未来。
据 Google Research 介绍,新发布的 TimesFM-3 是首个原生为多变量预测预训练的迭代版本。该模型参数量为 3.3 亿,预训练语料涵盖真实与合成数据,总计超过 1 万亿个时间点。它在保留前代零样本泛化能力的同时,无需任务特定微调即可处理复杂的多变量场景。
多变量能力覆盖哪些输入
TimesFM-3 原生支持三类输入结构:
- 多目标:可同时预测多个相关时间序列(例如不同品牌的冰淇淋销量),并对所有目标输出点预测与分位数预测。
- 历史协变量:纳入仅在历史上已知的特征,如过往客流量。
- 过去-未来(动态)协变量:利用已知未来事件引导预测,如计划中的促销活动或天气预报。
以零售促销为例,标准单变量模型只能依据历史销售外推周期规律;而将促销排期作为过去-未来协变量输入后,模型可从历史上下文中学习促销与销量提升的关系,并据此在预测中体现约 20% 的日销量增幅。
架构与推理机制
TimesFM-3 沿用前代的纯解码器 Transformer 架构,将连续数据点按 32 个时间步分组为 patch,并对每条时间序列独立归一化以应对量纲差异。
在 token 构造上,目标序列和历史协变量直接由单个 patch 生成 token;对于过去-未来协变量,模型采用“前瞻”策略,将当前 patch 与未来 patch 拼接,使 token 能够读取即将到来的已知信号。
token 化后的数据进入二维网格状 Transformer 堆栈,两种注意力机制交替运行:
- 因果时序注意力:token 沿时间轴水平关注,严格保持因果性,防止数据泄露。
- 全变量注意力:token 在同一时间步垂直关注所有其他时间序列,用于学习跨序列相关性。
在解码阶段,TimesFM-3 放弃了前代逐 patch 生成的自回归方式,改用连续 patch 掩码策略。模型在观测上下文之后追加代表未来区间的掩码占位符 token——目标序列和历史协变量被掩蔽,过去-未来协变量保持可见。通过交替注意力层,模型在一次前向传播中同时填充所有掩码 patch,无需迭代循环。每个目标序列在每个预测步输出第 10 至第 90 百分位的 9 个分位数,提供概率预测视角。
基准测试表现
Google Research 在 Gift-Eval、FEV-Bench 和 Time 三项公开预测基准上评估了 TimesFM-3,并将其与 Chronos-2、Toto 2.0 系列及 TimesFM-2.5 等模型对比。
结果显示,TimesFM-3 在点预测准确率和概率预测质量的平均排名上均位列所有预训练基础模型首位。即使关闭协变量和跨序列信息、以单变量模式运行,其性能也已匹配或优于竞争模型;切换至完整多变量模式后,排名进一步提升。
TimesFM-3 目前已在 GitHub 和 Hugging Face 开放,BigQuery 集成预计在未来数周内上线。
