top of page

Google Research 发布 TimesFM-3,但其最佳模型附带商业使用限制

Google Research 于 2026 年 8 月 31 日发布 TimesFM-3,为此前仅限单序列预测的模型家族加入了原生多变量预测能力。这款拥有 3.3 亿参数的模型可在一次推理中处理更多信息,包括相关序列、历史信号以及已知的未来事件。

这一变化意义重大,因为现实中的预测很少仅依赖一段历史数据。零售需求会受到促销和天气影响。能源消耗遵循温度、日程安排与活动情况。共享服务发生故障时,基础设施指标也会同步波动。

据 Google 表示,TimesFM-3 无需针对具体任务进行微调即可弥补这一缺口。不过,此次发布也带来一个重要矛盾:代码仍以 Apache 2.0 开源,而新的预训练权重禁止商业和生产环境使用。

因此,这不只是又一次模型更新。Google Research 打造了更强的通用预测架构,同时将公开实验与不受限制的部署分隔开来。这将对 Amazon 的 Chronos-2、Datadog 的 Toto 系列,以及维护专用预测流水线的团队形成压力。

Google Research 在 TimesFM-3 中做了哪些改变

TimesFM-3 让 TimesFM 家族从单序列预测器变成了能够理解相互关联变量的模型。

Google 于 2024 年 2 月推出最初的 TimesFM。该模型采用仅解码器 Transformer,即根据此前的时间序列块预测未来的序列块。其 2 亿参数在 1000 亿个真实世界时间点上训练而成。

原始模型采用零样本预测,也就是无需专门针对某个未见数据集训练,便可对其进行预测。Google 在其预测模型论文中报告称,该模型与统计方法及有监督深度学习模型相比表现具有竞争力。

随后,TimesFM-2.0 将模型规模提升至 5 亿参数。TimesFM-2.5 则回到 2 亿参数,同时将支持的上下文从 2,048 个时间点扩展至 16,384 个时间点。它还增加了覆盖最长 1,000 步预测范围的连续分位数预测。

但这些版本在本质上仍是单变量模型。即便可以通过独立机制使用外部回归变量,每次预测仍主要将一个目标序列视为待预测对象。

TimesFM-3 改变了这一设计。其 3.3 亿参数在超过一万亿个真实和合成时间点上进行了预训练。该训练语料规模是首个模型所披露语料的十倍以上。

模型可接受多种不同类型的信息。多个目标变量代表用户希望联合预测的相关序列。过去协变量提供仅在观测期内已知的变量。过去—未来协变量则包含在整个预测范围内已知的数值。

例如,零售商可以联合预测冰淇淋、甜筒和糖浆的需求。历史客流量可作为过去协变量,计划中的促销活动和天气预报则可成为过去—未来协变量。

这种安排使模型能够利用单变量预测会丢弃的关联关系。当模型看到销售激增与促销活动同时发生时,就更容易理解这一变化。相关产品之间的需求变化也可以为共同的行为模式提供证据。

官方 TimesFM-3 发布说明称,该模型支持对每个目标进行点预测和分位数预测。点预测给出一个预期值;分位数则描述可能结果的范围及其不确定性。

TimesFM-3 可生成九个分位数,覆盖第 10 至第 90 百分位。这对于单一预测不足以支持决策的场景至关重要。库存团队不仅需要了解预期需求,也需要理解缺货和积压库存的风险。

Google 还表示,该模型可以在单变量模式下运行。因此,开发者可在构建完整的多变量数据流水线之前,先将新检查点与现有的单序列工作负载进行测试。

该版本已通过公开的 Google Research 代码库和 Hugging Face 检查点提供。Google 表示,BigQuery 集成将在未来几周内推出,这也使 8 月 31 日成为该代码库重新获得关注背后的已验证事件日期。

因此,GitHub 上的热度与当前发布有关,而非 2024 年项目被重新发现。TimesFM-3 是该代码库的最新模型,新的多变量架构正是推动关注度上升的事件。

为什么多变量预测改变了竞争格局

关键转变并不只是准确率更高。TimesFM-3 所瞄准的是决定预测能否在生产环境中奏效的复杂关系。

大多数运营预测都处于相互连接的系统中。仓库的需求并不独立于定价、促销、天气、节假日和周边库存而存在。数据中心也不会产生彼此孤立的 CPU、内存、流量和延迟信号。

单变量模型会简化这些关系。它们能够识别单个目标历史数据中的季节性、趋势和重复模式。然而,除非通过其他机制输入信息,否则它们无法直接理解已排定的促销活动。

多变量预测会联合处理多个序列。它可以建模一个变量如何随另一个变量变化,以及外部信号如何改变目标变量。当这些关系在历史上下文中反复出现时,这种方法尤其有用。

Google 的零售示例说明了原因。单变量预测会延续历史每周销售模式;由于促销日程不会出现在目标变量的过去数值中,它无法预判促销日。

TimesFM-3 将该日程作为已知的未来协变量接收。模型随后把历史促销与销售变化关联起来,并将这种关系应用于计划日期。Google 的示例显示,每个促销日的预期销售额增长约为 20%。

这一数字仅作示例,并不表明该模型会在所有零售商场景中产生相同的增长预测。促销效果取决于定价、产品、客户、时机和数据质量。该示例展示的是未来信息如何进入预测过程。

这一能力直接对其他时间序列基础模型形成压力。Amazon 的 Chronos 系列帮助确立了类语言模型预训练作为可行预测方法的地位。Chronos-2 随后将竞争扩展到多变量和协变量感知任务。

Datadog 的 Toto 系列同样面向通用预测,包括多变量工作负载。Salesforce 的 Moirai 系列和 IBM 的 Tiny Time Mixers 则代表了其他尝试:以可复用的预训练系统替代多个独立的任务专用模型。

竞争越来越取决于部署范围。只能在干净的公开基准上表现良好的基础模型,对运营团队的价值有限。胜出的系统必须能够处理不规则的业务上下文、不确定性、变化中的关系,以及可接受的推理成本。

TimesFM-3 让 Google 能够对已超越单变量预测的竞争对手作出有力回应。它还将研究成果连接到既有分发渠道。早期 TimesFM 能力已进入 BigQuery、AlloyDB、Google Sheets 和 Vertex AI 环境。

Google 曾报告,到 2025 年,TimesFM 已通过 BigQuery 和 AlloyDB 每月处理数亿次查询。这一数字针对的是早期模型版本,而非 TimesFM-3,但它表明从研究到日常使用已有成熟路径。

分发能力的重要性可能不亚于基准排名。数据仓库中的预测模型让分析人员可以在受治理的业务数据附近工作,也避免每个团队在测试预测前都必须搭建单独的推理服务。

压力同样落在专用预测流水线上。许多组织仍为不同产品、地区或指标训练不同模型。每个模型都需要特征工程、验证、监控和反复维护。

零样本通用模型改变了起点。团队可以先在大量序列上评估一个模型,再决定哪些领域仍值得进行专门训练。这并不会消除定制模型,但会提高它们必须超越的标准。

这也是为什么“无需微调”这一说法需要谨慎解读。用户仍需选择目标变量、准备协变量、防止信息泄漏、确定预测范围,并评估业务成本。该模型省去了一个训练步骤,而非周边的预测规范。

单次推理模型重写了预测机制

TimesFM-3 将跨序列注意力与单次解码相结合,同时应对上下文缺失和误差累积问题。

与此前的 TimesFM 版本一样,该模型将相邻观测值分组为每组 32 个时间步的块。一个块类似于语言模型中的 token,将多个连续数值压缩为一个内部表示。

分块可缩短序列长度,使更长的历史数据更易处理。它还让 Transformer 能够处理重复出现的局部模式,而不是将每个测量值都视为毫无关联的项目。

TimesFM-3 在两个维度上排列这些 token。一个维度代表时间,另一个维度代表请求中包含的不同目标序列和协变量序列。

Transformer 在两种注意力操作之间交替运行。因果时间注意力检查同一序列中较早的块。“因果”意味着模型在形成预测时不能查看未知的未来目标值。

完整变量注意力则在同一时间位置上跨序列工作。它允许一个目标变量从其他目标变量和协变量中获取信息。这也是促销日程能够影响相关销售预测的方式。

过去—未来协变量会获得特殊的前瞻处理。每个 token 都将当前块与包含已知信息的未来块结合起来。因此,模型可以看到已排定的事件,同时不会接触未来的目标结果。

这种区别至关重要。未来节假日日历是有效输入,因为日期已知;明天的实际销售额则不是有效输入,因为透露它会泄露答案。

Google Research 还改变了解码过程。早期 TimesFM 模型按顺序生成预测块,每个预测块都会成为生成下一个块的上下文。

顺序生成有两个弱点。由于每一步都要等待前一步,因此会增加延迟;同时,早期预测错误也可能影响之后的每一个块。

TimesFM-3 改为使用连续块掩码。系统会添加覆盖整个预测范围的掩码占位符,然后在一次前向推理中预测这些位置。

已知的未来协变量保持可见,而目标值仍被掩盖。交替的时间注意力和变量注意力处理组合后的上下文。模型无需迭代生成循环即可填充整个预测范围。

这种非自回归设计,也就是说它不会一次一段地生成预测范围,是 Google 性能主张的核心。更长的预测范围不再需要按比例增加解码轮次。

这一机制也改变了用户应衡量的指标。原始模型延迟依然重要,但内存使用情况以及跨大量变量的扩展能力同样关键。联合预测可以在每次请求中纳入更多序列,从而增加注意力计算量。

公开的 TimesFM repository 包含可变长度单变量输入和多变量数组的示例。它还展示了仅过去协变量与过去-未来协变量的独立输入方式。

这些示例揭示了一项实际要求:用户必须将每个目标变量和协变量对齐到统一的时间轴上。缺失观测、延迟上报和频率不匹配,都会在推理开始前影响结果。

以可观测性工作负载为例。CPU 利用率可能每分钟上报一次,计费数据每小时一次,而部署标记仅在发布发生时出现。将它们合并需要就重采样和缺失值作出决策。

医疗和金融场景还会带来更严格的限制。团队必须判断某个外部变量在预测时点是否确实可用。否则,基准测试可能因意外使用未来信息而显得准确。

若仅将 TimesFM 解释为一个更大的 transformer,就会错过关键点。它的规模相较 TimesFM-2.5 仅小幅增加,而预训练语料已扩展至超过一万亿个数据点。更深层的变化在于,该架构如何表示变量关系并生成预测范围。

这一设计使 Google TimesFM 模型与运营规划更加相关,但也让评估更困难。成功如今取决于所提供的关系是否真实、稳定、时序正确,并且对决策有用。

基准测试无法回答生产环境的问题

Google 报告称其在三个公开基准测试中排名第一,但许可条款和独立验证限制了采用者目前能够得出的结论。

Google 在 GIFT-Eval、FEV-Bench 和 TIME 上评估了 TimesFM-3。这些评测套件涵盖不同的数据集、预测任务、预测范围和评估设置。

该公司称,TimesFM-3 在点预测和概率预测两方面均位列预训练基础模型第一。它还表示,该模型在 100 个真实世界任务组成的 FEV-Bench 中领先,并在涵盖 50 个领域的 98 个任务组成的 TIME 基准中领先。

GIFT-Eval 还提供了对零样本预测的广泛测试。Google 表示,TimesFM-3 在该比较纳入的基础模型中排名第一。

据称,该模型在无法利用协变量或跨序列信息的单变量模式下仍具竞争力。启用完整多变量模式后,其平均排名进一步提升。

这些是有意义的信号,因为它们测试了单一预训练模型是否能够迁移到多样化数据集上。它们还将 TimesFM-3 与近期系统进行了比较,包括 Chronos-2、Toto 2.0 和 TimesFM-2.5。

然而,平均排名将大量结果压缩为一个数字。它无法揭示该模型是否能在某一特定组织所关注的序列、预测范围和误差成本上取胜。

一家杂货零售企业的规划人员可能最关注节假日高峰前的误差。容量工程师可能更关心是否漏掉极端流量事件。财务团队则可能更重视校准良好的不确定性,而非平均表现上的微小提升。

公开基准测试也可能与生产数据不同。业务序列中存在缺货、政策变化、报告缺口、产品发布和一次性冲击。当这些条件发生变化时,从历史中学习到的关系可能失效。

最值得质疑的角度在于访问权限。该仓库的源代码采用 Apache 2.0 许可,而截至 TimesFM-2.5 的模型权重也保留该许可。TimesFM-3 权重则采用单独的非商业许可。

该许可将默认的 TimesFM-3 预训练权重限制为非商业和非生产用途。公司可以研究该架构并进行获许可的实验,但不能假定下载的检查点能够部署在创收型工作流中。

这在技术可用性和运营可用性之间造成了明显鸿沟。模型是公开的,但其最直接的生产路径仍由 Google 控制。

该仓库还警告,其开源版本并非 Google 官方支持的产品。因此,开发者应区分社区可访问的代码与提供企业支持承诺的服务。

BigQuery 集成可能解决部分部署问题。Google 表示,该集成将在发布后的数周内推出。其条款、地域可用性、配额、支持的输入以及生产环境表现都将很重要。

此前的 TimesFM 支持已通过 BigQuery 的 AI.FORECAST function 提供。该接口降低了 SQL 用户的使用门槛,但 TimesFM-3 支持必须在上线后加以确认。

此次发布也缺少那种随时间积累的独立生产证据。公开用户仅有数天时间测试多变量行为、内存需求、故障模式以及对协变量选择的敏感性。

即使 Google 提供的一万亿数据点训练规模,也留下了未解问题。此次发布描述了真实与合成时间序列的混合,但没有提供完整语料清单。用户无法仅凭规模全面判断领域覆盖情况。

初始模型将 Google Trends 和 Wikipedia 页面浏览数据作为公开数据源之一。这些数据集包含有用的时间模式,但不能假定这些模式与一家公司的内部运营相似。

分位数预测同样需要验证。产生九项不确定性估计,并不保证其区间会在新领域中得到校准。团队应检查实际结果落入每个预测范围内的频率。

因此,实际测试应当是比较性的。组织应使用相同的基于时间的切分方式,将 TimesFM-3 与 TimesFM-2.5、Chronos-2、Toto、统计基线以及当前生产模型进行对比。

它们还应对每种预测生成的决策进行评分。如果推理更困难、协变量不可靠或许可阻碍部署,微小的统计增益可能价值有限。

Google 的基准测试支持进行严肃评估。它们并不足以证明可以在没有本地测试、运营保障和明确使用权的情况下替换生产系统。

Google Research 发布后值得关注的事项

三个信号将决定 TimesFM-3 是成为广泛使用的预测层,还是仅停留为具有影响力的研究检查点。

第一个信号是承诺中的 BigQuery 集成。通过 SQL 提供服务,将使分析师能够直接在现有数据仓库数据附近进行多变量预测。

实施细节将揭示 TimesFM-3 的多少能力能够触达托管服务用户。采购方应关注是否支持多个目标变量、历史协变量、已知未来协变量、分位数输出以及现实的预测范围。

定价条款同样重要,尽管早期评估应更关注工作负载匹配度,而非表面成本。延迟、配额、区域可用性和数据治理控制,将决定团队能否反复使用该服务。

广泛的 BigQuery 支持将增强 Google 的地位,因为它会将研究发布转化为易用的基础设施。若集成延迟或能力受限,则会为竞争对手和独立预测供应商保留机会。

第二个信号是独立复现基准结果。研究人员和从业者需要在固定数据集、相同评估规则和可比计算条件下确认所报告的排名。

应尤其关注具有可用未来协变量的多变量任务。这些案例测试的是 TimesFM-3 的核心主张,而非其向后兼容的单变量表现。

评估者还应公布任务级结果,而非只给出平均排名。这些细节将显示 TimesFM-3 在何处表现不佳,以及其收益是否集中在特定领域或预测范围。

涉及缺失值、状态变化、噪声协变量和大量相关序列的测试,将更贴近生产环境。如果性能依赖于异常干净的输入,它们可能削弱 Google 的论据。

第三个信号是预训练权重的商业状态。更宽松的许可将使更多组织能够通过自有基础设施部署该检查点。持续的限制则会将商业采用推向 Google 的托管服务。

这一选择会影响竞争格局。当访问条款更符合私有部署要求时,Chronos-2、Toto、Moirai 及更小型的预测模型都可能获得优势。

开发者在围绕该检查点构建产品前,应查看 model license。公开可用并不会推翻其声明的限制。

团队仍可利用此次发布提出更好的技术问题。在严格的信息泄露控制后,跨序列信息是否提高准确性?已知的未来事件是否会带来合理变化?分位数预测在异常时期是否得到校准?

一项有用的评估应保留基于时间的留出集,对比简单基线,并计算特定决策的成本。团队应记录每一个历史预测时点实际已知的协变量。

他们也应保留最简单且可信的模型。如果季节性基线表现相近,基础模型便增加了复杂性却没有带来足够收益。如果 TimesFM-3 持续胜出,则为采用不同的预测工作流提供证据。

Google Research 已证明,通用预测模型应理解相互关联的变量,并高效生成完整预测范围。它尚未解决其最强权重将以何种开放程度进入生产环境的问题。

未来几个月将显示托管可用性、独立结果和许可条款是否会趋于一致。在此之前,最好将 TimesFM-3 视为一次重要的架构发布,以及一个需谨慎限定的部署候选方案。

对于开发者和数据团队而言,眼下的行动很直接:选择一个重要的预测问题,构建防止信息泄露的评估方案,并将该模型与当前正在作出决策的系统进行测试。TimesFM-3 是否改善了贵组织真正看重的结果?

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page