首页 / 资讯中心 / 文章详情

微软 ProbTS 统一评测上线:时序预测的“刷榜时代“要结束了?TimesFM 会被重新洗牌吗

微软 ProbTS 统一评测上线:时序预测的“刷榜时代“要结束了?TimesFM 会被重新洗牌吗 ★ FEATURED ARTICLE
微软 ProbTS 统一评测上线时序预测的刷榜时代要结束了TimesFM 会被重新洗牌吗【免费下载链接】timesfm-3.0-pytorch项目地址: https://ai.gitcode.com/hf_mirrors/google/timesfm-3.0-pytorch2026 年 8 月底Google Research 发布 TimesFM 3.0当天冲上 GitHub Trending官方口径一口气拿下 fev-bench100 个真实预测任务、TIME Benchmark50 个领域数据集、98 个评测任务、GIFT-Eval全部基础模型三个榜单的头名。两个月过去围绕它的讨论热度不减330M 参数、原生多变量、单次前向铺满预测区间每一项都像在给时序基础模型这个赛道重新划线。但如果我们把镜头拉远一点会发现一个更值得聊的问题这些榜单成绩到底是谁说了算当 Google、亚马逊、Salesforce、阿里各自发布基础模型、各自在自选的榜单上宣布第一时社区的信任状开始变得可疑。而早在 2024 年微软亚洲研究院就把一个名为ProbTS的统一评测框架送上了 NeurIPS 2024 的 Datasets and Benchmarks Track——它试图回答的正是如何让所有模型在同一条赛道上被公平地比较。本文结合 ProbTS 的论文与开源仓库、TimesFM 3.0 的官方权重仓库源码拆解三个问题ProbTS 到底做了什么、它对此前零样本媲美监督模型的叙事产生了怎样的冲击、以及它对 TimesFM 这类模型的未来选型意味着什么。ProbTS 是什么把点预测、分布预测、长短周期塞进同一个平台ProbTS 的全称是ProbTS: Benchmarking Point and Distributional Forecasting across Diverse Prediction Horizons论文发表于 NeurIPS 2024 Datasets and Benchmarks Track代码托管在微软官方仓库作者来自微软亚洲研究院MSRA与港科大广州。它的动机很朴素时序预测领域的研究长期分叉成两条互不搭理的支线。一条专注长期点预测代表作是 PatchTST、iTransformer、DLinear 这类定制化架构另一条专注短期概率估计代表作是 TimeGrad、CSDI 这类扩散/归一化流模型。两者各跑各的数据集、各报各的指标长期模型几乎不碰 CRPS短期概率模型很少被拉去测 720 步的长 horizon。结果就是每个模型在自己熟悉的赛道上都是冠军换个赛道立刻现原形。ProbTS 针对这个痛点做了三件事第一统一数据。它把公开数据集按 horizon 分为两档短期档Exchange-S、Solar-S、Electricity-S、Traffic-S、Wikipedia-Shorizon 24/30与长期档ETT 四件套、Electricity、Traffic、Exchange、Weather、ILIhorizon 96/192/336/720。更重要的是它对每个数据集做了量化体检——用 STL 分解量化趋势强度与季节性强度用 Jensen-Shannon 散度衡量窗口内数值分布偏离高斯的程度非高斯性。这三项指标成为解释谁在哪类数据上更强的钥匙。第二统一指标。点预测统一用归一化 MAENMAE分布预测统一用连续排序概率得分CRPS并把此前论文中反归一化后报 MAE只报 CRPS-sum这类口径差异全部抹平。论文里有一句值得记住的话有些模型在原论文里报的指标是在把预测反归一化回原始尺度之后才计算的口径不统一比较就无从谈起。第三统一模型实现。ProbTS 复现了 20 个模型并明确标注每个模型的关键方法论选择点 vs 概率输出、自回归ARvs 非自回归NAR解码、RevIN vs mean scaling 归一化。其中基础模型板块一口气集成了 Lag-Llama、Chronos、TimesFM、Timer、MOIRAI、UniTS、ForecastPFN、TTM 八家后续又陆续接入 Time-MoE2025 年 4 月、ModernTCN2025 年 5 月并在 2024 年 12 月开放了 GIFT-EVAL 数据集支持——这正是 TimesFM 3.0 后来主张成绩的那张榜单之一。对零样本评测结论的冲击TimesFM 在 ProbTS 里被拉平了什么在 ProbTS 出现之前TimesFM 一代论文的核心卖点是零样本性能接近、部分场景追平逐数据集训练的 SOTA 监督模型。这个说法本身没有错但 ProbTS 的实测给出了一组更细颗粒度的证据它揭示的结论比宣传口径微妙得多。先看评估设置ProbTS 在评测 TimesFM 时加载的是google/timesfm-1.0-200m检查点且为了公平把回看窗口统一设成 96——注意这个设置对 TimesFM 并不友好它在一代论文里使用的 context 是 512。论文附录也坦承由于时间限制我们没有为所有模型调整 context 窗口96 是一个平衡且公平的窗口但可能让部分模型表现次优。即便如此短 horizon 上的结论对 TimesFM 是有利的在 ETTm1-L 的 24 步预测上TimesFM 的 NMAE 为 0.133与 PatchTST0.199、iTransformer0.116、CSDI0.115处于同一量级且优于 MOIRAI-960.128 附近零样本能力确实成立。但真正的冲击在长 horizon。同一张表里把预测长度拉到 720 步后TimesFM 的 NMAE 从 0.133 恶化到 0.511而 MOIRAI5000 context只有 0.351PatchTST 是 0.353iTransformer 是 0.380。在 ETTm2-L 上同样如此TimesFM 从 24 步的 0.117 一路退化到 720 步的 0.246而 MOIRAI-5000 全程稳定在 0.100~0.200。长 horizon 下AR 解码基础模型与 NAR 模型之间的差距被系统性拉开——这不是个例而是 ProbTS 对全部基础模型做横评后总结出的普遍规律。ProbTS 给出的归因链条值得细读AR 解码的误差累积。TimesFM、Timer、Chronos、Lag-Llama 都是 decoder-only AR 生成。AR 把上一步的输出当作下一步的输入误差会沿 horizon 滚雪球在强趋势序列上一步偏差会被趋势放大长 horizon 退化尤其剧烈。归一化的杠杆作用。论文发现 RevIN 能显著缓解 AR 模型的误差累积——在 ETT 数据集上接上 RevIN 的 GRU NVP 甚至反超了 RevIN 版 PatchTST。这等于给 AR 派指出了救命稻草问题不在自回归本身而在自回归 不做尺度归一化。概率基础模型的短板。MOIRAI 用混合分布头、Chronos 用分箱离散化在非高斯性高的短期数据上两者的 CRPS 相对 CSDI 显著恶化。也就是说能输出分布不等于分布质量高。这套结论的组合拳直接给零样本媲美监督模型的叙事套上了上下文限制短 horizon 成立长 horizon 打折扣点预测成立复杂分布的概率预测存疑而回看窗口、归一化策略这些此前很少被并排比较的细节才是决定成败的变量。TimesFM 3.0像是一次对 ProbTS 结论的逐条回应有趣的是如果你带着 ProbTS 的结论去读 TimesFM 3.0 的仓库会发现 3.0 的架构改动几乎是对着那份诊断书开的药方。本地镜像仓库 config.json 里这些改动全部有配置项可查从逐块回喂到单次前向铺满 horizon。这是对 AR 误差累积最直接的回答。2.5 时代预测 512 步需要分块生成、把中位数预测当输入再喂回去3.0 的decode()把预测段与 context 拼成一条序列、打上horizon_cpm_mask只调用一次forward()就切出整个预测区间。use_stitching: true相邻输出 patch 重叠拼接与use_linear_detrending: truecontext 先去线性趋势、预测后加回再配合use_iterative_cpm_revin: true构成一套非自回归 趋势处理 迭代归一化的组合拳。误差不再沿生成的点再当输入的回路传播。20 层 1280 维不变但多了变量轴注意力。StackedMixingTransformer在时间轴上做因果注意力use_rope_seq: true在变量轴上做全变量注意力use_variate_attention: truemax_variates: 32同一时间步的 token 能看到数据集里其他所有序列——促销影响销量这类跨序列依赖首次成为一等公民。输出从单点变成 9 个分位数。quantiles: [0.1, ..., 0.9]median 在索引 4每个预测步都带 10%~90% 的不确定性区间。ProbTS 反复强调分布质量是基础模型的最大短板3.0 用连续分位数输出正面回应。参数规格上本地 README.md 与 config.json 给出的数据是20 层 Transformer、model dim 1280、16 头、输入 patch 32 点、输出 patch 64 点预训练语料为 GiftEvalPretrain剔除与 fev-bench 重叠部分、Wikipedia Pageviews、Google Trends top queries 与合成/增强数据——值得注意的是GiftEvalPretrain 与 GIFT-Eval 榜单同源这也是外部讨论中质疑自训自评公平性的焦点之一。但 3.0 真正的争议不在技术而在许可。仓库 README 的第一行标签就是timesfm-non-commercial-license-v1.0权重仅限测试、评估与研究用途微调产物LoRA adapter 等按许可文本也属于 Derivative被禁止分发。对比之下2.5 及更早版本权重仍是 Apache-2.0。这让能不能用 3.0从技术问题变成了法务问题——榜单第一、但商用门槛高企选型的天平反而可能倾向 2.5 或托管路径。榜单、统一评测与选型者的清醒回到本文标题里的问题ProbTS 会终结刷榜时代吗诚实的回答是不会终结但会显著提高刷榜的成本。一个被反复忽略的事实是TimesFM 3.0 主张的 GIFT-Eval 头名与 ProbTS 有直接关系——ProbTS 在 2024 年 12 月就接入了 GIFT-EVAL 数据集支持而 ProbTS 自己在 2024 年的论文里就已经完成过 8 家基础模型在同一组数据集、同一套指标下的横评。也就是说统一评测的基础设施在两年前就已就位基础模型厂商只是选择性地使用它。真正的改变在于当社区把 ProbTS 这类框架当成默认参照系单方自报的榜单数字就必须接受交叉验证这比任何刷榜警告都管用。对选型者而言可以从 ProbTS 的方法论里直接提炼出四条可执行的经验别信零样本最强这种无前提断言。先问 horizon 多长、context 多宽、在哪些数据集上、用 NMAE 还是 CRPS。ProbTS 用同一张表证明短 horizon 的冠军到了 720 步可能掉出第一梯队。把归一化当成模型能力的一部分而不是预处理细节。RevIN 对长 horizon AR 模型的增益可以跨过一个代差选型时优先看模型对尺度漂移的鲁棒性而非只看架构标签。概率输出要看分布质量。能输出 9 个分位数不等于分位数可靠。ProbTS 的建议是把分位数当置信区间做覆盖率检查真实值落在 P10~P90 内的比例应接近 80%这是可以自己复验的硬指标。榜单成绩自己重跑一遍。TimesFM 3.0 权重受非商用许可约束商业场景下 2.5Apache-2.0仍是更稳的起点无论选哪个版本用 README.md 里给出的接口在自己的业务数据上与现有基线做同窗口对比比引用任何榜单都更有说服力。ProbTS 论文自己在 Conclusion 里也留了退路它的分析主要依赖经验观察缺少理论支撑评测数据集虽广却可能无法覆盖真实世界的全部场景——尤其是不同基础模型预训练数据范围各异任何公平比较都只能是相对公平。这正是我们面对它的态度统一评测不是终点而是把谁说了算的问题从厂商 PR 部门转移到了可复现的实验台上。对于 TimesFM 3.0真正重要的不是它拿下了几个第一而是它用非自回归解码、变量轴注意力与迭代 RevIN 证明了一件事评测框架揭示的痛点正在实打实地改变下一代模型的设计方向。【免费下载链接】timesfm-3.0-pytorch项目地址: https://ai.gitcode.com/hf_mirrors/google/timesfm-3.0-pytorch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站