具備商業友善開源授權的高效能零樣本預測。時序基礎模型正在改變預測系統的建構方式。使用者不再需要為每個資料集訓練和維護獨立模型,而是能直接使用預訓練模型進行零樣本預測。
IBM 已發布 Granite Time Series PatchTST-FM-r2,這是 Granite TSFM 系列的最新模型。PatchTST-FM-r2 是其前身 PatchTST-FM-r1 的新版本,擁有約 3.85 億個參數,結合了更新的架構、更大的預訓練語料庫、機率式預測功能、支援遺失值填補,並展現強大的零樣本預測效能。
截至 2026 年 9 月 8 日,在 GIFT-Eval 排行榜上,該模型是所有可重現的零樣本模型中,唯一在寬鬆且商業友善的開源授權(Apache 2.0 和 OpenMDW 1.0)下發布且表現最優異的零樣本模型。GIFT-Eval 是一個全面的時序預測基準測試,旨在評估模型在各種預測情境下的表現;該模型在所有可重現的零樣本模型中總體排名第二。
模型權重、架構、推論管線以及重現基準測試結果所需的程式碼均已開放。本部落格將介紹該模型,深入探討基準測試結果和模型架構,討論訓練資料和授權,並提供使用模型的程式碼範例。最後,我們還將強調 Granite Time Series 系列模型如何利用 Confluent 產品在生產環境中的串流應用中使用。
該模型提供通用零樣本預測,適用於需求、價格、能源負載、交通、遙測及其他時序資料。它擁有約 3.85 億個參數,上下文長度可達 8,192,支援彈性預測長度,並透過 99 分位數預測頭提供機率式預測。模型核心由 Conformer 區塊構成,結合了多頭自注意力與時間卷積,以捕捉長短期時間結構。
這是一個在 GIFT-Eval 基準測試中,於可重現零樣本類別中表現頂尖的寬鬆授權模型(雙重授權於 Apache-2.0 和 OpenMDW-1.0,使用者可選擇任一授權)。模型權重、架構、推論管線和重現基準測試的程式碼均已開放。
基礎模型在能夠泛化到未經特定訓練的時序資料時最為有用,因此我們首先關注其零樣本效能。GIFT-Eval 提供了對預測模型在異質資料集和預測情境下的廣泛評估。截至 2026 年 9 月 8 日,當排行榜僅限於零樣本、可重現且無測試資料洩漏的模型時,PatchTST-FM-r2 在 CRPS 和 MASE 兩項指標上均排名第二(兩項指標值越低越好)。
更重要的是,PatchTST-FM-r2 是在相同類別中,採用寬鬆且商業友善授權的模型裡表現最佳的。
GIFT-Eval 上有些模型被歸類為預訓練模型,而非嚴格的零樣本模型。這些模型被允許將 GIFT-Eval 評估資料集的訓練部分納入其預訓練語料庫中。即使將這些預訓練模型納入比較,PatchTST-FM-r2 仍保持在前段班,如圖 3 和圖 4 所示:在可重現模型中,CRPS 排名第三,MASE 排名第四。
儘管一些競爭模型規模顯著更大,PatchTST-FM-r2 仍超越了包括 Chronos-2、Timer-S1 和 Toto 變體在內的多個預訓練模型。
PatchTST-FM-r2 保留了使 PatchTST 系列有效的基於區塊(patch-based)表示法,但內部架構經過重新設計,旨在有效捕捉長短期關係並平滑區塊間的預測,這兩項改進都顯著提升了錯誤測量指標。其中一項改變是從標準 Transformer 層轉向結合卷積與多頭自注意力的層。這些層被稱為 Conformer 層,其起源於語音處理應用。
PatchTST-FM-r1 區塊結合了多頭自注意力與前饋網路。在 r2 版本中,我們將其替換為 Conformer 風格的區塊,該區塊包含兩個半步前饋層,環繞著多頭自注意力層和一個時間卷積層。這賦予模型兩種互補的機制來處理時序資料。自注意力可以建模區塊之間的長程關係,而卷積則提供了對局部時間結構的歸納偏置。
因此,卷積部分可以捕捉短期互動,同時讓注意力集中於更長期的關係。這種現象在 Transformer 和 Conformer 版本的注意力模式中是可觀察到的(參見下方使用 ETTh1 資料集真實樣本的範例圖)。Transformer 的自注意力(圖左)大部分集中在對角線附近,即捕捉局部關係,而 Conformer 區塊的注意力(圖右)則顯示出長距離(遠離對角線)的焦點,這歸功於卷積層處理了短距離關係。
核心中的 Conformer 區塊使用交替的卷積核大小 3 和 5,以 {5, 5, 3, 3} 的重複模式排列。
此外,PatchTST-FM-r2 採用 50% 重疊的區塊,結合漢明窗加權和重疊相加預測,以平滑區塊邊界並提高預測準確度。最後,該架構增加了正規化以提高穩定性,並將區塊數量從 20 個擴展到 30 個。透過這些改進,最終模型的參數約為 3.85 億個,支援長達 8,192 步的超長上下文,並能預測彈性預測長度下的 99 個分位數。該模型同時提供點預測和分位數輸出,用於預測分佈和不確定性區間。
對於旨在實際應用的基礎模型而言,模型品質僅是其中一個考量。開發者越來越需要了解模型所使用的資料來源、基準測試資料是否可能洩漏到訓練中,以及部署模型可能帶來的影響。PatchTST-FM-r2 使用了有文件記錄的預訓練語料庫,該語料庫包含四個來源:來自 GiftEvalPretrain 的選定資料集;基於 KernelSynth 且修改了週期性核心並進行有限增強的客製化合成資料;使用 Chronos 描述的方法生成但僅限於 GIFT-Eval 評估集之外資料集的 TSMixup 語料庫;以及約 50 萬個合成的 CauKer 序列,每個序列長度為 4,096。
對於企業採用者而言,這種透明度可能與排行榜上的幾分之差同樣重要。這並不能免除組織自身進行模型治理和授權審查的需求,但它確實為使用者提供了比不透明預訓練語料庫更多的資訊來執行該審查。
為了提供社群更多選擇,Granite Time Series PatchTST-FM-r2 採用 Apache 2.0 和 OpenMDW 1.0 雙重授權。使用者可以選擇任一授權,兩者都提供廣泛且寬鬆的權利,允許使用、修改和分發模型。其中,Linux 基金會的 OpenMDW 提供了一個專為 AI 模型及相關材料設計的授權框架。
IBM 透過提供寬鬆的開源授權,旨在降低採用門檻,讓組織、研究人員和開發者能夠自信地基於這項技術進行開發,因為這些授權不會限制其使用。該架構的實作也透過 Granite-TSFM 儲存庫提供,並與 PatchTST-FM-r1 的檢查點向後相容。
評估基礎模型最簡單的方法是使用您自己的時序資料。首先安裝 Granite TSFM 套件:pip install "granite-tsfm>=0.3.9"。然後可以直接從 Hugging Face Hub 載入 PatchTST-FM-r2:
```python
import pandas as pd
from tsfm_public import PatchTSTFMForPrediction, TimeSeriesForecastingPipeline
Load model weights
model = PatchTSTFMForPrediction.from_pretrained(
"ibm-granite/granite-timeseries-patchtst-fm-r2"
)
Read some sample data from ETTh
df = pd.read_csv(
"https://raw.githubusercontent.com/zhouhaoyi/ETDataset/main/ETT-small/ETTh1.csv",
parse_dates=["date"],
)
Set up the forecasting pipeline
pipe = TimeSeriesForecastingPipeline(
model=model,
id_columns=[],
timestamp_column="date",
target_columns=["HUFL"],
max_context_length=model.config.context_length,
context_length=512,
prediction_length=64,
impute_method=None,
quantile_levels=[0.1, 0.5, 0.9],
explode_forecasts=True,
freq="1h",
)
Create a forecast from the last 512 samples of the input dataframe
forecast = pipe(df.iloc[-512:])
```
如您所見,無需微調或任務特定的模型擬合。該管線僅使用序列的近期歷史資料,即可生成未來的預測,包括所需的分位數。上述範例是基於公開資料的簡單示範,您可以將範例輸入資料替換為您自己的資料,例如需求、感測器遙測、CPU 使用率、能源消耗、交易量、交通、價格或其他定期採樣的時序資料。
本次發布是 IBM Granite Time Series 模型更廣泛工作的一部分,為其產品組合增添了新模型。對於資料持續不斷而非以靜態 DataFrame 形式到達的應用程式,IBM 和 Confluent 最近透過 Confluent Cloud 的搶先體驗計畫,提供了多個 Granite Time Series 模型。
最初的產品組合包括 PatchTST-FM-r1、FlowState-r1.1、TTM-r3 和 TSPulse。這項整合將基礎模型推論直接引入串流應用程式,透過 Confluent Cloud 上的 Apache Flink 實現。預測和異常偵測結果可以直接從即時串流生成,而無需團隊設定並將資料移動到單獨的機器學習環境。



