Vai al contenuto
AI.info

The Pulse

IBM presenta un modello Granite per le previsioni con 385 milioni di parametri

IBM ha pubblicato Granite Time Series PatchTST-FM-r2, un modello da 385 milioni di parametri per le previsioni zero-shot, le previsioni probabilistiche e l’imputazione dei valori mancanti. Il modello è al secondo posto tra i sistemi zero-sh

IBM presenta un modello Granite per le previsioni con 385 milioni di parametri

AI.info Team ·

Il nuovo modello di IBM punta a fare previsioni senza addestramento specifico per ogni attività

IBM ha pubblicato Granite Time Series PatchTST-FM-r2, un nuovo modello fondazionale progettato per prevedere l’andamento di serie temporali mai viste senza ricorrere al fine-tuning su ogni singolo dataset. Il sistema, con circa 385 milioni di parametri, supporta previsioni puntuali e probabilistiche, l’imputazione dei valori mancanti e orizzonti di previsione flessibili.

La pubblicazione è stata annunciata il 9 settembre 2026 in un post su Hugging Face firmato da Roman Vaculin, Wesley M. Gifford, Jiri Navratil, Chandra Reddy e Ayhan Sebin di IBM Research. I pesi del modello, la pipeline di inferenza, l’implementazione dell’architettura e il codice per riprodurre i risultati del benchmark sono disponibili sulla pagina del modello Granite Time Series.

«Invece di addestrare e mantenere un modello separato per ogni dataset, gli utenti possono usare un modello preaddestrato e generare previsioni zero-shot», ha scritto nell’annuncio Roman Vaculin, ricercatore principale presso IBM Research.

IBM propone il modello per applicazioni che comprendono la pianificazione della domanda, i consumi energetici, il traffico, i volumi delle transazioni, i prezzi, la telemetria dei sistemi informatici e i sensori industriali. Gli utenti forniscono una sequenza recente di osservazioni e il modello produce previsioni senza una fase di adattamento specifica per l’attività.

PatchTST-FM-r2 si colloca dietro TimesFM-3 su GIFT-Eval

La principale affermazione di IBM sulle prestazioni si basa su GIFT-Eval, un benchmark che valuta le previsioni di serie temporali su dataset e in condizioni di previsione differenti. All’8 settembre, il modello è al secondo posto tra i sistemi zero-shot replicabili valutati senza contaminazione dei dati di test.

PatchTST-FM-r2 registra un punteggio probabilistico continuo ordinato, o CRPS, in media geometrica di 0,467 e un errore assoluto medio scalato, o MASE, in media geometrica di 0,6846. Per entrambe le misure, i valori più bassi sono migliori. IBM afferma che il modello si colloca subito dietro TimesFM-3 nel confronto sul CRPS zero-shot e al primo posto tra i sistemi pubblicati con licenze commerciali permissive.

La posizione nel benchmark presenta limiti che IBM segnala nella propria documentazione. GIFT-Eval comprende modelli classificati come preaddestrati, ai quali è consentito usare nei dati di preaddestramento le porzioni destinate all’addestramento dei dataset di valutazione. Quando questi sistemi vengono inclusi nel confronto, PatchTST-FM-r2 si colloca al terzo posto per CRPS e al quarto per MASE tra i modelli replicabili.

La scheda del modello precisa inoltre che, al 31 agosto, i risultati erano stati inviati a GIFT-Eval tramite una pull request ancora in attesa di approvazione. Per il confronto, l’annuncio su Hugging Face usa la classifica aggiornata all’8 settembre: la posizione descrive quindi una situazione del benchmark riferita a quella data, non una posizione definitiva.

I blocchi conformer sostituiscono la struttura standard dei transformer

PatchTST-FM-r2 conserva l’approccio basato su patch usato dal precedente PatchTST-FM-r1, ma modifica i blocchi interni del modello. I livelli transformer standard sono sostituiti da blocchi di tipo conformer che combinano la self-attention multi-head con la convoluzione temporale.

Questa configurazione colloca un livello di convoluzione tra due livelli feed-forward a mezzo passo. L’attenzione può modellare le relazioni tra patch distanti, mentre la convoluzione gestisce gli schemi a più corto raggio nelle porzioni adiacenti di una serie. IBM afferma che il progetto mira a ridurre la tendenza delle previsioni basate su patch a produrre discontinuità tra patch vicine.

Il modello usa patch sovrapposte di lunghezza 16 con un passo di otto. Durante l’addestramento applica una ponderazione con finestra di Hamming, mentre nell’inferenza usa un metodo overlap-and-add per combinare le previsioni delle patch vicine. IBM porta inoltre l’architettura da 20 blocchi nella versione r1 a 30 nella r2 e aggiunge un livello di normalizzazione prima della testa di previsione per rendere più stabile l’addestramento.

PatchTST-FM-r2 accetta un contesto fino a 8.192 osservazioni e usa una testa di previsione a 99 quantili. Questa testa consente al sistema di restituire distribuzioni delle previsioni anziché un solo valore atteso, offrendo agli utenti diverse stime per differenti livelli di probabilità.

IBM indica quattro fonti per i dati di preaddestramento

Secondo la documentazione, i dati di preaddestramento del modello combinano diverse fonti. IBM afferma di aver usato dataset selezionati da GiftEvalPretrain, sequenze sintetiche personalizzate basate su KernelSynth, un corpus TSMixup generato con un procedimento descritto nel lavoro su Chronos e circa 500.000 sequenze sintetiche CauKer di lunghezza 4.096.

IBM afferma che i dati TSMixup erano limitati a dataset esterni al set di valutazione di GIFT-Eval. La separazione mira a limitare la contaminazione dei dati di test, una delle condizioni applicate nel confronto del benchmark. La scheda del modello indica l’ampliamento dei dati sintetici tra le principali differenze rispetto a PatchTST-FM-r1.

La pubblicazione delle fonti dei dati offre ai ricercatori più informazioni per valutare le affermazioni sulle prestazioni del modello nel benchmark e la sua idoneità alle proprie applicazioni. Non elimina però la necessità di verificare se un determinato impiego rispetti i requisiti di un’organizzazione in materia di governance, uso dei dati e licenze.

Apache 2.0 e OpenMDW 1.0 consentono un ampio uso dei pesi

IBM pubblica PatchTST-FM-r2 con una doppia licenza. Gli utenti possono scegliere tra Apache License 2.0 e Open Model Development and Distribution License versione 1.0, comunemente chiamata OpenMDW 1.0.

Le licenze permissive sono centrali nel modo in cui IBM presenta il modello. L’azienda afferma che PatchTST-FM-r2 è il modello con le prestazioni migliori nella sua categoria di GIFT-Eval tra i sistemi con licenze favorevoli all’uso commerciale. L’architettura è disponibile anche nel repository pubblico Granite TSFM di IBM, che secondo l’azienda mantiene la retrocompatibilità con i checkpoint di PatchTST-FM-r1.

Gli sviluppatori possono installare il pacchetto con pip install "granite-tsfm>=0.3.9", caricare il modello da Hugging Face Hub e passare alla pipeline di previsione una finestra di dati recenti. L’esempio di IBM usa 512 osservazioni orarie dal dataset ETTh1 per produrre una previsione a 64 passi con risultati al 10°, 50° e 90° percentile.

La pubblicazione amplia il portafoglio Granite Time Series di IBM. IBM e Confluent hanno annunciato il 1° settembre che diversi modelli Granite per le serie temporali sarebbero entrati nella fase di accesso anticipato su Confluent Cloud, dove è possibile generare previsioni e risultati relativi alle anomalie a partire da dati in streaming tramite Apache Flink. PatchTST-FM-r2 viene pubblicato inizialmente come modello aperto per la sperimentazione diretta, con i punteggi del benchmark, l’implementazione e le condizioni di licenza disponibili per essere esaminati.

Fonte

Esplora

Altri articoli