Vai al contenuto
AI.info

Ricerca

Cadence: compressione con perdita e limite d’errore delle serie temporali della domanda con un modello di base per serie temporali

Presentiamo Cadence, un compressore con perdita per serie temporali numeriche che garantisce un limite all’errore. Combina un modello di base per serie temporali da 330 milioni di parametri (Google Ti

Cadence: compressione con perdita e limite d’errore delle serie temporali della domanda con un modello di base per serie temporali
arXiv
2609.06008
Pubblicato
2026-09-05
Autori
Roberto Tacconelli

Abstract degli autori

Presentiamo Cadence, un compressore con perdita per serie temporali numeriche che garantisce un limite all’errore. Combina un modello di base per serie temporali da 330 milioni di parametri (Google TimesFM-3) con un codificatore aritmetico adattivo e garantisce $|\hat{x}_t-x_t|\leτ$ per ogni campione. Un risultato negativo delimita le possibilità progettuali: nella codifica senza perdita, un modello di base non offre alcun vantaggio, perché i bit risparmiati dipendono logaritmicamente dall’accuratezza del predittore, $Δb=\log_2(\mathrm{MAE_{old}}/\mathrm{MAE_{new}})$. Il vantaggio di $1.51\times$ di TimesFM-3 rispetto a un predittore lineare a 32 tap consente quindi di risparmiare 0,60 bit su 20,28, con un guadagno mediano del +0,03%. La codifica con limite all’errore supera questo vincolo in un caso: quando una previsione rientra nella fascia di tolleranza, l’indice del residuo è 0 e il campione costa pochissimo in termini di bit. Cadence apporta: (1) un codificatore a intervalli adattivo con binarizzazione modellata in base al contesto, che supera xz/zstd del 9,7% su indici reali (15/15), ribaltando un risultato ottenuto con un backend di uso generale; (2) un risultato sulla determinismo: le previsioni non sono identiche bit per bit al variare delle dimensioni dei batch e nessuna configurazione di PyTorch risolve il problema, rendendo necessario includere nel formato del contenitore la dimensione dei gruppi e il dispositivo di esecuzione; e (3) una localizzazione per dominio su corpora successivi a qualsiasi plausibile data limite dei dati di addestramento. Su 49 serie della domanda delle autorità di bilanciamento EIA-930 (2026), Cadence ottiene un guadagno del 13,3% rispetto al migliore di sei predittori classici; su 50 serie dei passeggeri MTA (2026), il guadagno è del 28,3%. Il guadagno mediano è del 21,4% su 297 coppie serie-tolleranza, con un risultato migliore in tutte e 297. Rispetto al downsampling, usato dai database di serie temporali per la conservazione dei dati, l’errore massimo garantito da Cadence è $28$--$56\times$ più contenuto a parità di dimensioni. Considerando l’intero processo, una volta sostenuto il costo di inizializzazione del contesto, i guadagni vanno dal 6,8% con sei mesi di dati orari al 15,1% asintoticamente. Abbiamo tentato di confutare il risultato relativo al dominio su SDRBench: la teoria prevede un fallimento, e i risultati lo confermano, con una mediana del -0,8% e guadagni per 0 coppie su 27. Sono riportati integralmente altri tre risultati negativi e otto affermazioni ritirate.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv