Ricerca
Che cosa sa un foundation model per l’osservabilità?
Un probe lineare può mostrare che un’etichetta è ricavabile dagli stati nascosti di un modello, ma non se questo riveli più di quanto sia già contenuto nell’input, né se il modello usi quell’informazi

- arXiv
- 2610.05577
- Pubblicato
- 2026-10-04
- Autori
- Dhyey Dharmendrakumar Mavani, Rian Atri, Tairan Ji
Abstract degli autori
Un probe lineare può mostrare che un’etichetta è ricavabile dagli stati nascosti di un modello, ma non se questo riveli più di quanto sia già contenuto nell’input, né se il modello usi quell’informazione. Esaminiamo Toto, un foundation model per la previsione dell’osservabilità, sul Benchmark of Observability Metrics (BOOM) in cinque nuove suddivisioni con serie disgiunte. Confrontiamo i probe lineari applicati al suo flusso residuo congelato con modelli che leggono la finestra di input grezza e con l’architettura di Toto privata della sua configurazione addestrata. La distinzione tra cadenza breve e media e il tipo di metrica sono ricavabili linearmente dai residui di Toto meglio che dal più efficace modello basato sulla finestra grezza in tutte le suddivisioni (macro-F1 rispettivamente di 0,766 contro 0,633 e di 0,545 contro 0,498). Per il dominio, i risultati sono quasi identici; la cardinalità delle serie, invece, si ricava molto meglio dalla finestra grezza. MOMENT-base mostra letture analoghe per cadenza, tipo di metrica e dominio. Che un’informazione sia ricavabile non significa che venga usata: sostituire i residui di Toto con quelli di donatori caratterizzati da molti picchi modifica come previsto una lettura della propensione futura ai picchi, ma non rende le previsioni sistematicamente più soggette a picchi rispetto all’uso di un donatore randomizzato. Un probe di coordinamento addestrato su BOOM ottiene un R^2 zero-shot negativo sui benchmark esterni esaminati. Per ogni etichetta riportiamo il confronto con il suo baseline più forte.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv