Vai al contenuto
AI.info

Ricerca

Oltre il supporto empirico: generazione strutturata di outlier mediante trasporto ottimale di Sinkhorn

Gli outlier sono essenziali per valutare e migliorare la robustezza dei sistemi di apprendimento automatico, soprattutto quando le distribuzioni future possono differire notevolmente dai dati storici

Oltre il supporto empirico: generazione strutturata di outlier mediante trasporto ottimale di Sinkhorn
arXiv
2609.31470
Pubblicato
2026-09-25
Autori
Haixiang Sun, Andrew L. Liu

Abstract degli autori

Gli outlier sono essenziali per valutare e migliorare la robustezza dei sistemi di apprendimento automatico, soprattutto quando le distribuzioni future possono differire notevolmente dai dati storici usati per l’addestramento. Nelle applicazioni ad alto rischio, la robustezza dipende spesso da casi rari che i dataset di dimensioni finite non riescono a includere: per generare scenari di stress, quindi, il semplice ricampionamento o l’introduzione di perturbazioni non bastano. I metodi esistenti per la sintesi di outlier si basano in genere su intorni poco densi, regioni dello spazio latente con scarso supporto o attraversamenti della frontiera di un classificatore; possono perciò risultare euristici, instabili e legati a specifiche modalità o architetture. Proponiamo quindi Sinkhorn Boundary Outlier Generation (SBOG), un framework strutturato per generare outlier nello spazio latente che combina la geometria del trasporto ottimale di Sinkhorn con una modellazione della frontiera robusta rispetto alle distribuzioni. Il costo di supporto indotto da Sinkhorn guida il campionatore verso regioni di frontiera con scarso supporto, mentre vincoli semantici impediscono che si allontani senza controllo dal contesto previsto. Si ottengono così deviazioni controllate dalla misura di riferimento interna alla distribuzione, anziché campioni arbitrari provenienti da regioni poco dense. Gli esperimenti sulla generazione di anomalie nelle serie temporali e sulla sintesi di outlier nelle immagini mostrano che il nostro framework produce outlier informativi e controllati sul piano semantico e migliora la valutazione a valle della robustezza in diverse modalità, ponendo le basi per generare scenari di stress oltre il supporto empirico.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv