Ricerca
ibUMAP: valutazione coerente e scalabile del campo per l’ottimizzazione di UMAP
UMAP ottimizza la disposizione in modo scalabile grazie al campionamento negativo stocastico. Questa stocasticità, tuttavia, può rendere instabili gli embedding tra esecuzioni successive e nei riutili

- arXiv
- 2610.01445
- Pubblicato
- 2026-10-01
- Autori
- Bin Chen, Yumeng Xue, Patrick Paetzold, Yunhai Wang, Oliver Deussen
Abstract degli autori
UMAP ottimizza la disposizione in modo scalabile grazie al campionamento negativo stocastico. Questa stocasticità, tuttavia, può rendere instabili gli embedding tra esecuzioni successive e nei riutilizzi a valle, perché le forze repulsive stimate dipendono dall’ordine degli eventi di campionamento. Presentiamo ibUMAP, un’alternativa coerente basata su un campo che calcola attrazione e repulsione a partire dalla stessa istantanea dell’embedding e le applica in modo sincrono. Il suo campo repulsivo, ponderato in base al grado, è motivato dal valore atteso condizionato del campionamento negativo per un embedding fissato ed è rappresentato da tre momenti scalari, calcolati in modo efficiente su CPU e GPU mediante uno schema FFT basato sull’interpolazione. Questa formulazione evita i calcoli espliciti su tutte le coppie, pur producendo dinamiche di ottimizzazione diverse da quelle di UMAP online standard. Esperimenti controllati mostrano che la sincronia e la limitazione del kernel modificano il compromesso tra fedeltà locale e globale, mentre il calcolo tramite FFT produce in media piccole variazioni nella qualità finale. I benchmark end-to-end mostrano accelerazioni mediane di 3,29x senza seed e 5,79x con seed rispetto a umap-learn su CPU, e di 1,44x rispetto a cuML su dataset di dimensioni nell’ordine del milione nell’esecuzione su GPU senza seed. Questi miglioramenti si accompagnano a una maggiore stabilità tra esecuzioni e a compromessi misurabili in termini di fedeltà.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv