Vai al contenuto
AI.info

Ricerca

Un quadro basato su interventi sui dati per verificare privacy ed equità nell’imaging medico generativo

La generazione di dati sintetici basata su modelli di diffusione offre una strada promettente per condividere dati di imaging medico senza divulgare le cartelle cliniche sensibili dei pazienti. Tuttav

Un quadro basato su interventi sui dati per verificare privacy ed equità nell’imaging medico generativo
arXiv
2609.26623
Pubblicato
2026-09-22
Autori
Mischa Dombrowski, Bernhard Kainz

Abstract degli autori

La generazione di dati sintetici basata su modelli di diffusione offre una strada promettente per condividere dati di imaging medico senza divulgare le cartelle cliniche sensibili dei pazienti. Tuttavia, i modelli generativi devono affrontare una tensione fondamentale tra privacy ed equità: possono memorizzare rari campioni di addestramento, creando rischi per la privacy, oppure non riuscire a riprodurre caratteristiche sottorappresentate, producendo distribuzioni sintetiche non eque. Sebbene gli studi precedenti si siano concentrati in gran parte sulla memorizzazione o sull’equità considerate separatamente, l’interazione tra le due rimane ancora poco compresa. In questo lavoro presentiamo un quadro basato su interventi sui dati per analizzare sistematicamente privacy ed equità nei modelli di diffusione. Discutiamo l’uso delle impronte anatomiche sintetiche (SAF), caratteristiche rare delle immagini inserite manualmente, come sonde controllate per studiare se i modelli generalizzino gli attributi sensibili tra identità diverse, memorizzino i campioni di addestramento oppure sopprimano del tutto i segnali rari. Esaminando diverse modalità di condizionamento, osserviamo un comportamento costante: i modelli dimenticano queste impronte oppure memorizzano l’intera immagine in cui compaiono, ma non le generalizzano a immagini nuove. Per consentire verifiche su larga scala quando l’estrazione esplicita dei campioni non è praticabile, presentiamo inoltre la metrica indicatrice t’, che stima la propensione di un modello alla memorizzazione sfruttando la struttura interna del processo di diffusione. Confrontando segnali di condizionamento con diversi livelli di sorpresa informativa, mettiamo in luce una chiara relazione tra la rarità del condizionamento e il comportamento di memorizzazione. I segnali di condizionamento ad alta sorpresa informativa fungono da chiavi di recupero che amplificano la memorizzazione, mentre quelli a bassa sorpresa informativa sopprimono sistematicamente le caratteristiche rare, anche quando queste compaiono ripetutamente nei dati di addestramento. I nostri risultati forniscono indicazioni operative e strategie concrete di mitigazione per condividere dati medici sintetici in modo sicuro ed equo. Il codice è disponibile all’indirizzo https://github.com/MischaD/Privacy.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv