Vai al contenuto
AI.info

Ricerca

Il triangolo dell’attenzione nei modelli audio-video

I modelli di diffusione audio-video si affidano all’attenzione intermodale per coordinare testo, suono e contenuti visivi, ma questo stesso meccanismo può introdurre una fuga semantica sottile e siste

Il triangolo dell’attenzione nei modelli audio-video
arXiv
2609.03586
Pubblicato
2026-09-03
Autori
Sagi Polaczek, Noa Kraicer, Gal Metzer, Zhuo Ning, Ali Mahdavi-Amiri, Daniel Cohen-Or, Raja Giryes

Abstract degli autori

I modelli di diffusione audio-video si affidano all’attenzione intermodale per coordinare testo, suono e contenuti visivi, ma questo stesso meccanismo può introdurre una fuga semantica sottile e sistematica. Studiamo questi modelli esaminando e analizzando il «triangolo dell’attenzione», formato dalle tre connessioni di attenzione incrociata tra i flussi di testo, audio e video, e osserviamo come le informazioni semantiche vengano instradate tra le modalità durante la generazione. La nostra analisi rivela che l’instradamento lungo la connessione audio-video è bidirezionale: l’audio può influenzare la generazione del video, mentre il video può influenzare quella dell’audio. Questa connessione risente dei bias codificati nei parametri del modello e risulta una delle principali cause della fuga semantica: quando i prompt sono in contrasto con le conoscenze a priori apprese, le interazioni intermodali possono prevalere sul condizionamento previsto e reindirizzare il contenuto semantico verso risultati visivamente canonici ma errati. Questi effetti suggeriscono che gli artefatti semantici derivino non soltanto dall’estendersi dell’attenzione oltre il bersaglio previsto, ma anche da interazioni strutturate, guidate dai bias, lungo percorsi specifici. Partendo da questa prospettiva, ricaviamo dall’attenzione segnali che mostrano come il contenuto semantico sia distribuito e ancorato nelle diverse modalità, e li usiamo come strumento diagnostico sia per analizzare la fuga semantica sia per provocarla deliberatamente in condizioni controllate. Questo ci permette di esaminare le dinamiche interne dell’instradamento intermodale e di isolare il ruolo delle singole interazioni. Usiamo inoltre questi segnali per guidare interventi in fase di inferenza che favoriscano un allineamento intermodale più coerente. Numerosi esperimenti corroborano la nostra analisi e dimostrano un miglior ancoraggio semantico senza compromettere la qualità della generazione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv