Vai al contenuto
AI.info

Ricerca

Prism: attenzione sparsa dinamica per l’addestramento nativo di modelli di generazione congiunta di video e audio a 2K

Addestrare nativamente modelli di generazione congiunta di video e audio a risoluzioni più elevate permette loro di apprendere dettagli visivi più ricchi e dinamiche del movimento più nitide. Tuttavia

Prism: attenzione sparsa dinamica per l’addestramento nativo di modelli di generazione congiunta di video e audio a 2K
arXiv
2610.05416
Pubblicato
2026-10-04
Autori
Shuyuan Tu, Qi Tian, Yinming Huang, Yue Wu, Xintong Han, Kaihang Pan, Weijie Kong, Jiangfeng Xiong, Jian-Wei Zhang, Zuxuan Wu, Yu-Gang Jiang

Abstract degli autori

Addestrare nativamente modelli di generazione congiunta di video e audio a risoluzioni più elevate permette loro di apprendere dettagli visivi più ricchi e dinamiche del movimento più nitide. Tuttavia, l’attenzione completa ha un costo quadratico e, all’aumentare della risoluzione, distribuisce l’attenzione su token sempre più ridondanti, indebolendo i segnali di apprendimento relativi ai contenuti informativi e alterando i prior appresi nel preaddestramento. I metodi di attenzione sparsa esistenti puntano all’accelerazione senza addestramento oppure trascurano la struttura peculiare dei dati video-audio congiunti, nei quali le interazioni tra modalità si concentrano per loro natura attorno alle regioni che producono suoni. Per affrontare questo problema, proponiamo Prism, un framework di attenzione sparsa dinamica per addestrare nativamente modelli di generazione congiunta di video e audio a 2K. In particolare, Prism organizza la sequenza di token in macrozone spaziotemporali, consentendo alla struttura dell’attenzione di adattarsi al contenuto locale. Per ciascuna zona, stima la struttura informativa locale attraverso la varianza delle caratteristiche video lungo la dimensione dei canali e le norme delle caratteristiche dell’attenzione incrociata dall’audio al video. Questi segnali descrivono congiuntamente come varia il contenuto visivo nelle diverse direzioni e quanto l’audio influenza ciascuna regione visiva. Sulla loro base, Prism assegna dinamicamente a ogni zona una forma dei blocchi su misura, suddividendola più finemente lungo gli assi in cui il contenuto visivo varia rapidamente e l’interazione tra audio e video è forte. Questo favorisce la coerenza semantica dei token all’interno di ciascun blocco, consentendo alle caratteristiche a livello di blocco di rappresentare sia il contenuto visivo sia gli schemi di interazione congiunta tra video e audio. Prism adotta inoltre una strategia ibrida di selezione dei blocchi per determinare dinamicamente il grado di sparsità per ciascuna query. Gli esperimenti mostrano che Prism accelera l’addestramento di 2,5$\times$ rispetto all’attenzione completa, superandola al contempo nella qualità della generazione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv