Ricerca
L’anello temporale mancante: Temporal Context Routing per la generazione audio-video guidata da un copione
I modelli di generazione congiunta di audio e video hanno compiuto notevoli progressi nella qualità visiva e nella sincronizzazione audiovisiva. Tuttavia, offrono ancora un controllo limitato sul mome

- arXiv
- 2609.02367
- Pubblicato
- 2026-09-02
- Autori
- Yichen Liu, Quanwei Zhang, Haozhe Wang, Donghao Zhou, Jiankun Zhang, Xiaojie Li, Yang Shi, Jiaming Liu, Ruihua Huang, Yingtian Zou, Daquan Zhou
Abstract degli autori
I modelli di generazione congiunta di audio e video hanno compiuto notevoli progressi nella qualità visiva e nella sincronizzazione audiovisiva. Tuttavia, offrono ancora un controllo limitato sul momento in cui avvengono i cambi di inquadratura e vengono pronunciate le battute. Questo limite ne restringe l’impiego nella creazione di contenuti guidata da un copione, dove gli errori di tempistica possono compromettere la coerenza narrativa e l’esperienza di visione. Gli attuali modelli di generazione congiunta allineano le rappresentazioni di video e audio su un asse temporale condiviso, ma la tempistica precisa delle inquadrature e dei dialoghi specificata in un prompt strutturato è codificata soltanto nella rappresentazione testuale del prompt e non è allineata alle coordinate temporali di nessuna delle due modalità. Di conseguenza, video e audio possono rimanere sincronizzati tra loro senza che nessuno dei due rispetti la scansione temporale del copione. Questa discrepanza ci spinge a estendere l’allineamento temporale oltre il video e l’audio, includendo anche il copione strutturato. Introduciamo quindi Temporal Context Routing (TCR), che colloca le indicazioni temporali del copione sull’asse temporale condiviso della generazione video e audio e indirizza le indicazioni di ciascun prompt alle posizioni corrispondenti in entrambe le modalità. Rispetto al modello di riferimento, su 200 copioni di prova TCR riduce lo Shot Boundary MAE del 96%, da 1,11 s a 0,042 s, e porta la Dialogue Acc@0,5 s dal 28,3% all’84,1%. TCR ottiene questi miglioramenti mantenendo una qualità visiva e una sincronizzazione audiovisiva paragonabili a quelle dei modelli di riferimento. Uno studio condotto con utenti mostra inoltre che i partecipanti preferiscono TCR in tutte e cinque le dimensioni valutate.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv