Vai al contenuto
AI.info

Ricerca

LIFT: generazione di video con layout futuro in presenza di ampi cambiamenti del punto di vista mediante autodistillazione on-policy

Presentiamo LIFT, un framework unificato per la generazione di video a partire da immagini che affianca al controllo della camera il controllo Layout-In-FuTure, consentendo agli utenti di specificare

LIFT: generazione di video con layout futuro in presenza di ampi cambiamenti del punto di vista mediante autodistillazione on-policy
arXiv
2609.38146
Pubblicato
2026-09-29
Autori
Shengxiang Ji, Boyang Wang, Haiyang Xu, Bingnan Li, Yucheng Mao, Zeyuan Chen, Xiaojun Shan, Xiang Zhang, Gang Hua, Jianwen Xie, Zezhou Cheng, Zhuowen Tu

Abstract degli autori

Presentiamo LIFT, un framework unificato per la generazione di video a partire da immagini che affianca al controllo della camera il controllo Layout-In-FuTure, consentendo agli utenti di specificare che cosa debba comparire in una vista futura e dove. Risponde a un’esigenza pratica della generazione controllabile di video: data un’immagine iniziale, spesso agli utenti interessa non solo come si muove la camera, ma anche quale aspetto debba avere la scena nei momenti futuri più importanti, soprattutto nell’ultimo fotogramma. I controlli della camera esistenti definiscono le traiettorie del punto di vista, mentre i prompt testuali forniscono solo indicazioni semantiche generiche; nessuno dei due determina con precisione il contenuto e la disposizione spaziale delle viste future. Questo limite è particolarmente evidente quando il punto di vista cambia molto e la camera rivela regioni non visibili nel primo fotogramma. LIFT usa quindi il layout dell’ultimo fotogramma come segnale di controllo esplicito per la scena futura desiderata. Poiché apprendere da indicazioni così limitate sul layout è molto più difficile che usare come condizione layout densi per ogni fotogramma, introduciamo l’autodistillazione on-policy (OPSD) per trasferire la capacità di controllo da un modello insegnante basato su layout densi a un modello studente basato sul layout dell’ultimo fotogramma. Abbiamo inoltre creato LIFT-Vista, un dataset caratterizzato da ampi cambiamenti del punto di vista, con annotazioni della camera e annotazioni del layout coerenti nel tempo. Gli esperimenti mostrano che LIFT migliora la qualità dei video, la controllabilità del layout futuro e quella della camera rispetto ad altri metodi.

Leggi il paper originale su arXiv