Ricerca
4Director: controllare i modelli del mondo video con la geometria 3D rigida
Il controllo preciso dei movimenti della telecamera e degli oggetti è essenziale per la produzione video professionale. I metodi esistenti controllano gli oggetti solo in modo approssimativo, attraver

- arXiv
- 2610.02160
- Pubblicato
- 2026-10-01
- Autori
- Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu
Abstract degli autori
Il controllo preciso dei movimenti della telecamera e degli oggetti è essenziale per la produzione video professionale. I metodi esistenti controllano gli oggetti solo in modo approssimativo, attraverso indizi sul piano dell’immagine che lasciano ambigue la profondità e la rotazione, oppure attraverso traiettorie e blob 3D privi di una geometria completa e incapaci di mantenere la coerenza quando cambia il punto di vista. Presentiamo 4Director, un modello del mondo per i video condizionato da una rappresentazione esplicita della scena in 4D: ogni oggetto viene ricostruito una sola volta a partire dall’immagine di input come mesh canonica e spostato mediante una trasformazione rigida prestabilita per ogni fotogramma. Questa rappresentazione offre un’interfaccia intuitiva per il controllo 3D e impedisce che la geometria non osservata venga rigenerata indipendentemente in ogni fotogramma. Produciamo un video di profondità della scena controllata e introduciamo Motion Adapter, che trasforma questa struttura geometrica in video sintetizzando l’aspetto, l’illuminazione e le dinamiche non rigide in modo coerente tra i diversi punti di vista. Per l’addestramento, creiamo RealCOD-Rigid, un nuovo dataset di 20.774 clip annotati con scene 3D rigide mediante la nostra pipeline automatica. Introduciamo inoltre Identity-Gated IoU (IG-IoU), che valuta congiuntamente l’aderenza al movimento prescritto degli oggetti e la conservazione della loro identità. Gli esperimenti dimostrano che 4Director supera sistematicamente i metodi precedenti per qualità visiva e controllo della telecamera e degli oggetti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv