Vai al contenuto
AI.info

Ricerca

World in World: esplorare il mondo con i modelli del mondo

I modelli del mondo video autoregressivi consentono un’esplorazione interattiva su orizzonti temporali lunghi, ma offrire un controllo flessibile resta difficile. Esplorare un video sorgente da nuovi

World in World: esplorare il mondo con i modelli del mondo
arXiv
2609.11548
Pubblicato
2026-09-10
Autori
Chenxi Song, Yanming Yang, Chi Zhang

Abstract degli autori

I modelli del mondo video autoregressivi consentono un’esplorazione interattiva su orizzonti temporali lunghi, ma offrire un controllo flessibile resta difficile. Esplorare un video sorgente da nuovi punti di vista richiede che la sequenza generata rimanga sincronizzata con l’evento registrato, collochi il contenuto osservato nella vista richiesta, completi in modo plausibile le regioni che diventano visibili e riproduca l’aspetto generato in precedenza quando si torna a una vista già esplorata. I metodi esistenti soddisfano in genere questi requisiti mediante moduli specifici per ciascun compito o un addestramento aggiuntivo. Presentiamo World in World, un’interfaccia utilizzabile in fase di inferenza senza addestramento aggiuntivo che converte informazioni di controllo eterogenee in stati visivi puliti, etichettati per telecamera e tempo, letti attraverso il meccanismo nativo di self-attention di un modello video causale congelato. Queste informazioni comprendono osservazioni del video sorgente, proiezioni della scena nella vista di destinazione, rendering geometrici che guidano il completamento delle regioni del soggetto appena rese visibili e stati generati recuperati oltre la cache scorrevole. Ogni fonte di informazioni ha un supporto a livello di token e una propria programmazione della disponibilità. Un router delle corrispondenze combina le identità persistenti dei punti con la geometria per stabilire corrispondenze tra token, indirizzando le query supportate verso i token corrispondenti del video sorgente. Evidence-wise attention CFG (EWA) regola poi in modo indipendente il contributo aggiuntivo di ciascun canale ausiliario, usando le risposte dell’attenzione ottenute dallo stesso passaggio forward di rimozione del rumore. La stessa interfaccia supporta il nuovo rendering con controllo della telecamera, il ritorno a viste già esplorate dopo lunghi intervalli e il trasferimento del movimento umano, utilizzando il medesimo modello di base congelato. Valutiamo World in World nel nuovo rendering di video con controllo della telecamera attraverso diversi cambiamenti di punto di vista, misurando la qualità percettiva, la coerenza temporale e l’accuratezza nel seguire la telecamera.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv