Vai al contenuto
AI.info

The Pulse

Google Research mostra un video di 10 minuti generato dall’IA

Google Research descrive quattro sistemi per pianificare, generare e perfezionare video di lunga durata, tra cui una dimostrazione di dieci minuti di A²RD.

Google Research mostra un video di 10 minuti generato dall’IA

AI.info Team ·

Dieci minuti è la durata del film generato dall’IA che Google Research usa per dimostrare un sistema pensato per mantenere coerenti personaggi e ambientazioni nel corso di una lunga storia. In un post pubblicato il 24 settembre, i ricercatori Yale Song e Yiwen Song descrivono quattro sistemi correlati per pianificare, generare e perfezionare sequenze video più lunghe. Il lavoro affronta una debolezza ricorrente dei video generati dall’IA: i dettagli possono cambiare da un’inquadratura all’altra, mentre gli errori in una fase possono ripercuotersi su quella successiva.

Un film di dieci minuti composto da segmenti

L’esempio più lungo è realizzato con A²RD, un sistema autoregressivo che genera video segmento per segmento e mantiene una memoria multimodale di ciò che è apparso. Per ogni segmento, recupera il contesto, genera nuovo materiale, lo perfeziona e aggiorna quella memoria. Google afferma che A²RD alterna l’espansione della storia con nuovi eventi e l’interpolazione attorno a personaggi e ambientazioni già apparsi.

«Per testare questo sistema, il film di dieci minuti qui sotto mostra una generazione di lunga durata, che richiede una progressione narrativa coerente attraverso intervalli temporali di diversi minuti.»

Yale Song e Yiwen Song, ricercatori di Google

La dimostrazione è un film di dieci minuti, non la prova che un singolo prompt produca un video finito di dieci minuti in un’unica passata. L’approccio a più fasi di A²RD è pensato per gestire la continuità tra i segmenti. Google afferma che il sistema aiuta a mantenere dettagli come l’identità dei personaggi, l’abbigliamento e la disposizione dei luoghi.

Quattro sistemi affrontano quattro cause di discontinuità

Il co-regista video basato sull’IA di Google pianifica una produzione coordinando diversi agenti. Un orchestratore sceglie una direzione creativa, poi gli agenti di pre-produzione e produzione realizzano uno storyboard e generano fotogrammi chiave, video e audio. Un modello multimodale esamina il montaggio assemblato e invia osservazioni per un nuovo ciclo di pianificazione.

CANVAS si concentra sulla continuità tra le inquadrature mantenendo registri strutturati di personaggi, luoghi e stati degli oggetti. VQQA, o Video Quality Question Answering, ha un ruolo diverso: pone domande su una clip generata, usa la valutazione critica di un modello visione-linguaggio per rivedere il prompt e seleziona il risultato migliore tra le diverse iterazioni. Google descrive i sistemi come livelli di orchestrazione, precisando che il co-regista è basato su Gemini e Veo e non viene presentato come un nuovo modello video fondamentale.

Il punteggio di 81,4 viene dal benchmark di Google

Google riporta un punteggio massimo di qualità di 81,4 per il co-regista video basato sull’IA su GenAD-Bench. Il benchmark mette alla prova 400 scenari che coinvolgono 50 marchi fittizi, ciascuno con quattro prodotti, rispetto a vincoli di marketing dettagliati. Il post descrive anche HardContinuityBench, dedicato alla continuità spaziale, e LVBench-C, che comprende 120 scenari per testare i cambiamenti di personaggi, oggetti e ambienti.

Il post afferma che CANVAS migliora la continuità su HardContinuityBench e che A²RD migliora la coerenza nei test sui video lunghi, ma nell’articolo non fornisce risultati numerici comparabili a sostegno di queste affermazioni. Google rimanda i lettori ai singoli articoli di ricerca per le configurazioni dei modelli e le valutazioni di riferimento. Il valore di 81,4 è quindi un risultato ottenuto su un benchmark descritto da Google, non una misura universale della coerenza dei video.

Google presenta una ricerca, non un prodotto di montaggio finito

L’annuncio presenta i quattro sistemi come strumenti per automatizzare attività ripetitive come il coordinamento dei prompt, la concatenazione delle inquadrature e la revisione visiva. Gli articoli sul co-regista e su CANVAS sono indicati come di prossima pubblicazione, rispettivamente a COLM 2026 e a EMNLP 2026. Il post non annuncia un lancio per i consumatori né indica una data di distribuzione.

Per i creatori, la dimostrazione suggerisce un flusso di lavoro in cui i modelli aiutano a mantenere la continuità narrativa, mentre le persone conservano il controllo della direzione e delle scelte narrative. Le prove pubblicate qui da Google consistono in un esempio di dieci minuti e nelle affermazioni sui benchmark; i confronti dettagliati e le informazioni sulle configurazioni restano negli articoli di ricerca collegati.

Fonte

Esplora

Altri articoli