Ricerca
StoryEngine: un framework agentico fondato sullo stato per la narrazione video
Nonostante i recenti progressi nella generazione agentica di video composti da più inquadrature, produrre storie lunghe, coerenti e visivamente consistenti resta difficile. Le pipeline agentiche esist

- arXiv
- 2609.33627
- Pubblicato
- 2026-09-27
- Autori
- Yingrui Wang, Zeqing Wang, Yeying Jin
Abstract degli autori
Nonostante i recenti progressi nella generazione agentica di video composti da più inquadrature, produrre storie lunghe, coerenti e visivamente consistenti resta difficile. Le pipeline agentiche esistenti si basano in genere su piani testuali delle inquadrature o su immagini generate in precedenza, ma non dispongono di un meccanismo esplicito per propagare le conseguenze degli eventi narrativi e mantenere lo stato del mondo rappresentato nel video da un’inquadratura all’altra. Di conseguenza, i dettagli visivi mancanti possono essere ricostruiti in modo impreciso, mentre la deriva visiva può propagarsi alle inquadrature successive, compromettendo sia la coerenza narrativa sia la consistenza visiva. Per affrontare queste difficoltà, proponiamo StoryEngine, un framework agentico fondato sullo stato per la narrazione video. StoryEngine distingue tra piani semantici autorevoli e osservazioni visive inaffidabili. In particolare, mantiene una rappresentazione strutturata della collocazione delle entità e degli stati rilevanti per la storia, e propaga i cambiamenti indotti dagli eventi per definire gli stati iniziale e finale previsti per ogni inquadratura. Per rappresentare visivamente questi stati, StoryEngine costruisce riferimenti canonici per le entità e gli ambienti ricorrenti e traduce i vincoli relativi allo stato e all’aspetto visivo in piani di rendering eseguibili. Inoltre, per realizzare correttamente questi stati, un ciclo di correzione delimitato e guidato dalla valutazione interviene sulle incongruenze locali dello stato. Nel loro insieme, questi meccanismi preservano la progressione causale della storia e impediscono che gli errori visivi locali si propaghino da un’inquadratura all’altra. Per valutare in modo completo la narrazione video di lunga durata, realizziamo un benchmark che copre scenari e stili visivi diversi, con metriche che misurano la qualità della narrazione, la coerenza narrativa e la consistenza visiva. I risultati sperimentali mostrano che StoryEngine supera sistematicamente i metodi più avanzati in tutte le dimensioni di valutazione, confermandone l’efficacia nel produrre narrazioni video coerenti e visivamente consistenti.