Ricerca
WanPE: verso un miglioramento cinematografico dei prompt per la moderna generazione di video da testo
La generazione video inizia nello spazio testuale, con la stesura di una sceneggiatura cinematografica, e si materializza poi in pixel. Man mano che i generatori video contemporanei si estendono fino

- arXiv
- 2609.30221
- Pubblicato
- 2026-09-24
- Autori
- Yubo Zhu, Yawen Shao, Ziyun Dai, Zixun Fang, Kai Zhu, Siyang Sun, Haolan Xue, Chuxin Wang, Tingyu Weng, Jingming Luo, Chen Shi, Lianghua Huang, Yufeng Ai, Yuzheng Wang, Wenyuan Zhang, Yu Shang, Yuxiang Bao, Zoubin Bi, Jie Xiao, Jinbo Xing, Jiaxing Zhao, Chongyang Zhong, Hengjian Chen, Chenwei Xie, Akide Liu, Zhehan Kan, Yu Liu, Wei Zhai, Sheng Zhong, Wei Tong
Abstract degli autori
La generazione video inizia nello spazio testuale, con la stesura di una sceneggiatura cinematografica, e si materializza poi in pixel. Man mano che i generatori video contemporanei si estendono fino a 30 secondi e seguono fedelmente condizioni complesse, il prompt testuale dirige in larga misura la produzione, pianificando lo svolgimento di azioni, traiettorie della camera, illuminazione e suono nel corso di sequenze composte da più inquadrature. In questo articolo presentiamo WanPE, un modello di ottimizzazione dei prompt da 397 miliardi di parametri, addestrato su 1,05 milioni di video del mondo reale per padroneggiare la pianificazione cinematografica a livello di regia. WanPE formula piani cinematografici a livello di inquadratura attraverso una ricostruzione inversa basata sui video e impiega Semantic-Consistency GRPO (SC-GRPO) per preservare fedelmente i requisiti degli utenti da un’inquadratura all’altra e nel tempo. Per valutare questa capacità, abbiamo creato WanPEval, un banco di prova annotato da esseri umani che copre durate dai 5 ai 30 secondi e diversi livelli di granularità dell’intento, basato su circa 11 mila valutazioni comparative alla cieca. Integrato nel generatore video Wan3.0, WanPE-397B aumenta di 10,66-18,84 punti la preferenza umana rispetto ai prompt originali degli utenti per durate di 5-15 secondi, e di ben 50,86 punti nella fascia dei 30 secondi. Gli studi di ablazione mostrano che la ricostruzione inversa è nettamente superiore alla riscrittura in avanti, mentre SC-GRPO preserva con robustezza la fedeltà semantica anche al variare delle dimensioni del modello. In definitiva, WanPE supera tutte le offerte commerciali valutate per durate di 5-15 secondi e resta competitivo con Seedance 2.5 a 30 secondi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv