Vai al contenuto
AI.info

Ricerca

VideoGen-Agent: agenti di generazione video potenziati con l’apprendimento per rinforzo

I recenti progressi nei modelli generativi video hanno reso possibile generare video ad alta fedeltà e coerenti nel tempo. Tuttavia, questi modelli spesso faticano a soddisfare prompt che richiedono c

VideoGen-Agent: agenti di generazione video potenziati con l’apprendimento per rinforzo
arXiv
2609.24997
Pubblicato
2026-09-21
Autori
Binxu Li, Haoyi Duan, Yuhui Zhang, Yaohui Zhang, Zihao Lin, Kaituo Feng, Suozhi Huang, Xiangyi Li, Yu Li, Chunyuan Li, Shilong Liu, Mengdi Wang

Abstract degli autori

I recenti progressi nei modelli generativi video hanno reso possibile generare video ad alta fedeltà e coerenti nel tempo. Tuttavia, questi modelli spesso faticano a soddisfare prompt che richiedono conoscenze specialistiche, identità specifiche, coerenza fisica o eventi in sequenza. In questo articolo presentiamo VideoGen-Agent, un agente multimodale addestrato con apprendimento per rinforzo agentico multitasking per usare strumenti esterni nella generazione di video. L’agente coordina strumenti di arricchimento, generazione e verifica attraverso interazioni su più turni, usando il prompt e le osservazioni intermedie per guidare le proprie decisioni. Addestriamo una policy condivisa su un dataset bilanciato per categoria che comprende sei task. Il fine-tuning supervisionato su traiettorie generate dall’insegnante stabilisce il comportamento d’uso degli strumenti, che viene poi perfezionato tramite apprendimento per rinforzo. Una ricompensa ibrida e consapevole delle categorie valuta la validità delle chiamate agli strumenti, l’uso degli strumenti appropriato al task e la qualità dei video generati. Presentiamo inoltre VABench, un benchmark di valutazione con 600 prompt tenuti fuori dall’addestramento, che coprono conoscenze procedurali, preservazione dell’identità di una o più entità, coerenza fisica, composizione delle scene e struttura temporale su più inquadrature. Su VABench, VideoGen-Agent migliora di 19,1 punti rispetto al generatore di testo-video di base, passando da 56,5 a 75,6. Potenziando gli strumenti di generazione, il punteggio sale ulteriormente a 86,1 senza ulteriore addestramento dell’agente. I valutatori umani preferiscono la configurazione potenziata alla baseline standalone più forte nell’84,3% dei confronti. Questi risultati avvalorano l’apprendimento dell’uso degli strumenti per diversi task di generazione video e mostrano che l’agente addestrato può trarre vantaggio dai successivi progressi negli strumenti di generazione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv