Ricerca
Modelli di generazione video: una rassegna sul post-training e sull’allineamento
La generazione video è passata rapidamente da clip brevi e di bassa qualità a sequenze ad alta risoluzione e di lunga durata, caratterizzate da dinamiche spaziotemporali complesse. Nonostante i solidi
- arXiv
- 2610.00812
- Pubblicato
- 2026-09-30
- Autori
- Chaoyu Li, Xiaoyi Gu, Yogesh Kulkarni, Eun Woo Im, Mohammadmahdi Honarmand, Zeyu Wang, Juntong Song, Fei Du, Xilin Jiang, Kexin Zheng, Tianzhi Li, Fei Tao, Pooyan Fazli
Abstract degli autori
La generazione video è passata rapidamente da clip brevi e di bassa qualità a sequenze ad alta risoluzione e di lunga durata, caratterizzate da dinamiche spaziotemporali complesse. Nonostante i solidi prior generativi appresi con il preaddestramento su larga scala, i modelli video preaddestrati spesso non riescono a seguire in modo affidabile le intenzioni umane, a mantenere la coerenza temporale o a rispettare i vincoli fisici e di sicurezza. Rispetto alla generazione di immagini e testo, l’allineamento nella generazione video presenta sfide specifiche, tra cui l’accumulo degli errori nel tempo, l’interdipendenza tra movimento e aspetto, i compromessi tra obiettivi diversi e la limitata supervisione delle proprietà temporali. Queste sfide rendono necessarie strategie sistematiche di post-training che adattino i modelli preaddestrati senza riaddestrarli da zero. In questa rassegna presentiamo la prima analisi completa del post-training e dell’allineamento nei modelli di generazione video. Consideriamo il post-training come un quadro di riferimento unificante e distinguiamo tra allineamento implicito ed esplicito in base al modo in cui vengono applicati i segnali di allineamento. In questa prospettiva, suddividiamo gli approcci esistenti in quattro grandi categorie: metodi di fine-tuning supervisionato, metodi di autoaddestramento e distillazione, metodi basati su preferenze e ricompense e metodi applicati durante l’inferenza. Questa classificazione offre una visione coerente di come i segnali di allineamento influenzino il comportamento dei modelli sia durante l’addestramento sia durante l’impiego. Oltre ai progressi metodologici, esaminiamo i dataset, i benchmark e le pratiche di valutazione più utilizzati e discutiamo questioni ancora aperte, come la progettazione di ricompense scalabile, la coerenza temporale su lunghi orizzonti, i compromessi tra stabilità ed espressività e la generazione attenta alla sicurezza. Questa rassegna intende offrire una base concettuale strutturata e indicazioni pratiche per sviluppare modelli di generazione video più controllabili e affidabili.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv