Vai al contenuto
AI.info

Ricerca

LongLive-Plug: distillazione una volta per tutte per la generazione di video

I modelli di diffusione per la generazione di video vengono sempre più spesso sviluppati in modelli specializzati per diverse attività a valle. Questo processo comprende spesso una fase di distillazio

LongLive-Plug: distillazione una volta per tutte per la generazione di video
arXiv
2609.38154
Pubblicato
2026-09-29
Autori
Shuai Yang, Luozhou Wang, Wei Huang, ZhiFei Chen, Bohan Zhang, Xiao Fu, Qianli Ma, Chen-Hsuan Lin, Weian Mao, Bryan Chu, Song Han, Yukang Chen

Abstract degli autori

I modelli di diffusione per la generazione di video vengono sempre più spesso sviluppati in modelli specializzati per diverse attività a valle. Questo processo comprende spesso una fase di distillazione, per esempio per accelerare il campionamento o migliorare la generazione di video lunghi. In genere, tale fase viene ripetuta per ogni modello specializzato. Presentiamo LongLive-Plug, un framework di distillazione una volta per tutte che apprende capacità riutilizzabili sotto forma di LoRAs su un modello di base, da applicare senza addestramento e in modalità plug-and-play a modelli a valle compatibili. Queste capacità comprendono la classifier-free guidance in un unico passaggio, il campionamento in pochi passaggi e la correzione degli errori nei contesti lunghi per la generazione autoregressiva. Gli adattatori restano riutilizzabili anche quando i modelli a valle aggiungono rami di condizionamento o ampliano i canali di output. Pur essendo stata addestrata con un valore fisso della guidance, la nostra LoRA dedicata alla CFG consente di controllare la guidance testuale attraverso il suo peso in fase di inferenza. Combinandola con una LoRA per la generazione in pochi passaggi, si preservano contemporaneamente la generazione in pochi passaggi e la controllabilità della CFG nelle attività a valle. Verifichiamo l’applicazione senza addestramento su 54 modelli a valle, appartenenti a tre famiglie di backbone e a otto categorie di attività, tra cui modellazione del mondo, robotica, editing e generazione multimodale. L’approccio potrebbe supportare ulteriori modelli compatibili. Ogni capacità può quindi essere distillata una sola volta per famiglia di backbone e riutilizzata senza riaddestramento per ciascun modello bersaglio.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv