Vai al contenuto
AI.info

Ricerca

SoL-Refiner: rifinitura in un solo passaggio alla velocità della luce per video ad alta risoluzione

Generare video ad alta risoluzione è costoso, perché il costo cresce rapidamente con il numero di token spaziotemporali. Un’alternativa pratica consiste nel generare prima un video a risoluzione infer

SoL-Refiner: rifinitura in un solo passaggio alla velocità della luce per video ad alta risoluzione
arXiv
2609.37969
Pubblicato
2026-09-29
Autori
Haozhe Liu, Tian Ye, Shuchen Xue, Yitong Li, Junsong Chen, Haopeng Li, Jincheng Yu, Duomin Wang, Ruihua Zhang, Lei Zhu, Song Han, Enze Xie

Abstract degli autori

Generare video ad alta risoluzione è costoso, perché il costo cresce rapidamente con il numero di token spaziotemporali. Un’alternativa pratica consiste nel generare prima un video a risoluzione inferiore e poi applicare un sistema di rifinitura, ma la rifinitura convenzionale in più passaggi introduce un secondo collo di bottiglia nel campionamento. Presentiamo SoL-Refiner, un sistema che trasforma gli output a bassa risoluzione dei modelli in video 4K con un solo passaggio di rimozione del rumore. Il nostro procedimento in tre fasi combina addestramento continuativo ad alta risoluzione, post-addestramento con apprendimento per rinforzo (RL) e una distillazione finale in un solo passaggio. Introduciamo Refiner-Bench, un benchmark per la rifinitura video costruito a partire dagli output di diversi generatori video, e usiamo un protocollo basato sugli stessi input per confrontare i sistemi di rifinitura a una risoluzione di output di circa 2K. A 2K, SoL-Refiner in un solo passaggio supera tutti i sistemi di rifinitura esterni nelle medie di VBench e UniPercept; a $3840\!\times\!2176$, migliora entrambe le metriche rispetto a LTX-2.3 Refiner in tre passaggi. Con lo stack completo di accelerazione, SoL-Refiner ottiene un’accelerazione di $8.91\times$ nella latenza della rifinitura rispetto allo stesso sistema di riferimento nella nostra configurazione di misurazione della latenza a 2K.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv