Vai al contenuto
AI.info

Ricerca

Tenere o scartare? Un tokenizer adattivo per una rappresentazione compatta dei video

I modelli di diffusione latente si sono affermati come uno dei principali approcci alla sintesi di immagini e video ad alta fedeltà: operano in spazi latenti compatti con autoencoder variazionali (VAE

Tenere o scartare? Un tokenizer adattivo per una rappresentazione compatta dei video
arXiv
2608.24293
Pubblicato
2026-08-25
Autori
Yeonkyeong Lee, Hyunsung Go, Jongmin Kim, Sewoong Lim, Donghoon Lee

Abstract degli autori

I modelli di diffusione latente si sono affermati come uno dei principali approcci alla sintesi di immagini e video ad alta fedeltà: operano in spazi latenti compatti con autoencoder variazionali (VAE), migliorando l’efficienza computazionale senza compromettere la qualità visiva. Tuttavia, i VAE convenzionali non sono ottimali per i video, perché impiegano rapporti di compressione fissi che non si adattano alla diversa complessità dei contenuti spazio-temporali. Presentiamo KATok (Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation), un VAE basato su transformer che incorpora un selettore adattivo di token, addestrato congiuntamente ai token latenti. Valutando la ricchezza di contenuto di ciascun token come probabilità di conservarlo o scartarlo, il selettore elimina i token non informativi, consentendo una compressione che si adatta ai dati. Applicare la tokenizzazione adattiva ai modelli di diffusione può causare disallineamenti spaziali, poiché l’eliminazione dei token può alterare la struttura spazio-temporale originale. Per attenuare questo problema, proponiamo due strategie di predizione delle posizioni, la generazione a cascata e quella congiunta, per garantire la coerenza spaziale. Mostriamo empiricamente che il nostro modello raggiunge un’elevata qualità di ricostruzione e generazione con un rapporto di compressione all’avanguardia. Ulteriori analisi sui dati video rivelano che questo miglioramento è dovuto principalmente alla riduzione della ridondanza spazio-temporale e all’eliminazione dei token non informativi, come confermano i risultati sia quantitativi sia qualitativi.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv