Ricerca
SemanTok: token semantici prevedibili per una generazione video autoregressiva efficiente
I recenti modelli del mondo basati sui video combinano la scalabilità della predizione autoregressiva (AR) con la qualità visiva dei modelli di diffusione. La scelta del tokenizer per le scene è fonda

- arXiv
- 2610.00686
- Pubblicato
- 2026-09-30
- Autori
- Mikhail Dereviannykh, Vikram Voleti, Simon Donne, Mallikarjun Byrasandra Ramalinga Reddy, Shimon Vainer, Mark Boss
Abstract degli autori
I recenti modelli del mondo basati sui video combinano la scalabilità della predizione autoregressiva (AR) con la qualità visiva dei modelli di diffusione. La scelta del tokenizer per le scene è fondamentale per ottenere prestazioni ottimali in entrambi, sia in termini di fedeltà sia di semantica. I tokenizer a lunghezza flessibile, che procedono dal grossolano al fine, offrono proprio questo: i primi token, più grossolani, contengono la semantica globale del video, mentre quelli successivi ne precisano i dettagli. I tokenizer flessibili esistenti applicano una funzione di perdita per l’allineamento delle rappresentazioni (REPA) soltanto ai primi stati nascosti del decoder, un obiettivo che il decoder può soddisfare in parte sfruttando invece il proprio input a cui è stato aggiunto rumore. Presentiamo SemanTok, un tokenizer video flessibile che fornisce al proprio encoder le rappresentazioni di DINO con parametri bloccati e aggiunge moduli leggeri che le ricostruiscono usando esclusivamente ciascun prefisso di token conservato. SemanTok raggiunge un elevato allineamento semantico e un’elevata fedeltà video con modelli AR di ogni dimensione: un modello AR SemanTok da 201M eguaglia o supera un modello AR VideoFlexTok grande $3.4\times$ quanto lui, e modelli AR SemanTok più grandi migliorano ulteriormente la fedeltà. Mantiene l’allineamento semantico sulle classi fuori distribuzione e assicura al decoder un maggiore allineamento semantico a ogni livello di rumore, incluso il rumore puro. Ottiene buoni risultati sia nella ricostruzione sia nella generazione, e i suoi prefissi di token brevi sono meno costosi da predire e offrono una maggiore fedeltà nella generazione, lasciando i dettagli a livello di pixel ai token successivi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv