Vai al contenuto
AI.info

Ricerca

QuadTok: tokenizer visivo a quadtree per la generazione autoregressiva di immagini

Presentiamo QuadTok, un nuovo approccio alla tokenizzazione visiva e alla generazione autoregressiva di immagini. Rispetto agli approcci tradizionali basati su griglie 2D o sequenze di token 1D, propo

QuadTok: tokenizer visivo a quadtree per la generazione autoregressiva di immagini
arXiv
2610.10497
Pubblicato
2026-10-07
Autori
Yucheng Mao, Zeyuan Chen, Xiaojun Shan, Xiang Zhang, Divyansh Srivastava, Bingnan Li, Zhuowen Tu

Abstract degli autori

Presentiamo QuadTok, un nuovo approccio alla tokenizzazione visiva e alla generazione autoregressiva di immagini. Rispetto agli approcci tradizionali basati su griglie 2D o sequenze di token 1D, proponiamo una struttura gerarchica a quadtree che concilia il legame spaziale 2D con la flessibilità delle sequenze 1D. Il tokenizer QuadTok assegna dinamicamente una maggiore capacità di rappresentazione alle aree visivamente complesse, mantenendo le regioni omogenee a una risoluzione grossolana. Rispetto a una griglia fissa di 256 token, il nostro tokenizer addestrato su ImageNet usa circa il 10% di token in meno su ImageNet e il 9% in meno quando viene trasferito in modalità zero-shot al dataset COCO, mantenendo una fedeltà di ricostruzione comparabile. Inoltre, la causalità naturale introdotta dalla struttura ad albero consente la generazione autoregressiva di immagini. Condizionato da una topologia quadtree fornita prima della generazione, il nostro modello generativo in stile GPT da 947M ottiene un gFID di 2,08 sul benchmark ImageNet $256 \times 256$. Sfruttando inoltre la forte correlazione spaziale preservata dalla struttura a quadtree, il generatore QuadTok consente di generare immagini con controllo spaziale in modalità zero-shot. Codice: https://github.com/myc634/QuadTok.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv