Ricerca
ZipTok3D: tokenizzazione 3D ad alta fedeltà con prefissi compatti di token
Le sequenze compatte di token sono essenziali per generare oggetti 3D in modo efficiente. Tuttavia, i tokenizer 3D esistenti organizzano in genere le rappresentazioni latenti per regioni spaziali oppu

- arXiv
- 2609.01740
- Pubblicato
- 2026-09-01
- Autori
- Mingda Lin, Weijie Wang, Zeyu Zhang, Bowen Cui, Yefei He, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang
Abstract degli autori
Le sequenze compatte di token sono essenziali per generare oggetti 3D in modo efficiente. Tuttavia, i tokenizer 3D esistenti organizzano in genere le rappresentazioni latenti per regioni spaziali oppure come insiemi di token globali di dimensione fissa. In entrambi i casi, la qualità della ricostruzione peggiora nettamente quando il numero di token viene ridotto a livelli estremamente bassi. In questo articolo presentiamo ZipTok3D, un tokenizer 3D progettato per ricostruzioni ad alta fedeltà a partire da sequenze di token estremamente brevi. L’idea centrale è organizzare la geometria degli oggetti in prefissi di token globali progressivamente più informativi e sviluppare queste rappresentazioni compatte mediante una decodifica iterativa. Nello specifico, durante l’addestramento il nested dropout tronca casualmente la sequenza latente dopo la codifica e richiede che ogni prefisso conservato ricostruisca l’intero oggetto, dando così priorità alle informazioni geometriche essenziali nei primi token. Il decoder applica poi ripetutamente un blocco Transformer con parametri condivisi per recuperare da ciascun prefisso la geometria nei dettagli, senza una fase separata di campionamento generativo. A parità di dimensione dei token, ZipTok3D raggiunge una qualità di ricostruzione paragonabile a quella di COD-VAE, usato come baseline con 32 token, impiegando un solo token su ShapeNet e quattro su TRELLIS: sequenze di token rispettivamente $32\times$ e $8\times$ più brevi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv