Vai al contenuto
AI.info

Ricerca

La generazione nativa di texture 3D richiede necessariamente asset 3D per l’addestramento?

La generazione nativa di texture 3D produce colori direttamente nello spazio 3D per una data geometria, usando come riferimento immagini da più punti di vista. Si ritiene generalmente che per addestra

La generazione nativa di texture 3D richiede necessariamente asset 3D per l’addestramento?
arXiv
2609.34621
Pubblicato
2026-09-28
Autori
Jiangshan Wang, Zeqiang Lai, Jiayi Guo, Xin Yang, Xin Huang, Jiarui Chen, Ziheng Ouyang, Chunchao Guo, Xiangyu Yue

Abstract degli autori

La generazione nativa di texture 3D produce colori direttamente nello spazio 3D per una data geometria, usando come riferimento immagini da più punti di vista. Si ritiene generalmente che per addestrare questi modelli servano grandi quantità di dati di alta qualità relativi ad asset 3D reali, la cui acquisizione resta un problema annoso e difficile. In questo lavoro proponiamo Tex-Zero e dimostriamo che un sistema per la generazione nativa di texture 3D ad alta fedeltà può essere addestrato senza asset 3D. La nostra osservazione fondamentale è che, per l’addestramento, sono essenziali soltanto informazioni cromatiche di alta qualità e a grana fine: le informazioni geometriche necessarie sono meno determinanti e possono essere costruite manualmente anziché ricavate da asset 3D reali. Questa constatazione permette di trasformare le abbondanti immagini 2D di alta qualità in campioni efficaci per addestrare la generazione di texture 3D. Nello specifico, convertiamo immagini 2D di alta qualità in campioni di addestramento 3D rappresentando ciascuna immagine come un piano nello spazio 3D e applicando rotazioni casuali alle singole patch, che vengono poi aggregate per costruire strutture geometriche complesse. Con i dati di immagine così costruiti addestriamo il Tex-Zero VAE, che riesce a ricostruire asset 3D reali con alta qualità pur non avendone mai osservati durante l’addestramento. A partire dal Tex-Zero VAE, addestriamo anche il Tex-Zero DiT esclusivamente con i dati di immagine costruiti: le immagini 2D da più punti di vista usate per il condizionamento vengono trasformate in piani nello spazio 3D e codificate anch’esse dal Tex-Zero VAE, riducendo così la distanza tra le rappresentazioni e migliorando la qualità della generazione. Numerosi esperimenti mostrano che Tex-Zero genera texture 3D ad alta fedeltà con dettagli fini usando soltanto immagini come dati di addestramento, offrendo una prospettiva promettente sul paradigma dei dati per la generazione di texture 3D su larga scala.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv