Vai al contenuto
AI.info

Ricerca

KaiNinja: estendere i generatori 3D nativi al livello delle parti

I generatori 3D nativi trasformano una singola immagine in un’unica mesh. TRELLIS.2 e i modelli analoghi producono geometrie ad alta fedeltà non a tenuta stagna, complete di materiali, ma il risultato

KaiNinja: estendere i generatori 3D nativi al livello delle parti
arXiv
2609.15659
Pubblicato
2026-09-14
Autori
Ruihan Yu, Lian Fu, Muyao Niu, Zheng-hui Huang, Yu-Ju Tsai, Sho Kuno, Fengbo Lan, Yonghao Yu, Erwin Wu, Ming-Hsuan Yang, Kaipeng Zhang, Zhixiang Wang

Abstract degli autori

I generatori 3D nativi trasformano una singola immagine in un’unica mesh. TRELLIS.2 e i modelli analoghi producono geometrie ad alta fedeltà non a tenuta stagna, complete di materiali, ma il risultato è un unico oggetto con le parti fuse insieme, mentre le attività successive, come la modifica, il rigging e la simulazione, lavorano su asset costituiti da parti distinte. Un’idea immediata sarebbe applicare una rete di segmentazione 3D alla mesh generata da TRELLIS.2, ma queste pipeline sono lente e le loro prestazioni sono limitate dall’accuratezza della segmentazione. Vogliamo un modo semplice per estendere un generatore 3D nativo esistente al livello delle parti. C’è però un problema fondamentale: la griglia O-Voxel memorizza un solo strato di superficie per voxel, quindi un singolo volume non può rappresentare l’interfaccia nel punto in cui due parti si toccano, a nessuna risoluzione. Per risolvere il problema introduciamo una rappresentazione a doppio volume e proponiamo KaiNinja, un’estensione di TRELLIS.2 al livello delle parti basata su una versione a doppio volume della sua rappresentazione O-Voxel. KaiNinja mantiene la velocità e la qualità di generazione di TRELLIS.2, estendendolo al livello delle parti senza maschere né segmentatori nella pipeline. I dati usati per addestrarlo provengono da fonti di vario tipo, tra cui modelli CAD e asset creati da un agente guidato da un LLM; per quanto ne sappiamo, è il primo modello generativo 3D addestrato su dati relativi alle parti creati da un agente. Sorprendentemente, riscontriamo anche un miglioramento nella fedeltà dell’oggetto nel suo complesso rispetto alla stessa architettura di base sottoposta a fine-tuning sullo stesso dataset. Rispetto a pipeline di generazione delle parti basate su paradigmi diversi, riduce del 40% la distanza di Chamfer dell’oggetto nel suo complesso e aumenta del 16% l’F-score rigoroso delle parti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv