Vai al contenuto
AI.info

Ricerca

Chat-Edit-3D++: editing interattivo di scene 3D e 4D tramite modelli linguistici di grandi dimensioni

I recenti lavori sulla manipolazione dei contenuti delle immagini basati su modelli visivo-linguistici preaddestrati sono stati estesi con successo all’editing di scene 3D guidato dal testo. Tuttavia,

Chat-Edit-3D++: editing interattivo di scene 3D e 4D tramite modelli linguistici di grandi dimensioni
arXiv
2608.29137
Pubblicato
2026-08-29
Autori
Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai, Wenrui Ding, Yi Yang, Shuchang Zhou, Ming-Hsuan Yang

Abstract degli autori

I recenti lavori sulla manipolazione dei contenuti delle immagini basati su modelli visivo-linguistici preaddestrati sono stati estesi con successo all’editing di scene 3D guidato dal testo. Tuttavia, gli approcci esistenti all’editing di scene 3D presentano ancora alcune carenze che ne ostacolano lo sviluppo come strumenti di progettazione interattiva. In genere seguono schemi di input fissi, che limitano la flessibilità dell’input testuale. Inoltre, le loro capacità di editing dipendono da uno o pochi modelli visivi 2D e richiedono la progettazione di pipeline complesse per integrare questi modelli nei processi di ricostruzione 3D. Per affrontare tali problemi, proponiamo la rete Hash-Atlas, che riformula l’editing di scene 3D come una serie di operazioni su immagini di atlanti 2D, separando così nel flusso di lavoro i processi di editing 2D e di ricostruzione 3D. Su questa base, presentiamo CE3D++, un approccio all’editing di scene 3D basato sul dialogo e incentrato su un modello linguistico di grandi dimensioni (LLM), che consente agli utenti di fornire qualsiasi input testuale, ne interpreta le intenzioni e permette poi di richiamare autonomamente i modelli visivi corrispondenti. Estendiamo inoltre CE3D++ alle scene 4D monoculari imponendo vincoli di movimento agli oggetti in movimento e sottoponendo l’LLM a ulteriore fine-tuning mediante la creazione di un dataset di traiettorie relativo ai compiti di editing. Questo consente al modello linguistico di dimensioni inferiori di coordinare con precisione fino a 30 diversi strumenti visivi. I risultati sperimentali mostrano che CE3D++ integra efficacemente più modelli visivi per ottenere diversi effetti di editing visivo e possiede una solida capacità di comprensione delle scene e di dialogo su più turni. I codici sorgente e i modelli addestrati sono disponibili all’indirizzo https://github.com/Fangkang515/CE3D.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv