Ricerca
TransNormal-2: flusso rettificato basato sulla geometria e decodifica sensibile ai contorni per una stima precisa delle normali
I modelli basati sulla diffusione consentono di stimare la geometria da una singola immagine, ma la loro precisione nello spazio dei pixel è limitata da una fonte di errore comune e ancora poco studia

- arXiv
- 2609.06665
- Pubblicato
- 2026-09-06
- Autori
- Mingwei Li, Yi Yang, Hehe Fan
Abstract degli autori
I modelli basati sulla diffusione consentono di stimare la geometria da una singola immagine, ma la loro precisione nello spazio dei pixel è limitata da una fonte di errore comune e ancora poco studiata: il degrado dovuto alla ricostruzione del VAE. La compressione spaziale di 8 volte nell’encoder-decoder VAE degrada le normali delle superfici ai contorni degli oggetti; persino codificare e decodificare le normali di riferimento introduce un errore angolare medio (MAE) di 1,3–8,5°, con un MAE ai contorni che raggiunge 2,8 volte quello globale. Presentiamo TransNormal-2, un framework di flusso rettificato basato su FLUX.2, con inferenza deterministica in un solo passaggio, che affronta questo degrado su entrambi i lati del decoder VAE: nel modo in cui le previsioni latenti sono supervisionate durante l’addestramento e nel modo in cui le normali decodificate sono corrette durante l’inferenza. In primo luogo, le funzioni di perdita nello spazio dei pixel che tengono conto della geometria, tra cui l’autoconsistenza del rendering inverso, la perdita angolare di von~Mises-Fisher e la regolarizzazione wavelet sensibile ai contorni, integrano l’MSE latente imponendo, dopo la decodifica VAE, la geometria sferica delle normali e i segnali di formazione dell’immagine legati alla riflessione diffusa. In secondo luogo, un leggero Geometric Refinement Module (GRM) applica una correzione residua guidata dall’RGB per ridurre gli errori di decodifica concentrati ai contorni, senza riscrivere liberamente la previsione approssimativa. Nei benchmark su scene generiche, TransNormal-2 eguaglia o supera MoGe-2 in tutte e otto le metriche riportate, utilizzando appena l’1,4% delle annotazioni delle normali specifiche per il compito. I miglioramenti sono più evidenti per gli oggetti trasparenti: rispetto alle migliori baseline precedenti, il MAE si riduce di 4,2° su ClearGrasp e di 3,1° su ClearPose. Il codice sarà pubblicato all’indirizzo https://longxiang-ai.github.io/TransNormal-2.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv