Vai al contenuto
AI.info

Ricerca

Marigold V2: una nuova analisi dei transformer a diffusione per la stima della profondità monoculare

La stima della profondità monoculare è un compito onnipresente nella visione artificiale, ma anche un problema fortemente mal posto. Trova applicazione, tra l’altro, nella ricostruzione di scene, nell

Marigold V2: una nuova analisi dei transformer a diffusione per la stima della profondità monoculare
arXiv
2609.08084
Pubblicato
2026-09-08
Autori
Igor Pavlovic, Thiemo Wandel, Anton Obukhov, Luca Bartolomei, Andrey Davydov, Fabio Tosi, Matteo Poggi, Sabine Süsstrunk, Dengxin Dai

Abstract degli autori

La stima della profondità monoculare è un compito onnipresente nella visione artificiale, ma anche un problema fortemente mal posto. Trova applicazione, tra l’altro, nella ricostruzione di scene, nella fotografia computazionale e nella robotica. Nonostante la maturità del settore, i modelli recenti faticano ancora a generalizzare su input fuori distribuzione e a produrre mappe di profondità nitide e dettagliate. In questo articolo riesaminiamo Marigold, un insieme di tecniche per adattare i moderni modelli di generazione e modifica delle immagini, basati sull’architettura diffusion transformer (DiT), alla stima della profondità monoculare con risultati all’avanguardia. Le nostre procedure mirano a ottenere un’inferenza in un solo passaggio da modelli di flow matching preaddestrati a più passaggi, ricorrendo alla quantizzazione dove necessario, senza sacrificare la capacità del modello e mantenendo bassi i costi di esecuzione. Analizziamo gli artefatti prodotti da un addestramento ingenuo e individuiamo due rimedi efficaci: allineare le rappresentazioni interne del modello alle caratteristiche semantiche estratte dai dati di riferimento e adottare un protocollo di fine-tuning in 2 fasi basato su una nuova funzione di perdita fondata su Sinkhorn. Ne risultano mappe di profondità più nitide e pulite, che generalizzano bene fuori distribuzione, con un miglioramento del 16-26% nell’AbsRel rispetto al precedente miglior risultato su KITTI ed ETH3D. Sul piano qualitativo, il nostro modello distingue il pelo, il fogliame e contorni sottili come un capello che i modelli precedenti non riuscivano a risolvere. Inoltre, Marigold V2 ottiene risultati all’avanguardia anche in altri compiti di regressione densa, come la stima delle normali alle superfici e la scomposizione delle immagini in componenti intrinseche. Sito del progetto: https://hf.co/spaces/huawei-bayerlab/marigold-v2-web

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv