Vai al contenuto
AI.info

Ricerca

OverLay++: dataset per la generazione di immagini da layout con sovrapposizioni dense

La generazione Layout-to-Image ha compiuto notevoli progressi nel controllo spaziale e dei singoli oggetti. Tuttavia, i metodi esistenti incontrano ancora difficoltà con le scene complesse che conteng

OverLay++: dataset per la generazione di immagini da layout con sovrapposizioni dense
arXiv
2610.09071
Pubblicato
2026-10-06
Autori
Shivansh Aggarwal, Shresth Grover, Divyansh Srivastava, Haiyang Xu, Bingnan Li, Xiang Zhang, Ethan J. Armand, Chuan Li, Jianwen Xie, Zhuowen Tu

Abstract degli autori

La generazione Layout-to-Image ha compiuto notevoli progressi nel controllo spaziale e dei singoli oggetti. Tuttavia, i metodi esistenti incontrano ancora difficoltà con le scene complesse che contengono molti oggetti sovrapposti e in interazione tra loro. Sosteniamo che i dati di addestramento costituiscano un ostacolo particolare: i dataset esistenti non includono esempi con interazioni dense e complesse tra oggetti. Per colmare questa lacuna, presentiamo OverLay++, un dataset Layout-to-Image su larga scala con scene strutturalmente complesse. OverLay++ contiene circa 500K immagini, con una media di 6,6 oggetti per immagine, e supera i dataset esistenti di 1,67 volte per densità delle annotazioni. Oltre a questa densità, OverLay++ offre un ricco dettaglio semantico, con descrizioni degli oggetti oltre sei volte più lunghe rispetto a quelle dei dataset attuali. La nostra procedura di generazione del dataset è semplice e produce annotazioni dense di oggetti sovrapposti, accompagnate da descrizioni ricche per ciascun oggetto. Su diversi benchmark, i metodi Layout-to-Image più avanzati addestrati sul dataset OverLay++ mostrano miglioramenti costanti e una convergenza più rapida, dimostrando l’importanza, per la generazione controllabile di immagini, di dati di supervisione densi, attenti alle sovrapposizioni e ricchi di descrizioni.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv