Vai al contenuto
AI.info

Ricerca

Forma e vuoto: composizione intrecciata attraverso un agente di IA autonomo

Lo spazio positivo e quello negativo costituiscono un principio fondamentale della composizione visiva, che permette di creare forme visivamente coerenti e relazioni semantiche stratificate. Generare

Forma e vuoto: composizione intrecciata attraverso un agente di IA autonomo
arXiv
2610.02045
Pubblicato
2026-10-01
Autori
Shiwen Wang, Jian Yang, Xu Wang, Xincan Wang, Weiming Dong

Abstract degli autori

Lo spazio positivo e quello negativo costituiscono un principio fondamentale della composizione visiva, che permette di creare forme visivamente coerenti e relazioni semantiche stratificate. Generare composizioni di questo tipo è difficile perché richiede un controllo coordinato di due concetti semantici che condividono un confine. Sebbene i recenti modelli da testo a immagine e i modelli linguistici multimodali di grandi dimensioni (MLLM) abbiano ottenuto risultati notevoli nella generazione di immagini e nella comprensione visiva, la generazione di composizioni basate sullo spazio positivo e negativo rimane difficile, soprattutto con prompt diretti in un unico passaggio. In questo lavoro presentiamo il \textbf{F}orm \textbf{a}nd \textbf{V}oid \textbf{A}gent (\textbf{FaV-A}), un agente multimodale progettato per generare queste composizioni in più fasi. FaV-A segue un processo progressivo: prima genera un oggetto di base, poi ne analizza la forma e la struttura spaziale per individuare possibili interpretazioni semantiche dello spazio negativo e infine produce istruzioni compositive per la fase finale di generazione dell’immagine. I risultati sperimentali e le analisi di ablazione suggeriscono che FaV-A offra un approccio più efficace rispetto ai modelli MLLM di riferimento zero-shot impiegati direttamente per produrre composizioni di spazi positivi e negativi visivamente coerenti e semanticamente allineate.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv