Vai al contenuto
AI.info

Ricerca

Generazione visiva agentica: dai modelli generativi al controllo agentico

La generazione visiva si sta evolvendo: da modelli generativi utilizzati con una singola chiamata a processi di controllo agentico capaci di pianificare, selezionare strumenti, esaminare i risultati s

Generazione visiva agentica: dai modelli generativi al controllo agentico
arXiv
2609.06758
Pubblicato
2026-09-06
Autori
Yinming Huang, Shuyuan Tu, Xi Yan, Jiahao Zhan, Zihan Yang, Zhen Xing, Hui Zhang, Tiehua Zhang, Yu-Gang Jiang, Zuxuan Wu

Abstract degli autori

La generazione visiva si sta evolvendo: da modelli generativi utilizzati con una singola chiamata a processi di controllo agentico capaci di pianificare, selezionare strumenti, esaminare i risultati sintetizzati intermedi, correggere gli errori e riutilizzare l’esperienza acquisita. Nella maggior parte dei sistemi esistenti, il controller è un LLM o un VLM, mentre i modelli di generazione visiva fungono da strumenti o esecutori. Tuttavia, i lavori esistenti non offrono un criterio coerente per stabilire quando un sistema di generazione diventi agentico. La profondità della pianificazione, l’uso di strumenti, la collaborazione tra più ruoli e l’apprendimento per rinforzo sono spesso considerati prove di agentività, anche se nessuno di questi elementi determina necessariamente quali decisioni sulla generazione il controller possa prendere. Organizziamo il campo in base a ciò che il controller può controllare direttamente nel processo di generazione. Al livello L1 Conditioning Control, il controller prepara l’input per un generatore predeterminato, ma non controlla quale operazione visiva venga eseguita. Al livello L2 Execution Control, seleziona e avvia operazioni effettive di generazione, modifica, rendering o altre operazioni che modificano i contenuti. Al livello L3 Outcome-Adaptive Control, osserva un risultato intermedio e usa tale osservazione per modificare un’operazione successiva nell’ambito del compito in corso. Al livello L4 Experience-Adaptive Control, conserva l’esperienza acquisita dai compiti completati e la usa per modificare le decisioni relative ai compiti futuri. Il livello L0 Fixed Support indica separatamente generatori, strumenti di modifica, valutatori, modelli di ricompensa, benchmark e pipeline fisse privi di un controller operativo che prenda decisioni a livello di generazione. Questi livelli descrivono un ambito decisionale progressivamente più ampio, non la dimensione del modello, la complessità del sistema, la qualità dei risultati, il numero di strumenti o ruoli, né il metodo di addestramento. Applicare questo quadro alla generazione di immagini, video, modifiche, contenuti 3D, mondi, slide e interfacce utente mostra come si siano evolute le capacità dei controller e come i relativi meccanismi si distribuiscano tra i livelli.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv