Ricerca
MaLiang-Harness: un percorso programmabile per la generazione di immagini e video
I programmi eseguibili offrono un controllo esplicito su come vengono costruiti immagini e video, ma generare codice funzionante è solo l’inizio della creazione visiva. Un programma può essere eseguit

- arXiv
- 2609.34309
- Pubblicato
- 2026-09-28
- Autori
- Haoyu Zhao, Zihao Zhang, Xudong Wang, Jiaxi Gu, Zuxuan Wu, Yu-Gang Jiang, Shuicheng Yan
Abstract degli autori
I programmi eseguibili offrono un controllo esplicito su come vengono costruiti immagini e video, ma generare codice funzionante è solo l’inizio della creazione visiva. Un programma può essere eseguito correttamente e, al tempo stesso, non rispettare la composizione, l’aspetto o il movimento richiesti. Definiamo questa discrepanza divario Program-to-Visual (P2V) e presentiamo MaLiang-Harness, un framework unificato che organizza la generazione visiva guidata da MLLM come processo persistente di costruzione, ispezione e revisione. Il principio centrale è che il programma visivo in evoluzione, la cronologia della sua costruzione e la sua verifica condividano un riferimento comune per le revisioni. Definiamo lo stato Persistent Executable Generation (PEG) come la conservazione dei programmi e del contesto del compito. Traceable Generation Process (TGP) collega le modifiche ai riscontri ottenuti dal rendering, mentre Revision-aware Editing and Verification (REV) supporta il ripristino e verifica la revisione corrente prima del completamento. Insieme, questi meccanismi coordinano pianificazione, esecuzione e feedback visivo tra diversi backend di rendering. Valutiamo 11 potenti MLLM a codice chiuso su MaLiang-IBench e quattro su MaLiang-VBench, misurando la riuscita della generazione, la qualità visiva e il costo computazionale. GPT-6-Astra raggiunge il 100% di riuscita della generazione in entrambi i benchmark, con il 96,0% dei compiti relativi alle immagini e il 76,9% di quelli relativi ai video che soddisfano tutte le soglie di qualità. Il confronto rivela anche una discrepanza tra i punteggi di capacità generale e le prestazioni nella generazione visiva: modelli con punteggi simili differiscono notevolmente nella capacità di soddisfare i requisiti visivi. MaLiang-Harness offre una base sistematica per studiare come gli MLLM traducano il codice eseguibile in risultati visivi, mettendo in luce sia il potenziale della generazione programmabile sia i limiti dei benchmark generali nel prevedere questa capacità. Il progetto è disponibile all’indirizzo https://github.com/gulucaptain/MaLiang-Harness.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv