Vai al contenuto
AI.info

Ricerca

Autoregressive Mosaics: un’indagine sul ragionamento spaziale bidimensionale nei modelli linguistici solo testuali

I modelli linguistici di grandi dimensioni (LLM) addestrati soltanto su testo e codice riescono talvolta a generare programmi che disegnano immagini riconoscibili. Non è chiaro, però, se questo riflet

Autoregressive Mosaics: un’indagine sul ragionamento spaziale bidimensionale nei modelli linguistici solo testuali
arXiv
2608.30751
Pubblicato
2026-08-31
Autori
Ashwin Nedungadi, Stefan Oehmcke, Stefan Lüdtke

Abstract degli autori

I modelli linguistici di grandi dimensioni (LLM) addestrati soltanto su testo e codice riescono talvolta a generare programmi che disegnano immagini riconoscibili. Non è chiaro, però, se questo rifletta una rappresentazione interna della disposizione spaziale bidimensionale o semplicemente la capacità di tradurre descrizioni spaziali in codice. Presentiamo Autoregressive Mosaics (AM-Bench), un benchmark che distingue questi due aspetti. Nel primo compito, di traduzione, al modello viene fornita come prompt una descrizione verbale che specifica interamente la geometria di un’immagine, e gli si chiede di produrre il codice per realizzarla. Nel secondo, il compito di composizione, il modello deve comporre un’immagine a partire da un prompt che non la specifica completamente. Su otto modelli a pesi aperti addestrati soltanto su testo e codice, tutti traducono in modo affidabile una geometria specificata in codice, ma le loro prestazioni nella composizione libera differiscono notevolmente. Queste differenze, quindi, non si spiegano con la sola capacità di generare codice. Un esperimento di ablazione sul mezzo di output mostra inoltre che l’interfaccia o il mezzo di espressione usato dal modello conta: sostituire il codice procedurale con SVG grezzo migliora i punteggi di composizione di tutti i modelli. Infine, l’analisi delle attivazioni dei modelli mostra che, prima della generazione, è presente un piano approssimativo della disposizione spaziale, che però riflette soltanto quella implicita nel prompt. Durante la generazione, i modelli seguono l’evoluzione dello stato geometrico anziché eseguire un piano fissato inizialmente. Nel complesso, questi risultati mostrano che le prestazioni spaziali bidimensionali degli LLM solo testuali dipendono sia dal modello sia dal mezzo di output e non si spiegano con la sola capacità di generare codice.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv