Vai al contenuto
AI.info

Approfondimenti tecnici

Modelli visione-linguaggio: come l’IA ha imparato a vedere e a parlare di ciò che vede

Dal tasso di errore del 15,3% di AlexNet su ImageNet nel 2012 all’addestramento contrastivo di CLIP su 400 milioni di coppie nel 2021: ecco come visione e linguaggio sono confluiti in un unico modello, dove questo continua ad avere allucina

Modelli visione-linguaggio: come l’IA ha imparato a vedere e a parlare di ciò che vede

Gabriele Masetti ·

Il tasso di errore del 15,3% che segnò la fine della vecchia visione artificiale

Per anni, il riconoscimento delle immagini è stato una sfida tra rilevatori di caratteristiche progettati a mano — filtri per i bordi, descrittori SIFT, istogrammi dei colori — abbinati a classificatori che non riuscivano mai a generalizzare del tutto. La situazione cambiò all’ImageNet Large Scale Visual Recognition Challenge del 2012, quando Alex Krizhevsky, Ilya Sutskever e Geoffrey Hinton presentarono una rete neurale convoluzionale poi chiamata AlexNet. Ottenne un tasso di errore top-5 del 15,3% sul set di test ImageNet da 1.000 categorie; la seconda classificata, basata su metodi tradizionali, si fermò al 26,2%. AlexNet aveva otto strati — cinque convoluzionali e tre completamente connessi — e girava su due GPU GTX 580 perché una sola scheda non bastava a contenerla.

Benchmark Modello / metodo Risultato
ImageNet 2012, errore top-5 AlexNet (CNN) 15,3%
ImageNet 2012, errore top-5 Migliore modello basato su caratteristiche progettate a mano 26,2%
ImageNet, top-1 zero-shot CLIP ViT-L/14 @ 336px 76,2%
ImageNet, top-1 zero-shot Metodi zero-shot precedenti a CLIP 11,5%
ImageNet-Sketch, top-1 CLIP 60,2%
ImageNet-Sketch, top-1 ResNet-50 (addestrato con supervisione) 25,2%
MMMU (2023) GPT-4V 55,7%
MMMU (2023) Esperto umano 88,6%

È quel divario, superiore a dieci punti percentuali, a fare del 2012 il punto di svolta della visione artificiale moderna. Dimostrò che una rete capace di apprendere le proprie caratteristiche dai pixel grezzi, con abbastanza dati etichettati e potenza di calcolo, supera metodi sviluppati a mano per decenni. Da allora, ogni vincitore di ImageNet è stato una qualche variante di rete neurale profonda e, a metà degli anni 2010, le CNN erano diventate la scelta predefinita per qualsiasi compito di visione artificiale.

Ma le CNN addestrate in questo modo avevano un limite strutturale: potevano riconoscere soltanto l’insieme fisso di categorie su cui erano state addestrate. Un modello addestrato sulle 1.000 classi di ImageNet poteva rispondere «Labrador retriever», ma non aveva modo di descrivere una scena, rispondere a una domanda su di essa o gestire una categoria che nessuno si era preso la briga di etichettare. Visione e linguaggio rimasero discipline separate, con modelli separati, per altri nove anni.

CLIP e i 400 milioni di coppie che cambiarono la domanda

Nel gennaio 2021, OpenAI pubblicò «Learning Transferable Visual Models From Natural Language Supervision», il paper che presentava CLIP (Contrastive Language-Image Pre-training). Anziché addestrarsi su un insieme fisso di etichette, CLIP addestrava congiuntamente un encoder di immagini e uno di testo su circa 400 milioni di coppie (immagine, testo) raccolte dalla rete pubblica, usando un obiettivo contrastivo: avvicinare le rappresentazioni di una coppia immagine-didascalia corrispondente e allontanare quelle delle coppie non corrispondenti. Nessuno dovette assegnare a mano il nome di una categoria a una sola di quelle 400 milioni di immagini: l’etichetta era la didascalia.

Il risultato cambiò il significato stesso di «riconoscimento». Il miglior modello di CLIP, una variante di ViT-L/14 eseguita a una risoluzione di 336 pixel, eguagliò l’accuratezza top-1 del 76,2% di una ResNet-50 addestrata con supervisione completa su ImageNet, senza mai addestrarsi sulle etichette di ImageNet: al momento dell’inferenza si limitava a confrontare le rappresentazioni delle immagini con prompt testuali come «una foto di un cane». Prima di CLIP, i metodi di trasferimento zero-shot arrivavano a circa l’11,5% sullo stesso benchmark: si trattava quindi di un aumento di circa 6,6 volte.

CLIP generalizzava anche nei casi in cui storicamente i classificatori fallivano: raggiungeva il 60,2% su ImageNet-Sketch contro il 25,2% di una ResNet e superava il miglior modello ImageNet pubblico in 20 degli altri 26 benchmark di trasferimento su cui era stato testato. La conseguenza pratica contava più del risultato in classifica: avere un encoder di immagini e uno di testo che condividono lo stesso spazio di coordinate significa disporre del collegamento necessario per costruire un modello capace di guardare un’immagine e produrre una descrizione linguistica. È l’encoder visivo di CLIP, non la famiglia di ResNet, a trovarsi all’interno della maggior parte dei modelli visione-linguaggio costruiti da allora.

Dentro un moderno modello visione-linguaggio: patch, proiettori e parole da 16x16

L’architettura che CLIP ha reso praticabile si fonda sul Vision Transformer, introdotto da Alexey Dosovitskiy e colleghi di Google Research nel paper dell’ottobre 2020 «An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale», pubblicato in seguito a ICLR 2021. ViT elimina quasi del tutto la convoluzione: suddivide un’immagine in patch di dimensioni fisse — 16x16 pixel nella configurazione di riferimento del paper —, appiattisce ciascuna patch, la proietta linearmente in una rappresentazione e passa la sequenza risultante di rappresentazioni delle patch a un encoder transformer standard, esattamente come un modello linguistico elabora una sequenza di token di parole. Un’immagine di un cane diventa, in pratica, una frase composta da patch d’immagine invece che da parole.

È questo formato condiviso dei token a rendere possibile la costruzione degli odierni modelli visione-linguaggio. La formula ormai standard ha tre componenti: un encoder visivo (spesso un ViT sul modello di CLIP o SigLIP) trasforma un’immagine in un insieme di rappresentazioni delle patch; un proiettore — talvolta un singolo strato lineare, talvolta un piccolo MLP o un «resampler» con cross-attention — mappa tali rappresentazioni nello spazio delle dimensioni attese dal modello linguistico; infine, un LLM preaddestrato elabora i token dell’immagine proiettati, intercalati ai token di testo, generando una risposta in modo autoregressivo, come se l’immagine fosse semplicemente altro testo.

LLaVA, pubblicato da Haotian Liu e coautori il 17 aprile 2023 («Visual Instruction Tuning», un paper presentato oralmente a NeurIPS 2023), dimostrò che questa formula poteva essere realizzata a basso costo: un encoder CLIP con parametri congelati, un semplice proiettore lineare e Vicuna come modello linguistico, sottoposto a fine-tuning su dati di istruzioni generati da GPT-4. Ogni successivo modello visione-linguaggio aperto — Qwen-VL, i successori dello stesso LLaVA, PaliGemma, i modelli visivi di Llama — è una variazione di quella stessa struttura in tre parti: cambiano soprattutto la scelta dell’encoder, il progetto del proiettore, la gestione della risoluzione e la porzione del sistema che viene addestrata anziché mantenuta con parametri congelati.

L’evoluzione: da GPT-4V a Qwen3.5

Dal 2023 in poi, i modelli proprietari e quelli aperti hanno avanzato quasi di pari passo. OpenAI ha annunciato GPT-4 with Vision nel settembre 2023 — la scheda del sistema è datata 25 settembre 2023 — dando a ChatGPT la capacità di rispondere a domande sulle immagini caricate dagli utenti; l’accesso tramite API è seguito il 6 novembre 2023. Il team Qwen di Alibaba aveva pubblicato Qwen-VL su arXiv il 24 agosto 2023: uno dei primi concorrenti aperti, costruito sul suo modello linguistico Qwen. Google ha risposto il 6 dicembre 2023 con Gemini 1.0, presentato come nativamente multimodale fin dalla fase di pretraining, anziché come un modello testuale a cui fosse stato aggiunto in seguito un modulo visivo. È stato rilasciato nelle versioni Ultra, Pro e Nano, con accesso pubblico dal 13 dicembre 2023.

Il 2024 è stato l’anno in cui l’ecosistema aperto ha recuperato terreno nella cadenza dei rilasci. Il 14 maggio 2024 Google ha rilasciato PaliGemma, che abbina un encoder visivo SigLIP-So400m a un’architettura Gemma da 3B parametri — abbastanza piccolo da funzionare su una singola GPU per uso domestico — e nel dicembre 2024 ha fatto seguire il più grande PaliGemma 2, nelle varianti 3B, 10B e 28B. Anthropic ha introdotto per la prima volta la possibilità di fornire immagini in input a Claude il 4 marzo 2024, con la famiglia Claude 3 (Opus, Sonnet, Haiku), rendendo disponibile la capacità visiva in tutte le fasce fin dal lancio, anziché riservarla al modello di punta.

Alibaba ha rilasciato Qwen2-VL il 30 agosto 2024 e Meta ha rilasciato il 25 settembre 2024 i modelli Llama 3.2 dotati di capacità visive — nelle versioni da 11B e 90B parametri, in grado di elaborare immagini fino a 1120x1120 pixel. Il ritmo ha continuato ad accelerare nel 2025: Qwen2.5-VL è arrivato il 28 gennaio 2025 e le varianti più grandi di Qwen3-VL (235B-A22B, sia nella versione Instruct sia in quella Thinking) il 23 settembre 2025. Poi la denominazione ha smesso del tutto di indicare la capacità visiva come una variante. Alibaba ha rilasciato Qwen3.5 il 16 febbraio 2026, inaugurando la serie con il modello a pesi aperti Qwen3.5-397B-A17B: un modello sparse mixture-of-experts che attiva 17 miliardi dei suoi 397 miliardi di parametri per token ed è descritto come nativamente visivo-linguistico, anziché come un’edizione VL di un modello testuale. In circa tre anni, una tecnica inventata in due laboratori ha smesso di essere una funzionalità ed è diventata la configurazione standard del modello.

Cosa non sanno ancora fare: punti ciechi, conteggi e grafici

I risultati più citati nei benchmark appaiono solidi e continuano a salire. MMMU (Massive Multi-discipline Multimodal Understanding), presentato su arXiv nel novembre 2023 con 11,5K domande di livello universitario in sei discipline, collocava GPT-4V al 55,7% al momento del lancio, contro una precisione stimata dell’88,6% per gli esperti umani: un divario ampio. A metà del 2026 la classifica racconta una storia diversa: secondo quanto riportato, i modelli di frontiera superano la fascia alta degli 80 punti percentuali, avvicinandosi al risultato degli esperti umani o superandolo di poco.

Su DocVQA, un benchmark di domande e risposte visive sui documenti, i modelli di frontiera superavano il 95% entro il 2026 e la classifica viene descritta come prossima alla saturazione per la comprensione di documenti a pagina singola: sulle suddivisioni standard dei dati, Qwen2.5-VL-72B avrebbe raggiunto 0,964 e GPT-4o 0,928.

Questi numeri misurano il riconoscimento e la lettura, non il ragionamento visivo preciso che gli esseri umani svolgono senza pensarci. Uno studio del luglio 2024 intitolato «Vision Language Models Are Blind» (Rahmanzadehgervi, Bolton e coautori, presentato ad ACCV 2024) ha creato una suite «BlindTest» di sette compiti banali per gli esseri umani: stabilire se due cerchi si sovrappongono, quante volte si incrociano due linee, quale lettera di una parola è cerchiata, quanti cerchi compaiono in un logo in stile olimpico.

Quattro modelli visivo-linguistici che all’epoca erano all’avanguardia, tra cui GPT-4o e Gemini 1.5 Pro, hanno ottenuto in media appena il 58,07% di risposte corrette in quei compiti; Claude 3.5 Sonnet ha fatto meglio, con il 77,84%, ancora ben lontano dal 100% che un essere umano raggiunge quasi all’istante. Lo schema degli errori è costante: le prestazioni di questi modelli peggiorano specificamente quando forme geometriche elementari si sovrappongono o sono vicine tra loro. Questo significa che ragionano su una rappresentazione compressa e approssimativa dell’immagine, anziché seguire l’esatta geometria dei pixel.

I risultati dello studio restano quelli; i modelli esaminati, invece, non sono rimasti fermi. GPT-4o, Gemini 1.5 Pro e Claude 3.5 Sonnet risalgono ormai a diverse generazioni fa e non è stata pubblicata alcuna ripetizione comparabile di BlindTest sui modelli di frontiera attuali. Il 58,07% va letto come una misura dei sistemi del 2024, non come un verdetto sui modelli disponibili oggi.

Un problema collegato e più noto è il conteggio degli oggetti. Diversi benchmark sulle allucinazioni, che comprendono categorie come gli errori relativi ad attributi, relazioni, confronti e OCR, lo considerano una categoria di errore distinta dal riconoscimento generale: i modelli indicano con sicurezza un conteggio sbagliato di uno o due elementi, oppure inventano oggetti o testi assenti dall’immagine, soprattutto quando la scena è affollata o le immagini di grafici e documenti sono a bassa risoluzione.

La conseguenza pratica, per chiunque impieghi questi sistemi, è che risultati medi elevati nei benchmark convivono con errori specifici e difficili da prevedere proprio nei compiti — il conteggio preciso, la gestione delle sovrapposizioni, la disposizione dei dettagli in un grafico — che a un revisore umano sembrano più facili.

Anche i modelli visivo-linguistici più forti restano molto indietro rispetto agli esseri umani in compiti banali basati su forme geometriche elementari.

Be My AI, bozze di referti radiologici ed estrazione dai documenti

L’applicazione più concreta del lavoro sull’accessibilità dei VLM è la collaborazione tra Be My Eyes e OpenAI. Le due aziende hanno annunciato la collaborazione nel marzo 2023 per sviluppare «Virtual Volunteer» — in seguito ribattezzato Be My AI — sfruttando le capacità visive di GPT-4. L’obiettivo era permettere alle persone cieche e ipovedenti di puntare la fotocamera del telefono verso una scena o un documento e ottenere subito una descrizione vocale, senza dover aspettare un volontario.

Dopo l’annuncio iniziale, la funzione è passata alla fase di beta testing su iOS nell’agosto di quell’anno. A partire da dicembre 2023 è stata distribuita a centinaia di migliaia di utenti iOS e Android; nel novembre dello stesso anno è arrivata anche un’integrazione per i centri di assistenza. È una delle poche applicazioni dei VLM in cui la capacità di «vedere» costituisce l’intero prodotto, anziché una funzione aggiunta a qualcos’altro.

In medicina, l’impiego è ancora più vicino alla ricerca che alla pratica clinica. GPT-4V e modelli comparabili si sono dimostrati capaci di redigere, a partire da radiografie del torace, bozze di referti radiologici dal tono plausibile. La ricerca del 2024–2025 ha inoltre prodotto sistemi visione-linguaggio specifici per la medicina, pensati per generare referti e renderli interpretabili. Tra questi figurano approcci basati sulla catena di pensiero che cercano di ancorare una diagnosi a regioni precise dell’immagine, invece di produrre una descrizione per libera associazione.

Quel confine normativo si è spostato alla fine del 2025, anche se non nel campo della diagnostica per immagini. UpDoc V1.0, autorizzato ai sensi della procedura 510(k) K253281 il 23 dicembre 2025 e annunciato il 25 giugno 2026, è descritto dal suo produttore come il primo Software as a Medical Device basato su un modello linguistico di grandi dimensioni rivolto ai pazienti. Il suo ambito è volutamente ristretto: riguarda la titolazione dell’insulina per adulti con diabete di tipo 2, prevede un insieme definito di azioni e registra la provenienza di ogni passaggio.

Leggere le immagini diagnostiche è un problema diverso. Gli strumenti per la diagnostica per immagini autorizzati dalla FDA sono ancora reti più circoscritte, progettate per compiti specifici come il rilevamento di noduli o fratture. L’agenzia ha detto soltanto che esplorerà modi per identificare e contrassegnare, nel suo elenco pubblico, i dispositivi basati su foundation model; a settembre 2026 non vi compariva ancora alcun contrassegno del genere. Il lavoro sui VLM in radiologia rientra nella ricerca e nell’assistenza alla stesura di bozze, non nella diagnosi autonoma.

L’IA per i documenti è l’ambito in cui l’impiego suscita meno controversie: l’estrazione in stile DocVQA, che comprende la lettura di tabelle, moduli e testi scansionati, è ormai una capacità diffusa tanto nei modelli di frontiera quanto negli attuali modelli aperti. Questo proprio perché si tratta di un problema di riconoscimento del testo, per il quale il transformer sottostante e i dati di addestramento affini a quelli dell’OCR sono particolarmente adatti, e non di ragionamento spaziale, ambito in cui questi modelli sono più deboli.

Dai pixel ai comandi motori: RT-2, OpenVLA e π0 di Physical Intelligence

La stessa architettura che permette a un modello di descrivere un’immagine può essere riutilizzata per controllare un robot, se si riaddestra il livello di output a emettere comandi motori anziché parole. RT-2 (Robotic Transformer 2) di Google DeepMind, annunciato il 28 luglio 2023, è stato tra i primi a dimostrarlo: realizzato adattando modelli visione-linguaggio esistenti (PaLM-E e PaLI-X) invece di partire da zero, RT-2 produceva azioni robotiche sotto forma di token testuali. È stato addestrato congiuntamente su dati visione-linguaggio su scala Internet e su dimostrazioni fisiche raccolte da 13 robot nell’arco di 17 mesi.

Riusciva a generalizzare a istruzioni e oggetti mai comparsi nei dati di addestramento specifici per i robot — per esempio collocare un oggetto su un numero stampato o scegliere il più piccolo tra diversi oggetti — perché il VLM sottostante aveva già appreso quei concetti durante il preaddestramento su scala web.

Nel 2024 è arrivata la risposta open source, OpenVLA: un modello da 7 miliardi di parametri basato sul framework VLM Prismatic-7B, che combina un encoder visivo ottenuto dalla fusione di DINOv2 e SigLIP con un’architettura di base Llama 2. Addestrato su 970.000 dimostrazioni di robot nel mondo reale, è stato pubblicato con tutti i pesi, così che anche i laboratori privi di flotte di robot delle dimensioni di quelle di Google potessero sottoporlo a fine-tuning. Oggi è soprattutto l’implementazione aperta di riferimento, più che lo stato dell’arte.

Physical Intelligence, startup di robotica di San Francisco costituita nel 2024, ha presentato π0 il 31 ottobre 2024 come un «modello di flusso visione-linguaggio-azione»: parte da un VLM preaddestrato e vi aggiunge un modulo per le azioni basato sul flow matching. È stato addestrato su 7 configurazioni robotiche distinte e 68 compiti, e ha mostrato di poter svolgere dall’inizio alla fine compiti che nessun precedente sistema robotico basato sull’apprendimento era riuscito a completare, tra cui piegare il bucato prelevato da un cesto e assemblare una scatola di cartone. Lo stesso laboratorio ha poi sviluppato 3 successori: π0.5 il 22 aprile 2025, π*0.6 il 17 novembre 2025 e π0.7 il 16 aprile 2026, ciascuno presentato per la capacità di generalizzare a compiti mai mostrati al robot.

Il 12 marzo 2025 Google DeepMind ha esteso questa linea a una famiglia orientata alla produzione, lanciando Gemini Robotics e Gemini Robotics-ER (ragionamento incarnato), basati su Gemini 2.0 e sviluppati in collaborazione con Apptronik per robot umanoidi. Gemini Robotics 2 è arrivato il 30 luglio 2026, affiancato da ER 2 e da una variante eseguibile sul dispositivo: il problema del controllo passava così da un paio di braccia a un intero corpo umanoide. DeepMind descrive questa estensione con l’espressione «dai piedi alla punta delle dita», e l’ha dimostrata su Apollo 2 di Apptronik. Lo schema è identico in tutti e 3 i progetti: prendere un modello che ha già imparato ad associare pixel e linguaggio su scala Internet e trattare l’azione fisica come un’ulteriore modalità che si può insegnare allo stesso transformer a produrre in output.

Esplora

Altri articoli