Orizzonti futuri
Perché i robot non possono imparare come hanno fatto i chatbot: la carenza di dati dell’IA incarnata
Il clamore sugli umanoidi nasconde il vero limite: ai robot manca un corpus su scala Internet con dati abbinati alle azioni. Simulazione, teleoperazione in VR e video egocentrici sono le tre soluzioni del 2026, ma il divario visivo tra simu

Gabriele Masetti ·
Perché i robot non sono ancora più intelligenti? L’entusiasmo per gli umanoidi si scontra con la carenza di dati
Nel 2026 i robot umanoidi dominano i palchi delle presentazioni. Le macchine di terza generazione di Figure smistano componenti in uno stabilimento di assemblaggio BMW a Spartanburg, 1X ha esaurito in cinque giorni la produzione di un anno dei robot domestici Neo da 20.000 dollari, Tesla ha smantellato la linea di Fremont su cui costruiva la Model S per produrvi invece Optimus, e i capitali di rischio continuano ad arrivare a ritmi che due anni fa sarebbero sembrati assurdi. Chiedete a un ingegnere di una di queste aziende perché un robot continui a maneggiare maldestramente un calice di vino o a lasciar cadere un tovagliolo di stoffa: difficilmente la risposta riguarderà chip o attuatori. Il problema sono i dati.
I grandi modelli linguistici hanno imparato a scrivere, ragionare e programmare assimilando un corpus di testi accumulato in tre decenni di internet aperta: blog, libri, forum, repository di codice. Per i robot non esiste un corpus equivalente. Ken Goldberg, ricercatore di robotica alla UC Berkeley, ha descritto il divario senza mezzi termini: a un essere umano servirebbero circa 100.000 anni per leggere i testi usati per addestrare i grandi modelli linguistici di oggi.
«Non abbiamo neanche lontanamente una quantità di dati simile per addestrare i robot, e 100.000 anni sono solo il tempo necessario per leggere i testi che abbiamo per addestrare i modelli linguistici», ha detto. Nessuno sa esattamente quanti dati sulle interazioni fisiche servano a un robot generalista, ma ogni stima attendibile colloca il fabbisogno ben al di sopra di tutto ciò che è stato raccolto finora.
Il divario di 100.000 anni nei dati di addestramento dell’IA incarnata
I dati testuali possono crescere su larga scala perché copiarli e trasmetterli non costa quasi nulla. Un post scritto una volta su un blog viene letto da milioni di persone. Con i dati per i robot non funziona così. Ogni dimostrazione richiede un robot fisico, un ambiente fisico e, in quasi tutti i sistemi oggi in uso, un essere umano che comandi direttamente il braccio o lo sorvegli abbastanza da poter intervenire. Una seconda osservazione di Goldberg, ancora più amara, spiega il limite: «ogni otto ore di lavoro ti danno solo altre otto ore di dati».
Un modello come GPT non è stato addestrato facendo scrivere una persona per otto ore: ha attinto a un corpus costruito da miliardi di persone nell’arco di decenni. Un braccio robotico teleoperato produce esempi di addestramento esattamente alla velocità con cui una persona riesce a muoverlo.
In un rapporto dell’aprile 2026, Bessemer Venture Partners ha quantificato questa scarsità: i dati raccolti in tutto il mondo sulla manipolazione robotica ammontano complessivamente a circa 300.000 ore, contro circa un miliardo di ore di video disponibili su internet per il preaddestramento di modelli linguistici e video. Open X-Embodiment, il dataset più usato tra diverse piattaforme robotiche, riunito da Google DeepMind e da oltre 30 istituzioni partner, contiene poco più di un milione di traiettorie reali di robot relative a 22 piattaforme: una risorsa importante per la ricerca, ma una quantità trascurabile rispetto al corpus usato per addestrare un grande modello linguistico.
DROID, un progetto accademico con più laboratori che coinvolge 13 istituzioni in tre continenti, ha aggiunto circa 76.000 traiettorie e circa 350 ore di interazioni teleoperate in 564 ambienti e 86 compiti. Dati utili e variegati, ma ancora minuscoli rispetto a quelli di cui disponeva l’IA basata sul testo.
| Dataset | Traiettorie | Ambito |
|---|---|---|
| Open X-Embodiment | Oltre 1 milione | 22 piattaforme, oltre 30 istituzioni |
| DROID | ~76.000 | 13 istituzioni, 564 ambienti, 86 compiti |
| NVIDIA GR00T-Mimic (sintetico) | 780.000 | Generate in 11 ore a partire da dimostrazioni reali |
| Fonte dei dati | Dimensioni |
|---|---|
| Testi usati per addestrare gli LLM di oggi (stima di Goldberg) | ~100.000 anni di lettura per un essere umano |
| Dati sulla manipolazione robotica a livello mondiale (Bessemer, 2026) | ~300.000 ore |
| Video disponibili su internet per il preaddestramento | ~1 miliardo di ore |
Modelli del mondo per i robot: la simulazione è la prima soluzione
La prima risposta adottata nella pratica è smettere di raccogliere dati esclusivamente nel mondo reale e generare esperienze sintetiche da cui un robot possa imparare prima ancora di interagire con un dispositivo fisico. La piattaforma Isaac GR00T di NVIDIA abbina un modello di base visione-linguaggio-azione, GR00T N1, a una pipeline di dati sintetici chiamata GR00T-Mimic, che moltiplica un piccolo numero di dimostrazioni umane registrate trasformandole in dataset simulati molto più grandi.
NVIDIA ha dichiarato di aver generato 780.000 traiettorie sintetiche — l’equivalente di circa 6.500 ore di dimostrazioni umane, o nove mesi di registrazione continua — in appena 11 ore di calcolo. L’addestramento dei modelli di base del mondo Cosmos dell’azienda ha richiesto una risorsa di altro tipo: circa 10.000 GPU H100 in funzione per circa tre mesi.
NVIDIA non è l’unica a scommettere su modelli del mondo addestrati sui video anziché su una fisica codificata a mano. Genie 3 e Dreamer 4 di Google DeepMind generano ambienti interattivi in cui una policy può esercitarsi prima di essere impiegata, e Wayve, specializzata nella guida autonoma, ha applicato la stessa idea al proprio settore con un modello da 8,4 miliardi di parametri chiamato GAIA-2. Anche far funzionare un modello del mondo all’avanguardia non costa poco: il costo di esecuzione di Genie 3 di Google è stato stimato in circa 100 dollari per ogni ora di ambiente generato. È anche per questo che i capitali diretti verso questo approccio sono cresciuti così rapidamente.
I finanziamenti hanno seguito la scommessa che i modelli del mondo siano la via per superare il limite dei dati. La nuova impresa di Yann LeCun, AMI Labs, ha raccolto 1,03 miliardi di dollari in finanziamenti iniziali nel marzo 2026, con una valutazione pre-money di 3,5 miliardi di dollari, con l’obiettivo dichiarato di costruire modelli del mondo anziché un altro grande modello linguistico.
World Labs di Fei-Fei Li ha chiuso un round da 1 miliardo di dollari il 18 febbraio 2026, portando i finanziamenti complessivi a circa 1,23 miliardi di dollari, con il sostegno di Autodesk, AMD, NVIDIA, Fidelity e Sea, per sviluppare modelli di intelligenza spaziale nella sua linea di prodotti Marble. Bessemer ha stimato che circa 6 miliardi di dollari siano confluiti in sei o sette aziende attive nei modelli del mondo nel solo primo trimestre del 2026 e, separatamente, ha previsto che i costi complessivi dei dati robotici nel settore supereranno i 3 miliardi di dollari nei due anni successivi.
Teleoperazione in VR e corsa alla raccolta di dati sulla destrezza
La simulazione gestisce abbastanza bene la locomozione — camminare, mantenere l’equilibrio, riprendersi da un inciampo — perché i motori fisici modellano accuratamente la dinamica dei corpi rigidi. È molto meno affidabile quando si tratta di manipolazione destrezza, perciò le aziende continuano ad affidarsi a persone che pilotano direttamente i robot, sempre più spesso attraverso visori VR di largo consumo anziché apparecchiature industriali. I visori Apple Vision Pro e Meta Quest 3 fanno ormai parte dei sistemi di teleoperazione perché rilevano nativamente il movimento delle mani a sei gradi di libertà, anche se ogni sistema ha comunque bisogno di un livello di conversione che mappi le 27 articolazioni della mano umana su una pinza o su una mano robotica destrezza con 12-16 gradi di libertà.
Il gruppo di ricerca di Apple ha sviluppato ARMADA, un sistema che attraverso Vision Pro sovrappone un robot virtuale al mondo reale: una persona può così mostrare un compito a mani nude e produrre comunque dati compatibili con i limiti di un robot fisico. È importante perché elimina del tutto la necessità di possedere un robot.
Accanto ai visori restano ampiamente utilizzate apparecchiature più vecchie ed economiche: ALOHA 2, un sistema bimanuale di bracci in configurazione guida-seguace che costa circa 15.000-20.000 dollari da costruire, produce tra 10 e 30 episodi dimostrativi utilizzabili per ogni ora di lavoro umano; UMI, un dispositivo di acquisizione montato al polso, permette invece di raccogliere dati nelle normali cucine e officine, anche in totale assenza di un robot.
Figure AI ha aperto un Helix Lab dedicato per far funzionare su larga scala la propria pipeline VR e di teleoperazione destinata a Helix, il suo modello visione-linguaggio-azione. Nei suoi annunci di lavoro compaiono ora «creatori di dati per Helix» e «piloti di robot umanoidi», che indossano attrezzature di teleoperazione per guidare i robot nell’esecuzione dei compiti e caricarne i risultati. Ciò che questa pipeline alimenta è ormai in fabbrica: Helix 02, il modello di Figure che traduce i pixel in azioni, controlla i robot Figure 03 arrivati il 30 giugno 2026 nel padiglione 52 dello stabilimento BMW di Spartanburg per disporre componenti non smistati sui carrelli di consegna. È un compito più difficile del caricamento di lamiere che il loro predecessore vi aveva svolto nel 2025 per oltre 30.000 X3.
1X ha proposto ai consumatori la versione più diretta di questa scommessa. Chi acquista Neo, il suo robot domestico — 20.000 dollari per riceverlo in via prioritaria nel 2026, oppure 499 dollari al mese per una consegna successiva — viene informato fin dall’inizio che operatori umani vedranno l’interno della sua casa mentre pilotano il robot. Il 30 aprile 2026, 1X ha aperto a Hayward, in California, una fabbrica per costruirli, con una capacità di 10.000 unità l’anno.
Il fondatore Bernt Børnich ha spiegato esplicitamente il motivo: «Se non abbiamo i vostri dati, non possiamo migliorare il prodotto». Nel 2025 Tesla ha preso la direzione opposta, abbandonando le tute per il motion capture e le apparecchiature di teleoperazione a favore di gruppi di videocamere montate su caschi e zaini indossati da lavoratori che svolgono attività ordinarie, come piegare una camicia. La modifica è stata introdotta appositamente per raccogliere dati più in fretta dopo che Ashok Elluswamy ha assunto la guida del programma Optimus al posto di Milan Kovac.
Preaddestramento con video in soggettiva: apprendere dalle mani umane
La terza soluzione fa a meno sia dei robot sia delle apparecchiature di teleoperazione e attinge invece ai video di persone riprese mentre vivono la propria quotidianità. Il dataset Ego4D di Meta, realizzato con 13 università partner, contiene quasi 3.700 ore di video in soggettiva registrati da 931 persone dotate di videocamera in 74 località di nove paesi: riprese di attività come cucinare, riparare oggetti e fare giardinaggio, oltre ad altre forme di manipolazione quotidiana, senza alcun robot coinvolto.
Il progetto EgoScale di NVIDIA, pubblicato nel febbraio 2026 con collaboratori della UC Berkeley e della University of Maryland, ha preaddestrato una policy visione-linguaggio-azione su 20.854 ore di video in soggettiva di esseri umani, acquisiti con guanti dotati di tracciamento del movimento: una quantità oltre 20 volte superiore a quella dei precedenti tentativi di preaddestramento basati su video di esseri umani.
Lo studio ha rilevato una chiara legge di scala log-lineare tra la quantità di dati usati nel preaddestramento e le successive prestazioni del robot — una prima prova che le policy robotiche migliorano in modo prevedibile con l’aumentare dei dati, come accade ai modelli linguistici — e la policy risultante ha superato del 54% una baseline priva di preaddestramento su una mano robotica destrezza a 22 gradi di libertà.

Il world model V-JEPA 2 di Meta ha seguito un approccio affine ma distinto: preaddestramento su circa un milione di ore di video generici tratti da internet per apprendere un’intuizione delle leggi fisiche, poi fine-tuning su meno di 62 ore di filmati specifici di robot ricavati da DROID. Il sistema risultante, V-JEPA 2-AC, impiegato zero-shot su bracci robotici Franka in due laboratori distinti in cui non aveva mai operato, ha raggiunto una percentuale di successo del 65-80% nei compiti di prelievo e posizionamento, immaginando circa 16 secondi di conseguenze prima di agire, senza aver prima raccolto neppure un fotogramma di dati in nessuno dei due laboratori.
Il divario tra simulazione e realtà: perché gli oggetti speculari e trasparenti continuano a mettere in crisi le policy
Nessuna di queste tre soluzioni ha colmato il divario visivo tra simulazione e realtà, che i ricercatori indicano sempre più spesso come una delle principali cause del fallimento delle policy di manipolazione quando un robot esce dal laboratorio. La randomizzazione del dominio — variare texture, illuminazione e proprietà degli oggetti in un simulatore durante l’addestramento — resta la contromisura più comune, ma non riesce a coprire in modo affidabile le superfici speculari e trasparenti: una ciotola di acciaio inossidabile, un bicchiere, un contenitore di plastica per alimenti.
I motori di rendering progettati per la velocità anziché per l’accuratezza fisica spesso rinunciano al ray tracing. Non riescono quindi a riprodurre il modo in cui la luce si riflette su un piano di lavoro a specchio o si rifrange attraverso l’acqua, e una policy addestrata su immagini così imperfette impara indizi visivi che nella stanza reale non esistono.
I benchmark accademici sul trasferimento dalla simulazione alla realtà hanno misurato cali del tasso di successo nella manipolazione dal 24 al 30% quando una policy addestrata esclusivamente in simulazione incontra telecamere e illuminazione reali. I ricercatori che sviluppano pipeline di rendering basate sulla fisica hanno riscontrato che materiali accurati e un’illuminazione plausibile sono necessari, non facoltativi, per colmare quel divario. La fisica dei corpi deformabili aggrava il problema: la dinamica dei tessuti, la deformazione delle spugne e l’attrito dei cassetti non sono ancora modellati con una fedeltà sufficiente perché una policy di presa addestrata in simulazione funzioni in modo affidabile nel mondo reale.
Il momento GPT-2.5: che cosa finanzia davvero l’ondata di investimenti del 2026
Nell’aprile 2026 Bessemer Venture Partners ha descritto la fase raggiunta dal settore come «il momento GPT-2.5 della robotica»: le capacità sono reali e avanzano rapidamente, e le leggi di scala cominciano a emergere in studi come EgoScale, ma resta ampia la distanza tra una dimostrazione in laboratorio e la soglia del 99,9% di affidabilità sul campo. Physical Intelligence ha rilasciato quattro policy generaliste in diciotto mesi a dimostrazione di questo progresso: π0 ha piegato il bucato e sparecchiato i tavoli dopo un addestramento su 68 compiti distribuiti su sette piattaforme robotiche; π0.7, rilasciata il 16 aprile 2026, dichiara di poter trasferire capacità senza esempi preliminari tra robot di forme diverse — un robot che piega il bucato senza che quel compito gli sia mai stato mostrato — e di poter azionare una macchina per espresso senza ulteriori adattamenti.
I calcoli della stessa Bessemer mostrano perché quella soglia conta: una policy che riesce nel 95% dei casi in ciascuna fase di un compito composto da dieci fasi completa l’intero compito solo nel 60% circa dei casi, un tasso di fallimento che nessun magazzino o stabilimento può sostenere.
Nessuna delle tre soluzioni attuali sostituisce completamente il corpus su scala internet che ha reso possibili i chatbot, e combinarle è ormai la strategia dichiarata di ogni laboratorio di rilievo: simulazione per la locomozione e la scala, teleoperazione per i dati sulla destrezza che solo gli esseri umani possono produrre in modo affidabile, e video egocentrici per le ampie conoscenze a priori del mondo fisico che nessuna delle altre due fonti fornisce a basso costo.
La quarta speranza è che le flotte di robot già impiegate diventino motori di raccolta dati che nessun dataset pubblicato potrebbe eguagliare. L’esperienza di Tesla di quest’anno mostra quanto lentamente ciò avvenga. Durante la conferenza sui risultati del 28 gennaio 2026, Musk ha detto che le diverse centinaia di unità Optimus nelle fabbriche di Tesla servivano soprattutto all’apprendimento e alla raccolta di dati, più che a svolgere lavoro produttivo: motori di raccolta dati in senso letterale, e per ora nient’altro. Tesla non aveva ancora mostrato pubblicamente Optimus Gen 3 nell’agosto 2026, quando ha comunicato agli investitori che il progetto era stato ultimato e che le vendite commerciali avrebbero potuto iniziare «già» nella seconda metà del 2027. Le indicazioni di Musk sono state nette.
«No, la produzione di Optimus sarà estremamente lenta all’inizio, perché tutto è nuovo. Non è come costruire un’auto». — Elon Musk, amministratore delegato, Tesla
XPeng ha avviato una linea automatizzata per la produzione di robot umanoidi a Guangzhou nel settembre 2026 e punta alla produzione su larga scala entro la fine dell’anno: sarebbe la prima flotta abbastanza grande da mettere alla prova la teoria dei motori di raccolta dati. Finché una di queste linee non entrerà in funzione, il corpus continuerà a essere costruito un’ora di lavoro di un braccio robotico alla volta, proprio come aveva descritto Goldberg.