The Pulse
Figure afferma che Helix 2.5 ha operato in 30 case mai viste prima
Figure afferma che il suo sistema umanoide Helix 2.5 ha svolto tre attività domestiche in 30 case della Bay Area mai viste prima, senza raccogliere nuovi dati né adattare il modello in quelle abitazioni.

AI.info Team ·
Figure afferma che il suo sistema umanoide Helix 2.5 ha svolto tre attività domestiche in 30 case della Bay Area mai viste prima, senza raccogliere nuovi dati né adattare il modello in quelle abitazioni. L’azienda definisce il risultato del 17 settembre 2026 la sua prima dimostrazione su larga scala della capacità di generalizzazione dell’intero corpo di un umanoide in case mai viste prima.
La valutazione ha riguardato il riordino del soggiorno, la piegatura degli asciugamani e il rifacimento del letto. Figure afferma che Helix 2.5 ha utilizzato un unico modello fondazionale, preaddestrato su Index, il dataset aziendale sul comportamento umano, e poi adattato alle tre attività con dati raccolti al di fuori delle case di prova. Il robot doveva lavorare con i mobili già presenti in ogni abitazione e con oggetti che non comparivano nei dati di specifica delle attività.
Trenta case, tre attività, nessun nuovo addestramento sul posto
Nell’esperimento Figure definisce «zero-shot» in senso stretto: durante l’addestramento il robot non aveva mai visto gli ambienti di valutazione né gli oggetti che avrebbe manipolato, e non sono stati usati dati di rollout provenienti da quelle case per scegliere o aggiornare il checkpoint. Per ciascuna attività è stato utilizzato un unico modello fisso in tutte e 30 le case.
Per ottenere un esito positivo era inoltre necessario completare l’intera attività, senza ricevere credito per i progressi parziali. Per riordinare il soggiorno, il robot doveva raccogliere tutti i 13-15 giocattoli presenti nella scena e metterli in un cestino. Per piegare gli asciugamani, doveva piegarli tutti e metterli nel cestino. Per rifare il letto, entrambi i cuscini e gli angoli del piumone dovevano arrivare in cima al letto, con il piumone ben disteso.
Queste attività costringono la macchina a combinare locomozione, percezione visiva, presa, manipolazione a due mani e posizionamento del corpo. Un robot non può trattare il lavoro come una routine fissa da tavolo: deve individuare gli oggetti, muoversi in stanze con spazi limitati, regolare la propria postura e recuperare quando un’azione non va come previsto.
Il preaddestramento su Index è alla base del miglioramento dichiarato
Figure ha condotto uno studio di ablazione per isolare l’effetto del preaddestramento su Index rispetto a quello dei dati di addestramento specifici per le attività. L’azienda ha addestrato due policy con gli stessi dati a valle, la stessa architettura, le stesse impostazioni di ottimizzazione e le stesse procedure di valutazione. Una partiva da pesi casuali; l’altra dal modello Helix 2.5 preaddestrato su Index.
Nelle valutazioni in cieco di Figure, la policy addestrata da zero ha avuto successo nel 9% delle prove zero-shot. Quella preaddestrata su Index ha avuto successo nel 56% dei casi, un risultato che l’azienda descrive come più di sei volte superiore. Figure afferma che nessuna singola attività di valutazione rappresentava più dell’1,90% del dataset di preaddestramento Index.
Il risultato sostiene la tesi di Figure secondo cui i dati ampi sul comportamento umano, più che le sole dimostrazioni delle attività, forniscono gran parte della capacità del modello di trasferire un comportamento appreso a un nuovo contesto fisico. L’azienda non presenta il dato del 56% come una soluzione alla robotica domestica; afferma anzi che la robotica umanoide generale non è ancora risolta.
La metà dei dati di adattamento per una prova più ampia
Figure ha inoltre confrontato Helix 2.5 con una precedente policy, Helix 02, addestrata per la stessa attività. Helix 02 si basava su dati raccolti direttamente nell’ambiente in cui veniva valutata. Figure afferma che Helix 2.5 ha eguagliato il tasso di successo di quella policy usando la metà dei dati di adattamento, per poi operare in 30 case mai viste prima.
L’azienda sottolinea l’autocorrezione come differenza qualitativa. Nella sua descrizione, il robot fa un passo indietro per riposizionarsi, cambia postura e si sposta intorno al letto quando occorre correggere una piega. Questi comportamenti sono importanti perché le attività domestiche più lunghe accumulano piccoli errori, soprattutto quando mobili e oggetti sono disposti diversamente da una casa all’altra.
Una tesi sulla scalabilità basata sui video di persone
Figure ha addestrato quattro modelli su sottoinsiemi annidati di Index, con un aumento di otto volte dei dati di preaddestramento, mantenendo costanti le dimensioni del modello e l’addestramento a valle. Ogni modello è stato sottoposto a fine-tuning sugli stessi dati delle attività e valutato usando la stessa loss di previsione dell’azione successiva su dati tenuti da parte.
L’azienda riferisce che la loss è diminuita in modo prevedibile a ogni raddoppio dei dati di Index. Usando gli esperimenti di addestramento più piccoli, Figure afferma di aver previsto la loss sul test set dell’esperimento più grande fino alla quarta cifra decimale, prima di condurlo. L’errore di previsione è stato pari allo 0,54% della variazione osservata nell’intero intervallo, con dati aumentati di otto volte.
Questo esperimento misura soltanto la scalabilità dei dati. Non stabilisce in che modo le variazioni delle dimensioni del modello, della potenza di calcolo o dell’addestramento a valle influirebbero sulle prestazioni. Figure presenta il risultato come prova del fatto che il trasferimento dall’essere umano al robot potrebbe essere abbastanza prevedibile da orientare le future decisioni sulla raccolta dei dati e sull’addestramento.
Il prossimo collo di bottiglia per Figure è la scala
Figure afferma che Index genera ora circa 35 minuti di nuove esperienze umane al secondo e che l’azienda ha stanziato 3,5 miliardi di dollari in capacità di calcolo per addestrare Helix. La strategia dichiarata è apprendere più comportamenti fisici prima che un robot entri in una nuova casa, riducendo la necessità di raccogliere dimostrazioni in ogni ambiente di impiego.
Il tasso di successo del 56% dichiarato per Helix 2.5 lascia comunque incompleta una quota consistente di prove rigorose in cui conta solo il completamento integrale. Il risultato è significativo perché la prova va oltre una stanza controllata: un unico checkpoint deve affrontare disposizioni degli spazi, mobili e oggetti mai visti, coordinando al tempo stesso l’intero corpo del robot. Per ora, la rivendicazione concreta di Figure è più limitata di quella di una macchina pronta per le case: tre comportamenti specifici, 30 case mai viste e nessun adattamento sul posto.