The Pulse
Skild AI insegna ai robot nuovi compiti a partire da un solo video con NVIDIA
Skild AI afferma che il suo modello di base per la robotica S1 può imparare compiti sconosciuti e articolati in più fasi da un solo video, senza essere riaddestrato. Il modello usa NVIDIA Cosmos, Isaac Lab, Omniverse e TensorRT per la gener

AI.info Team ·
Skild AI afferma che il suo modello di base per la robotica S1 può imparare compiti sconosciuti e di lunga durata da un’unica dimostrazione video, mentre NVIDIA fornisce le risorse di calcolo e gli strumenti di simulazione e gestione dei dati alla base del sistema. L’affermazione mette in discussione il normale flusso di lavoro della robotica industriale, in cui un nuovo prodotto, una diversa disposizione degli impianti o un cambiamento di processo richiedono spesso una nuova raccolta di dati, un riaddestramento e una fase di validazione.
S1 segue un’altra strada: un operatore registra il compito desiderato, fornisce il video al modello come prompt e lascia che il robot traduca la dimostrazione in azioni. Skild afferma che il modello non aggiorna i propri pesi né viene sottoposto a un addestramento successivo specifico per il compito prima di tentare di eseguirlo.
Le aziende hanno reso nota la collaborazione in un articolo pubblicato il 10 settembre sul blog di NVIDIA. Skild ha pubblicato separatamente la propria descrizione tecnica di S1 in agosto, presentando il sistema come un modello che apprende dal contesto per la manipolazione robotica.
La promessa di Skild di imparare da un solo video alla prova della fabbrica
I robot industriali svolgono in genere compiti circoscritti e ripetitivi. Cambiare un componente, spostare una postazione di lavoro o modificare la sequenza di assemblaggio può costringere gli ingegneri a raccogliere nuovi esempi e a mettere a punto una strategia specializzata. Skild sostiene che S1 possa adattarsi a questi cambiamenti partendo da una dimostrazione, anziché da un nuovo ciclo di addestramento.
L’azienda afferma che S1 gestisce compiti sconosciuti della durata massima di 10 minuti e composti da decine di passaggi di manipolazione. Fra gli esempi figurano mettere una pianta in vaso, preparare una frittella, fare il caffè con il metodo pour-over e assemblare un kit. Secondo Skild, questi compiti richiedono al sistema di combinare abilità in sequenze che non comparivano insieme nei dati di addestramento.
«Imparare dall’esperienza, anziché dalla programmazione preventiva, è il salto di qualità che si è verificato nella robotica», afferma Deepak Pathak, cofondatore e amministratore delegato di Skild AI, nell’articolo di NVIDIA. «Le tecnologie NVIDIA Isaac Lab e NVIDIA Cosmos aiutano Skild a creare l’esperienza ampia e diversificata di cui i suoi robot hanno bisogno per imparare in molti scenari e con diverse configurazioni fisiche».
Il 66% di successo nei compiti sconosciuti in più fasi
Skild riferisce per S1 un tasso di successo del 66% per singolo passaggio nei nuovi compiti in più fasi, contro il 9% di un sistema di IA simile guidato da prompt testuali. Il confronto proviene da una valutazione interna dell’azienda e indica un risultato superiore di oltre sette volte, ma non è un benchmark verificato in modo indipendente.
Secondo la descrizione tecnica pubblicata da Skild, i compiti del test duravano da quattro a otto minuti ed erano tratti da una serie di attività esterne alla distribuzione dei dati usati per il preaddestramento del modello. L’azienda ha valutato il successo cumulativo per singolo passaggio e ha fatto intervenire persone per riprendere l’esecuzione dopo gli errori, soprattutto perché, altrimenti, il sistema usato per il confronto non riusciva a completare i compiti sconosciuti più lunghi.
Il vantaggio più marcato dichiarato per il modello emerge nei compiti che non aveva mai incontrato. Skild afferma che i sistemi guidati da prompt testuali hanno raggiunto un tasso di successo del 9% dopo l’addestramento su 100.000 ore di dati, mentre S1 ha raggiunto il 66% apprendendo dal contesto attraverso video, su una valutazione della stessa portata. Nei compiti compresi nella distribuzione dei dati di addestramento, Skild riferisce che S1 ha raggiunto una precisione di circa il 96%.
Un confronto separato stima che una dimostrazione video produca prestazioni simili a quelle ottenute con circa 380 episodi di addestramento successivo. Secondo Skild, raccogliere quegli episodi tramite teleoperazione richiederebbe da 50 a 100 ore per i compiti di lunga durata. La stima deriva dall’interpolazione dei risultati interni dell’azienda, non da uno studio sull’impiego in produzione.
Dalla dimostrazione con una pianta in vaso all’assemblaggio di Blackwell
Secondo Skild, il test più rapido dal video dimostrativo all’esecuzione ha riguardato la messa in vaso di una pianta. Il team ha registrato un unico video dal punto di vista di una persona alle 9:22 di sera e S1 ha iniziato l’esecuzione autonoma sul robot alle 9:27 di sera. La cronologia pubblicata dall’azienda indica un intervallo complessivo di 11 minuti tra la registrazione della dimostrazione e l’esecuzione da parte del robot, compresa la preparazione dell’ambiente.
Secondo le aziende, il modello ha gestito anche i cambiamenti durante l’esecuzione. Skild afferma che S1 può reagire quando gli oggetti vengono spostati, riprendersi dagli errori e usare oggetti sostitutivi con funzioni simili. La sua pubblicazione tecnica descrive esempi in cui il robot cambia il modo in cui annaffia una pianta o riempie un bicchiere quasi pieno, invece di copiare meccanicamente la dimostrazione.
L’obiettivo commerciale è meno scenografico che girare una frittella. Skild, NVIDIA e Foxconn stanno impiegando Skild Brain su manipolatori a due bracci per l’assemblaggio ad alta precisione dei sistemi NVIDIA Blackwell. In una procedura dimostrata, un robot deve installare una barra collettrice e un blocco di arresto, serrare 16 viti e reagire quando la situazione differisce dal piano iniziale.
Skild afferma inoltre di essere al lavoro per impiegare S1 presso Sumitomo Wiring Systems in processi di produzione di cablaggi che l’azienda descrive come finora difficili da automatizzare. Nell’aggiornamento sulla propria attività del 10 settembre, Skild afferma di avere più di 60 clienti paganti e di aver superato un ritmo di fatturato ricorrente annuo di 100 milioni di dollari 10 mesi dopo il suo primo impiego commerciale.
NVIDIA fornisce gli strumenti per l’addestramento e la simulazione
Il ruolo di NVIDIA va oltre le GPU usate per addestrare S1. Le aziende affermano che Skild usa i modelli NVIDIA Cosmos per diversificare i dati di addestramento e convertire i video in descrizioni strutturate, mentre Cosmos Curator aiuta a organizzare e filtrare i dati.
Skild usa anche le librerie NVIDIA Omniverse e Isaac Sim per creare ambienti virtuali basati sulla fisica, verificare condizioni insolite e validare il comportamento del robot prima dell’impiego operativo. Isaac Lab fornisce il framework per l’apprendimento per rinforzo, mentre il motore fisico Newton modella forze, contatti, collisioni e pressione nel tentativo di ridurre la distanza tra simulazione e robot fisico.
Le due aziende stanno sviluppando insieme risolutori di simulazione accelerati da GPU per il contatto dei robot, la presa e la manipolazione degli oggetti. NVIDIA afferma che questi risolutori saranno in futuro disponibili anche ad altri sviluppatori tramite Newton. Gli strumenti Nsight aiutano a individuare i colli di bottiglia nell’addestramento, mentre TensorRT viene usato per ottimizzare l’inferenza affinché i robot rispondano in tempo reale.
L’impiego operativo è la prova che S1 deve ancora superare
Skild pone l’impiego operativo al centro della propria strategia di valutazione. L’azienda avverte che un video in cui un robot riesce a svolgere un compito può nascondere se il sistema funzioni nel 5%, nel 10% o nel 99% dei casi, perché un team può ripetere una dimostrazione finché non ottiene una buona registrazione.
Per S1, la distinzione è importante. Un prompt costituito da un solo video può ridurre il tempo necessario per configurare un nuovo compito, ma le fabbriche richiedono comunque tempi di ciclo prevedibili, un comportamento sicuro nel recupero dagli errori e affidabilità con attrezzature, materiali e operatori diversi. Skild afferma che i suoi impieghi commerciali sono pensati per far confluire l’esperienza acquisita nel modello generale, laddove gli accordi con i clienti lo consentano.
Le prove disponibili per ora combinano risultati di benchmark interni e primi impieghi industriali, non dati pubblici sulle prestazioni mantenute nel tempo in produzione presso l’insieme dei clienti dell’azienda. Per il momento, la proposta più concreta di S1 è precisa: mostrare al robot un nuovo compito in più fasi, evitare un nuovo ciclo di fine-tuning e passare dalla dimostrazione all’esecuzione sul robot in pochi minuti, anziché dopo settimane di preparazione specifica per il compito.