The Pulse
CoreWeave inserisce 504 GPU Vera Rubin in un cluster di sette rack
CoreWeave ha messo in produzione sette rack NVIDIA Vera Rubin NVL72 in due regioni, realizzando un’installazione da 504 GPU. L’azienda afferma che i suoi sistemi software, di rete, raffreddamento e archiviazione sono progettati per far funz

AI.info Team ·
CoreWeave ha messo in produzione sette rack NVIDIA Vera Rubin NVL72 in due regioni: un’installazione che comprende in tutto 504 GPU Rubin, mentre il fornitore di servizi cloud va oltre i sistemi a rack singolo. Il dato, riportato da TechTarget, colloca CoreWeave tra i primi operatori a offrire la più recente piattaforma NVIDIA su scala rack come sistema cloud più ampio, composto da più rack.
CoreWeave ha annunciato l’installazione il 16 settembre 2026, affermando che i clienti possono eseguire attività di addestramento e inferenza su centinaia di GPU Rubin attraverso un unico cluster scale-out. L’azienda punta ai carichi di lavoro di IA agentica, nei quali le chiamate ripetute ai modelli, l’uso di strumenti e i calcoli intermedi possono amplificare i ritardi nella rete, nell’archiviazione e nella gestione dei checkpoint.
Sette rack, 504 GPU e un unico dominio operativo
Ogni rack Vera Rubin NVL72 combina 72 GPU NVIDIA Rubin con 36 CPU Vera, NVIDIA NVLink 6, schede di rete ConnectX-9 SuperNIC e DPU BlueField-4. CoreWeave collega i rack con la rete Ethernet NVIDIA Spectrum-X, estendendo il sistema ad alta larghezza di banda presente all’interno di ciascun rack a una fabric più ampia, in grado di trasportare traffico tra i rack.
«CoreWeave è stato il primo fornitore di servizi cloud per l’IA a convalidare e avviare un sistema Vera Rubin NVL72, dimostrando che questa architettura avanzata su scala rack poteva funzionare come un servizio cloud affidabile e ad alte prestazioni», ha dichiarato Chen Goldberg, vicepresidente esecutiva per prodotto e ingegneria di CoreWeave. «Con Vera Rubin multi-rack, colleghiamo centinaia di GPU Rubin in un unico cluster scale-out».
L’azienda afferma che l’installazione è pensata per supportare l’addestramento di modelli più grandi, l’inferenza impegnativa e i carichi di lavoro di apprendimento per rinforzo. L’obiettivo dichiarato è nascondere ai processi dei clienti i confini fisici tra i rack, in modo che il carico di lavoro si trovi davanti a un unico pool di calcolo convalidato, anziché a un insieme di macchine gestite separatamente.
La rete diventa parte del computer
La descrizione tecnica dell’installazione fornita da CoreWeave illustra una fabric di rete a due livelli, non bloccante, con più rail e piani. Ogni GPU Rubin utilizza due schede di rete ConnectX-9 SuperNIC, che offrono fino a 1,6 terabit al secondo di connettività backend per GPU.
Questa larghezza di banda è destinata ai carichi di lavoro sincronizzati, nei quali le GPU si scambiano dati in continuazione. CoreWeave afferma che la fabric può supportare circa 128.000 GPU per rail, una capacità architetturale che non corrisponde alle dimensioni dell’attuale installazione Rubin dell’azienda. Il fornitore testa inoltre il traffico sulla rete backend, anziché affidarsi soltanto ai collegamenti interni più veloci tra le GPU, usando questo processo per individuare guasti negli switch, nei cavi, nel software e in altri componenti di rete.
Nella sua descrizione tecnica della messa in funzione, CoreWeave afferma di eseguire carichi di lavoro GPU sincronizzati, test simili a quelli di addestramento, prove di stress computazionale e benchmark personalizzati prima che un rack entri in produzione. Il processo di convalida verifica i sistemi completi, senza fermarsi alla diagnostica dei singoli componenti.
Racky e Valvey estendono il controllo oltre i server
CoreWeave ha ampliato la sua piattaforma Mission Control con Racky, un livello di controllo per la gestione dei rack, e Valvey, un sistema programmabile per il controllo del raffreddamento a liquido. Il Rack LifeCycle Controller coordina il rilevamento dell’hardware, gli aggiornamenti del firmware, i metadati, la convalida, l’alimentazione e il raffreddamento, mentre le nuove infrastrutture passano dall’installazione alla produzione.
L’approccio riflette le esigenze fisiche della piattaforma Vera Rubin. Un singolo rack NVL72 include una rete ad alta velocità, un’erogazione di potenza considerevole e un sistema di raffreddamento a liquido progettato per funzionare a 45 gradi Celsius. Su più rack, afferma CoreWeave, una GPU lenta, un collegamento di rete instabile, un’anomalia nel raffreddamento o una configurazione non corrispondente possono influire sulle prestazioni del carico di lavoro complessivo.
Invece di considerare il raffreddamento un’attività separata, affidata alla gestione degli impianti, CoreWeave integra il flusso del liquido refrigerante e il monitoraggio ambientale nello stesso processo operativo usato per il calcolo e la rete. Questo permette agli operatori di confrontare lo stato dei sistemi tra i rack mentre i carichi di lavoro vengono eseguiti sotto carico prolungato.
Le modifiche all’archiviazione puntano a ridurre i ritardi tra le fasi dei modelli
L’annuncio di Vera Rubin include anche due novità per CoreWeave AI Object Storage: l’accelerazione delle scritture tra regioni e un livello Archive a costi inferiori. L’accelerazione delle scritture tra regioni consente a un processo di salvare localmente i checkpoint mentre la piattaforma replica i dati in background in una seconda regione.
CoreWeave afferma che questa funzionalità consente a un cluster Kubernetes di continuare l’addestramento senza aspettare che termini una scrittura remota. Le applicazioni possono utilizzare un unico bucket in più regioni senza modificare il codice, mantenendo coerenti autorizzazioni e regole di conservazione.
Il Local Object Transport Accelerator di CoreWeave, o LOTA, offre una cache gestita sui nodi di CoreWeave Kubernetes Service. CoreWeave afferma che LOTA può fornire letture alla velocità degli NVMe locali, ridurre la latenza di otto volte rispetto alle letture dirette da un cluster di archiviazione tradizionale e raggiungere un throughput fino a 7 GB al secondo per GPU, nelle condizioni di carico di lavoro e di cache appropriate.
«I nostri dataset si estendono su più regioni e non possiamo permetterci che i nostri programmi di addestramento siano dettati dai ritardi nel recupero dei dati tra regioni», ha dichiarato Cécile Robert-Michon, direttrice dell’infrastruttura interna di Cohere. «CoreWeave AI Object Storage ci offre un archivio unificato dei dataset tra regioni, con letture memorizzate nella cache locale, così nulla deve aspettare la rete».
La prova operativa è mantenere in attività, di concerto, 504 GPU
L’annuncio di CoreWeave presenta l’installazione come una sfida infrastrutturale tanto quanto un’implementazione hardware. Il fornitore deve mantenere calcolo, rete, archiviazione, alimentazione, raffreddamento, firmware e software entro gli stessi parametri prestazionali, mentre i processi si estendono su più rack e regioni.
La distinzione è importante perché il dato di 504 GPU descrive la capacità in produzione, non semplicemente il numero di acceleratori installati. La misura concreta è la capacità di un processo di addestramento distribuito o di inferenza di proseguire quando una GPU rallenta, un percorso di rete peggiora o un rack richiede un intervento. Il sistema multi-rack Rubin di CoreWeave è ora progettato intorno a questa prova: sette armadi NVL72 che operano come un unico pool gestito in due regioni.