Vai al contenuto
AI.info

The Pulse

Gimlet Labs raccoglie 300 milioni di dollari per l’inferenza IA su chip diversi

Gimlet Labs ha raccolto 300 milioni di dollari in un round di Serie B guidato da Andreessen Horowitz per il suo cloud di inferenza su chip di diversi tipi. La startup di San Francisco afferma di avere miliardi di dollari di ricavi contrattu

Gimlet Labs raccoglie 300 milioni di dollari per l’inferenza IA su chip diversi

AI.info Team ·

Il 4 settembre Gimlet Labs ha annunciato un round di Serie B da 300 milioni di dollari, destinato a sostenere il suo progetto di eseguire l’inferenza dell’IA su diversi tipi di processori, invece di costruire data center basati soltanto sulle GPU.

Il round è stato guidato da Andreessen Horowitz e comprende Sapphire Ventures, Menlo Ventures, 645 Ventures, Arm, Eclipse, Emergence, Factory, Hudson River Trading, M12, OnePrime Capital, Prosperity7, QuantumLight, Samsung Ventures, Tiger Global Management, Triatomic, Wing Ventures e XTX Markets. Un comunicato sul finanziamento diffuso dall’azienda valuta Gimlet 3 miliardi di dollari e indica in 392 milioni di dollari il totale dei finanziamenti raccolti.

Gimlet afferma di aver aggiunto miliardi di dollari di ricavi contrattualizzati dal round di Serie A da 80 milioni di dollari dello scorso marzo e di stare ampliando la capacità gestita, con l’obiettivo di raggiungere centinaia di megawatt. Secondo l’azienda, i nuovi fondi serviranno a sostenere il suo cloud di inferenza, le attività infrastrutturali e le assunzioni.

La scommessa di Gimlet da 300 milioni di dollari sull’hardware misto

L’argomento centrale di Gimlet è che l’inferenza non richiede lo stesso tipo di hardware in ogni fase. La fase di prefill di una chiamata al modello è in genere intensiva dal punto di vista computazionale, mentre la fase di decodifica dipende maggiormente dalla larghezza di banda della memoria. I sistemi agentici aggiungono ulteriori variabili, concatenando chiamate al modello con recupero di informazioni, esecuzione di codice e uso di strumenti esterni.

Il software dell’azienda traccia e scompone i carichi di lavoro, quindi ne pianifica le diverse parti su GPU, unità di calcolo vicino alla memoria, architetture dataflow e CPU. Gimlet afferma che il suo sistema può distribuire un modello su più acceleratori, separare il prefill dalla decodifica e riequilibrare il lavoro quando una categoria di processori raggiunge la capacità massima.

«Siamo arrivati a un punto di svolta: l’inferenza è ormai il carico di lavoro dominante nell’IA e la domanda di token è esplosiva», ha dichiarato Zain Asgar, cofondatore e amministratore delegato di Gimlet Labs. «Con Gimlet, i nostri clienti riescono a elaborare enormi volumi di token con una latenza molto bassa, anche mentre i loro carichi di lavoro legati all’IA continuano a crescere sotto ogni aspetto».

L’azienda dichiara di ottenere accelerazioni da 5 a 10 volte a parità di potenza assorbita, oppure miglioramenti comparabili della capacità di elaborazione a parità di latenza. Nel comunicato sul finanziamento, il prodotto è descritto come un cloud multi-silicio progettato appositamente per l’inferenza, anziché come un cluster di addestramento riadattato.

Energia, latenza e limiti dell’espansione basata solo sulle GPU

Il finanziamento di Gimlet arriva mentre le aziende di IA si scontrano con vincoli che vanno oltre la disponibilità di chip. L’energia dei data center, i collegamenti alla rete elettrica, il raffreddamento e la disponibilità di memoria incidono tutti sulla rapidità con cui i fornitori possono aumentare la capacità di inferenza. Gimlet cita circa 18 gigawatt di capacità dei data center per l’IA assorbiti nel 2025 e afferma che la cifra potrebbe triplicare entro il 2030.

L’azienda afferma inoltre che la generazione mensile di token è aumentata di sei volte nell’ultimo anno. Secondo Gimlet, gli operatori possono elaborare più richieste con un budget energetico fisso assegnando ciascuna fase di un carico di lavoro all’hardware più adatto, invece di far passare ogni fase dallo stesso acceleratore.

Nel comunicato sul finanziamento, Raghu Raghuram, managing partner di Andreessen Horowitz, che entrerà nel consiglio di amministrazione di Gimlet, ha descritto l’investimento come una risposta ai limiti fisici che l’infrastruttura dell’IA si trova ad affrontare.

«La domanda di IA cresce in modo esponenziale, mentre i data center e il silicio non riescono a tenere il passo. La risposta non è semplicemente più infrastruttura: serve un’architettura migliore».

Raghu Raghuram, managing partner, Andreessen Horowitz

La nota d’investimento di Andreessen Horowitz afferma che il sistema di Gimlet può indirizzare modelli e strumenti verso processori diversi, separare il prefill dalla decodifica e suddividere un modello a livello di layer o di singola operazione. La società afferma che l’azienda ha già implementato il suo approccio presso un laboratorio di frontiera e un hyperscaler, senza però fare il nome di nessuno dei due clienti.

Dalla Serie A a centinaia di megawatt

Gimlet ha raccolto il suo round di Serie A a marzo, guidato da Menlo Ventures, e all’epoca ha dichiarato che la sua base di clienti era triplicata, includendo un importante laboratorio di frontiera e un hyperscaler. La startup è uscita dalla fase stealth nell’ottobre 2025 con l’obiettivo dichiarato di rendere più efficienti i carichi di lavoro dell’IA ampliando la gamma di risorse di calcolo utilizzabili.

La startup afferma ora che la sua architettura supporta i chip di NVIDIA, AMD, Intel, Arm, Cerebras e d-Matrix. Sapphire Ventures, che ha partecipato al round di Serie B, afferma che Gimlet sta ampliando la propria infrastruttura eterogenea fino a raggiungere centinaia di megawatt e si è assicurata miliardi di dollari di ricavi contrattualizzati.

Questa affermazione evidenzia la grande distanza tra una dimostrazione software e un servizio di inferenza operativo su scala industriale. Il supporto di più architetture di chip richiede compilatori, ambienti di esecuzione, reti, sistemi di pianificazione, impianti elettrici e soluzioni di raffreddamento capaci di tenere conto delle diverse esigenze dei dispositivi. Andreessen Horowitz osserva che persino le temperature dell’acqua in ingresso possono variare da un sistema di acceleratori all’altro.

La prova decisiva è l’utilizzo, non la cifra raccolta

Gimlet propone una soluzione basata sull’efficienza in un momento in cui aggiungere capacità è costoso e difficile da collegare alla rete elettrica. Il suo sistema deve dimostrare che i vantaggi dello spostamento del lavoro da un processore all’altro superano la complessità aggiuntiva di gestire un insieme eterogeneo di dispositivi.

Nel suo annuncio, l’azienda afferma che i carichi di lavoro possono essere pianificati in base ai requisiti dei livelli di servizio e all’hardware disponibile, riassegnando la capacità inutilizzata quando cambia la domanda. Questo approccio potrebbe rivelarsi particolarmente importante per i carichi di lavoro agentici, in cui una singola richiesta dell’utente può generare decine di chiamate sequenziali al modello e la latenza si accumula a ogni passaggio.

Gimlet afferma di collaborare con laboratori di frontiera e altri grandi utilizzatori di inferenza e di voler estendere l’accesso oltre la sua attuale base di clienti. L’obiettivo immediato dell’espansione non è un nuovo modello o chip, ma l’aumento della capacità gestita del cloud di inferenza che l’azienda sviluppa sin dal lancio.

Fonte

Esplora

Altri articoli