The Pulse
Cirrascale lancia una piattaforma di inferenza in produzione per più acceleratori
Cirrascale Cloud Services ha rilasciato una piattaforma di inferenza in produzione che instrada i modelli tra gli acceleratori di NVIDIA, AMD, Qualcomm e Tenstorrent. La piattaforma aggiunge hosting privato dei modelli, fine-tuning, control

AI.info Team ·
«Fin dal primo giorno, i clienti possono usare applicazioni funzionanti, controllare la spesa e applicare misure di sicurezza agli agenti, il tutto in un ambiente privato e sull’acceleratore più adatto al loro carico di lavoro.»
Alex Nataros, direttore tecnico, Cirrascale Cloud Services
Cirrascale Cloud Services ha rilasciato la versione in produzione della sua Cirrascale Inference Platform, uno stack privato di IA per le aziende, progettato per instradare i carichi di lavoro tra gli acceleratori di NVIDIA, AMD, Qualcomm e Tenstorrent. L’azienda ha annunciato il rilascio il 15 settembre 2026, all’AI Infra Summit di Santa Clara, in California.
La piattaforma combina distribuzione dei modelli, instradamento, selezione degli acceleratori, controlli di sicurezza e strumenti per le applicazioni in un’unica console web. Cirrascale afferma che i clienti possono eseguire modelli open source, modelli privati ed ecosistemi di modelli chiusi, incluso Google Gemini, fornito in locale tramite Google Distributed Cloud e gestito da Cirrascale.
Un’unica console per modelli, applicazioni e controlli
Cirrascale punta a sistemi di ricerca, chatbot, copiloti per l’ambiente di lavoro, servizi agentici, assistenti di programmazione, sistemi di intelligenza documentale e generazione di video. La sua piattaforma collega queste pipeline ai dati e ai servizi aziendali esistenti, sia negli ambienti locali sia nelle infrastrutture degli hyperscaler.
L’azienda offre un’applicazione di chat privata collegata alla base di conoscenze di un’organizzazione, controlli per gestire il consumo di IA per team e misure di sicurezza per i carichi di lavoro agentici. Cirrascale afferma che il modello di distribuzione supporta, ove applicabile, requisiti in linea con HIPAA, SOC 2 e FedRAMP.
«Le aziende non hanno più difficoltà a mettere in funzione l’endpoint di un modello», ha detto Nataros. «La difficoltà sta in tutto quello che gli ruota attorno: governance, controllo dei costi e messa a disposizione dei dipendenti di un’applicazione sicura».
Instradamento tra quattro produttori di acceleratori
Il livello della piattaforma che seleziona modelli e hardware è pensato per separare la scelta del modello da un impegno vincolante verso una specifica infrastruttura. Cirrascale afferma di poter instradare automaticamente ogni richiesta verso il modello più adatto e selezionare un acceleratore disponibile, senza richiedere modifiche al codice dell’applicazione quando cambia l’hardware.
I produttori di acceleratori supportati e citati nel comunicato sono NVIDIA, AMD, Qualcomm e Tenstorrent. L’azienda afferma che il livello di ottimizzazione è progettato per aumentare la velocità di elaborazione, mantenere stabile la latenza all’aumentare della domanda ed eseguire modelli più grandi sui sistemi esistenti, rendendo al contempo più prevedibile il costo per token.
Nel comunicato Cirrascale non pubblica risultati di benchmark, prezzi né un elenco dettagliato dei modelli di acceleratori. Il rilascio presenta invece la scelta dell’hardware come una funzionalità operativa per le organizzazioni che vogliono confrontare combinazioni di modelli e acceleratori all’interno di un unico servizio.
Fine-tuning privato e distribuzione aziendale
Secondo Cirrascale, i clienti possono fare fine-tuning dei modelli sui dati privati senza trasferirli al di fuori del proprio ambiente. I modelli risultanti possono essere distribuiti tramite la stessa piattaforma e gli stessi endpoint usati per gli altri carichi di lavoro.
L’azienda afferma inoltre che il servizio in produzione comprende operazioni in più regioni, consentendo alle pipeline aziendali di collegarsi ai dati e ai servizi nelle località in cui sono già in esecuzione. Cirrascale presenta questa soluzione come un’alternativa alla creazione di livelli separati di inferenza, governance e applicazioni attorno alla capacità grezza degli acceleratori.
La scommessa di Cirrascale sulla scelta dell’infrastruttura
Dave Driggers, amministratore delegato e cofondatore di Cirrascale, ha presentato il prodotto come una risposta al modo in cui i servizi di IA sul cloud legano in genere i modelli all’hardware del proprio provider.
«Scelgono il modello e noi lo eseguiamo sull’hardware più adatto, in un ambiente privato e a un prezzo che il direttore finanziario può pianificare», ha detto Driggers.
La Cirrascale Inference Platform è disponibile nelle regioni statunitensi e internazionali dell’azienda. Il rilascio segna il passaggio dalla precedente fase di anteprima della piattaforma a un servizio in produzione incentrato sulla selezione di acceleratori di più produttori, sulla distribuzione privata e sui controlli software necessari per gestire l’inferenza aziendale.