Vai al contenuto
AI.info

The Pulse

Subconscious raccoglie 5,1 milioni di dollari, sostiene di ridurre dell’80% i costi degli agenti

Subconscious ha raccolto 5,1 milioni di dollari per commercializzare una piattaforma di inferenza per agenti di IA di lunga durata. La startup di Cambridge, Massachusetts, afferma che la compressione dinamica del contesto può ridurre i cost

Subconscious raccoglie 5,1 milioni di dollari, sostiene di ridurre dell’80% i costi degli agenti

AI.info Team ·

Subconscious annuncia un finanziamento di 5,1 milioni di dollari il 22 settembre 2026, mentre la startup di Cambridge, Massachusetts, lancia una piattaforma di inferenza progettata per agenti di IA che operano su migliaia o milioni di token.

L’azienda afferma che il suo runtime può ridurre i costi fino all’80% per gli agenti che elaborano più di 200.000 token, completando al contempo le attività due volte più velocemente e ampliando la finestra di contesto effettiva dei modelli esistenti a oltre 5 milioni di token. MassVentures guida i round pre-seed e seed, con la partecipazione, tra gli altri, di Foothill Ventures, Underscore VC, E14 Fund, Oakseed Ventures e Agent Fund.

Subconscious descrive il prodotto come un livello di inferenza, anziché come un altro framework per agenti. Il suo sistema combina la compressione dinamica del contesto con una cache progettata per preservare le informazioni utili mentre un agente affronta lunghe sequenze di chiamate agli strumenti. L’azienda afferma che i team di ingegneria possono utilizzare il servizio tramite un’implementazione cloud gestita oppure eseguirlo sulle proprie GPU.

Subconscious punta ai costi delle lunghe tracce degli agenti

Gli agenti di lunga durata creano un problema infrastrutturale complesso: ogni nuovo passaggio può aggiungere al contesto del modello risultati degli strumenti, istruzioni e lavoro intermedio. I sistemi di inferenza standard elaborano ripetutamente gran parte di quella cronologia, aumentando la latenza e i costi dei token man mano che l’attività prosegue.

Subconscious afferma che il suo runtime rimuove durante l’inferenza il materiale meno utile, conservando le informazioni necessarie nei passaggi successivi. L’azienda presenta questa tecnica come un modo per ridurre la quantità di contesto che il modello deve elaborare, senza richiedere modifiche all’hardware, al modello o all’applicazione sottostanti.

Per i carichi di lavoro che superano i 200.000 token, Subconscious sostiene che la sua piattaforma può completare le attività due volte più velocemente, estendere il contesto effettivo oltre i 5 milioni di token, migliorare i risultati tra l’1% e il 10% in benchmark selezionati di programmazione e flussi di lavoro e ridurre i costi fino all’80%. Si tratta di risultati dichiarati dall’azienda, non di una valutazione indipendente.

I benchmark mostrano costi inferiori nelle attività di programmazione più lunghe

Nel benchmark TriE, che Subconscious usa per misurare le prestazioni del sistema, l’azienda afferma che il suo runtime ha completato le attività due volte più velocemente di SGLang e ha supportato un numero di richieste simultanee 2,3 volte superiore. La startup sostiene che una maggiore concorrenza consenta allo stesso cluster di GPU di gestire più lavoro degli agenti.

Subconscious riporta anche i risultati ottenuti con DeepSWE, un benchmark per attività di programmazione lunghe. GLM 5.2 servito tramite il suo runtime ha risolto il 46% dei problemi con un costo medio di 2,79 dollari, rispetto a un tasso di successo del 44% e a un costo medio di 3,92 dollari per lo stesso modello su un’infrastruttura di inferenza standard.

Il confronto combina accuratezza e costo, ma l’annuncio non fornisce una metodologia indipendente completa, una descrizione dettagliata dell’hardware o una verifica da parte di terzi. Subconscious attribuisce la differenza al suo sistema di compressione e caching.

Un team di ingegneria di 20 persone ha ridotto la spesa mensile per l’IA

L’azienda afferma che a luglio un team di ingegneria di 20 persone è passato da Claude a GLM 5.2 ospitato su Subconscious. Nei due mesi successivi, la spesa mensile del team per l’IA è scesa da 40.000 a 6.000 dollari, mentre gli ingegneri hanno segnalato una maggiore velocità di elaborazione dei token e nessun problema di limiti di utilizzo, secondo l’annuncio.

Una traccia di un agente ha raggiunto 4.571 turni e ha effettuato 9.556 chiamate agli strumenti. Subconscious afferma che la traccia ha registrato 449 milioni di token sul suo sistema, rispetto ai 2,6 miliardi di token che un runtime convenzionale avrebbe addebitato, con una riduzione dell’82%. L’azienda afferma che il team di ingegneria non ha segnalato alcuna perdita di capacità del modello nonostante la compressione.

Subconscious non identifica il team di ingegneria nell’annuncio del finanziamento. L’esempio costituisce quindi un caso di studio riportato da un cliente, anziché un riferimento a un cliente identificato per nome.

I modelli aperti sono al centro del lancio

La piattaforma è progettata intorno a modelli aperti, tra cui GLM 5.2, e supporta applicazioni popolari per agenti come Claude Code, Codex, Pi, Copilot e OpenCode. Subconscious afferma che i team possono collegare questi strumenti tramite la sua interfaccia a riga di comando in circa 30 secondi.

Jack O’Brien, cofondatore e CEO di Subconscious, inquadra il prodotto alla luce di un cambiamento nell’economia dell’implementazione degli agenti. «Quest’estate i modelli aperti sono finalmente diventati abbastanza validi da non rappresentare più un compromesso rispetto alla qualità dei modelli proprietari», afferma. «Nel frattempo, ogni team di ingegneria con cui parlo ha fissato un tetto alla spesa per sviluppatore».

O’Brien aggiunge che Subconscious esegue modelli aperti in un modo progettato per gli agenti di programmazione, consentendo ai team di ridurre la spesa e di far funzionare gli agenti più a lungo. La proposta dell’azienda dipende dal funzionamento congiunto di entrambi gli elementi: il solo accesso a modelli meno costosi non risolverebbe i costi legati alla ripetizione del contesto, che aumentano nel corso delle attività più lunghe.

MassVentures sostiene una strategia incentrata sull’inferenza

Stacy Swider, vicepresidente degli investimenti di MassVentures, afferma che il fondo considera Subconscious un team concentrato su uno dei problemi infrastrutturali più complessi degli agenti di IA. «Non potremmo essere più entusiasti di partecipare alla loro crescita mentre si espandono per supportare migliaia di aziende e miliardi o persino migliaia di miliardi di agenti di IA», afferma Swider.

Il finanziamento fornisce a Subconscious il capitale per ampliare un prodotto nato da ricerche del MIT sulla progettazione di modelli e runtime. In precedenza, l’azienda aveva presentato la famiglia di modelli di inferenza TIM e il runtime TIMRUN, che, afferma, sono progettati per gestire il ragionamento su orizzonti temporali lunghi, l’uso di strumenti e il recupero del contesto.

Subconscious afferma che la piattaforma è già disponibile tramite il suo servizio ospitato, con implementazioni autogestite per le aziende che vogliono eseguire il sistema sulla propria infrastruttura o mantenere i carichi di lavoro completamente isolati dalle reti esterne. Il suo obiettivo commerciale immediato sono gli agenti di programmazione, per i quali le lunghe tracce e le chiamate ripetute agli strumenti rendono particolarmente evidenti i costi di inferenza.

Fonte

Esplora

Altri articoli