Vai al contenuto
AI.info

The Pulse

Cognition porta Fusion, il suo sistema di programmazione a due modelli, su Devin Desktop e CLI

Cognition ha lanciato Fusion su Devin Desktop e Devin CLI, affiancando a un modello di frontiera «guida» un assistente dedicato all’esecuzione. Secondo l’azienda, il sistema riduce il costo per attività fino al 46% su alcuni benchmark di pr

Cognition porta Fusion, il suo sistema di programmazione a due modelli, su Devin Desktop e CLI

AI.info Team ·

46% è la massima riduzione del costo per attività che Cognition dichiara per Fusion, il suo sistema di programmazione a due modelli, nel benchmark DeepSWE 1.1. Il dato riguarda una configurazione che abbina Fable 5.1 come modello guida a SWE-2 di Cognition come assistente: Fusion ha ottenuto un punteggio di 63,1 contro 64,3 di Fable da solo, mentre il costo medio per attività è sceso da 14,63 a 7,88 dollari. Cognition ha lanciato Fusion su Devin Desktop e Devin CLI l’11 settembre, portando sulle postazioni di lavoro locali degli sviluppatori un’architettura già disponibile nel suo prodotto cloud.

Fusion non è un nuovo modello di base. È un sistema che coordina due agenti con compiti diversi: un modello più capace e costoso pianifica il lavoro, risolve le ambiguità e verifica il risultato, mentre un modello meno costoso esamina il codice, apporta modifiche, esegue i test e restituisce i risultati. Cognition parte dall’idea che gli agenti di programmazione non abbiano bisogno delle capacità di ragionamento di un modello di frontiera a ogni passaggio, ma che affidare un’intera attività a un modello più economico rischi di far mancare il giudizio necessario per una modifica destinata alla produzione.

Il lancio arriva un giorno dopo la presentazione di SWE-2, il modello di programmazione che Cognition raccomanda come assistente per l’esecuzione in Fusion. Insieme, i due lanci mostrano che Cognition punta non soltanto su singoli modelli di programmazione migliori, ma anche sul livello software che decide come ripartire il lavoro tra quei modelli. Per i team di ingegneria che pagano per token o per attività completata da un agente, il risultato potrebbe contare quanto un modesto aumento dell’accuratezza nei benchmark.

Fusion separa la pianificazione dall’esecuzione

Gli utenti di Devin che selezionano Fusion scelgono due modelli anziché uno. Cognition chiama il modello di frontiera «guida» e il modello meno costoso «assistente», e raccomanda Fable 5.1 e SWE-2 come combinazione preferita. Il modello guida controlla la sessione, definisce il piano, interpreta i requisiti poco chiari e verifica il risultato; l’assistente riceve istruzioni mirate, con vincoli e criteri di successo.

Secondo Cognition, questa divisione evita un limite comune del semplice instradamento tra modelli. Un prompt che chiede di correggere un bug non rivela se il lavoro richieda una modifica di una riga o una riprogettazione che coinvolge l’intera base di codice. La difficoltà cambia anche dopo che un agente inizia a esaminare i repository, riprodurre i malfunzionamenti ed eseguire i test: decidere una volta per tutte di affidare un’attività a un modello economico può quindi rivelarsi una scelta sbagliata quando il lavoro diventa più complesso.

Cognition mantiene invece entrambi gli agenti attivi in parallelo, con contesti persistenti e accesso agli strumenti separati. Anziché trasferire tra i modelli l’intera conversazione e ogni risultato degli strumenti, gli agenti si scambiano brevi istruzioni, risultati e riscontri. Secondo l’azienda, questa soluzione conserva i vantaggi della cache dei prompt, perché ciascun modello continua a lavorare nel proprio contesto invece di ricostruire una lunga cronologia a ogni passaggio di consegne.

Questa organizzazione assegna inoltre al modello guida un ruolo di supervisione continuativa. L’assistente può realizzare una modifica ben delimitata o occuparsi di test e operazioni ripetitive sui repository, ma il modello guida può individuare un approccio errato, chiedere correzioni o subentrare. Cognition sostiene che questa supervisione distingua Fusion da un sistema di instradamento che si limita ad assegnare un intero compito a un modello all’inizio.

Le tabelle dei benchmark mostrano costi inferiori, ma non miglioramenti uniformi

Cognition ha collaborato con Artificial Analysis e Vals AI per valutare Fusion su cinque benchmark per agenti di programmazione. L’azienda presenta i risultati di Fable 5.1 e GPT-6 Astra come modelli guida, ciascuno abbinato a SWE-2. I costi diminuiscono in tutti i confronti pubblicati, ma i punteggi non seguono la stessa direzione in tutti i carichi di lavoro.

Su DeepSWE 1.1, Fusion con Fable 5.1 ha ridotto del 46% il costo per attività riportato, da 14,63 a 7,88 dollari, con un calo del punteggio di 1,2 punti. Fusion con Astra ha ridotto il costo del 40%, da 7,88 a 4,69 dollari, mentre il punteggio è passato da 67,6 a 67,3. Su Terminal-Bench 4, la combinazione con Fable ha consentito un risparmio del 23% e quella con Astra del 40%, anche se entrambe hanno registrato punteggi inferiori rispetto ai rispettivi risultati di riferimento con un solo modello.

Altri risultati mostrano che Fusion eguaglia o supera il punteggio del modello guida. La combinazione Fable-SWE-2 ha ottenuto 65,9 su SWE-Atlas QnA contro 64,8 di Fable da solo, mentre il costo riportato è sceso del 34%, da 7,57 a 5,00 dollari. Su Vals Code Migration, Fusion ha ottenuto 57,3 contro 54,6 di Fable da solo e ha ridotto il costo del 41%, da 70,97 a 42,00 dollari.

Il divario di punteggio più ampio nella tabella va però nella direzione opposta: Astra da solo ha ottenuto 67,7 su Vals Code Migration, mentre abbinato a SWE-2 ha ottenuto 61,3, pur con un calo dei costi del 20%. Questi dati chiariscono i limiti di un’unica affermazione generale sull’efficienza. I risultati pubblicati per Fusion suggeriscono che il sistema possa far risparmiare denaro mantenendo prestazioni vicine a quelle del modello originale in molte attività, ma le prestazioni dipendono dal benchmark, dal modello guida e dal lavoro affidato all’assistente.

La cache dei prompt entra nel calcolo dei costi

La tesi tecnica di Cognition a favore di Fusion si fonda in larga misura sulla cache dei prompt. Le sessioni di programmazione prolungate possono accumulare nel proprio contesto di lavoro repository di grandi dimensioni, output del terminale, registri dei test e tracce della pianificazione. Passare un’attività da un modello a un altro può costringere il nuovo modello a elaborare nuovamente quel materiale, trasformando una scelta di instradamento economica in una costosa mancata corrispondenza nella cache.

Secondo l’azienda, Fusion evita questo costo dando fin dall’inizio a ciascun agente un proprio contesto continuativo. Per valutare una modifica completata, il modello guida non ha bisogno di conoscere ogni comando eseguito dall’assistente; l’assistente, a sua volta, non ha bisogno dell’intera cronologia di pianificazione del modello guida per modificare una parte definita di un repository. Lo scambio sintetico tra gli agenti mira a ridurre le letture duplicate, conservando al tempo stesso informazioni sufficienti per la verifica.

Cognition afferma inoltre che un modello più costoso può ridurre il costo totale se commette meno errori o fornisce istruzioni più chiare. In un confronto, sostituire Opus 4.8 con Fable 5 come modello guida ha ridotto del 9% il costo medio per sessione, nonostante il prezzo dichiarato per token più alto di Fable. Cognition attribuisce il risultato a un’assegnazione più tempestiva dei compiti e a istruzioni migliori da parte di Fable, che hanno ridotto il lavoro ripetuto dall’assistente e quello di verifica svolto dal modello guida.

Lo stesso ragionamento orienta la scelta di SWE-2 rispetto a un modello di esecuzione più economico. Cognition indica per GPT-5.6 Luna un prezzo di listino di 0,20 dollari per milione di token e per SWE-2 di 0,75 dollari per milione di token, con un aumento del 275%. Eppure, secondo i dati dell’azienda, in una configurazione Fusion con Astra come modello guida su FrontierCode 1.1, la versione con SWE-2 ha ottenuto 63,4 a 2,34 dollari per attività, contro 62,0 a 2,39 dollari della versione con Luna.

Ogni coppia di modelli richiede regole operative proprie

Fusion non considera il modello guida e l’assistente componenti intercambiabili. Cognition afferma di mettere a punto il sistema per specifiche coppie di modelli, stabilendo tra l’altro quanto dettagliate debbano essere le istruzioni del modello guida, se l’assistente debba mettere in discussione il piano e quali attività di esplorazione spettino al modello guida. Un assistente meno capace può aver bisogno di istruzioni molto prescrittive, mentre uno più capace può esaminare i dettagli dell’implementazione e contestare un presupposto errato.

Affidare il lavoro all’assistente resta rischioso quando il risultato richiesto è proprio una valutazione. In una precedente analisi di Fusion, Cognition ha descritto una complessa funzionalità React e Redux in cui l’assistente si è occupato del codice, ma non ha colto le sfumature degli obiettivi di prodotto; l’attività è costata meno, ma il punteggio è calato nettamente. Un’altra attività, relativa a una difficile integrazione Java, è andata meglio con l’assistente perché il lavoro consisteva soprattutto nel riutilizzo meccanico di codice a monte.

Questa distinzione conta per gli utenti che valutano gli agenti al di là delle classifiche dei benchmark. Migrazioni meccaniche, dismissioni su larga scala, modifiche ripetitive e lunghe esecuzioni dei test possono adattarsi bene al modello con assistente. Funzionalità di prodotto dai requisiti ambigui, decisioni architetturali e indagini sui bug che servono a stabilire cosa cambiare possono richiedere che il modello guida segua il lavoro più da vicino.

«Il settore deve passare dal massimizzare le metriche di utilizzo al massimizzare i risultati», ha scritto a giugno Scott Wu, cofondatore e amministratore delegato di Cognition, quando l’azienda ha annunciato una garanzia sulla produttività dell’IA per i clienti aziendali.

L’impostazione di Wu aiuta a spiegare perché Cognition dia risalto al prezzo per attività completata anziché al prezzo per token. Fusion chiede agli acquirenti di valutare un agente in base alla sua capacità di produrre una pull request accettabile a un costo inferiore, non soltanto in base al numero di token che consuma. I costi dei benchmark restano tuttavia stime legate a test definiti, e i team dovranno confrontarli con i propri repository, sistemi di build e criteri di revisione.

Devin Desktop porta Fusion nel flusso di lavoro locale

Fusion era già operativo in Devin Cloud, ma il lancio dell’11 settembre lo rende disponibile su Devin Desktop e tramite Devin CLI. Devin Desktop è il successore, ribattezzato da Cognition, di Windsurf, l’ambiente di sviluppo basato su agenti acquisito da Cognition nel 2025. La disponibilità in locale porta il sistema con modello guida e assistente nello stesso ambiente in cui gli sviluppatori esaminano le differenze tra versioni, eseguono comandi e decidono se integrare una modifica.

Nell’annuncio, Cognition presenta una sessione CLI in cui Fusion usa 113.000 token di Fable 5.1 e 97.000 di SWE-2, per un totale di 210.000 token, sostenendo che l’esecuzione costi il 39% in meno rispetto a Fable 5.1 da solo. La tabella pubblica dei benchmark dell’azienda riporta risparmi percentuali maggiori su alcuni carichi di lavoro, tra cui il 46% su DeepSWE: il dato del 39% descrive quindi una sessione illustrativa distinta, non una riduzione universale.

Il lancio lascia aperte diverse questioni pratiche per le organizzazioni di ingegneria. Quanto spesso il modello guida individuerà un errore sottile ma plausibile dell’assistente prima della revisione del codice? Di quanta messa a punto avranno bisogno i team per linguaggi, framework e pratiche di sviluppo interne che non assomigliano ai benchmark pubblici? Se il modello guida saprà rilevare questi errori in basi di codice che non conosce è la domanda a cui risponderanno ora i nuovi utenti di Fusion su Devin Desktop e CLI.

Fonte

Esplora

Altri articoli