Vai al contenuto
AI.info

The Pulse

Sakana AI divide Fugu in Max, più economico, e Ultra v2, più potente

Sakana AI ha rilasciato Fugu Max e Fugu Ultra v2, due sistemi di orchestrazione pensati per ridurre i costi di inferenza e migliorare le prestazioni nei compiti complessi. Fugu Max costa 2 dollari per milione di token in input, mentre Ultra

Sakana AI divide Fugu in Max, più economico, e Ultra v2, più potente

AI.info Team ·

Sakana AI porta sul mercato due risposte diverse alla stessa questione che divide il settore. L’azienda con sede a Tokyo sostiene che i modelli fondazionali più grandi e costosi non siano sempre il modo migliore per gestire carichi di lavoro reali; tuttavia, i fornitori che sviluppano questi modelli controllano ancora gran parte delle migliori capacità di programmazione e ragionamento disponibili sul mercato. La risposta dell’azienda è Fugu Max, che smista i compiti tra un insieme più ampio di modelli open e specializzati, e Fugu Ultra v2, progettato per ottenere la massima qualità nei lavori difficili e articolati in più passaggi.

Sakana ha annunciato entrambi i sistemi l’11 settembre 2026, presentandoli come due versioni della stessa architettura di orchestrazione anziché come prodotti indipendenti. Fugu Max punta all’efficienza dei costi, mentre Fugu Ultra v2 è progettato per ottenere risultati migliori nei benchmark. Entrambi sono disponibili tramite l’API di Sakana compatibile con OpenAI; secondo l’azienda, i clienti Fugu esistenti possono passare da un sistema all’altro modificando un solo parametro del modello.

Il lancio porta avanti una strategia di prodotto che mette in discussione l’idea che un singolo modello debba svolgere ogni compito. Il sistema Fugu di Sakana offre agli utenti un unico endpoint API, ma al suo interno seleziona, delega, coordina e combina più agenti. Il rapporto tecnico dell’azienda descrive i modelli Fugu come modelli linguistici addestrati per costruire strutture agentiche adattive per le singole richieste, con una variante che privilegia la latenza e un’altra la qualità delle risposte.

Fugu Max punta a ridurre i costi di utilizzo dei modelli all’avanguardia

Con Fugu Max, Sakana prova a rendere l’orchestrazione dei modelli economicamente vantaggiosa su larga scala. Il sistema indirizza dinamicamente ogni richiesta al modello più leggero che, secondo l’azienda, è in grado di risolverla, invece di inviare ogni compito al modello più potente disponibile. Sakana afferma che l’insieme ampliato comprende sistemi open-weight e specializzati, tra cui la famiglia Nemotron di NVIDIA, grazie alla partnership con il produttore di chip.

Il prezzo pubblicato è di 2 dollari per milione di token in input e 6 dollari per milione di token in output. L’input memorizzato nella cache costa 0,25 dollari per milione di token; Sakana afferma inoltre che il prezzo dell’output del modello è inferiore del 40%-60% rispetto a quello di Sonnet 5, GPT 5.6 Terra e Kimi K3. L’azienda sostiene anche che Fugu Max offra prestazioni non lontane da quelle dei modelli d’élite a un costo da due a sei volte inferiore, sebbene questi confronti si basino sulle valutazioni e sull’analisi dei prezzi condotte dalla stessa Sakana.

Sakana riferisce che Fugu Max ottiene il miglior punteggio complessivo in sei benchmark: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench e SWEFish. SWEFish è descritto come un benchmark interno basato sulle sfide di programmazione e sui casi d’uso di Sakana. L’azienda afferma inoltre che Max estende la frontiera del rapporto tra costi e prestazioni in sette dei dieci benchmark valutati.

Queste affermazioni sono importanti perché i sistemi di instradamento possono comportare costi che un modello convenzionale non rende visibili. Ogni richiesta può attivare diverse chiamate interne ai modelli e la risposta finale può includere il lavoro svolto dal livello di orchestrazione oltre a quello visibile nella risposta. La documentazione sui prezzi di Sakana specifica che questi token di orchestrazione vengono conteggiati nella fattura finale alle stesse tariffe previste per input e output: in questo modo gli sviluppatori possono rendere meglio conto del lavoro interno del sistema, ma i prezzi pubblicizzati per token non bastano a misurare la spesa complessiva.

Ultra v2 sacrifica il risparmio per affrontare ragionamenti più difficili

Fugu Ultra v2 adotta la strategia opposta. Sakana afferma che coordina un insieme più ampio di agenti per il ragionamento complesso, la ricerca autonoma e lo sviluppo software full-stack, ambiti in cui la latenza e il consumo di token contano meno della qualità del risultato finale. Secondo l’azienda, Ultra v2 ottiene il punteggio migliore o a pari merito in cinque degli otto benchmark: GDP.pdf, Chartography, SWEFish, DeepSWE e Toolathon.

Il risultato pubblicato più notevole riguarda Chartography, che valuta il ragionamento visivo e l’interpretazione dei dati. Sakana riferisce che Fugu Ultra v2 ottiene 48,3 punti, contro i 27,3 di Opus 5 e i 29,5 di Fable 5. In DeepSWE, una valutazione delle capacità di ingegneria del software, l’azienda riporta un punteggio di 74,3. Sakana afferma che Ultra v2 si colloca tra i primi due in sette degli otto benchmark inclusi nel confronto.

L’azienda avanza anche un’affermazione più circoscritta su ciò che sta alla base di questi risultati. Sakana afferma che l’insieme di modelli di Fugu Ultra v2 non comprende Fable 5, Fable 5.1 o GPT-6-Astra e che i punteggi pubblicati non dipendono da questi sistemi proprietari. Ciò non significa che il sistema funzioni senza accedere ad alcun modello esterno; significa che, secondo Sakana, i tre modelli citati non fanno parte dell’insieme usato da Ultra v2.

Secondo quanto dichiarato da Sakana al momento del lancio, i dati di addestramento di Fugu Ultra v2 arrivano fino al 28 agosto 2026. Il prezzo è di 5 dollari per milione di token in input e 30 dollari per milione di token in output, mentre l’input memorizzato nella cache costa 0,50 dollari per milione. Per contesti superiori a 272.000 token, le tariffe salgono a 10 dollari per milione di token in input, 45 dollari per milione di token in output e 1 dollaro per milione di token in input memorizzato nella cache.

Il prodotto dipende da un insieme di modelli in continua evoluzione

La principale scommessa tecnica di Sakana è che la selezione dei modelli possa diventare una capacità a sé stante. Una richiesta di ingegneria del software potrebbe essere indirizzata ad agenti particolarmente efficaci nella generazione di codice e nell’uso degli strumenti; una domanda scientifica potrebbe attivare una combinazione diversa. Il rapporto tecnico su Fugu afferma che il sistema può instradare le richieste, delegare e coordinare agenti specializzati, offrendo all’utente l’esperienza di chiamare un unico modello.

L’approccio si basa sul precedente lancio di Fugu da parte di Sakana, avvenuto a giugno. Quella versione presentava due varianti: Fugu standard, per prestazioni migliori con una latenza inferiore, e Fugu Ultra, per un’orchestrazione più approfondita su un insieme più ampio di agenti esecutori. Il rapporto tecnico di Sakana afferma che i sistemi impiegano fine-tuning su larga scala, algoritmi evolutivi e apprendimento per rinforzo per addestrare il livello di orchestrazione e adattarlo a compiti diversi.

Sakana sostiene che un insieme di modelli intercambiabili riduca la dipendenza da un unico fornitore. Se un fornitore modifica un’API, revoca l’accesso o limita un modello in un determinato mercato, Fugu può ricorrere a un agente alternativo senza costringere i clienti a riprogettare l’interfaccia della loro applicazione, afferma l’azienda. Si tratta di una caratteristica architetturale, non di una garanzia: il sistema dipende comunque dalla disponibilità, dai prezzi e dalle condizioni d’uso dei modelli che può chiamare.

I modelli Nemotron di NVIDIA fanno parte di questa strategia. In un annuncio di luglio, Sakana ha dichiarato che avrebbe integrato Nemotron in Fugu come agenti specializzati, con punti di forza nella programmazione, nella chiamata degli strumenti e nel rispetto delle istruzioni. David Ha, cofondatore e amministratore delegato di Sakana AI, ha dichiarato: «Siamo entusiasti di collaborare con NVIDIA per costruire insieme la prossima generazione di modelli di orchestrazione Fugu, integrando modelli open-weight all’avanguardia come Nemotron».

Un’API, due modalità operative

Per gli sviluppatori, la differenza tra Max e Ultra v2 è semplice, anche se i sistemi che li alimentano non lo sono. Max è l’opzione meno costosa per carichi di lavoro che richiedono buoni risultati su un grande volume di richieste. Ultra v2 è la scelta più costosa per i lavori in cui un ragionamento più approfondito, un’esecuzione più lunga e una migliore qualità delle risposte giustificano una fattura più salata.

Sakana afferma che entrambi i modelli sono subito disponibili tramite la sua API standard compatibile con OpenAI. Le applicazioni Fugu esistenti non richiedono un progetto di migrazione: secondo l’azienda, i clienti possono passare all’una o all’altra versione modificando un parametro. AI Gateway di Vercel elenca entrambi gli identificativi dei modelli e consente l’accesso tramite interfacce compatibili con OpenAI Chat Completions, OpenAI Responses e Anthropic Messages, offrendo agli sviluppatori un altro modo per provare i sistemi.

Anche con questo modello di API, l’insieme di agenti sottostante resta in gran parte invisibile. Gli utenti ricevono una risposta tramite un unico endpoint, anziché scegliere personalmente ogni modello esecutore. Questo riduce la complessità delle applicazioni, ma significa anche che i clienti devono fidarsi delle scelte di instradamento di Sakana e accettare che l’insieme possa cambiare man mano che i modelli vengono aggiunti, rimossi o riprezzati.

Le affermazioni di Sakana sui benchmark saranno messe alla prova in produzione

Il lancio offre a Sakana una proposta commerciale più incisiva rispetto al debutto originale di Fugu. Max ha un prezzo concreto e competitivo, mentre Ultra v2 presenta risultati elevati nelle valutazioni di programmazione, ragionamento visivo e capacità agentiche. Insieme, consentono all’azienda di proporre l’orchestrazione come scelta tra una modalità operativa più economica e una più capace, anziché presentare un unico sistema con un compromesso poco chiaro tra prestazioni e costi.

Sarà una verifica indipendente a determinare quanto regga questa distinzione al di fuori della suite di test di Sakana. Nel suo annuncio, l’azienda indica i benchmark e i modelli di confronto, ma non dimostra che ogni carico di lavoro riprodurrà la stessa graduatoria. Alcuni valori di riferimento provengono dai fornitori dei modelli; inoltre, la composizione dell’insieme, il comportamento dell’instradamento e l’uso interno dei token possono influenzare i risultati in modi che un punteggio statico ottenuto in un benchmark non mostra.

Per ora, l’offerta concreta è chiara: Fugu Max è disponibile a 2 dollari per milione di token in input e 6 dollari per milione di token in output, mentre Fugu Ultra v2 parte da 5 e 30 dollari. Entrambi i sistemi espongono la stessa interfaccia compatibile con OpenAI, ma collocano la tesi di Sakana sull’orchestrazione ai due estremi della decisione d’acquisto: da un lato, chiedersi a quale costo minimo si possa completare un compito; dall’altro, quante prestazioni un cliente sia disposto ad acquistare.

Fonte

Esplora

Altri articoli