Vai al contenuto
AI.info

The Pulse

Anthropic lancia Claude Fable 5.1 e Mythos 5.1

Anthropic ha reso Claude Fable 5.1 disponibile al pubblico e Claude Mythos 5.1 accessibile alle organizzazioni selezionate che operano nella cybersicurezza e nelle scienze della vita. I modelli condividono lo stesso sistema di base, ma prez

Anthropic lancia Claude Fable 5.1 e Mythos 5.1

AI.info Team ·

Anthropic ha lanciato Claude Fable 5.1 e Claude Mythos 5.1 il 1 settembre, presentandoli come lo stesso modello di base configurato con diverse misure di sicurezza. Fable 5.1 è disponibile al pubblico per la programmazione, il lavoro intellettuale e le attività agentiche di lunga durata, mentre Mythos 5.1 è riservato alle organizzazioni selezionate che operano nella cybersicurezza e nelle scienze della vita.

Il lancio abbina un aggiornamento del modello a costi API più bassi e a un cambiamento nella gestione dei carichi di lavoro sensibili da parte di Anthropic. L’azienda afferma che il prezzo delle letture dalla cache scende del 75%, a 0,25 dollari per milione di token, riducendo i costi dei carichi di lavoro tipici di circa il 25% rispetto a Fable 5 e quelli dei carichi di lavoro fortemente agentici fino al 45%.

Anthropic afferma inoltre che Fable 5.1 è in grado di individuare vulnerabilità software senza sviluppare exploit, mentre le misure di sicurezza aggiornate per la cybersicurezza producono il 60% di falsi positivi in meno rispetto al sistema precedente. L’azienda prevede di offrire il sistema Enterprise Frontier Safeguards ai clienti aziendali in più fasi, a partire da più avanti questo autunno.

Fable 5.1 è pensato per attività software di lunga durata

Fable 5.1 è disponibile tramite i prodotti Claude, la Claude API e piattaforme cloud tra cui Amazon Web Services, Google Cloud e Microsoft Azure. Gli sviluppatori possono richiamarlo con l’identificativo del modello claude-fable-5-1. Anthropic indica prezzi di 10 dollari per milione di token in input e 50 dollari per milione di token in output, con le letture dalla cache fatturate separatamente alla tariffa ridotta.

Il modello è progettato per attività che si svolgono su più applicazioni e richiedono verifiche ripetute. Anthropic afferma che può utilizzare browser, tenere registri, riprendersi dopo passaggi non riusciti e proseguire il lavoro senza supervisione tramite strumenti come Claude Code e Claude Cowork. Il livello di impegno predefinito è alto in Claude Code e medio in Claude Cowork e Claude.ai.

I clienti che hanno avuto accesso in anteprima descrivono il principale miglioramento come una prestazione costante nel tempo, più che un singolo balzo in un benchmark. «Claude Fable 5.1 è più a suo agio con attività lunghe e non supervisionate rispetto a Fable 5», ha dichiarato Ben Lafferty, ingegnere senior dello staff di Shopify. «Mi è capitato di eseguire flussi di lavoro a lungo senza che perdesse il filo: tiene i propri registri, rivede le priorità quando le cose cambiano e riprende da dove si era fermato».

Anthropic segnala progressi nella programmazione e nell’uso del computer

I risultati pubblicati da Anthropic mostrano che Fable 5.1 ottiene il 55,8% in Terminal-Bench 4.0, contro il 42,0% di Fable 5 e il 52,3% di Claude Opus 5. In CursorBench 3.2.0, il nuovo modello raggiunge il 73,4%, superando Fable 5, al 70,5%, e Opus 5, al 70,0%.

Nella versione di Terminal-Bench-Science 0.1 realizzata dall’azienda, Fable 5.1 ottiene il 52,6%, contro il 24,7% di Fable 5 e il 29,0% di Opus 5. Anthropic avverte che il benchmark ha un errore standard di circa 3,5–4,5 punti percentuali per modello e che la sua riproduzione dei punteggi precedenti differisce dalla classifica pubblica.

L’azienda riporta un punteggio parziale del 77,9% e un punteggio rigoroso del 41,7% in OSWorld 2.0. Anthropic afferma che le misure di sicurezza in produzione hanno influito su alcune attività e che, durante i test, i lavori soggetti a restrizioni in ambito di cybersicurezza e biologia sono stati indirizzati ad altri modelli Claude. Questa precisazione rende difficile interpretare i risultati come un confronto puro delle capacità dei modelli, ma mostra anche come i controlli di sicurezza continuino a far parte del profilo prestazionale del prodotto.

Mythos 5.1 si occupa delle attività di ricerca a rischio più elevato

Mythos 5.1 utilizza lo stesso modello di Fable 5.1, ma elimina o modifica le misure di sicurezza per le attività approvate nei settori in cui un’assistenza più potente può comportare rischi maggiori. Al momento l’accesso è riservato a un gruppo di organizzazioni statunitensi; Anthropic sta coordinandosi con il governo degli Stati Uniti per ampliare l’accesso ai partner nazionali e internazionali.

Anthropic afferma che, durante i test condotti con strumenti open source per la progettazione e il ripiegamento delle proteine, Mythos 5.1 ha prodotto leganti proteici ad alta affinità. Su 12 bersagli, quasi la metà dei progetti si è rivelata costituita da leganti funzionali; secondo l’azienda, per tre bersagli le affinità di legame erano dieci volte superiori a quelle dei migliori progetti presentati alle competizioni di Adaptyv Bio sulla progettazione proteica.

L’azienda afferma inoltre che Fable 5.1 ha addestrato una rete neurale a produrre una mappa altimetrica di Venere a risoluzione più elevata, che copre un terzo del pianeta. Secondo Anthropic, la mappa porta il livello di dettaglio da circa 10–20 chilometri a due–tre chilometri e stima le altezze con una precisione fino al 25% maggiore.

Ai prezzi più bassi si affianca un nuovo sistema per la privacy

Il sistema Enterprise Frontier Safeguards di Anthropic intende consentire ai clienti di mantenere i dati in un’infrastruttura cloud controllata interamente dal cliente anziché da Anthropic. L’azienda descrive questa soluzione come in grado di garantire una privacy equivalente alla conservazione zero dei dati, mantenendo al contempo protezioni contro gli usi avversari.

EFS non è disponibile al lancio. Anthropic afferma che i clienti idonei possono utilizzare Fable 5.1 con conservazione zero dei dati fino all’avvio della distribuzione del sistema aziendale, previsto più avanti questo autunno. Il rilascio graduale affianca l’impegno per la privacy alla più ampia disponibilità del modello, anziché farne un prerequisito per l’accesso.

Mythos 5.1 è soggetto a un modello di accesso distinto. Gli utenti che operano nella cybersicurezza possono richiedere l’accesso tramite il Cyber Verification Program di Anthropic, mentre l’azienda afferma che l’iscrizione degli scienziati al suo programma di biologia dovrebbe aprire a breve.

Le affermazioni di Anthropic sulla ricerca richiedono ancora una verifica indipendente

La presentazione descrive Fable 5.1 e Mythos 5.1 come strumenti per il lavoro scientifico oltre che per lo sviluppo di software commerciale. Gli esempi di Anthropic sono specifici: esperimenti sul legame delle proteine, ottimizzazione di kernel GPU per modelli biologici e una mappa altimetrica di Venere basata sui dati radar della sonda NASA Magellan.

Anthropic afferma che Mythos 5.1 ha accelerato fino a 2,5 volte sette modelli open source di deep learning, utilizzando kernel GPU personalizzati e risultati intermedi memorizzati nella cache. L’azienda stima che queste ottimizzazioni potrebbero ridurre del 30–60% i costi GPU delle analisi su scala genomica e afferma che prevede di renderle open source.

Il lancio non dimostra che i modelli abbiano prodotto autonomamente scoperte scientifiche pubblicabili. Mostra però che Anthropic si sta spostando dalle dimostrazioni di generazione di testo e codice verso sistemi che utilizzano strumenti, conducono esperimenti e producono risultati di ricerca in condizioni di accesso controllato. Fable 5.1 è già disponibile agli utenti comuni; Mythos 5.1, più permissivo, resta riservato alle organizzazioni approvate.

Fonte

Esplora

Altri articoli