The Pulse
Mozilla: i modelli di IA aperti sono indietro di soli 4,4 mesi
Secondo il rapporto State of Open Source AI di Mozilla, i principali modelli a pesi aperti sono indietro di circa 4,4 mesi rispetto ai sistemi chiusi, ma costano meno per molte attività.

AI.info Team ·
La più recente ricerca di Mozilla stima in circa quattro mesi il divario tra i migliori modelli di IA a pesi aperti e i sistemi chiusi più avanzati, avvertendo però che i modelli definiti «aperti» di solito non sono open source nel pieno senso tecnico del termine.
Il rapporto State of Open Source AI, pubblicato il 14 settembre, afferma che, secondo misure delle capacità basate sulla durata delle attività, il miglior modello aperto è indietro di circa 4,4 mesi rispetto al miglior modello chiuso. Mozilla rileva inoltre che i modelli aperti si avvicinano ormai alle prestazioni dei sistemi proprietari a prezzi nettamente inferiori, cambiando i termini della valutazione economica per molte attività ordinarie.
A questi progressi si contrappone però un’altra realtà: i modelli aperti restano più difficili da distribuire, mantenere e valutare. Il rapporto di Mozilla presenta quindi un bilancio in chiaroscuro, non una netta vittoria dell’una o dell’altra categoria.
Quattro mesi di vantaggio, un prezzo cinque volte superiore
Il confronto di Mozilla usa i dati del METR time-horizon framework, che misura la durata delle attività che un sistema di IA riesce a completare con una probabilità di successo del 50 per cento. Secondo il rapporto, il miglior modello chiuso è attualmente in grado di svolgere un’attività circa 1,74 volte più lunga rispetto al miglior modello aperto.
In termini pratici, Mozilla afferma che i sistemi chiusi riescono a svolgere attività della durata di otto-12 ore che i modelli aperti non sono ancora in grado di completare in modo affidabile. Il rapporto stima che i modelli aperti raggiungano la stessa fascia di durata circa quattro mesi dopo, mentre nessuna delle due categorie riesce a svolgere con costanza lavori che durano più di 12 ore.
Sul prezzo, il divario va nella direzione opposta. Secondo Mozilla, Kimi K3 di Moonshot AI ottiene sull’Artificial Analysis Intelligence Index un punteggio inferiore di pochi punti a quello di Fable 5 di Anthropic, pur costando circa il 30 per cento rispetto a quest’ultimo. Su un’infrastruttura software neutrale per Terminal-Bench 2.1, il rapporto afferma che GLM 5.2 di Z.ai ottiene un punteggio che si discosta di non più di un punto da quelli di Claude Opus 4.7 e 4.8 di Anthropic, a un costo per attività completata pari a circa un quinto.
Questi confronti hanno dei limiti. I fornitori di modelli chiusi spesso realizzano le proprie infrastrutture software per l’uso degli strumenti, la memoria e il comportamento degli agenti, mentre i modelli aperti possono dare risultati diversi quando vengono testati tramite sistemi di terzi. Il rapporto di Mozilla considera quindi i risultati dei benchmark una prova della riduzione del divario, non una classifica valida in ogni contesto.
Kimi K3 mostra dove i modelli chiusi restano in vantaggio
Il rapporto distingue le prestazioni dei modelli in base al tipo di attività, anziché ridurre le loro capacità a un unico numero. Secondo l’analisi di Mozilla, Kimi K3 è in testa o alla pari in diversi confronti relativi alla programmazione frontend, alla capacità di seguire le istruzioni e alle conoscenze generali.
Il lavoro degli agenti nel terminale è più conteso. Kimi K3 ottiene 88,3 su Terminal-Bench 2.1 contro gli 88,8 di un altro sistema tra i più avanzati, ma resta indietro su FrontierSWE, un benchmark basato su incarichi reali di ingegneria del software. Mozilla afferma che il modello chiuso supera Kimi K3 di 92 punti Elo su GDPval-AA v2, che misura le prestazioni in attività professionali basate sulle conoscenze e valutate da esperti.
Il recupero di informazioni da contesti lunghi è un altro ambito in cui i sistemi proprietari hanno un netto vantaggio. Il rapporto cita un tasso di successo dell’89 per cento per Gemini 3.1 Pro contro il 41 per cento di DeepSeek V4-Pro in un test di recupero con più elementi da individuare su un milione di token. Mozilla indica inoltre la documentazione e gli strumenti per la conformità, l’assistenza e l’attribuzione delle responsabilità tra i motivi per cui le aziende continuano a pagare per i servizi chiusi, anche quando modelli più economici possono svolgere gran parte del lavoro.
La maggior parte dei modelli «aperti» non rivela ancora tutti gli elementi necessari per riprodurli
La terminologia di Mozilla richiede una precisazione importante. Il rapporto esamina 16 rilasci aperti di rilievo e afferma che nessuno mette a disposizione tutti gli elementi previsti dalla definizione di software open source dell’Open Source Initiative.
La maggior parte rende scaricabili i pesi dei modelli, ma non divulga alcuni tra i dati di addestramento, i metodi di elaborazione dei dati, il codice di addestramento e le altre informazioni necessarie per riprodurre il sistema. Mozilla usa quindi «pesi aperti» come termine più preciso per molti dei modelli trattati.
La distinzione conta per le organizzazioni che vogliono avere il controllo dei propri sistemi, non soltanto un’API più economica. I pesi scaricabili possono consentire a un’azienda di eseguire un modello sul proprio hardware, esaminarne il comportamento ed evitare di dipendere dal servizio di un fornitore, ma non rendono necessariamente il modello riproducibile o pienamente verificabile.
«Un’argomentazione che nasconde i propri punti deboli è una pubblicità.»
Raffi Krikorian, responsabile della tecnologia, Mozilla
La frase di Krikorian compare nell’introduzione del rapporto, secondo cui l’IA aperta va giudicata tanto per i suoi punti deboli quanto per i suoi progressi. Mozilla individua gli ostacoli principali negli strumenti per la distribuzione, nella standardizzazione delle infrastrutture, nella documentazione, nella valutazione e nell’assistenza alle imprese.
I modelli aperti si diffondono, ma restano indietro sul piano operativo
Secondo l’indagine di Mozilla tra gli sviluppatori, i modelli aperti sono usati dal 79 per cento degli sviluppatori professionisti, contro il 71 per cento per quelli chiusi. Metà degli intervistati usa entrambe le categorie, mentre il 29 per cento usa soltanto modelli aperti e il 21 per cento soltanto modelli chiusi.
I modelli aperti coprono anche un numero leggermente maggiore di casi d’uso per sviluppatore: 5,1 contro 4,6 per i sistemi chiusi. Eppure, secondo Mozilla, i modelli aperti arrivano nell’ambiente di produzione con una frequenza inferiore di 12 punti percentuali, una differenza legata soprattutto agli strumenti per la distribuzione e la gestione operativa, più che alle capacità in sé.
Tra i problemi citati più spesso figurano i costi dell’infrastruttura o della capacità di calcolo, le preoccupazioni per la sicurezza e la conformità normativa, la manutenzione, la complessità della distribuzione e la mancanza di assistenza specializzata. Le prestazioni dei modelli figurano più in basso nell’elenco rispetto a diversi ostacoli operativi: ciò suggerisce che spesso le organizzazioni rinuncino ai modelli aperti perché sono difficili da gestire, non perché siano palesemente incapaci di svolgere le attività richieste.
La Cina fornisce la maggior parte dei modelli aperti più avanzati
Mozilla rileva anche uno squilibrio geografico. Secondo il rapporto, otto dei 10 modelli con i maggiori volumi di token su OpenRouter nell’agosto 2026 hanno pesi aperti e sette di questi otto sono stati sviluppati da aziende cinesi.
Questa constatazione conferisce all’IA aperta una dimensione politica che va oltre i costi e il controllo tecnico. I modelli chiusi più avanzati restano concentrati tra le aziende statunitensi, mentre i modelli scaricabili più potenti provengono sempre più spesso dalla Cina. Il rapporto di Mozilla afferma che tale concentrazione potrebbe consentire a un solo paese di influenzare le scelte predefinite adottate da sviluppatori e organizzazioni in tutto il mondo.
Raffi Krikorian sostiene che le istituzioni statunitensi ed europee dovrebbero competere nello stesso ambito aperto, anziché lasciarlo ai laboratori cinesi. Mozilla indica i programmi pubblici per l’accesso alla capacità di calcolo, le fondazioni neutrali e le infrastrutture di valutazione condivise come possibili basi di un ecosistema più ampio.
La raccomandazione immediata del rapporto è pratica: usare i modelli aperti per le attività adatte alle loro attuali capacità e al loro profilo di costo, riservando poi i sistemi chiusi ai compiti per i quali il loro vantaggio è significativo. I quattro mesi di vantaggio contano soprattutto quando una scadenza arriva prima che i modelli aperti abbiano colmato il divario; per le attività ordinarie che possono attendere il successivo ciclo di rilascio, i dati di Mozilla suggeriscono che pagare cinque volte tanto potrebbe offrire ben poco di duraturo.