The Pulse
Real-SWE mette gli agenti di programmazione alla prova su codice aziendale privato
Il benchmark Real-SWE di Specific Labs valuta gli agenti di programmazione su codebase di produzione private e rileva che la configurazione migliore ha risolto il 38,8% dei tentativi valutati.

AI.info Team ·
Specific Labs ha lanciato Real-SWE, un benchmark che chiede agli agenti di programmazione di modificare software di produzione privato, anziché repository pubblici o esercizi sintetici. Su 10 attività, otto configurazioni di modello e agente e otto esecuzioni indipendenti per attività, il benchmark registra 640 esecuzioni valutate.
Fable 5.1, eseguito tramite Claude Code, si classifica al primo posto con un tasso di risoluzione del 38,8%. GPT-6 Astra tramite Codex CLI segue con il 33,8%, mentre Gemini 3.8 Flash tramite Gemini CLI raggiunge il 31,2%. Specific Labs presenta i risultati come una verifica della capacità degli agenti di lavorare all’interno dei sistemi, delle convenzioni e delle regole aziendali specifiche che caratterizzano la normale attività di sviluppo software.
Specific Labs va oltre i problemi pubblici di GitHub
Real-SWE utilizza attività tratte da codebase di produzione private, concesse in licenza da aziende reali. I sistemi coinvolti operano in ambienti isolati che possono includere Docker, Kubernetes, GitHub, PostgreSQL, MySQL, MongoDB, Redis, emulatori AWS e strumenti aziendali come Linear, Slack, Intercom, Google Drive, email e ClickUp.
Le codebase di esempio del benchmark comprendono un concorrente di Luma e Partiful con oltre 200.000 utenti e una posizione nella top 100 dell’App Store, una piattaforma fintech per i consumatori che elabora più di 100.000 estratti conto bancari e piattaforme di vendita basate sull’IA per aziende, costruite attorno a flussi di lavoro aziendali complessi. Specific Labs non indica i nomi delle aziende né pubblica i repository privati.
Le attività riguardano ambiti come fatturazione, calcolo delle imposte, migrazione dei clienti, archiviazione dei dati, identità e analisi. Un esempio chiede a un agente di correggere la gestione delle imposte sulle fatture in diverse configurazioni aziendali, tenendo conto dei servizi esterni delle autorità fiscali e dei requisiti di contabilità. L’attività richiede più che modificare una funzione: l’agente deve dedurre come l’applicazione circostante gestisce ambienti, esenzioni, indirizzi, regolamenti e rendicontazione.
Gli agenti modificano 11 file, ma non rispettano i requisiti
Un’istruzione mediana di Real-SWE contiene 1.742 caratteri e le soluzioni di riferimento modificano 11 file. Specific Labs confronta questo dato con i sei file di FrontierCode e DeepSWE, altre due valutazioni di agenti di programmazione. Secondo gli autori del benchmark, l’ampiezza delle modifiche riflette il fatto che gli interventi coinvolgono servizi applicativi, infrastruttura e strumenti aziendali.
L’analisi degli errori indica una comprensione incompleta, più che semplici errori di sintassi. Per diverse configurazioni, i requisiti non individuati sono la categoria di errore più frequente: riguardano il 67,2% delle esecuzioni fallite di Grok 4.6, il 53,8% di quelle di Kimi K3 e il 38,6% di quelle di GLM 5.3. Gli agenti fanno anche supposizioni non verificate, inseriscono correzioni altrimenti ragionevoli nella parte sbagliata di un sistema o introducono regressioni.
Gemini 3.8 Flash registra la quota più alta di errori di integrazione: il 49,1% delle sue esecuzioni fallite. Fable 5.1, il modello al primo posto nella classifica generale, presenta un tasso di errori di integrazione del 34,7% tra le esecuzioni fallite. Questi dati mostrano perché superare un test circoscritto non basta quando la modifica richiesta dipende da più servizi e da comportamenti aziendali consolidati.
Le esecuzioni più brevi non risultano svantaggiate
Real-SWE tiene traccia anche della durata del lavoro degli agenti. Le esecuzioni di durata inferiore a 10 minuti falliscono 70 volte su 98, pari al 71,4%. Quelle più lunghe falliscono 398 volte su 542, pari al 73,4%. Il risultato non mostra un vantaggio in termini di prestazioni per il semplice fatto di concedere più tempo a un agente.
Specific Labs stima che il costo di un’esecuzione sia compreso tra 2,50 e 6,96 dollari. Gemini 3.8 Flash è la configurazione meno costosa nella tabella pubblicata, mentre Fable 5.1 è la più costosa. Costo e accuratezza non vanno di pari passo: Fable è in testa al benchmark, ma la configurazione Gemini, più economica, si classifica terza.
Gli autori del benchmark riassumono la prova con una domanda diretta: Un agente di programmazione è davvero in grado di svolgere il lavoro di un ingegnere del software nel mondo reale?
Siddhant Paliwal, coautore del rapporto su Real-SWE, e i suoi coautori scrivono:
I nostri risultati mostrano che siamo ancora lontani da questa realtà.
Perché il codice privato cambia il risultato
I benchmark pubblici di programmazione offrono ai modelli un contesto familiare: un repository open source, un problema strutturato e una soluzione che spesso può essere ricondotta a materiale disponibile su Internet. Real-SWE elimina gran parte di questa familiarità. Le sue attività provengono da codice e flussi di lavoro che i modelli coinvolti non potevano esaminare durante l’addestramento, mentre le istruzioni li costringono a scoprire i dettagli di implementazione all’interno di ciascun ambiente.
Specific Labs afferma che il 99% dei token nei sistemi aziendali del mondo reale è al di fuori dei dati disponibili ai modelli di frontiera. Non si tratta di una misurazione di tutto il software aziendale, ma la cifra coglie la premessa centrale del benchmark: il codice di produzione contiene regole locali che raramente vengono documentate nelle descrizioni standard dei problemi e che non si possono risolvere in modo affidabile basandosi soltanto sul riconoscimento di schemi ricorrenti.
L’azienda afferma inoltre che i suoi verificatori si ispirano a suite di test esistenti o le usano senza modifiche, e che vengono inseriti durante la valutazione. Questo approccio mantiene riservati i repository privati e le soluzioni di riferimento, verificando comunque se una modifica inviata preserva il comportamento atteso dagli ingegneri originali.
Real-SWE verifica ciò che i punteggi pubblici non misurano
Real-SWE non dimostra che un modello sia incapace di svolgere attività utili di sviluppo software. Fable 5.1 risolve quasi quattro tentativi valutati su 10 secondo le regole del benchmark, e singole attività mostrano tassi di risoluzione molto più alti della media complessiva. GPT-6 Astra, per esempio, risolve tutte e otto le esecuzioni nell’attività di scansione multi-regione del benchmark; lo stesso fa Gemini 3.8 Flash.
Il quadro generale è meno lusinghiero. Nessuna configurazione risolve tutte le attività e diversi agenti falliscono ripetutamente nelle migrazioni della fatturazione, nella misurazione dei token API, nelle misurazioni dei datastore, nelle giurisdizioni fiscali e nelle attività relative ai flussi di dati analitici. Per le aziende che valutano gli agenti di programmazione, le prove pubblicate indicano un’esigenza pratica: la revisione deve concentrarsi non solo sulla capacità di un agente di scrivere codice che supera i test, ma anche sulla possibilità che abbia individuato tutti i requisiti aziendali e modificato il percorso di esecuzione effettivamente utilizzato.
La prima classifica di Real-SWE misura quindi una questione più circoscritta, ma più impegnativa, rispetto ai punteggi dei benchmark pubblici: con quale frequenza un agente riesce a introdurre una modifica corretta in un software che non ha mai visto, rispettando regole che deve ricostruire dal sistema circostante? Nei risultati pubblicati, il massimo è il 38,8%, raggiunto dalla configurazione Fable 5.1 e Claude Code.