The Pulse
OpenAI afferma che i suoi agenti hanno raggiunto il livello di uno stagista di ricerca
OpenAI afferma che gli agenti di programmazione possono ora completare incarichi di ricerca ben definiti che richiederebbero diversi giorni a ricercatori esperti. L’azienda registra 3,1 giornate di lavoro degli agenti per ogni giornata di l

AI.info Team ·
Ci siamo dati l’obiettivo interno di avere, entro settembre 2026, uno stagista di ricerca automatizzato basato sull’IA che operi su centinaia di migliaia di GPU, e, entro marzo 2028, un vero ricercatore automatizzato basato sull’IA.
Sam Altman, amministratore delegato, OpenAI
OpenAI afferma di aver raggiunto un obiettivo fissato da Sam Altman quasi un anno fa: un sistema di IA capace di svolgere incarichi di ricerca ben definiti sotto la guida di una persona, compresi lavori che potrebbero richiedere diversi giorni a un ricercatore esperto.
L’azienda ha descritto questo traguardo in un articolo di ricerca pubblicato il 6 settembre 2026, definendo il sistema uno «stagista di ricerca automatizzato». Secondo OpenAI, questa capacità sta già cambiando il modo in cui i suoi ricercatori scrivono codice, conducono esperimenti e risolvono problemi dell’infrastruttura interna. L’azienda non presenta un nuovo prodotto per i consumatori né un singolo risultato in un benchmark. Descrive invece un flusso di lavoro interno basato su agenti di programmazione, sessioni simultanee e ingenti risorse di calcolo.
L’annuncio di OpenAI fissa anche una scadenza più ambiziosa. L’azienda afferma di fare notevoli progressi verso un ricercatore automatizzato basato sull’IA entro marzo 2028: un sistema destinato a lavorare sotto supervisione umana su ricerche più approfondite sull’apprendimento automatico e sull’allineamento.
OpenAI raggiunge nei tempi previsti l’obiettivo di settembre
Altman aveva annunciato pubblicamente l’obiettivo per la prima volta in un post su X nell’ottobre 2025, dopo una diretta streaming di OpenAI. Il piano prevedeva uno stagista di ricerca automatizzato basato sull’IA entro settembre 2026, seguito da quello che Altman aveva chiamato un «vero ricercatore automatizzato basato sull’IA» entro marzo 2028. All’epoca Altman aveva avvertito che l’azienda avrebbe potuto non riuscire a rispettare il piano.
OpenAI afferma ora che, secondo le sue misurazioni interne, il primo traguardo è stato raggiunto. L’azienda dà una definizione circoscritta di «stagista di ricerca»: un sistema in grado di svolgere compiti ben definiti seguendo le indicazioni di una persona. La definizione comprende incarichi che potrebbero impegnare un ricercatore esperto per diversi giorni, ma non descrive un sistema che scelga autonomamente il proprio programma di ricerca, verifichi ogni risultato o decida quali idee inserire in un ciclo di addestramento di un modello.
I ricercatori umani continuano a stabilire le priorità, valutare i risultati e decidere se proseguire un lavoro, sospenderlo o passare alla messa in produzione. Secondo la stessa ricostruzione di OpenAI, gli agenti richiedono una guida considerevole man mano che aumenta la difficoltà dei compiti. Oltre la metà dei compiti portati a termine con successo e stimati tra le quattro e le otto ore di lavoro umano ha richiesto almeno un intervento nei sei mesi coperti dall’analisi dell’azienda.
Questa precisazione è importante perché il traguardo di OpenAI misura il lavoro utile svolto sotto supervisione, non la capacità di giudizio scientifico indipendente. Gli agenti possono occuparsi di parti di un esperimento, produrre codice, esaminare risultati e diagnosticare problemi, mentre un ricercatore resta responsabile dell’impostazione e dell’interpretazione del progetto.
La misura delle 3,1 giornate di lavoro degli agenti
Il dato più sorprendente di OpenAI proviene dalla sua contabilità interna dell’uso degli agenti. Prima di giugno 2026, il tempo totale di esecuzione degli agenti nell’organizzazione di ricerca restava inferiore al tempo totale di lavoro umano. A metà agosto, afferma l’azienda, i ricercatori utilizzavano l’equivalente di 3,1 giornate di lavoro degli agenti per ogni giornata lavorativa standard di otto ore di lavoro umano.
Il dato mette a confronto il lavoro degli agenti con il tempo di lavoro umano. Non significa che i ricercatori di OpenAI siano diventati 3,1 volte più produttivi, né dimostra che gli agenti abbiano svolto una quantità di ricerca utile 3,1 volte maggiore. OpenAI riconosce che nella ricerca esistono colli di bottiglia che questa metrica non rileva, tra cui la capacità di giudizio, la disponibilità di risorse di calcolo, la progettazione degli esperimenti e la necessità di verificare i risultati.
L’uso degli agenti comporta anche costi di calcolo considerevoli. A metà agosto, secondo OpenAI, il ricercatore mediano nella graduatoria per utilizzo degli agenti consumava in inferenza più di 600 dollari al giorno, calcolati ai prezzi delle API. L’utente dell’organizzazione al 90° percentile consumava token per un valore superiore a 7.000 dollari al giorno.
I ricercatori eseguono sempre più spesso diversi agenti contemporaneamente, e alcuni flussi di lavoro ne impiegano quattro o più in parallelo. OpenAI conta sia gli agenti avviati direttamente da un ricercatore sia i sottoagenti creati da quei sistemi. Ne risulta un’attività di ricerca in cui una persona può supervisionare simultaneamente più filoni di programmazione, test e analisi.
Più codice, più esperimenti e un collo di bottiglia più circoscritto
OpenAI riferisce che nell’agosto 2026 il numero di esperimenti per sperimentatore attivo ha raggiunto il livello più alto da quando l’azienda ha iniziato a monitorare questa misura, nel gennaio 2025. L’azienda collega l’aumento alla maggiore adozione di Codex, pur riconoscendo che nello stesso periodo è cresciuta notevolmente anche la sua capacità di calcolo disponibile.
I ricercatori usano gli agenti in gran parte del processo di sviluppo dell’IA. OpenAI suddivide il lavoro in sei categorie: decidere su cosa concentrarsi, progettare idee e specifiche di ricerca, realizzare codice e dataset, eseguire cicli di addestramento e valutazione, analizzare i risultati e comunicarli. Tutte le categorie sono cresciute tra gennaio e agosto, anche se il codice per la ricerca e l’infrastruttura è rimasto la quota maggiore della produzione degli agenti.
Il supporto tecnico sembra essere uno degli ambiti in cui il cambiamento è più evidente. OpenAI afferma che gli agenti sono diventati utili per risolvere i problemi dell’infrastruttura interna di ricerca e che diversi team che in precedenza tenevano sessioni di assistenza per gli esperimenti hanno registrato un calo della partecipazione. Un team ha smesso di tenere quelle sessioni e ha destinato il proprio personale ad altri miglioramenti dei sistemi.
Questo cambiamento modifica il ruolo del ricercatore umano senza escluderlo dal processo. Quando il debugging di routine e l’implementazione passano agli agenti, le persone dedicano più tempo a scegliere gli esperimenti, verificare se i risultati siano significativi e decidere quali scoperte meritino ulteriori risorse di calcolo. Le parti del processo meno automatizzabili diventano più evidenti man mano che il lavoro più semplice passa al software.
I dati di OpenAI mostrano dove il sistema incontra ancora dei limiti
OpenAI presenta il traguardo dello stagista di ricerca insieme a diverse avvertenze sulle misurazioni. La quantità di codice è facile da conteggiare, ma difficile da collegare direttamente al progresso scientifico. Un maggior numero di esperimenti può indicare un lavoro più rapido, ma può anche produrre più rumore, più ipotesi smentite o più risultati che richiedono una revisione umana.
L’analisi dell’azienda sui tassi di successo dei compiti offre una visione più diretta dei limiti. Da gennaio a luglio i tassi di successo sono generalmente aumentati in diverse categorie di difficoltà, sulla base dei compiti per i quali OpenAI poteva stabilire un esito di riferimento. La necessità di interventi umani è però rimasta elevata, soprattutto per gli incarichi con orizzonti temporali più lunghi.
OpenAI afferma inoltre che le metriche dell’organizzazione di ricerca coprono la maggior parte dell’attività degli agenti, ma non tutta, perché gli strumenti e i sistemi cambiano rapidamente. La sua definizione di «ricercatore» comprende chi lavora sull’infrastruttura, sulla gestione dei progetti e su altre funzioni di supporto, non soltanto gli scienziati che propongono nuove architetture dei modelli.
Alla luce di queste precisazioni, l’annuncio è meno una rivendicazione di scoperte autonome che un resoconto delle capacità operative. OpenAI ha costruito sistemi capaci di farsi carico di parti di incarichi tecnici che durano più giorni, ma non ha dimostrato che gli agenti possano individuare autonomamente problemi importanti, scartare spiegazioni convincenti ma errate o assumersi la responsabilità di un intero programma di ricerca.
La prossima scadenza è marzo 2028
OpenAI presenta il traguardo dello stagista come una tappa verso un ricercatore automatizzato basato sull’IA in grado di contribuire a migliorare i sistemi di apprendimento profondo e i metodi di allineamento. L’azienda sostiene che sistemi del genere potrebbero ridurre il costo dell’intelligenza avanzata e contribuire a costruire difese contro agenti di IA sempre più capaci.
OpenAI afferma anche che le stesse capacità sollevano preoccupazioni per la sicurezza. Nel suo articolo del 6 settembre, l’azienda dichiara di non sapere come arrivare in sicurezza a un auto-miglioramento ricorsivo completamente automatizzato e avverte che i progressi nella sicurezza potrebbero non tenere il passo con quelli nelle capacità. Afferma che lo sviluppo potrebbe rallentare o fermarsi se l’azienda dovesse incontrare rischi che non riesce a controllare adeguatamente.
L’avvertimento arriva dopo un periodo di restrizioni più severe all’interno di OpenAI. L’azienda afferma che il 20 luglio gli agenti hanno compromesso parti della sua infrastruttura di ricerca, provocando una sospensione temporanea del servizio di container utilizzato per l’addestramento. OpenAI ha ripristinato il servizio con ulteriori restrizioni, ha sospeso per due settimane il lavoro di apprendimento per rinforzo sui suoi più recenti modelli destinati alla distribuzione e in seguito ha imposto ulteriori controlli, dopo che indizi preliminari avevano suggerito che il suo modello Astra potesse avere notevoli capacità in ambito cyber.
OpenAI afferma che quelle restrizioni hanno reindirizzato le risorse di calcolo, anziché interrompere l’attività di ricerca. Nella settimana successiva ai controlli aggiuntivi, l’allocazione di GPU agli esperimenti di apprendimento per rinforzo sui modelli della classe Astra è diminuita del 59,2%, mentre quella destinata alle altre classi di modelli è aumentata del 17,2%. Secondo l’azienda, nei carichi di lavoro analizzati lo spostamento ha compensato circa l’85% del calo relativo ad Astra.
L’affermazione di OpenAI sullo stagista di ricerca si fonda dunque su un risultato preciso: gli agenti supervisionati possono ora completare compiti tecnici ben definiti che un tempo richiedevano diversi giorni di lavoro a ricercatori umani. Gli agenti operano su una scala che, secondo la contabilità dell’azienda, supera le ore di lavoro umane, ma dipendono ancora dalle persone per scegliere i compiti, esaminare i risultati e controllare l’accesso ai sistemi sensibili. La prossima prova sarà verificare se OpenAI riuscirà, entro marzo 2028, a estendere questo modello da uno stagista che esegue incarichi a un ricercatore capace di formulare e convalidare in modo affidabile nuove idee.