The Pulse
GPT-5.6 Sol completa 36 delle 40 misurazioni previste dei qubit in autonomia
OpenAI afferma che GPT-5.6 Sol, eseguito tramite Codex, ha completato 36 delle 40 misurazioni previste su un chip a sei qubit mai calibrato prima, con appena quattro interventi dei ricercatori. L’esperimento del MIT mostra in quali ambiti g

AI.info Team ·
GPT-5.6 Sol ha completato 36 delle 40 misurazioni previste su un chip a qubit superconduttori mai calibrato prima; i ricercatori sono intervenuti per migliorarne soltanto quattro. Il risultato, presentato da OpenAI e dal MIT’s Engineering Quantum Systems Group, costituisce una prova pratica di un agente di IA che controlla apparecchiature di laboratorio in tempo reale, anziché limitarsi ad analizzare un insieme di dati offline.
OpenAI ha collegato GPT-5.6 Sol a Codex e al software di misurazione già in uso al MIT. L’agente ha selezionato i parametri, azionato gli strumenti, interpretato i dati in arrivo e deciso se perfezionare una misurazione o passare alla fase successiva. Il lavoro si è concentrato sulla calibrazione di routine di un chip a sei qubit, non sulla progettazione o sull’esecuzione di un nuovo algoritmo quantistico.
Quaranta misurazioni, quattro interventi
Beatriz Yankelevich, dottoranda al MIT, ha usato Codex tramite un’interfaccia interna basata su Jupyter, collegata al sistema di orchestrazione del laboratorio dell’Engineering Quantum Systems Group. Il sistema ha dato all’agente accesso ai parametri di misurazione in tempo reale, ai programmi di controllo, ai grafici, ai dati grezzi, ai log, a un database di misurazioni e agli appunti di laboratorio.
Il chip conteneva sei qubit non accoppiati: quattro a frequenza fissa e due a frequenza sintonizzabile. Non era mai stato sottoposto a misurazioni. GPT-5.6 Sol ha innanzitutto individuato i sei risonatori di lettura, ne ha identificato le frequenze approssimative e ha selezionato potenze degli impulsi adeguate. Secondo il caso di studio tecnico di OpenAI, l’agente ha poi completato una serie standard di misurazioni sui quattro qubit a frequenza fissa, tra cui spettroscopia, calibrazione degli impulsi, ottimizzazione della lettura e misurazioni della coerenza.
Per un qubit, l’agente ha misurato un tempo di rilassamento di circa 32 microsecondi e un tempo di coerenza di Ramsey di circa 59 microsecondi. Questi valori sono stati ottenuti durante la sequenza di calibrazione, che comprendeva anche misurazioni delle energie di transizione del qubit, della risposta del risonatore e della temperatura effettiva.
Nell’esperimento è stato usato GPT-5.6 Sol al livello di ragionamento Ultra. Il caso di studio tecnico di OpenAI, datato 4 settembre 2026, afferma che l’agente ha operato l’hardware in tempo reale tramite il software di orchestrazione già in uso presso EQuS, senza ricorrere a un framework specializzato per agenti, ma solo a una semplice interfaccia interna.
Cosa controllava davvero l’agente
Gli esperimenti con qubit superconduttori si prestano particolarmente bene all’uso di agenti software: il chip fisico si trova in un frigorifero a diluizione, mentre l’elettronica a temperatura ambiente genera impulsi a microonde, raccoglie i segnali di ritorno ed elabora i risultati. Una volta raffreddato e cablato il dispositivo, gran parte dell’esperimento si svolge tramite software.
La calibrazione consiste in una catena di decisioni interdipendenti. La misurazione della frequenza di un risonatore determina le impostazioni da usare per gli impulsi di lettura successivi. La spettroscopia individua la frequenza di transizione di un qubit. Le misurazioni di Rabi permettono di stabilire ampiezze e durate degli impulsi, mentre le sequenze di rilassamento e di eco stimano per quanto tempo il qubit conserva l’informazione quantistica.
GPT-5.6 Sol ha utilizzato istruzioni specifiche per ogni misurazione, che descrivevano il codice pertinente, le calibrazioni necessarie, le indicazioni per selezionare i parametri, le probabili modalità di errore e alcuni esempi di grafici riusciti e non riusciti. L’agente poteva eseguire la misurazione, adattare un modello ai dati risultanti o esaminarli, aggiornare le impostazioni di calibrazione e avviare l’esperimento successivo.
Quando i segnali erano chiari, il sistema richiedeva poca supervisione. OpenAI afferma che l’agente ha individuato tutti e sei i risonatori del chip e completato una sequenza standard di misurazioni che ha determinato le frequenze di transizione, le impostazioni degli impulsi di controllo e i tempi di coerenza.
I segnali rumorosi hanno messo in luce il limite
Lo stesso sistema si è dimostrato meno affidabile quando i dati erano deboli o ambigui. I due qubit sintonizzabili producevano segnali più deboli lontano dalla loro frequenza massima e, inizialmente, l’agente ha faticato a tracciare lo spettro di un qubit lungo l’intero intervallo di flusso.
I ricercatori hanno dovuto suggerire scansioni più ampie e parametri di misurazione più puliti prima che l’agente producesse un risultato accettabile. In un tentativo precedente, GPT-5.6 Sol aveva giudicato erroneamente soddisfacente una scansione, benché lo spettro del qubit fosse uscito da una parte dell’intervallo misurato. Il ricercatore ha quindi chiesto una scansione più fine, che ha rivelato le caratteristiche mancanti.
La misurazione finale accettata conteneva un’asimmetria inspiegata e un incrocio tra modi vicino a 4,8 gigahertz. Secondo il caso di studio di OpenAI, per stabilire se queste caratteristiche fossero di natura fisica e se fossero rilevanti per l’esperimento serviva comunque un ricercatore esperto.
Questi errori sono importanti perché i dati di laboratorio raramente arrivano con una risposta già pronta. Una caratteristica debole può indicare un effetto fisico reale, la scelta di un parametro sbagliato, rumore strumentale o un cambiamento del dispositivo. GPT-5.6 Sol era in grado di adattare il proprio flusso di lavoro, ma non riconosceva sempre con coerenza quale spiegazione dovesse avere la priorità.
Operatività notturna, non una fisica più veloce
L’agente ha anche monitorato un ciclo automatizzato per 12 ore durante la notte, nel corso delle quali il sistema ha eseguito 200 misurazioni lungo un intervallo di flusso. In seguito, i ricercatori hanno esaminato diversi punti in cui le misurazioni non erano riuscite.
Nel rapporto, OpenAI individua il vantaggio pratico nell’operatività senza supervisione, non in una maggiore velocità di acquisizione dei dati. Secondo il caso di studio, un ricercatore esperto può caratterizzare qubit a frequenza fissa in circa un giorno e qubit sintonizzabili in circa una settimana. L’agente può impiegare più tempo di un esperto per raggiungere le impostazioni corrette, ma può continuare a lavorare mentre il ricercatore si trova in camera bianca, analizza i risultati o pianifica l’esperimento successivo.
«Posso lasciare che gli agenti eseguano misurazioni per molte ore durante la notte o mentre lavoro in camera bianca», ha detto Yankelevich. «Posso controllare dal telefono cosa hanno fatto e guidarli se c’è qualcosa da correggere o se voglio esplorare un’altra direzione».
Beatriz Yankelevich, dottoranda, MIT Engineering Quantum Systems Group
È anche possibile misurare contemporaneamente più chip in un unico frigorifero, con limiti determinati soprattutto dai cablaggi e dalle porte disponibili per l’elettronica di controllo. In questo modo gli agenti possono aumentare il numero di dispositivi che un gruppo di ricerca riesce a caratterizzare, anche se ogni singola misurazione richiede sempre lo stesso tempo fisico.
La calibrazione di routine è solo la prima prova
OpenAI e MIT descrivono il chip come un dispositivo di riferimento semplice. Le misurazioni erano standard e molto meno complesse della calibrazione necessaria per un nuovo esperimento con più qubit. Il caso di studio non sostiene che GPT-5.6 Sol abbia scoperto autonomamente un nuovo fenomeno quantistico o condotto un intero programma di ricerca senza la guida di esseri umani.
La prossima sfida tecnica consiste nel combinare generazione di codice, simulazione e misurazione in un unico ciclo. Spesso i ricercatori simulano un esperimento prima di eseguirlo, per poi imbattersi in comportamenti fisici che il modello non aveva previsto. Un agente capace di modificare il software di controllo, metterlo alla prova con misurazioni in tempo reale e confrontare i risultati con la simulazione potrebbe abbreviare i cicli di sviluppo di esperimenti più complessi.
Anche le attività più prolungate dovranno fare i conti con la deriva dell’hardware. Gli offset di flusso, i tempi di coerenza e i difetti microscopici possono cambiare nel tempo, facendo fallire una misurazione che prima riusciva. Per diagnosticare il problema potrebbe essere necessario riesaminare decisioni prese decine di passaggi prima: un compito che dipende ancora molto dal contesto sperimentale.
Per ora, il risultato è più circoscritto e concreto: GPT-5.6 Sol è in grado di eseguire per periodi prolungati un flusso di lavoro definito per la calibrazione di qubit superconduttori e, nelle misurazioni più chiare, ha completato 36 dei 40 obiettivi senza interventi. Le quattro correzioni, i dati rumorosi dei qubit sintonizzabili e il ciclo supervisionato di 12 ore mostrano perché i ricercatori considerino gli agenti operatori di laboratorio per le attività di routine, non sostituti delle persone che interpretano i fenomeni fisici incerti.