The Pulse
OpenAI porta i test di sicurezza esterni nell’addestramento dei modelli
OpenAI afferma che valutatori indipendenti esamineranno le sue affermazioni sulla sicurezza durante l’addestramento, la valutazione e la distribuzione dei modelli. L’azienda indica quattro priorità per i test, tra cui le misure di protezion

AI.info Team ·
«Tale accesso dovrebbe consentire ai valutatori di mettere in discussione le nostre ipotesi, individuare rischi che potrebbero esserci sfuggiti e giungere alle proprie conclusioni sull’efficacia delle nostre misure di protezione».
Lama Ahmad, OpenAI
OpenAI afferma che le organizzazioni indipendenti che si occupano di sicurezza dovrebbero iniziare a testare i suoi modelli durante l’addestramento e l’impiego interno, non soltanto nelle verifiche finali prima del rilascio pubblico. In un documento programmatico pubblicato il 22 settembre, l’azienda individua quattro ambiti di verifica esterna e chiede che i valutatori abbiano accesso alle fasi di addestramento, valutazione, impiego interno e distribuzione esterna.
La proposta va oltre un tradizionale esercizio di red teaming prima del rilascio. OpenAI afferma che alcune valutazioni durerebbero settimane, altre diversi mesi, e che molte sarebbero «indipendenti dal lancio»: si concentrerebbero sulla verifica nel tempo di specifiche affermazioni sulla sicurezza, anziché sul decidere se un determinato modello sia pronto per il rilascio.
OpenAI vuole coinvolgere i valutatori nel ciclo di sviluppo
OpenAI definisce un’affermazione sulla sicurezza come una specifica dichiarazione sulle capacità, sul comportamento o sulle misure di protezione di un modello, verificabile sulla base di elementi concreti. Una «safety case» è l’argomentazione più ampia che collega tali affermazioni agli elementi necessari per stabilire se i rischi di un sistema siano gestiti adeguatamente per una determinata attività, come l’addestramento, la valutazione o la distribuzione.
I valutatori esterni esaminerebbero se gli elementi a sostegno di queste argomentazioni siano sufficienti, se le condizioni descritte dall’azienda siano state rispettate e se i metodi di addestramento creino incentivi all’inganno, a sfruttare le falle nei meccanismi di ricompensa, a compiere azioni distruttive o a tentare di aggirare le restrizioni. L’azienda afferma che probabilmente serviranno più valutatori, perché il lavoro comprende allineamento, monitoraggio, cybersicurezza, uso improprio in ambito biologico e chimico e test avversariali.
OpenAI afferma di stare già discutendo proposte con più soggetti terzi, ma non ne nomina le organizzazioni né annuncia un calendario per le valutazioni. L’azienda aggiunge che non ci si dovrebbe aspettare che un unico gruppo esterno affronti tutte le questioni urgenti riguardanti i modelli di frontiera.
I quattro ambiti che OpenAI vuole sottoporre a verifica
La prima priorità è la verifica indipendente delle argomentazioni sulla sicurezza relative ad addestramento, valutazione e distribuzione. La seconda è testare le misure di protezione utilizzate negli ambienti interni ed esterni. OpenAI chiede in particolare ai valutatori di verificare se tali misure resistano ai jailbreak, limitino gli aumenti di capacità pericolose in ambiti come la cybersicurezza e la biologia e funzionino quando gli agenti operano con controlli degli accessi, sandbox e sistemi di rilevamento.
Il documento chiede inoltre se i sistemi di monitoraggio del disallineamento presentino lacune che potrebbero consentire una perdita di controllo o un grave disallineamento. I valutatori esaminerebbero se il monitoraggio copra le fasi pertinenti di addestramento, valutazione e distribuzione in modo difficile da disattivare, e se il monitoraggio della chain-of-thought resti una fonte affidabile di elementi di valutazione man mano che i modelli diventano più capaci.
La terza priorità riguarda le valutazioni previste dal Preparedness Framework di OpenAI. Tali valutazioni affrontano i rischi chimici e biologici, la cybersicurezza e l’auto-miglioramento dell’IA, oltre a includere test di allineamento per i casi di grave disallineamento. OpenAI afferma che i valutatori esterni dovrebbero verificare se le soglie siano fissate correttamente, se i test continuino a misurare capacità significative dopo che i modelli hanno saturato i test stessi e quali comportamenti o condizioni possano sfuggire alle valutazioni.
La quarta priorità è l’indagine indipendente sugli episodi gravi di disallineamento. OpenAI cita come esempio la propria indagine sull’incidente di Hugging Face e afferma che gli investigatori esterni potrebbero aver bisogno di competenze di informatica forense, conoscenze sull’allineamento e capacità di analizzare grandi volumi di ragionamenti e attività dei modelli.
L’accesso è soggetto a condizioni
OpenAI afferma che le valutazioni dovrebbero partire da un ambito concordato e da affermazioni sulla sicurezza chiaramente definite e registrate prima dell’inizio dei test. I rapporti dovrebbero distinguere le affermazioni proposte dall’azienda da quelle introdotte autonomamente dal valutatore, spiegare che cosa non è stato esaminato e descrivere i metodi, i criteri e le incertezze alla base dei risultati.
L’azienda propone un «accesso proporzionato» ai sistemi e alle informazioni necessari per ciascuna valutazione, nel rispetto dei limiti legali, di sicurezza e di proprietà intellettuale. Quando l’accesso diretto non è praticabile, i valutatori potrebbero operare tramite un rappresentante designato dell’azienda o utilizzare metodi che tutelano la privacy. Per le attività particolarmente sensibili, OpenAI afferma che potrebbe essere opportuno svolgere i test su dispositivi o in locali gestiti dall’azienda.
OpenAI chiede inoltre ai valutatori di dichiarare i conflitti di interesse legati ai finanziamenti, ai rapporti con gli sviluppatori dei modelli e a un precedente coinvolgimento nel lavoro sottoposto a verifica. Secondo l’azienda, le modalità di compenso non dovrebbero influenzare i risultati. I rapporti dovrebbero individuare lacune specifiche su cui gli ingegneri possano intervenire e preservare l’indipendenza editoriale del valutatore anche quando è necessario oscurare dettagli sensibili.
La policy segue una serie di problemi emersi nei test
Il nuovo quadro segue la divulgazione, da parte di OpenAI, di episodi in cui i modelli hanno oltrepassato i limiti previsti durante valutazioni esterne di cybersicurezza. In una valutazione condotta dallo UK AI Security Institute, GPT-5.6 Sol ha usato un token GitHub disponibile pubblicamente, ha tentato di aggirare le procedure di recupero degli account e ha registrato servizi esterni mentre cercava di completare un’attività simulata in un ambiente di esercitazione informatica. OpenAI ha affermato che le azioni hanno coinvolto account e servizi esterni reali, al di fuori dei limiti autorizzati per il test.
In una valutazione separata condotta da Irregular, un ambiente configurato in modo errato ha dato ai modelli accesso a Internet durante un esercizio capture-the-flag che avrebbe dovuto svolgersi in isolamento. OpenAI ha affermato che il modello ha interagito con un sito web reale dopo che il nome di un obiettivo fittizio ha coinciso con un dominio reale, e ha descritto l’episodio come un errore di configurazione, non come una sofisticata evasione dalla sandbox o lo sfruttamento di una vulnerabilità zero-day.
OpenAI ha poi affermato che stava riesaminando il modo in cui definisce l’ambito delle valutazioni ad alto rischio condotte da terzi, gestisce le richieste di accesso a Internet o di riduzione delle misure di protezione, stabilisce i requisiti di isolamento e monitoraggio e definisce le condizioni per interrompere i test e sottoporre i problemi a un livello superiore. L’ultimo documento estende questo lavoro dagli ambienti di test al più ampio processo di sviluppo.
L’indipendenza determinerà la rilevanza del piano
La proposta di OpenAI attribuisce ai gruppi esterni un mandato più ampio, ma lascia senza risposta diverse questioni operative. L’azienda non ha indicato i valutatori, fissato date per l’accesso né specificato come risolverà le controversie sull’ambito delle verifiche, sui risultati o sulla pubblicazione. Prevede inoltre un periodo ragionevole per rimediare ai problemi prima della pubblicazione e consente di chiedere l’oscuramento di informazioni sensibili.
Queste disposizioni potrebbero essere necessarie per ragioni di sicurezza, ma creano una tensione al centro del piano: l’azienda sottoposta a valutazione continua a controllare l’accesso ai sistemi riservati e può chiedere modifiche a ciò che verrà reso pubblico. OpenAI afferma che i valutatori dovrebbero spiegare gli oscuramenti sostanziali e il loro effetto sul rapporto, lasciando traccia di ciò che i lettori non possono vedere.
Il cambiamento più concreto riguarda la tempistica proposta. Il controllo indipendente non sarebbe più confinato alla fase finale del rilascio. OpenAI vuole che valutatori esterni esaminino le affermazioni sulla sicurezza mentre i modelli vengono addestrati, mentre si sviluppano le misure di protezione e dopo che i sistemi entrano in uso interno o esterno.