The Pulse
Meta aggiunge misure di sicurezza durante l’addestramento al suo quadro per il rilascio dei modelli di IA
Il 2 ottobre Meta ha aggiornato il suo Superintelligence Scaling Framework, aggiungendo misure di sicurezza per le sessioni di addestramento ad alto rischio e perfezionando il modo in cui valuta i rilasci di modelli a pesi aperti. L’azienda

AI.info Team ·
Tre misure di sicurezza entrano nelle sessioni di addestramento ad alto rischio
L’aggiornamento del 2 ottobre di Meta introduce tre misure di sicurezza per le sessioni di apprendimento per rinforzo ad alto rischio: sandbox sottoposte a verifica, registrazioni protette dell’attività del modello e sistemi di monitoraggio automatici in grado di interrompere una sessione. Le misure estendono le regole di Meta sulla perdita di controllo oltre la distribuzione dei modelli, fino all’addestramento e alla valutazione. Meta afferma che valuterà innanzitutto se un modello possa compromettere l’ambiente in cui opera; i controlli aggiuntivi si applicano se viene individuato questo rischio.
Per queste sessioni, Meta afferma che esaminerà le sandbox alla ricerca di gravi vulnerabilità e di configurazioni che potrebbero favorire la manipolazione delle ricompense, come sistemi di valutazione sfruttabili o compiti impossibili. Registrerà gli output del modello, comprese le traiettorie complete e la catena di pensiero, in sistemi progettati per impedire che vengano successivamente modificati o cancellati. Sistemi di monitoraggio automatici seguiranno ogni rollout di un modello ad alto rischio, con la facoltà di interrompere una sessione in caso di gravi comportamenti scorretti o tentativi di eludere il contenimento.
«Prima di ogni sessione di addestramento con apprendimento per rinforzo, stabiliremo se le capacità del modello in fase di addestramento potrebbero potenzialmente compromettere l’ambiente in cui opera.»
Meta AI Research
Meta afferma inoltre che sottoporrà i sistemi di monitoraggio a stress test per valutare se siano in grado di rilevare azioni non autorizzate. L’azienda cita il rischio che un modello con forti capacità nel campo della cybersicurezza possa sfruttare debolezze dell’ambiente circostante prima del rilascio, ma nel post non indica un incidente specifico.
I pesi aperti comportano un rischio diverso
Il quadro rivisto precisa anche come Meta valuta i modelli i cui pesi diventano pubblicamente disponibili. Meta afferma che chi ha accesso ai pesi potrebbe tentare ripetutamente, generando più risposte, di aggirare un rifiuto, precompilare gli output o eliminare con il fine-tuning il comportamento di rifiuto. Secondo l’azienda, la valutazione dovrebbe tenere conto di come un modello possa essere modificato e utilizzato nel suo specifico contesto di distribuzione.
Meta afferma che potrebbe avvalersi di esperti esterni per la modellazione delle minacce e che terrà conto dei contributi di enti governativi e altre parti interessate. Per i rischi legati alle armi biologiche e chimiche, prevede di valutare sia le capacità che un modello rende possibili sia la possibilità che una specifica distribuzione contribuisca alla proliferazione.
L’azienda presenta i rilasci a pesi aperti come utili per la ricerca riproducibile, compresi i lavori sull’allineamento e sull’interpretabilità, e per applicazioni come l’analisi di immagini mediche. L’aggiornamento non annuncia una sospensione dei rilasci aperti né cita un nuovo modello; espone ulteriori fattori che Meta afferma di voler considerare prima di decidere sui rilasci.
La supervisione del consiglio di amministrazione resta in programma
Meta afferma che istituirà un comitato per l’IA del proprio consiglio di amministrazione «nei prossimi mesi». Il comitato dovrà esaminare le future modifiche al quadro e verificare in modo indipendente se le attività dell’azienda rispettino gli standard che essa dichiara di seguire. Si tratta di una misura di governance prevista, non di un comitato che Meta afferma sia già operativo.
La tempistica segue un accordo della Casa Bianca del 29 settembre, firmato dall’amministratore delegato di Meta Mark Zuckerberg e dai vertici di Google, Anthropic, OpenAI, xAI e Nvidia, insieme al presidente Donald Trump. Il documento stabilisce quattro livelli di supervisione: controlli aziendali, un team interno, un revisore o valutatore esterno indipendente e un comitato indipendente del consiglio di amministrazione. Meta afferma che i cambiamenti di governance previsti sono in linea con questi impegni.
Controlli specifici, ma date ancora da definire
Per sviluppatori e ricercatori, l’aggiornamento rende più specifico l’approccio dichiarato da Meta in due ambiti: il contenimento durante l’addestramento e la valutazione dei rischi dei modelli a pesi aperti dopo il rilascio. Chiarisce inoltre che l’accesso aperto resta parte dell’approccio dichiarato di Meta, pur introducendo un esame più attento di come i pesi rilasciati potrebbero essere adattati.
Nel post Meta non indica né i membri del comitato del consiglio di amministrazione previsto né un revisore esterno, e non fornisce una data precisa per il comitato oltre a «nei prossimi mesi». Le nuove misure di sicurezza per l’addestramento sono descritte in termini operativi; non lo è il calendario pubblico della supervisione da parte del consiglio di amministrazione e di soggetti esterni.