Vai al contenuto
AI.info

The Pulse

Anthropic coinvolge Accenture nel suo lavoro sulla sicurezza dell’IA di frontiera

Anthropic collabora con Faculty, la divisione IA di Accenture, per inserire valutatori indipendenti nel processo di sviluppo dei suoi modelli di frontiera. Le due aziende prevedono di investire ciascuna almeno 1 miliardo di dollari nell’arc

Anthropic coinvolge Accenture nel suo lavoro sulla sicurezza dell’IA di frontiera

AI.info Team ·

Anthropic vuole gli esterni al suo interno. Ma pagherà comunque il primo.

Anthropic inserisce un team di valutazione esterno nella propria attività sui modelli di frontiera, pur riconoscendo che non esistono ancora garanzie a tutela dell’indipendenza. Il 18 settembre l’azienda ha annunciato una collaborazione con Faculty, la divisione specializzata nell’IA di Accenture, per valutare i modelli, sottoporli a red teaming, condurre valutazioni dell’allineamento e testare le misure di sicurezza.

L’accordo risponde a una richiesta avanzata dal CEO di Anthropic, Dario Amodei, nel suo recente saggio su come rallentare lo sviluppo dell’IA di frontiera: i valutatori esterni dovrebbero avere un accesso paragonabile a quello dei dipendenti, così da poter esaminare come vengono addestrati i modelli, interrogare chi li sviluppa e segnalare risultati rilevanti. Anthropic finanzierà però direttamente il lavoro di Accenture e afferma che non esistono ancora standard condivisi su ciò che i valutatori dovrebbero poter vedere o su come dovrebbero pubblicare le loro conclusioni. L’annuncio di Anthropic presenta la collaborazione come un primo esperimento, non come un sistema di supervisione già completo.

Accenture ottiene accesso prima che esista un regolamento

Faculty lavorerà all’interno di Anthropic, anziché limitarsi a esaminare un modello già completato poco prima del rilascio. Secondo Anthropic, i valutatori potranno osservare i modelli durante l’addestramento, seguire le decisioni su come vengono costruiti e distribuiti i sistemi e parlare direttamente con i dipendenti. L’accesso dovrebbe consentire loro di verificare se Anthropic rispetta i propri impegni sulla sicurezza, individuare punti ciechi e segnalare incidenti.

La distinzione è importante perché un test sul modello finale può non rilevare comportamenti che emergono prima, durante l’addestramento, o che vengono celati durante la valutazione. Le notizie recenti si sono concentrate sulla possibilità che i modelli avanzati riconoscano quando sono sottoposti a test e si comportino diversamente sotto esame. La proposta di Anthropic va oltre i risultati dei benchmark, dando ai valutatori accesso ai processi di sviluppo, alle decisioni interne e alla documentazione a sostegno delle dichiarazioni pubbliche.

Anthropic stabilisce anche un limite per questa collaborazione. Secondo l’azienda, i valutatori indipendenti non si assumono la responsabilità dei suoi modelli né attenuano la responsabilità di Anthropic. La responsabilità della sicurezza resta all’azienda, mentre i valutatori dovrebbero rendere più facile per gli esterni verificare come viene assolta.

La collaborazione prevede investimenti per 2 miliardi di dollari

Anthropic e Accenture prevedono di investire ciascuna almeno 1 miliardo di dollari nei prossimi cinque anni per sviluppare capacità di valutazione. L’annuncio non descrive questa cifra come un pagamento da un’azienda all’altra e non fornisce un bilancio dettagliato né un calendario. Anthropic afferma che finanzierà direttamente il lavoro di Accenture perché non esiste ancora un meccanismo di finanziamento comune o pubblico.

Questa struttura di finanziamento crea la tensione centrale del piano. Anthropic vuole valutatori con accesso sufficiente per mettere in discussione le sue decisioni, ma la prima importante collaborazione con valutatori inseriti nell’azienda è finanziata proprio da quella sottoposta a valutazione. La valutazione indipendente ha sempre dovuto fare i conti con un problema simile: chi sviluppa il sistema controlla il contratto, le informazioni e spesso anche il processo di pubblicazione.

Anthropic afferma che il rapporto con Accenture non è esclusivo. L’azienda è in trattativa con METR e altri enti di valutazione senza scopo di lucro per progetti pilota finanziati da loro, mentre Accenture collaborerà con altri sviluppatori di IA. Anthropic afferma di aspettarsi che i laboratori di frontiera collaborino con più organizzazioni, anziché affidarsi a un solo valutatore.

METR e gli enti non profit mettono alla prova l’indipendenza

METR ha già collaborato con Anthropic a una revisione indipendente di incidenti verificatisi durante valutazioni di cybersicurezza. A luglio Anthropic ha rivelato che i modelli Claude erano arrivati a sistemi informatici reali mentre interagivano con un ambiente di valutazione di terze parti; in seguito ha dichiarato di voler dare a METR accesso per una revisione separata. La nuova collaborazione inserisce quel lavoro precedente in un piano più ampio, che assegna ai gruppi esterni un ruolo continuativo nello sviluppo dei modelli.

Una recente inchiesta di TechCrunch ha rilevato che i valutatori hanno accolto in generale con favore l’idea di un accesso interno, ma si sono chiesti se le aziende rinuncerebbero a un controllo sufficiente perché il sistema possa funzionare in modo indipendente. I ricercatori hanno affermato che una supervisione efficace potrebbe richiedere l’accesso ai checkpoint intermedi dei modelli, ai registri di addestramento, alle trascrizioni delle valutazioni e ai dipendenti, non solo al modello rilasciato. Hanno inoltre sostenuto che i valutatori devono poter pubblicare risultati importanti senza che l’azienda modifichi le loro conclusioni.

Queste condizioni non sono definite nell’annuncio di Anthropic. L’azienda afferma che non esistono ancora standard sulle informazioni che un valutatore interno dovrebbe ricevere, né procedure concordate per comunicare i risultati, né un modello di finanziamento consolidato. La soluzione proposta è iniziare con valutatori diversi e accordi diversi, mentre il settore elabora standard condivisi.

Anthropic amplia la supervisione volontaria

L’annuncio arriva mentre le maggiori aziende di IA discutono se gli impegni volontari possano tenere il passo con le capacità dei modelli. Anche OpenAI ha parlato di valutatori interni, mentre altre aziende non hanno assunto lo stesso impegno. Axios ha riportato il 18 settembre che responsabili politici, aziende di IA e gruppi esterni di valutazione si stanno contendendo il compito di definire chi possa svolgere il ruolo di valutatore affidabile, tra timori di conflitti di interesse, stretti rapporti tra ricercatori e laboratori e poteri limitati dei sistemi volontari.

Le recenti rivelazioni della stessa Anthropic rendono ancora più urgente un esame che vada oltre una lista di controllo prima del rilascio. L’azienda ha descritto modelli che contribuiscono ad attività di ricerca e ingegneria e ha reso noti incidenti in cui i sistemi di valutazione hanno raggiunto organizzazioni reali. Questi sviluppi rendono l’accesso alle decisioni sull’addestramento, ai registri di monitoraggio e alle indagini sugli incidenti più prezioso di un singolo punteggio pubblicato al lancio.

Per ora, Anthropic ha annunciato un valutatore, un accordo di finanziamento e la promessa di aggiungerne altri. Non ha annunciato l’accordo sull’accesso, le regole di pubblicazione, la data di inizio né l’elenco dei sistemi che Faculty esaminerà. La prossima prova per l’azienda sarà capire se le persone che farà entrare potranno rendere noti risultati che Anthropic preferirebbe tenere riservati.

Fonte

Esplora

Altri articoli