Vai al contenuto
AI.info

The Pulse

Base Labs collabora con Hugging Face e Goodfire sulla sicurezza dei modelli open

Base Labs collabora con Hugging Face e Goodfire AI allo sviluppo di infrastrutture per la valutazione e il monitoraggio della sicurezza dei modelli a pesi aperti.

Base Labs collabora con Hugging Face e Goodfire sulla sicurezza dei modelli open

AI.info Team ·

Su Hugging Face sono elencati più di 6.000 modelli abliterati, secondo TechCrunch, mentre Base Labs avvia una collaborazione sulla sicurezza con Hugging Face e Goodfire AI. La collaborazione svilupperà metodi per addestrare e monitorare modelli a pesi aperti, per poi integrare quei metodi nei sistemi di distribuzione in produzione di Baseten.

Per «abliterazione» si intendono le tecniche che rimuovono o indeboliscono i controlli di sicurezza di un modello dopo che i suoi pesi sono stati rilasciati. La diffusione di questi modelli ha reso le misure di protezione un problema che non può essere affrontato soltanto durante l’addestramento iniziale. Gli sviluppatori hanno anche bisogno di strumenti per testare i modelli prima della distribuzione e osservarne il comportamento mentre vengono utilizzati dagli utenti.

Base Labs vuole integrare i controlli di sicurezza nel ciclo di vita dei modelli

Base Labs, l’organizzazione di ricerca creata dalla società di infrastrutture per l’IA Baseten, afferma che svilupperà e pubblicherà metodi per addestrare e monitorare modelli aperti. Baseten integrerà il lavoro risultante nella propria infrastruttura di distribuzione, monitorerà i modelli durante l’esecuzione e offrirà il servizio ai clienti.

L’azienda descrive l’iniziativa come uno standard di sicurezza per i modelli aperti, anziché come un prodotto chiuso. Nell’annuncio afferma che il lavoro sarà trasparente e integrato nelle modalità di addestramento e distribuzione dei modelli, invitando sviluppatori e ricercatori esterni a contribuire.

«Crediamo che l’apertura sia un vantaggio per la sicurezza dell’IA. L’apertura offre maggiore visibilità sul comportamento dei modelli e, soprattutto, maggiori possibilità di trasformare la ricerca sulla sicurezza in controlli concreti e trasparenti rispetto a quanto consentano le soluzioni a codice chiuso.»

Base Labs, citata da TechCrunch

L’affermazione riflette una tensione di lunga data nello sviluppo di modelli a pesi aperti. I pesi pubblici consentono ai ricercatori di ispezionare e modificare i modelli, ma le stesse possibilità permettono agli utenti di rimuovere le misure di protezione, applicare il fine-tuning per ottenere comportamenti indesiderati o distribuire versioni modificate al di fuori del controllo dello sviluppatore originale.

Goodfire porta nella collaborazione l’interpretabilità dei modelli

Goodfire si definisce un laboratorio di ricerca sull’interpretabilità dell’IA, che sviluppa strumenti per comprendere, monitorare e allineare i modelli. Il suo ruolo nella collaborazione non è stato precisato nei dettagli tecnici, ma il lavoro dell’azienda si concentra sull’esame delle caratteristiche e dei meccanismi interni che influenzano il comportamento dei modelli.

In risposta all’annuncio di Base Labs, Goodfire ha riassunto il principio operativo in termini diretti: «La sicurezza deve essere integrata nei modelli aperti e garantita da chi li mette a disposizione». La dichiarazione fa pensare a una ripartizione dei compiti in cui Base Labs sviluppa metodi di addestramento e monitoraggio, Goodfire contribuisce all’analisi del comportamento dei modelli e Baseten applica i controlli durante l’inferenza.

Nessuna delle aziende ha pubblicato un’architettura dettagliata, una suite di valutazione o un calendario di lancio per la collaborazione. L’annuncio non indica neppure quali modelli saranno utilizzati per i test iniziali, quali rischi per la sicurezza saranno misurati o come i partner gestiranno i modelli modificati dagli sviluppatori dopo il rilascio.

Baseten collega la ricerca all’inferenza in produzione

Il ruolo di Baseten fornisce al progetto un livello di distribuzione che la maggior parte delle ricerche sulla sicurezza dei modelli non controlla direttamente. Secondo l’annuncio, l’azienda effettuerà il monitoraggio in produzione, anziché considerare la valutazione un controllo una tantum prima che il modello raggiunga gli utenti.

La distinzione è importante per i sistemi a pesi aperti. Un modello può superare un test di sicurezza in una configurazione e comportarsi diversamente dopo il fine-tuning, la quantizzazione, l’integrazione di strumenti o modifiche al prompt di sistema. Il monitoraggio durante l’esecuzione può esaminare il modello mentre viene effettivamente messo a disposizione, anche se la collaborazione non ha specificato quali segnali verranno raccolti né quali azioni scatteranno in caso di problemi.

Baseten ha inoltre presentato Base Labs come un’organizzazione di ricerca, anziché come una tradizionale unità commerciale dedicata ai prodotti. Un annuncio separato dell’azienda descrive il lavoro di Base Labs come ricerca aperta sull’apprendimento continuo, l’apprendimento per rinforzo, il post-addestramento e le prestazioni dei modelli, con esperimenti e ricette condivisi pubblicamente.

I modelli aperti devono dimostrare la loro sicurezza nella pratica

La collaborazione arriva mentre diventa più facile scaricare, modificare e distribuire modelli a pesi aperti. Hugging Face ospita uno dei più grandi archivi pubblici di questi sistemi, Baseten fornisce l’infrastruttura per metterli a disposizione e Goodfire sviluppa strumenti per esaminarne il comportamento interno.

Questa combinazione copre tre diversi momenti del ciclo di vita dei modelli: distribuzione, messa in produzione e ispezione. Potrebbe offrire agli sviluppatori un metodo comune per confrontare i modelli, individuare comportamenti non sicuri e applicare controlli, senza costringere ogni organizzazione a costruire una propria struttura di valutazione e monitoraggio.

La questione più difficile è se uno standard volontario possa tenere il passo con i modelli modificati che escono dall’infrastruttura dei partner originari. Base Labs invita la comunità open source a partecipare, ma l’annuncio non definisce regole di certificazione, meccanismi di applicazione né una procedura per i modelli ospitati altrove.

La prima misura concreta dei progressi sarà ciò che i partner pubblicheranno: i metodi di addestramento e monitoraggio, i risultati delle valutazioni e i controlli durante l’esecuzione. Finché questi materiali non saranno disponibili, la collaborazione resterà una dichiarazione d’intenti, non un sistema di sicurezza dimostrato.

Fonte

Esplora

Altri articoli