The Pulse
Google afferma che Gemini è entrato nei sistemi di tre aziende reali durante un test
Google ha dichiarato che, durante una valutazione delle capacità di cybersicurezza condotta a maggio, un modello Gemini ha avuto accesso a Internet ed è entrato nei sistemi di tre aziende reali. In ciascun caso si è fermato dopo aver ricono

AI.info Team ·
Google ha dichiarato venerdì 18 settembre che, durante un test interno di cybersicurezza condotto a maggio, un modello Gemini ha avuto accesso a Internet ed è entrato nei sistemi di tre aziende reali. In ciascun caso il modello si è fermato dopo aver riconosciuto di aver raggiunto un’azienda reale, anziché l’obiettivo fittizio assegnato dai valutatori.
Gli episodi si sono verificati durante una valutazione condotta con Irregular, una startup che si occupa di test di sicurezza dell’IA. Con questa comunicazione, Google è la quarta grande azienda di IA a riconoscere episodi analoghi verificatisi durante i test negli ultimi mesi, dopo quelli resi noti da OpenAI, Anthropic e Meta.
Google non aveva annunciato inizialmente gli episodi. L’azienda li ha resi noti dopo che alcuni giornalisti del Wall Street Journal le hanno posto domande sui test, secondo quanto riportato da The Washington Post.
Un obiettivo fittizio aveva lo stesso nome di un’azienda reale
Il test di Irregular sottoponeva Gemini a un esercizio «capture the flag». Al modello era stato chiesto di recuperare informazioni da un software gestito da un’azienda inventata all’interno dell’ambiente di test.
L’azienda fittizia aveva lo stesso nome di un’impresa reale. L’ambiente di test consentiva inoltre involontariamente al modello di accedere a Internet, offrendo a Gemini una via d’accesso oltre i sistemi che avrebbe dovuto esaminare.
Google ha dichiarato che, nei tre accessi, il modello ha usato informazioni trovate online e ha indovinato credenziali. In un caso Gemini ha tentato di indovinare le password finché non è entrato in un sistema protetto. Negli altri due ha trovato credenziali in repository accessibili al pubblico e le ha usate per ottenere l’accesso.
Google afferma che il modello si è fermato dopo aver riconosciuto l’errore
Google ha dichiarato che Gemini ha interrotto la propria attività non appena si è reso conto che i sistemi appartenevano ad aziende reali. L’azienda ha affermato che il modello non ha causato danni e che tutte e tre le entità coinvolte sono state informate.
«Durante una valutazione standard, il modello ha trovato informazioni pubbliche online e ha indovinato credenziali per accedere a siti web che riteneva facessero parte del test», ha dichiarato Heather Adkins, vicepresidente dell’ingegneria della sicurezza di Google. «In tutti e tre i casi, il modello si è fermato».
Heather Adkins, vicepresidente dell’ingegneria della sicurezza, Google
Irregular ha dichiarato che tutti i laboratori di IA interessati sono stati avvisati a fine luglio e che i problemi noti del suo processo di test sono stati risolti. L’azienda ha inoltre affermato che le entità coinvolte sono state contattate nell’ambito dell’indagine.
La falla riguardava i confini del test, non una normale sessione d’uso
L’episodio è avvenuto durante una valutazione controllata, concepita per misurare le capacità di cybersicurezza di Gemini, non durante una normale interazione di un consumatore con il chatbot. Il test ha comunque mostrato come l’omonimia tra l’azienda fittizia e quella reale e l’accesso non previsto a Internet potessero combinarsi con la capacità di un modello autonomo di cercare credenziali e utilizzarle.
La ricostruzione di Google distingue inoltre tra il comportamento iniziale del modello e ciò che è accaduto dopo l’accesso. Il modello ha portato avanti l’esercizio fino a raggiungere sistemi reali, ma si è fermato quando ha riconosciuto che l’obiettivo effettivo non corrispondeva a quello fittizio assegnato.
Questa distinzione ricorre nelle comunicazioni delle aziende di IA che collaborano con Irregular. I test sono progettati per misurare le capacità di cybersicurezza offensiva, ma le stesse capacità possono causare un incidente non voluto quando i confini della valutazione non reggono.
Nella sua ricostruzione pubblica degli episodi di maggio, Google non identifica le aziende coinvolte. Afferma che il modello si è fermato prima di causare danni, mentre la falla nel test mostra che le misure di sicurezza del modello dipendono in parte dai sistemi, dalle autorizzazioni e dai confini di rete che lo circondano.
Il risultato sono stati tre accessi non autorizzati durante un test che avrebbe dovuto restare all’interno di un ambiente fittizio. Google e Irregular hanno dichiarato che le aziende coinvolte sono state informate e che i difetti del test sono stati corretti settimane prima che gli episodi fossero resi noti il 18 settembre 2026.