Vai al contenuto
AI.info

The Pulse

Un benchmark simulato di blackjack mette alla prova il rilevamento della collusione tra agenti di IA

Secondo uno studio basato su benchmark, l’analisi delle attivazioni interne dei modelli di IA ha rilevato comportamenti coordinati in un compito simulato di conteggio delle carte nel blackjack, anche quando gli agenti comunicavano con frasi

Un benchmark simulato di blackjack mette alla prova il rilevamento della collusione tra agenti di IA

AI.info Team ·

Secondo uno studio basato su benchmark, l’analisi delle attivazioni interne dei modelli di IA ha rilevato comportamenti coordinati in un compito simulato di conteggio delle carte nel blackjack, anche quando gli agenti comunicavano con frasi che sembravano normali chiacchiere al tavolo. In questo compito, cinque tecniche di rilevamento hanno ottenuto punteggi AUROC compresi tra 0,99 e 1,00 sul modello più efficace tra quelli testati dai ricercatori. Lo studio riporta inoltre risultati di trasferimento compresi tra 0,73 e 0,93 AUROC in scenari multiagente strutturalmente diversi.

Lo studio, «Detecting Multi-Agent Collusion Through Multi-Agent Interpretability», presenta NARCBench, un benchmark per verificare se i segnali interni dei modelli possano aiutare a individuare la collusione a livello di gruppo. Gli autori sono Aaron Rose, Carissa Cullen, Sahar Abdelnabi, Philip Torr, Brandon Gary Kaplowitz e Christian Schroeder de Witt.

Un benchmark articolato in tre tipi di test

NARCBench ha tre livelli. Il livello Core comprende 50 scenari di deliberazione collegiale in 17 ambiti. In questi test, gli agenti valutano una scelta binaria e quelli che si coordinano in segreto cercano di orientare il gruppo verso un esito prestabilito. Il livello Transfer mette alla prova sei famiglie di scenari strutturalmente diverse, tra cui il sabotaggio della revisione del codice, la manipolazione dei titoli azionari, il sabotaggio delle pipeline software, l’alterazione delle basi di conoscenza, l’orientamento delle politiche di ricerca e la rappresentazione delle notizie.

Il livello Stego usa il conteggio delle carte nel blackjack. Secondo la descrizione dello studio, due agenti concordano in privato uno schema di codifica: un Counter tiene traccia del conteggio progressivo delle carte e lo comunica attraverso le conversazioni pubbliche al tavolo, mentre un Big Player decodifica il segnale e adegua le puntate. Le conversazioni sono concepite per sembrare normali chiacchiere tra giocatori, e ogni serie simulata di carte usa un nuovo schema di codifica.

I ricercatori hanno testato quattro modelli a pesi aperti: Qwen3-32B, Llama-3.1-70B, DeepSeek-R1 32B e GPT-OSS-20B. Hanno addestrato un modello di analisi a ricavare punteggi di inganno dalle attivazioni degli agenti, poi hanno combinato i punteggi dei diversi agenti con cinque tecniche. I metodi mirano a rilevare schemi diversi, come un punteggio insolitamente alto per un agente, una differenza tra un sottogruppo colluso e gli altri agenti, oppure un cambiamento nelle relazioni tra le rappresentazioni interne degli agenti.

I risultati dipendono dal compito e dal metodo di rilevamento

Per Llama-3.1-70B, le cinque tecniche hanno ottenuto punteggi compresi tra 0,73 e 0,93 AUROC nel livello Transfer e tra 0,99 e 1,00 nel compito di blackjack. Nei risultati dello studio mediati tra modelli e tecniche, l’AUROC per il trasferimento andava da 0,68 per GPT-OSS-20B a 0,87 per Llama-3.1-70B; i risultati per il blackjack andavano da 0,86 a 1,00. L’AUROC misura quanto bene un metodo distingue i casi di collusione da quelli di controllo al variare delle soglie decisionali.

I ricercatori riferiscono che un valutatore LLM incaricato di monitorare le conversazioni al tavolo di blackjack non distingueva in modo affidabile le prove con collusione da quelle di controllo. Hanno inoltre riscontrato che nessuna singola tecnica di analisi offriva le prestazioni migliori per tutte le forme di collusione. Lo studio presenta l’analisi delle attivazioni come un segnale complementare al monitoraggio del testo, non come un rilevatore universale.

I risultati dello studio hanno dei limiti. I ricercatori presuppongono di avere accesso alle attivazioni di tutti gli agenti, un’ipotesi che definiscono forte. Affermano inoltre di non aver verificato se agenti collusi, consapevoli del monitoraggio delle attivazioni, potrebbero nascondere i propri segnali. Nel livello Transfer, più vario dal punto di vista strutturale, il metodo migliore per Llama-3.1-70B ha raggiunto una recall di 0,38 con un tasso di falsi positivi dell’1%, secondo lo studio. Gli autori affermano che occorrono ulteriori ricerche per valutare la robustezza e la capacità di rilevamento in contesti diversi.

Fonte

Esplora

Altri articoli