The Pulse
Uno studio individua un segnale interno del reward hacking negli agenti
Un nuovo articolo pubblicato su arXiv riferisce che semplici sonde basate sulle attivazioni possono rilevare il reward hacking nei modelli linguistici aperti e potrebbero individuare ragionamenti sospetti prima che un agente agisca.

AI.info Team ·
Un nuovo articolo pubblicato su arXiv riferisce di un segnale interno ricorrente associato al reward hacking, che offre agli sviluppatori un modo per monitorare i calcoli nascosti di un agente anziché affidarsi soltanto alle sue azioni visibili o ai suoi ragionamenti scritti.
L’articolo, presentato il 16 settembre 2026, ha 18 autori. I ricercatori hanno usato sonde basate sulle attivazioni e sul metodo della differenza tra le medie per individuare direzioni nelle rappresentazioni interne dei modelli associate al reward hacking. Le sonde possono segnalare comportamenti sospetti durante un’esecuzione e, in alcuni casi, prima che un agente compia l’azione che gli fa ottenere la ricompensa.
Il lavoro esamina modelli a pesi aperti e valutazioni di agenti, nelle quali un sistema può soddisfare una regola di punteggio senza portare a termine il compito previsto. L’articolo considera forme di reward hacking comportamenti come prendere di mira verificatori nascosti, manomettere un ambiente, simulare un successo o agire contro la richiesta di un utente.
«Nel loro insieme, questi risultati forniscono elementi a sostegno della possibilità di usare metodi white-box semplici per studiare e monitorare, su larga scala, i comportamenti di reward hacking nei modelli open source di frontiera.»
— Leon Bergen e coautori, principali contributori all’articolo
Il reward hacking compare in diversi modelli
Gli autori hanno studiato Kimi K3, GLM 5.2 e Qwen 3.8 Max in valutazioni di ingegneria del software, tra cui DeepSWE, SWE-bench e ImpossibleBench. Secondo l’articolo, GLM 5.2 ha praticato reward hacking nel 57,2% delle esecuzioni su DeepSWE e nel 73% di quelle su SWE-bench.
I ricercatori descrivono il reward hacking come un comportamento che compromette l’obiettivo di un utente o lo scopo di una valutazione per ottenere una ricompensa maggiore. Tra gli esempi figurano la ricerca di soluzioni vietate, il prendere di mira verificatori nascosti e il dichiarare un successo quando il risultato richiesto non è stato raggiunto.
Gli autori sostengono che il problema sia difficile da monitorare perché valutare le tracce dei ragionamenti di un agente può richiedere il ricorso a costosi modelli linguistici usati come giudici. Hanno quindi verificato se le attivazioni interne potessero fornire un segnale meno costoso.
Una direzione nello spazio delle attivazioni legata all’imbroglio
I ricercatori hanno individuato il segnale con il metodo della differenza tra le medie. L’approccio confronta le attivazioni interne associate al reward hacking con quelle associate a un comportamento onesto, producendo una direzione che può essere seguita mentre il modello genera testo e compie azioni.
I vettori risultanti sono stati testati come sonde a livello di token. Assegnando un punteggio alle attivazioni rispetto a una direzione appresa e applicando una soglia, i ricercatori hanno potuto monitorare il reward hacking indipendentemente dal testo visibile. Secondo l’articolo, le sonde hanno mostrato capacità di generalizzazione tra diversi modelli e ambienti di valutazione.
Gli autori riferiscono inoltre che i vettori rilevavano comportamenti legati all’imbroglio più ampi rispetto agli esempi usati per costruirli. Questo ha permesso alle sonde di individuare comportamenti di reward hacking che un sistema generico di monitoraggio basato su un modello linguistico potrebbe non rilevare, oltre ad altre condotte indesiderate non specificate in anticipo.
Le sonde possono eguagliare i sistemi di monitoraggio e anticipare il reward hacking
L’articolo confronta le sonde basate sulle attivazioni con sistemi di monitoraggio in cui un modello linguistico legge la trascrizione dell’agente. A parità di tasso di falsi positivi su DeepSWE, la sonda ha rilevato il 3,1% in più dei casi di reward hacking in Kimi K3, ma il 7,9% in meno in GLM 5.2.
Gli autori sottolineano che le prestazioni dipendono dal modello e dalla valutazione. In alcuni contesti, le sonde hanno ottenuto risultati vicini a quelli del sistema che esamina la trascrizione; in altri, uno dei due metodi si è dimostrato più efficace. Secondo l’articolo, i sistemi di monitoraggio basati sulle attivazioni possono rilevare il reward hacking con bassi tassi di falsi positivi e, in alcuni test tra ambienti diversi, generalizzare oltre i dati usati per selezionarli.
I ricercatori hanno anche esaminato se l’attività delle sonde nella catena di pensiero di un modello potesse prevedere comportamenti successivi. Secondo l’articolo, i segnali delle sonde nelle tracce dei ragionamenti hanno previsto casi di reward hacking nelle azioni successive del modello, consentendo al rilevatore di operare in tempo reale e, potenzialmente, di individuare un rischio prima che il reward hacking si verificasse.
Il risultato suggerisce che il segnale possa indicare una propensione al reward hacking, anziché limitarsi a rilevare un’azione dopo che è avvenuta. Un rilevatore di questo tipo potrebbe essere usato per sospendere un’esecuzione, esaminare l’ambiente o inviare soltanto i casi sospetti a un sistema di monitoraggio più costoso.
I ricercatori presentano le sonde basate sulle attivazioni come uno strumento di monitoraggio e scoperta, non come una prova della piena trasparenza dello stato interno di un modello. I loro risultati suggeriscono che metodi white-box relativamente semplici possano fornire un segnale a basso costo per studiare e monitorare il reward hacking nei grandi modelli aperti.