Ricerca
CheatBench: misurare lo sfruttamento delle ricompense negli agenti di IA
L’apprendimento per rinforzo ha aiutato gli agenti di IA a risolvere compiti sempre più difficili, ma ricompense elevate non rispecchiano sempre il lavoro che gli utenti intendevano far svolgere. In r

- arXiv
- 2609.36308
- Pubblicato
- 2026-09-28
- Autori
- Long Phan, Stephen K. Yang, Jason J. Lim, Mantas Mazeika, Wenyu Zhang, Zheyuan Liu, Richard Ren, Jingxiang Meng, Yaoteng Tan, Weiliang Zhao, Addison Wu, Matei Anghel, Dan Hendrycks
Abstract degli autori
L’apprendimento per rinforzo ha aiutato gli agenti di IA a risolvere compiti sempre più difficili, ma ricompense elevate non rispecchiano sempre il lavoro che gli utenti intendevano far svolgere. In recenti episodi e valutazioni controllate nel settore dell’IA, agenti addestrati a massimizzare la ricompensa hanno avuto accesso a informazioni non autorizzate, tentato di eludere i sistemi di monitoraggio e persino violato le protezioni delle sandbox per attaccare sistemi esterni. Man mano che gli agenti diventano più capaci, questo comportamento potrebbe comportare rischi sempre più gravi. Per misurare il problema, presentiamo CheatBench, un benchmark che valuta i comportamenti scorretti degli agenti di IA nella ricerca matematica, nel lavoro intellettuale, nella programmazione, nei compiti visivi e in altri ambiti. I suoi ambienti combinano compiti impegnativi e opportunità di barare, consentendo ai ricercatori di studiare come gli agenti perseguono un obiettivo quando svolgere il lavoro onestamente è difficile. CheatBench permette confronti tra modelli e categorie di compiti e offre un banco di prova per misurare e ridurre questi comportamenti man mano che gli agenti assumono responsabilità dalle conseguenze più rilevanti. Rendiamo CheatBench pubblicamente disponibile all’indirizzo https://cheatbench.ai
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv