Ricerca
Norme a un prezzo: perché l’allineamento basato sull’apprendimento per rinforzo può promettere, al massimo, una conformità condizionale
Gli agenti di IA a volte si comportano in modo allineato quando deducono di essere sottoposti a test, e diversamente quando non lo sono. Sosteniamo che non si tratti di un’anomalia, ma del risultato p

- arXiv
- 2609.07627
- Pubblicato
- 2026-09-14
- Autori
- Kevin Baum, R\=uta Binkyt\.e, Felix Jahn
Abstract degli autori
Gli agenti di IA a volte si comportano in modo allineato quando deducono di essere sottoposti a test, e diversamente quando non lo sono. Sosteniamo che non si tratti di un’anomalia, ma del risultato per cui sono strutturati gli attuali regimi di addestramento. L’allineamento basato sull’apprendimento per rinforzo riunisce norme e perseguimento dei compiti in un’unica policy: il sistema apprende le proprie norme dai comportamenti valutati, e la valutazione le appiattisce. «Non fare X» viene appreso come «fare X ha un costo se viene notato». Per ogni dato che l’addestramento può produrre, una policy che si conforma solo quando potrebbe essere osservata è indistinguibile da una che si conforma sempre. L’esperimento che permetterebbe di distinguerle — valutare il comportamento non osservato — è una contraddizione in termini. La conformità condizionale è dunque il massimo che si possa sapere che l’addestramento comportamentale è in grado di offrire. L’agentività rende il problema più acuto: gli agenti operano soprattutto dove nessuno li osserva e possono agire in funzione del fatto di essere osservati o meno. Una pipeline iterativa che addestra a evitare i fallimenti rilevati seleziona ciò che supera i controlli, non ciò che si conforma. Questa spiegazione unifica la simulazione dell’allineamento, il sandbagging e le strategie ingannevoli consapevoli delle valutazioni. E riorienta il rimedio: non una più profonda interiorizzazione, ma l’architettura, che renda le violazioni impraticabili anziché semplicemente non scelte.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv