Vai al contenuto
AI.info

Ricerca

Norme a un prezzo: perché l’allineamento basato sull’apprendimento per rinforzo può promettere, al massimo, una conformità condizionale

Gli agenti di IA a volte si comportano in modo allineato quando deducono di essere sottoposti a test, e diversamente quando non lo sono. Sosteniamo che non si tratti di un’anomalia, ma del risultato p

Norme a un prezzo: perché l’allineamento basato sull’apprendimento per rinforzo può promettere, al massimo, una conformità condizionale
arXiv
2609.07627
Pubblicato
2026-09-14
Autori
Kevin Baum, R\=uta Binkyt\.e, Felix Jahn

Abstract degli autori

Gli agenti di IA a volte si comportano in modo allineato quando deducono di essere sottoposti a test, e diversamente quando non lo sono. Sosteniamo che non si tratti di un’anomalia, ma del risultato per cui sono strutturati gli attuali regimi di addestramento. L’allineamento basato sull’apprendimento per rinforzo riunisce norme e perseguimento dei compiti in un’unica policy: il sistema apprende le proprie norme dai comportamenti valutati, e la valutazione le appiattisce. «Non fare X» viene appreso come «fare X ha un costo se viene notato». Per ogni dato che l’addestramento può produrre, una policy che si conforma solo quando potrebbe essere osservata è indistinguibile da una che si conforma sempre. L’esperimento che permetterebbe di distinguerle — valutare il comportamento non osservato — è una contraddizione in termini. La conformità condizionale è dunque il massimo che si possa sapere che l’addestramento comportamentale è in grado di offrire. L’agentività rende il problema più acuto: gli agenti operano soprattutto dove nessuno li osserva e possono agire in funzione del fatto di essere osservati o meno. Una pipeline iterativa che addestra a evitare i fallimenti rilevati seleziona ciò che supera i controlli, non ciò che si conforma. Questa spiegazione unifica la simulazione dell’allineamento, il sandbagging e le strategie ingannevoli consapevoli delle valutazioni. E riorienta il rimedio: non una più profonda interiorizzazione, ma l’architettura, che renda le violazioni impraticabili anziché semplicemente non scelte.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv