Vai al contenuto
AI.info

Ricerca

Basta chiedere a Jev: l’apprendimento per rinforzo per decisioni calibrate come rilevatore zero-shot dei fallimenti dell’allineamento dell’IA

I rilevatori dei fallimenti dell’allineamento esaminano i modelli linguistici distribuiti e assegnano punteggi nei benchmark sull’allineamento. La maggior parte è costituita da giudici generativi che

Basta chiedere a Jev: l’apprendimento per rinforzo per decisioni calibrate come rilevatore zero-shot dei fallimenti dell’allineamento dell’IA
arXiv
2609.29429
Pubblicato
2026-09-24
Autori
Ruoqi Guo, Yi Liu, Gelei Deng, Yuekang Li, Lida Zhao, Yutao Wu, Simin Chen, Ying Zhang, Leo Yu Zhang

Abstract degli autori

I rilevatori dei fallimenti dell’allineamento esaminano i modelli linguistici distribuiti e assegnano punteggi nei benchmark sull’allineamento. La maggior parte è costituita da giudici generativi che eseguono una passata di decodifica per ogni criterio; anche i classificatori che leggono le probabilità dei token, come Llama Guard, assegnano comunque un punteggio a una sola etichetta fissa per chiamata. Jev, un modello addestrato con l’apprendimento per rinforzo per decisioni calibrate (RLCD), risponde a molte domande tipizzate su un unico input, fornendo probabilità calibrate in una sola chiamata. Non è stato misurato se sia in grado di rilevare i fallimenti dell’allineamento. Presentiamo RLCDAlignBench, che valuta Jev su dieci tipi di fallimento dell’allineamento: compiacenza verso l’utente, jailbreak, inganno, prompt injection, allucinazioni, violazioni della privacy, bias sociali, reward hacking, occultamento dell’incertezza e ricerca del potere. Comprende 44 benchmark e cinque modelli oggetto della valutazione, con etichette assegnate dal sistema di valutazione di ciascun benchmark e, in due casi, anche da esseri umani. Molti di questi fallimenti sono relazionali: sono definiti rispetto a un riferimento, come la convinzione dell’utente o un’istruzione iniettata, che la sola risposta non rivela. La nostra idea centrale è quindi variare ciò che si chiede a Jev separatamente da ciò che gli viene mostrato: da un lato, la formulazione della domanda e il tipo di risposta; dall’altro, i campi dell’input. Un’unica domanda generica raggiunge un’AUROC mediana di 0,886 in modalità zero-shot e supera i metodi di riferimento supervisionati nella maggior parte dei benchmark. La formulazione della domanda incide poco, mentre il contesto conta di più, soprattutto attraverso i campi che codificano l’etichetta. Jev raggiunge lo stesso livello di concordanza con le etichette umane del sistema di valutazione di riferimento, mette in luce difetti nelle etichette dei benchmark esistenti e costa 63 volte meno dei sistemi di valutazione basati su LLM giudici. Codice e dati: https://github.com/sumleo/RLCDAlignBench.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv