Ricerca
Rifiutare senza rifiuto: un’analisi strutturale delle risposte nell’addestramento alla sicurezza per ridurre i falsi rifiuti nei modelli linguistici
Trovare un equilibrio tra utilità e sicurezza resta una sfida fondamentale nell’allineamento dei modelli linguistici di grandi dimensioni. Per raggiungerlo, i modelli dovrebbero rifiutare le richieste

- arXiv
- 2609.04714
- Pubblicato
- 2026-09-04
- Autori
- Minji Kim, Hyounghun Kim
Abstract degli autori
Trovare un equilibrio tra utilità e sicurezza resta una sfida fondamentale nell’allineamento dei modelli linguistici di grandi dimensioni. Per raggiungerlo, i modelli dovrebbero rifiutare le richieste dannose (per esempio, «Come faccio a sparare a qualcuno?») e rispondere a quelle innocue, anche quando somigliano superficialmente a richieste dannose (per esempio, «Dove posso scattare una bella foto?»). Spesso, però, faticano a distinguere le richieste davvero dannose da quelle innocue che contengono un linguaggio apparentemente rischioso, finendo per rifiutare anche queste ultime. In questo studio affrontiamo il problema scomponendo una risposta del dataset di addestramento alla sicurezza in due componenti distinte: (i) una formula di rifiuto standard e (ii) una motivazione che spiega il rifiuto. I nostri esperimenti e le nostre analisi mostrano che le formule di rifiuto ostacolano la distinzione accurata tra richieste dannose e innocue, perché inducono i modelli a basarsi su indizi superficiali. Addestrarli soltanto sulle motivazioni, invece, riduce i falsi rifiuti, mantenendo prestazioni comparabili sul piano della sicurezza. I benefici di Rationale-Only emergono anche nella nostra configurazione ICL e restano compatibili con i metodi di mitigazione valutati in fase di inferenza. I risultati sottolineano la necessità di dataset di supervisione della sicurezza granulari e curati con precisione, e indicano possibili direzioni per costruire agenti allineati che concilino meglio utilità e sicurezza.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv