Ricerca
Disallineamento tra riconoscimento e rifiuto negli LLM: perché i modelli rispondono a domande strutturalmente prive di risposta
I modelli linguistici di grandi dimensioni spesso rispondono a domande strutturalmente prive di risposta, come il calcolo di cot(-540°) o la valutazione di (1).startswith("1"), anziché astenersi. Ci c

- arXiv
- 2608.29109
- Pubblicato
- 2026-08-29
- Autori
- Yucheng Du, Xiyang Hu
Abstract degli autori
I modelli linguistici di grandi dimensioni spesso rispondono a domande strutturalmente prive di risposta, come il calcolo di cot(-540°) o la valutazione di (1).startswith("1"), anziché astenersi. Ci chiediamo se questo errore dipenda dal mancato riconoscimento dell’impossibilità o dal mancato passaggio dal riconoscimento all’astensione. In modelli sottoposti a fine-tuning su istruzioni, con un numero di parametri compreso tra 1,7 e 70 miliardi, una singola direzione lineare nello stato nascosto distingue i prompt di matematica e codice che ammettono una risposta da quelli strutturalmente impossibili: i modelli, dunque, rappresentano l’impossibilità prima di generare la risposta. Eppure questa direzione di riconoscimento è quasi ortogonale alla direzione canonica del rifiuto per motivi di sicurezza, che media il rifiuto appreso dei contenuti dannosi. Una direzione che tiene conto della non validità, definita in base al comportamento nello stesso dominio, è più vicina a quella di riconoscimento, ma vi è allineata solo in parte e resta pressoché ortogonale a quella del rifiuto per motivi di sicurezza. Orientare il modello lungo la direzione di riconoscimento durante la generazione modifica il comportamento che tiene conto della non validità in entrambe le direzioni e in misura proporzionale all’intensità dell’intervento nei casi di matematica e codice strutturalmente impossibili; direzioni casuali, invece, non producono questo effetto. I confronti tra modelli base e modelli sottoposti a fine-tuning su istruzioni mostrano inoltre che la geometria caratterizzata da una bassa similarità del coseno è già presente al termine del preaddestramento. L’errore di rispondere con sicurezza a domande impossibili si spiega quindi meglio come un problema di instradamento che di codifica: il modello dispone di un segnale utilizzabile che indica «nessuna risposta ammissibile», ma il percorso del rifiuto per motivi di sicurezza non è allineato in modo da utilizzarlo.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv