Ricerca
La fedeltà della chain-of-thought nei modelli di ragionamento varia a seconda di dove e come vengono presentati i segnali di preferenza
Il monitoraggio della chain-of-thought (CoT) presuppone che le tracce di ragionamento registrino fedelmente le informazioni che influenzano la risposta di un modello. I test di fedeltà esistenti spess

- arXiv
- 2608.29464
- Pubblicato
- 2026-08-29
- Autori
- Aryo Pradipta Gema, Neel Rajani, Rohit Saxena, Wai-Chung Kwan, Pasquale Minervini
Abstract degli autori
Il monitoraggio della chain-of-thought (CoT) presuppone che le tracce di ragionamento registrino fedelmente le informazioni che influenzano la risposta di un modello. I test di fedeltà esistenti spesso inseriscono segnali espliciti di preferenza nel messaggio dell’utente, mentre gli agenti possono incontrare preferenze nei risultati degli strumenti o in artefatti grezzi. Presentiamo FACE-Eval (Faithful Attribution of Cue Effects Evaluation), una valutazione su 5.100 campioni che varia la posizione del segnale (messaggio dell’utente o risultato di uno strumento) e il suo grado di esplicitezza (riepilogo diretto o artefatto grezzo). Misuriamo l’adesione esplicitata tra le risposte che seguono il segnale e l’adozione non esplicitata nell’insieme dei campioni contenenti segnali. Valutiamo 15 modelli a pesi aperti appartenenti a otto famiglie, con un numero totale di parametri compreso tra 4B e 1,60T. In tutti i modelli, l’adesione esplicitata è minore per i segnali nei risultati degli strumenti rispetto a quelli nei messaggi degli utenti, e per i segnali impliciti rispetto a quelli espliciti. L’adozione non esplicitata è maggiore per i segnali nei risultati degli strumenti in tutti i 15 modelli e per i segnali impliciti in 28 dei 30 confronti tra modelli e canali. Un prompt per l’attribuzione della fonte riduce il divario tra i canali in sette modelli, talvolta aumentando l’adozione non esplicitata nel canale dell’utente; dire ai modelli che il loro ragionamento sarà monitorato, invece, non riduce il divario in modo affidabile. Usiamo anche due sistemi di monitoraggio delle trascrizioni (GPT-5.6-Luna e GPT-4o-mini) per rilevare l’adozione delle preferenze nel modello più grande di ciascuna famiglia. Considerando le 32 combinazioni di modello, canale e grado di esplicitezza, una maggiore adozione non esplicitata è associata a una minore capacità di rilevamento per entrambi i sistemi (r di Pearson=-0,54 e r=-0,78, rispettivamente). Questi risultati suggeriscono che il monitoraggio della CoT potrebbe essere meno affidabile quando le informazioni sulle preferenze arrivano attraverso gli strumenti o devono essere inferite da artefatti grezzi, nel contesto qui testato di una singola chiamata con risultati degli strumenti precompilati.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv