Vai al contenuto
AI.info

Ricerca

Far dire agli LLM ciò che pensano: misurare e migliorare l’allineamento tra CoT e interpretabilità

Le tracce della catena di pensiero (CoT) sono spesso usate come indicatore indiretto di come i modelli linguistici di grandi dimensioni (LLM) arrivano alle loro risposte. Tuttavia, prove sempre più nu

Far dire agli LLM ciò che pensano: misurare e migliorare l’allineamento tra CoT e interpretabilità
arXiv
2609.38972
Pubblicato
2026-09-30
Autori
Yihuai Hong, Shauli Ravfogel, Chen Zhao, Eunsol Choi

Abstract degli autori

Le tracce della catena di pensiero (CoT) sono spesso usate come indicatore indiretto di come i modelli linguistici di grandi dimensioni (LLM) arrivano alle loro risposte. Tuttavia, prove sempre più numerose mostrano che la CoT dei modelli spesso non rispecchia i loro calcoli interni e può essere modificata senza influire sulle risposte finali. In questo lavoro misuriamo e miglioriamo l’allineamento tra il ragionamento descritto nella CoT di un LLM e ciò che il modello calcola al proprio interno. Proponiamo CoT-Interpretability Alignment (CIA), una metrica che misura la concordanza tra le tracce CoT di un modello e le sue strategie di ragionamento interne, rilevate con strumenti di interpretabilità. Valutiamo CIA su tre compiti (risposta a domande in due passaggi, intervento sugli indizi e moltiplicazione di numeri interi) e tre LLM, riscontrando un allineamento limitato in tutti i compiti (44,8-75,9%). Sperimentiamo poi come migliorare CIA mediante il post-training, usando come ricompensa sia segnali di accuratezza nel compito sia segnali di fedeltà parametrica. Gli esperimenti mostrano che possiamo migliorare sensibilmente la fedeltà parametrica della CoT mantenendo o migliorando l’accuratezza nel compito. Presentiamo un’analisi approfondita, che comprende i loro schemi di generalizzazione. Il nostro lavoro offre sia un quadro per verificare la fedeltà parametrica della CoT sia una via per rendere più affidabile il ragionamento esplicito dei modelli. Il codice e i dati sono disponibili all’indirizzo https://github.com/yihuaihong/CIA-minimal-repro.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv