Vai al contenuto
AI.info

Ricerca

Codificata presto, usata tardi: dove i transformer iniziano ad agire in base alla competenza dedotta dell’interlocutore

Un transformer può rendere un attributo decodificabile linearmente nel proprio flusso residuo a una profondità alla quale quell’attributo non influenza ancora l’output. Questo divario tra il punto in

Codificata presto, usata tardi: dove i transformer iniziano ad agire in base alla competenza dedotta dell’interlocutore
arXiv
2609.07139
Pubblicato
2026-09-07
Autori
Mika Okamoto, Gabriele Sarti

Abstract degli autori

Un transformer può rendere un attributo decodificabile linearmente nel proprio flusso residuo a una profondità alla quale quell’attributo non influenza ancora l’output. Questo divario tra il punto in cui l’informazione è leggibile e quello in cui viene utilizzata è stato dimostrato per attributi dichiarati direttamente nell’input. Ci chiediamo se valga anche per un attributo che il modello deve dedurre gradualmente nel corso di una conversazione: il livello di competenza del suo interlocutore. Usando ExpertCollab, un corpus di dialoghi di pianificazione della ricerca su più turni tra personaggi interpretati da modelli, con quattro livelli di competenza, osserviamo che la competenza dell’interlocutore è decodificabile soprattutto nei primi strati e che la sua decodificabilità scende a livelli prossimi al caso prima della metà della rete. Il patching controfattuale mostra che inserire la differenza di competenza nello strato in cui la decodificabilità è massima modifica appena una lettura fissa effettuata in uno strato avanzato, mentre la stessa differenza inserita dopo la metà della rete si propaga quasi completamente: uno scarto superiore a un ordine di grandezza. Un controllo casuale abbinato per contenuto e un test diagnostico senza probe collocano la transizione nello stesso strato iniziale, mentre un attributo di controllo definito staticamente resta decodificabile lungo tutta la rete. Un attributo relazionale dedotto è dunque rappresentato ben prima di diventare causalmente attivo: questo delimita il punto in cui deve intervenire qualunque tentativo di leggere o orientare il comportamento condizionato dall’interlocutore. Usiamo un solo modello su un corpus sintetico come dimostrazione iniziale.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv