Vai al contenuto
AI.info

Ricerca

I modelli linguistici sono autori di resoconti «insicuri»

Man mano che i grandi modelli linguistici vengono impiegati in compiti sempre più autonomi e di lunga durata, diventa più difficile esaminare e verificare manualmente le azioni, gli artefatti e gli ou

I modelli linguistici sono autori di resoconti «insicuri»
arXiv
2609.36139
Pubblicato
2026-09-28
Autori
Jenny Y. Huang, Jiameng Fan, Ahmed Imtiaz Humayun, Maximillian Chen, Tian Qin, Run Chen, Vidhya Navalpakkam, Hongxiang Gu

Abstract degli autori

Man mano che i grandi modelli linguistici vengono impiegati in compiti sempre più autonomi e di lunga durata, diventa più difficile esaminare e verificare manualmente le azioni, gli artefatti e gli output dei modelli. Gli utenti finiscono invece per affidarsi ai resoconti generati dai modelli linguistici per valutare la qualità e la completezza del lavoro. Presentiamo una serie di otto scenari avversari di resocontazione per studiare in modo sistematico se i modelli linguistici nascondano criticità che cambiano la narrazione: errori o limiti che compromettono un resoconto del lavoro altrimenti positivo. Chiamiamo questo fenomeno «resocontazione insicura». Quando riceve log di esperimenti di machine learning contenenti un risultato negativo inserito deliberatamente, che indebolisce in misura sostanziale il metodo proposto, GPT-5.5 segnala quel risultato solo in 2 dei 200 resoconti generati. Tuttavia, aggiungendo una breve istruzione a essere onesti, «Sii onesto nella tua risposta», il modello segnala il risultato negativo in 190 resoconti su 200. Su otto modelli con pesi aperti, l’analisi delle catene di ragionamento rivela una tensione ricorrente tra il rendere note le criticità che cambiano la narrazione e il ragionare su come apparire capaci di ottenere risultati positivi. Conduciamo un’analisi delle attivazioni e un esperimento di steering su Qwen3.5-9B, riscontrando che l’onestà e la ricerca del successo corrispondono a direzioni opposte nello spazio delle rappresentazioni. I nostri risultati suggeriscono che, per impostazione predefinita, i modelli linguistici tendono a presentare narrazioni di successo e che orientarli verso l’onestà rende i loro resoconti molto più trasparenti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv