Vai al contenuto
AI.info

Ricerca

I calcoli svolti per problemi precedenti possono aiutare gli LLM a risolverne di nuovi?

I modelli linguistici di grandi dimensioni risolvono spesso problemi indipendenti nella stessa conversazione. I calcoli svolti per problemi precedenti possono aiutarli a risolverne di nuovi? Per rispo

I calcoli svolti per problemi precedenti possono aiutare gli LLM a risolverne di nuovi?
arXiv
2609.39394
Pubblicato
2026-09-30
Autori
Jipei He, Wenhui Tan, Xiaoyi Yu, Enver Sangineto, Fiorenzo Parascandolo, Rita Cucchiara, Ruihua Song

Abstract degli autori

I modelli linguistici di grandi dimensioni risolvono spesso problemi indipendenti nella stessa conversazione. I calcoli svolti per problemi precedenti possono aiutarli a risolverne di nuovi? Per rispondere, conduciamo anzitutto esperimenti preliminari che mostrano come la cronologia mantenuta possa aumentare o ridurre l’accuratezza nei turni successivi, anche all’interno dello stesso dominio. Per comprendere questi effetti, usiamo un replay controllato per isolare i cambiamenti dello stato interno specifici di ciascuna coppia problema-cronologia. Con cronologie diverse, questi cambiamenti preservano relazioni simili tra i problemi correnti. Per migliorare il ragionamento quando la cronologia viene mantenuta, introduciamo STAIR (Stale-Token Attention for Inter-query Reuse). STAIR acquisisce chiavi e valori generati durante le risposte precedenti e li conserva in un banco fisso. Impara a reindirizzare le query correnti quando queste accedono al banco durante l’elaborazione del prompt. Il modello di base resta congelato: vengono addestrati solo 12.288 parametri. Su tre modelli Qwen e quattro benchmark, STAIR migliora l’accuratezza media nei turni successivi fino a 11,67 punti percentuali rispetto al modello non modificato con cronologia.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv