Ricerca
SAGE: mitigare i bias del ragionamento a lungo orizzonte tramite una guida topologica
Il ragionamento a lungo orizzonte resta una sfida centrale per i grandi modelli linguistici (LLM) in regimi con ricompense sparse. Sosteniamo che questa fragilità derivi da due bias indotti da spazi d

- arXiv
- 2609.30192
- Pubblicato
- 2026-09-24
- Autori
- Xinyue Zeng, Jiawei Zhang, Yujun Yan, Dawei Zhou
Abstract degli autori
Il ragionamento a lungo orizzonte resta una sfida centrale per i grandi modelli linguistici (LLM) in regimi con ricompense sparse. Sosteniamo che questa fragilità derivi da due bias indotti da spazi di ragionamento complessi: un bias esplorativo, per cui i modelli sono attratti da rami plausibili localmente ma strutturalmente instabili, e un bias cumulativo, per cui piccole deviazioni locali si accumulano con la profondità e riducono le ricompense rare. Introduciamo la Symbolic Closure Analysis (SCA) come quadro teorico per caratterizzare il modo in cui le strutture ramificate e le ricompense sparse inducono questi bias nel ragionamento a lungo orizzonte con ammissibilità locale, e come principio di progettazione per i priori strutturali in compiti di ragionamento meno formali. Sulla base di questa analisi, proponiamo SAGE (Structural Admissibility-Guided Exploration), un quadro unificato che introduce una guida strutturale per attenuare il bias esplorativo e quello cumulativo nel ragionamento a lungo orizzonte. SAGE combina due forme complementari di guida strutturale: la sparsificazione algebrica, che proietta i candidati localmente ammissibili su sottospazi algebrici indicizzati dagli operatori per sopprimere le ramificazioni spurie e attenuare il bias esplorativo, e la guida strutturale iperbolica, che incorpora gli stati di ragionamento in uno spazio a curvatura negativa per fornire segnali densi lungo la profondità e attenuare il bias cumulativo. Su 12 benchmark e 7 famiglie di modelli, SAGE supera le baseline più competitive. In particolare, SAGE ottiene un miglioramento fino a 8 volte sul problema di Andrews-Curtis, un problema aperto e reale di ragionamento a lungo orizzonte. Il codice è disponibile all’indirizzo: https://github.com/Susan571/SAGE-NeurIPS2026.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv