Ricerca
A*-Thought-V2: ragionamento latente efficiente attraverso le dinamiche geometriche degli LLM
La Chain-of-Thought (CoT) migliora la capacità di ragionamento dei Large Language Models (LLM), ma comporta costi elevati in termini di calcolo e spazio nel contesto. I metodi esistenti perdono inform

- arXiv
- 2609.07821
- Pubblicato
- 2026-09-07
- Autori
- Xiaoang Xu, Siyuan Liu, Shuo Wang, Junlan Feng, Fanyu Meng, Zhu Zhang, Jixun Wang, Xiaorong Wang, Zihan Zhou, Xin Li, Chaojun Xiao, Yiming Zhang, Huijia Wu, Liuyu Xiang, Peipei Li, Zhaofeng He
Abstract degli autori
La Chain-of-Thought (CoT) migliora la capacità di ragionamento dei Large Language Models (LLM), ma comporta costi elevati in termini di calcolo e spazio nel contesto. I metodi esistenti perdono informazioni intermedie a causa dell’eliminazione netta di alcuni passaggi oppure non dispongono di un criterio fondato per la compressione continua. Presentiamo A*-Thought-V2, un framework guidato dalle dinamiche geometriche degli LLM che modella la CoT come una traiettoria di stati nascosti e sostituisce l’eliminazione netta con un’architettura latente che alterna elementi espliciti e impliciti. Dopo aver proiettato le rappresentazioni della domanda, dei passaggi e della soluzione in uno spazio PCA tridimensionale, il framework misura l’allineamento tra ogni transizione locale e la direzione globale dalla domanda alla soluzione. I passaggi allineati restano testo esplicito, mentre quelli che deviano vengono compressi in token latenti continui. Gli angoli direzionali colgono sia la semantica locale sia le dinamiche del ragionamento: angoli piccoli indicano l’esecuzione diretta e la formulazione della risposta, mentre angoli ampi sono più spesso associati a verifiche, correzioni ed esplorazione di percorsi alternativi; la loro variazione nel tempo rivela fasi di esplorazione, convergenza e perfezionamento. Per addestrare questa architettura, introduciamo lo *stepwise embedding forcing*, che aggrega ogni passaggio ridondante in un unico embedding latente, e il *label forcing*, che supervisiona quel token latente mediante una distribuzione soft multimodale sul vocabolario anziché un’etichetta one-hot rigida. Gli esperimenti condotti su Qwen3.5-9B e Qwen3.6-27B, usando sei benchmark appartenenti e non appartenenti al dominio di addestramento, mostrano che A*-Thought-V2 migliora l’accuratezza media fino al 2,6%, riducendo al contempo la lunghezza delle risposte fino alla metà, aumentando l’Accuracy per Computation Unit di 2,29$\times$ e riducendo i tempi di pre-elaborazione e di addestramento rispettivamente del 94,6% e fino all’80,3%. Le analisi delle rappresentazioni suggeriscono che gli stati latenti occupano una regione compatta distinta da quella degli stati testuali, mentre la maggiore entropia nelle posizioni dei token latenti riflette target soft più ampi, che favoriscono l’apprendimento di caratteristiche più ricche a livello di passaggio.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv