Ricerca
Che cosa conta nel ragionamento latente con flow matching
Il ragionamento latente consente a un modello linguistico di grandi dimensioni (LLM) di ragionare in uno spazio continuo e di esprimere a parole soltanto la risposta. Sosteniamo che, per essere effica

- arXiv
- 2610.06666
- Pubblicato
- 2026-10-05
- Autori
- Yassine Ouali, Adrian Bulat, Georgios Tzimiropoulos
Abstract degli autori
Il ragionamento latente consente a un modello linguistico di grandi dimensioni (LLM) di ragionare in uno spazio continuo e di esprimere a parole soltanto la risposta. Sosteniamo che, per essere efficace, un pensiero latente debba soddisfare cinque requisiti: essere utile, cioè aiutare a produrre la risposta corretta anziché limitarsi a cambiarla; essere diversificato, in modo che il ricampionamento produca traiettorie di ragionamento diverse; essere spiegabile, così che una catena di pensiero (CoT) decodificata rispecchi il ragionamento effettivamente seguito per arrivare alla risposta; poter essere perfezionato con maggiori risorse di calcolo in fase di inferenza; ed essere efficiente, richiedendo meno risorse di una CoT esplicita a parità di accuratezza. I metodi attuali soddisfano raramente questi requisiti: apprendono scorciatoie a partire dalla domanda, distillano la CoT esplicita nei propri pesi oppure la imitano un token alla volta. Ci concentriamo sul flow matching in uno spazio latente appreso, la famiglia di metodi che riteniamo più adatta a soddisfare questi requisiti, e individuiamo le scelte di addestramento che la rendono efficace. Il risultato è Flow-based Latent Reasoning (FLaRe), una procedura semplice che definisce cosa codifica lo spazio latente e come strutturarlo, dove addestrare il flusso, come ricavare la risposta e una fase finale di addestramento sui pensieri verificati del modello stesso. Un test per ciascun requisito mostra che FLaRe supera i precedenti metodi latenti in tutti e cinque. Ottiene inoltre risultati favorevoli rispetto a questi metodi nei benchmark aritmetici, raggiungendo il 97% dell’accuratezza della CoT esplicita con un quarto della sua latenza.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv