Vai al contenuto
AI.info

Ricerca

Sapere quando pensare non basta: insegnare ai piccoli modelli di ragionamento a ragionare oltre le proprie conoscenze parametriche

Aumentare il calcolo in fase di test è un modo efficace per migliorare la capacità di ragionamento dei modelli linguistici, ed è particolarmente interessante per i piccoli modelli di ragionamento (sRM

Sapere quando pensare non basta: insegnare ai piccoli modelli di ragionamento a ragionare oltre le proprie conoscenze parametriche
arXiv
2609.34327
Pubblicato
2026-09-28
Autori
Chanuk Lee, Minki Kang, Sangwoo Park, Woongyeong Yeo, Jinheon Baek, Sung Ju Hwang

Abstract degli autori

Aumentare il calcolo in fase di test è un modo efficace per migliorare la capacità di ragionamento dei modelli linguistici, ed è particolarmente interessante per i piccoli modelli di ragionamento (sRM), il cui utilizzo costa poco. Ma pensare di più è sempre la scelta giusta? Intervenendo sugli stati intermedi del ragionamento in due famiglie di modelli e a diverse scale, scopriamo che l’autoaffinamento concentra in larga misura la massa di probabilità sulle soluzioni già raggiungibili dallo stato attuale, anziché renderne raggiungibili di nuove. Questi interventi rivelano due tipi di collo di bottiglia: quelli nell’esecuzione, in cui il percorso corretto è raggiungibile e la riflessione può recuperarlo, e quelli nella conoscenza, in cui sono le informazioni esterne pertinenti a renderlo raggiungibile. Partendo da questa distinzione, presentiamo FlyBy, un framework di interrogazione selettiva, e addestriamo varianti 4B e 8B a ragionare prima di tutto, individuare ciò che resta irrisolto e, di fronte a un collo di bottiglia nella conoscenza, interrogare modelli più potenti la cui conoscenza parametrica supera la propria. Il fine-tuning supervisionato avvia un’azione di interrogazione a più livelli di profondità, mentre l’apprendimento per rinforzo attento ai costi calibra la scelta se interrogare un modello, che cosa chiedere e quanto spendere. Su 1.158 problemi difficili distribuiti su sei benchmark, FlyBy-4B raggiunge un pass@8 del 45,96%, superando Qwen3-14B (41,64%) con un costo di erogazione 2,7 volte inferiore, e supera anche Qwen3-8B nel pass@1 (16,85% contro 15,31%). Passando a FlyBy-8B, il pass@8 sale ulteriormente al 51,81%.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv