Vai al contenuto
AI.info

Ricerca

When2Think: apprendere a controllare la lunghezza in base alla difficoltà per modelli ibridi di ragionamento efficienti

I Large Reasoning Models (LRM) ottengono risultati elevati nei compiti complessi, ma presentano un’inefficienza sistematica: spesso ragionano troppo sui problemi facili e troppo poco su quelli diffici

When2Think: apprendere a controllare la lunghezza in base alla difficoltà per modelli ibridi di ragionamento efficienti
arXiv
2609.19671
Pubblicato
2026-09-17
Autori
Jaejun Shim, HyunJin Kim, Young Jin Kim, JinYeong Bak

Abstract degli autori

I Large Reasoning Models (LRM) ottengono risultati elevati nei compiti complessi, ma presentano un’inefficienza sistematica: spesso ragionano troppo sui problemi facili e troppo poco su quelli difficili. Gli approcci esistenti, basati su penalità uniformi per la lunghezza o su un routing rigido, comportano un costo in termini di efficienza: riducono il calcolo nei casi facili a scapito dell’accuratezza in quelli difficili. Formuliamo il ragionamento efficiente come un problema di allocazione del calcolo adattiva per ciascun caso e proponiamo When2Think, un framework di post-training per il ragionamento ibrido che alloca dinamicamente il calcolo in base alla difficoltà del problema. Il nostro metodo introduce Instance-level Difficulty-Aware Control (IDAC), un meccanismo di modulazione delle ricompense che sfrutta statistiche di riferimento precalcolate (accuratezza e uso di token) per regolare la profondità del ragionamento. Insieme alle ricompense basate su un verificatore e agli advantage standardizzati per batch, IDAC consente un’ottimizzazione stabile senza critic, senza modelli di ricompensa appresi né interrogazioni online a modelli di riferimento. When2Think incoraggia risposte dirette nei casi facili, preservando il ragionamento esteso in quelli difficili, e apprende così quando usare il Sistema 1 (NoThink) anziché il Sistema 2 (Think). Gli esperimenti su benchmark matematici mostrano un migliore compromesso tra accuratezza ed efficienza: su AIME24, rispetto al modello di base, Pass@3 aumenta del 10,0% mentre l’uso di token si riduce del 27,9%; su AIME25, When2Think raggiunge un Pass@3 del 40,0%, superando le baseline basate sulla compressione e quelle basate esclusivamente sul routing.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv