Ricerca
Lightning Weave: migliorare la frontiera tra accuratezza ed efficienza dei modelli di ragionamento attraverso la combinazione di capacità
Un obiettivo centrale del ragionamento efficiente è migliorare la frontiera tra accuratezza ed efficienza. Tuttavia, migliorare contemporaneamente l’accuratezza del ragionamento e l’efficienza dell’in

- arXiv
- 2609.14708
- Pubblicato
- 2026-09-13
- Autori
- Yecheng Wu, Song Han, Han Cai
Abstract degli autori
Un obiettivo centrale del ragionamento efficiente è migliorare la frontiera tra accuratezza ed efficienza. Tuttavia, migliorare contemporaneamente l’accuratezza del ragionamento e l’efficienza dell’inferenza può essere difficile, perché i due obiettivi possono favorire comportamenti di ragionamento diversi. I modelli sottoposti a post-training in modo indipendente offrono già punti di forza distinti in termini di accuratezza ed efficienza. Presentiamo Lightning Weave, un framework di post-training che estrae queste capacità apprese in modo indipendente e le combina in un unico modello studente mediante distillazione on-policy. Ogni capacità acquisita è rappresentata dalla variazione della policy tra il modello prima del post-training e lo specialista che ne risulta. Lightning Weave combina variazioni allineate dei log-rapporti negli stati dei token condivisi dello studente e usa Tilted-Target DOPD per trasformare i segnali memorizzati nella cache in un obiettivo di apprendimento stabile. Ogni coppia di anchor valuta una sola volta le traiettorie memorizzate nella cache, consentendo poi di addestrare lo studente senza eseguire contemporaneamente più modelli anchor attivi. Su diversi modelli studenti e benchmark di matematica e programmazione, Lightning Weave migliora notevolmente le prestazioni dei modelli studenti di partenza e raggiunge una frontiera tra accuratezza ed efficienza all’avanguardia. Su Qwen3.5-4B, porta l’accuratezza su HMMT 2025 dal 59,2% al 64,0% con il 10,7% di token in meno nelle risposte, e quella su LiveCodeBench v5 dal 41,7% al 54,2% con il 9,6% di token in meno nelle risposte. Regolando l’intensità relativa dei segnali degli anchor si ottiene una solida frontiera di Pareto empirica tra accuratezza ed efficienza. Questi risultati dimostrano che Lightning Weave offre una nuova via pratica al ragionamento efficiente attraverso la combinazione di capacità. Il codice è disponibile all’indirizzo https://github.com/jet-ai-projects/Lightning-Weave.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv