Vai al contenuto
AI.info

Ricerca

Il router interno: far emergere l’instradamento nativo delle skill da un LLM congelato

Le skill estendono le capacità di un agente LLM oltre la sua conoscenza parametrica, e il vantaggio che promettono dipende dalla scelta di quella giusta. Gli harness utilizzati in produzione instradan

Il router interno: far emergere l’instradamento nativo delle skill da un LLM congelato
arXiv
2609.15982
Pubblicato
2026-09-14
Autori
Ruishuo Chen, Xun Wang, Yu Chen, Zhuoran Li, Longbo Huang

Abstract degli autori

Le skill estendono le capacità di un agente LLM oltre la sua conoscenza parametrica, e il vantaggio che promettono dipende dalla scelta di quella giusta. Gli harness utilizzati in produzione instradano le richieste precaricando nel contesto i metadati di ogni skill: questo disperde l’attenzione dell’agente e limita le dimensioni della libreria. Le pipeline di recupero spostano la selezione fuori dal contesto, ma anche fuori dalle capacità dell’agente. Mostriamo che l’LLM congelato dell’agente contiene già, nelle proprie passate in avanti, il segnale necessario per l’instradamento e che bastano due trasformazioni lineari per estrarlo, senza inserire nel contesto il testo delle skill. Gavel (Glance And Verdict from a frozen LLM) lo legge in due passaggi. Una prima valutazione proietta gli stati degli strati intermedi del compito e di ciascuna skill attraverso le due trasformazioni, gli unici parametri addestrati, e assegna un punteggio all’intera libreria confrontandola con raccolte compatte per ciascuna skill, costruite con una sola passata in avanti al momento dell’installazione. Un verdetto riprende quindi le passate in avanti delle skill selezionate e legge la probabilità assegnata dal modello stesso e il suo giudizio sì/no, combinandoli con la prima valutazione come prodotto di esperti. Addestrato una sola volta, Gavel si trasferisce in modalità zero-shot a tre benchmark pubblici e a SkillTraj, il nostro nuovo benchmark composto da 372 traiettorie simulate di agenti. Su Qwen3-32B supera la rivelazione progressiva e le pipeline di recupero e riordinamento, che aggiungono da 1,2 a 16 miliardi di parametri esterni: il vantaggio arriva a 13,4 punti nei compiti scritti e a 21,9 punti quando la necessità di una skill emerge nel corso dell’esecuzione. La precisione dell’instradamento migliora al migliorare del backbone e, in un harness per agenti bash, lo stesso modello 32B attiva la skill corretta su Skill-Use più spesso di modelli di frontiera molto più grandi eseguiti in Codex.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv