Vai al contenuto
AI.info

Ricerca

Co-evoluzione di harness e modelli: la correzione on-policy aiuta i modelli più deboli a colmare il divario dove l’imitazione fallisce

Gli harness degli agenti (il prompt di sistema, l’insieme degli strumenti, gli hook di esecuzione e la struttura di supporto per la gestione del contesto che circondano un modello) sono determinanti p

Co-evoluzione di harness e modelli: la correzione on-policy aiuta i modelli più deboli a colmare il divario dove l’imitazione fallisce
arXiv
2609.09134
Pubblicato
2026-09-08
Autori
Zhou Yu, Bin Bi, Shiva Kumar Pentyala, Shubham Mehrotra, Sougata Chaudhuri, Shilpa Bhagavath, Zeyuan Chen, Ran Xu, Phil Mui, James Zhu, Sitaram Asur

Abstract degli autori

Gli harness degli agenti (il prompt di sistema, l’insieme degli strumenti, gli hook di esecuzione e la struttura di supporto per la gestione del contesto che circondano un modello) sono determinanti per il successo nei compiti agentici. L’evoluzione automatizzata degli harness può consentire ai modelli più piccoli di ottenere buoni risultati in compiti specifici di un dominio a una frazione del costo dei modelli di frontiera. Poiché sia l’harness sia i pesi del modello ne influenzano il comportamento, ci chiediamo come combinare l’evoluzione dell’harness e un fine-tuning leggero. Su sette compiti agentici aziendali, facciamo dapprima evolvere un harness con il modello più debole e osserviamo poi che un esperto più potente spesso lo usa con maggiore efficacia: questo suggerisce che la supervisione dell’esperto potrebbe colmare il divario restante. Tuttavia, addestrare il modello più debole sulle traiettorie complete dell’esperto con l’harness evoluto produce l’effetto opposto: le prestazioni peggiorano in tutti e sette i compiti, da 4 a 30 punti con Qwen3-Coder e Gemma 4, benché la stessa procedura sia utile con l’harness non evoluto. La nostra analisi mostra che l’imitazione trasferisce conoscenze e aumenta l’uso della struttura di supporto, ma compromette la compatibilità tra modello e harness: il modello più debole adotta la strategia di pianificazione dell’esperto senza avere la capacità di attuarla e non è più compatibile con l’harness evoluto attorno al suo stile di pianificazione originario. Sviluppiamo quindi una procedura di correzione on-policy da parte dell’esperto, automatizzata da un agente MLE di livello meta, che individua il turno in cui si verifica l’errore nel rollout del modello più debole e chiede all’esperto di riscrivere soltanto quel turno. Questo approccio preserva lo stile di pianificazione del modello e combina i vantaggi dell’evoluzione dell’harness e dell’adattamento del modello. I nostri risultati individuano e risolvono una fonte di conflitto tra gli aggiornamenti dell’harness e quelli dei pesi, offrendo una procedura che preserva la compatibilità per una co-evoluzione a costi contenuti nei compiti aziendali specifici di un dominio.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv