Vai al contenuto
AI.info

Ricerca

WHALE: una semplice ricetta per ottimizzare congiuntamente harness e pesi

Le prestazioni di un agente dipendono sia dai parametri del modello sia dal codice eseguibile dell’harness, che gestisce il contesto e il flusso di controllo. Ottimizzare una sola delle due componenti

WHALE: una semplice ricetta per ottimizzare congiuntamente harness e pesi
arXiv
2609.00196
Pubblicato
2026-08-31
Autori
Haechan Kim, Yoonho Lee, Gisang Lee, Chelsea Finn, Kangwook Lee

Abstract degli autori

Le prestazioni di un agente dipendono sia dai parametri del modello sia dal codice eseguibile dell’harness, che gestisce il contesto e il flusso di controllo. Ottimizzare una sola delle due componenti può lasciare il sistema limitato dall’altra, rimasta invariata: aggiornare i pesi può cambiare quale harness è efficace, mentre aggiornare l’harness può cambiare quali capacità del modello vengono sfruttate. I metodi esistenti di adattamento congiunto ottimizzano i pesi e i prompt testuali, ma lasciano invariato il resto dell’harness. Proponiamo Weight-Harness Alternating LEarning (WHALE), una semplice procedura che alterna due fasi: aggiornare il modello con l’harness corrente, poi cercare un harness migliore per il modello aggiornato. Realizziamo le due fasi, rispettivamente, con il fine-tuning online tramite campionamento per rifiuto e con Meta-Harness. Decidere quando passare da una fase all’altra è una scelta progettuale fondamentale: per distinguere i miglioramenti reali dal rumore senza ottimizzare eccessivamente rispetto a una controparte che cambia, WHALE usa fasi di durata fissa oppure una regola adattiva di pazienza basata sui segnali di addestramento. Con agenti Qwen3.5-2B/4B in tre ambiti — risposta a domande mediante ricerca, ragionamento matematico e problemi di scacchi — WHALE supera l’ottimizzazione dei soli pesi, quella del solo harness e Fast-Slow Training di 4,15-24,38 punti percentuali nella migliore accuratezza mean@8. Ciascuna delle due componenti può costituire il collo di bottiglia: in SearchQA, la ricerca dell’harness raggiunge la massima accuratezza ottenuta ottimizzando solo i pesi con molti meno rollout, ma migliora l’accuratezza in matematica solo dopo un aggiornamento dei pesi. Piccoli aggiornamenti alternati superano inoltre l’ottimizzazione per fasi, prima dei pesi e poi dell’harness, sia per accuratezza sia per costo in rollout. Il codice è disponibile all’indirizzo https://github.com/krafton-ai/WHALE.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv