Vai al contenuto
AI.info

Ricerca

Scalare le traiettorie per compiti complessi tramite l’autoriscrittura ricorsiva

Le traiettorie riuscite in compiti difficili forniscono indicazioni preziose per migliorare i modelli, ma gli harness specializzati introducono interventi che potrebbero non essere disponibili durante

Scalare le traiettorie per compiti complessi tramite l’autoriscrittura ricorsiva
arXiv
2610.02826
Pubblicato
2026-10-02
Autori
Zongxia Li, Yucheng Shi, Zhongzhi Li, Junyao Yang, Ruhan Wang, Chengsong Huang, Fuxiao Liu, Haitao Mi, Jordan Boyd-Graber, LeoweiLiang

Abstract degli autori

Le traiettorie riuscite in compiti difficili forniscono indicazioni preziose per migliorare i modelli, ma gli harness specializzati introducono interventi che potrebbero non essere disponibili durante l’impiego. Proponiamo Recursive Self-Rewrite (RSR), un framework che usa un unico modello di base, Qwen-3.8-27B, per trovare soluzioni riuscite con diversi harness e ricostruirle come traiettorie di addestramento con un harness generale. Un pianificatore estrae le procedure e le organizza in manuali operativi; un critico verifica che non vi siano fughe di informazioni sul verificatore o sulla soluzione e guida la revisione ricorsiva; un esecutore segue i manuali operativi giudicati idonei in nuovi ambienti isolati. Su circa 3K compiti da terminale selezionati da noi, tre harness risolvono complessivamente 759 compiti, il 34,3% in più rispetto al miglior harness individuale nell’insieme registrato. RSR trasforma 2.001 traiettorie di origine riuscite in 11.094 traiettorie riscritte per il fine-tuning supervisionato. L’addestramento su queste traiettorie supera sia il modello di base sia l’SFT diretto sulle traiettorie. Rispetto al modello di base, il pass@3 sale dal 57,0% al 74,2% su Terminal-Bench 2, dall’1,5% al 9,1% su Terminal-Bench 4, dal 39,0% al 63,0% su Terminal-Bench Hard, selezionato da noi, e dal 3,0% al 6,0% su Software Terminal-Bench, anch’esso selezionato da noi. La ricompensa di processo su Long-Horizon Terminal-Bench sale da 0,21 a 0,29. Questi risultati mostrano come le esperienze maturate con l’aiuto di diversi harness possano essere ricostruite in capacità riutilizzabili da un modello che opera con un harness generale.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv