Ricerca
NeoHorse-1: verso l’auto-miglioramento ricorsivo attraverso il post-training agentico con un harness di routing
L’auto-miglioramento ricorsivo (RSI) richiede un meccanismo concreto con cui un sistema di IA osservi le proprie capacità e trasformi le informazioni raccolte nel successivo ciclo di apprendimento. Pr

- arXiv
- 2609.08183
- Pubblicato
- 2026-09-08
- Autori
- NeoHorse Team, Guoliang Cao, Guohao Dai, Tianyu Guo, Kai Han, Hailin Hu, Zihan Jiang, Xiang Kuang, Boxun Li, Yulong Li, Zehua Pei, Yuchuan Tian, Jiamin Wang, Yu Wang, Yunhe Wang, Yihong Wu, Haiyang Xu, Shuo Zhang, Hang Zhou, Siyang Cheng, Jiayu Fan, Wei He, Qingrui Jiao, Hongguang Li, Zhiyuan Li, Runke Liu, Xi Liu, Xinchen Liu, Sinno Jialin Pan, Yi Ren, Liuyang Song, Chenyu Wang, Bei Yu, Quanlu Zhang, Xiangyu Zhang, Mengyu Zheng, Yingjie Zong
Abstract degli autori
L’auto-miglioramento ricorsivo (RSI) richiede un meccanismo concreto con cui un sistema di IA osservi le proprie capacità e trasformi le informazioni raccolte nel successivo ciclo di apprendimento. Presentiamo NeoHorse-1, una famiglia di modelli progettati per operare come agenti e sviluppati per esplorare questa strada attraverso il post-training agentico. Il nostro sistema combina un insieme eterogeneo di modelli con un routing intelligente e registra, per ogni turno dell’utente, il fabbisogno di capacità previsto, il livello di servizio selezionato e la successiva interazione. Questi dati vengono trasformati in esempi di addestramento che conservano il ragionamento intercalato, le chiamate agli strumenti e il contesto dell’harness, e vengono ammessi dopo una validazione strutturale, una valutazione semantica su sei dimensioni e un’etichettatura a livello di sottoscena. I segnali di routing organizzano il fine-tuning supervisionato in un percorso di apprendimento in tre fasi e vengono impiegati anche nella distillazione on-policy guidata dal routing, in cui un modello docente supervisiona le risposte generate dal modello studente secondo la stessa progressione. L’allocazione guidata dalle capacità trasforma poi il feedback della valutazione nella successiva combinazione di dati di addestramento, chiudendo un ciclo di valutazione, selezione e aggiornamento in cui ciò che il sistema impara a fare determina da quali dati imparerà in seguito. Su undici benchmark che coprono agenti basati su harness, uso degli strumenti, programmazione e rispetto delle istruzioni, il post-training porta la macro-media da 58,94 a 64,87 per il modello 4B e da 65,60 a 69,04 per il modello 9B, riducendo sensibilmente il divario complessivo tra il modello 4B dopo il post-training e il modello 9B di base. NeoHorse-1 offre un primo prototipo di questo processo guidato dal feedback e un percorso verso l’RSI mediato dall’harness attraverso iterazioni successive.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv