Vai al contenuto
AI.info

Ricerca

Aspire: i modelli possono evolvere autonomamente a partire da obiettivi vaghi?

Molte forme importanti di apprendimento umano partono da un obiettivo vago, come «diventare un fisico migliore» o «migliorare nella ricerca». Chi apprende deve interpretare l’obiettivo, individuare le

Aspire: i modelli possono evolvere autonomamente a partire da obiettivi vaghi?
arXiv
2608.31111
Pubblicato
2026-08-31
Autori
Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei, Junting Zhou, Zexuan Wang, Yuchen Wu, Huan Zhou, Duo Wang, Yinzhu Piao, Yongchang Peng, Yunfeng Shi, Jin Chen, Zuo Wang, Jinkai Liu, Jiaheng Liu, Wenxuan Zhang, Shen Yan, Wenhao Huang, Ge Zhang

Abstract degli autori

Molte forme importanti di apprendimento umano partono da un obiettivo vago, come «diventare un fisico migliore» o «migliorare nella ricerca». Chi apprende deve interpretare l’obiettivo, individuare le lacune nelle proprie capacità, decidere come imparare e stabilire se è davvero migliorato. Al contrario, gli studi esistenti sull’autoevoluzione dei modelli linguistici di grandi dimensioni partono in genere da compiti e metriche di valutazione definiti dagli esseri umani: l’autoevoluzione si riduce così all’ottimizzazione di un obiettivo esplicito, anziché alla scelta di cosa e come imparare. Presentiamo ASPIRE, un benchmark per l’autoevoluzione guidata da obiettivi vaghi. ASPIRE fornisce soltanto un obiettivo relativo alle capacità, formulato in linguaggio naturale, mentre i compiti di valutazione successivi restano nascosti. L’agente deve tradurre l’obiettivo in termini operativi scegliendo dati e metodi di aggiornamento, costruendo segnali per l’addestramento e la validazione e decidendo quando effettuare la valutazione. ASPIRE consente sia l’evoluzione dei pesi del modello sia quella dell’infrastruttura dell’agente in un ambiente interattivo unificato e valuta i sistemi risultanti su un insieme nascosto di 520 elementi preparati da esperti e relativi a sei obiettivi. I nostri esperimenti mostrano che gli obiettivi vaghi spostano lo sforzo di ricerca verso l’interpretazione dell’obiettivo. Gli agenti attuali portano regolarmente a termine cicli di addestramento e di modifica dell’infrastruttura dell’agente, ma i miglioramenti ottenuti intervenendo sui pesi restano sporadici e instabili, e l’infrastruttura evoluta più efficace rimane inferiore al riferimento Qwen-Agent progettato appositamente. Gli agenti spesso si addestrano su dati non pertinenti e si affidano ad autovalutazioni limitate: per questo i miglioramenti locali non si trasferiscono alla valutazione nascosta, e proseguire la ricerca e l’addestramento può cancellare i progressi precedenti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv