Vai al contenuto
AI.info

Ricerca

QwenGyre: un framework elastico di apprendimento per rinforzo per addestrare agenti a orizzonte estremamente lungo

Gli agenti basati su modelli linguistici di grandi dimensioni (LLM) affrontano sempre più spesso compiti con un orizzonte temporale estremamente lungo (xlong), in cui una singola esecuzione può durare

QwenGyre: un framework elastico di apprendimento per rinforzo per addestrare agenti a orizzonte estremamente lungo
arXiv
2609.33848
Pubblicato
2026-09-27
Autori
Weiqi Wang, Yuxin Zhou, Mouxiang Chen, Siyuan Zhang, Yi Zhang, Yuyan Luo, Zhiyu Yin, Chencan Wu, Jiemin Jiang, Wentao Yao, Chujie Zheng, JianWei Zhang

Abstract degli autori

Gli agenti basati su modelli linguistici di grandi dimensioni (LLM) affrontano sempre più spesso compiti con un orizzonte temporale estremamente lungo (xlong), in cui una singola esecuzione può durare ore, comportare centinaia di interazioni tra modello e ambiente e arrivare a quasi 1M di token per rollout. Applicare l’apprendimento per rinforzo online (RL) a queste esecuzioni pone due sfide fondamentali: (1) la forte variabilità dei tempi di esecuzione e i lunghi ritardi dei rollout lasciano inattive le GPU per molto tempo; (2) le complesse ramificazioni non lineari generano un’enorme ridondanza delle traiettorie, compromettendo l’efficienza dell’addestramento. Per affrontare queste sfide, presentiamo QwenGyre, un framework end-to-end per l’RL online su orizzonti xlong. QwenGyre rialloca in modo flessibile le GPU tra rollout e addestramento senza interrompere le esecuzioni in corso, mentre il suo sistema di elaborazione delle traiettorie ricostruisce le sequenze ramificate, valuta i progressi parziali ed elimina i percorsi ridondanti per contenere i costi di addestramento. Applicato su scala al nostro modello di punta, Qwen~3.8 2.4T, con 700K token per rollout, QwenGyre ottiene un incremento assoluto del 6,0% su NL2RepoBench (dal 52,5% $\to$ 58,5%) in 48 passaggi. Nelle nostre valutazioni su diversi ambiti dei dataset di addestramento, QwenGyre raggiunge accelerazioni fino a $1.85\times$ e $1.78\times$ rispetto, rispettivamente, a Colocate e Async.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv