Vai al contenuto
AI.info

Ricerca

Qwen-Planner-Agent: un framework di IA per l’IA a ciclo chiuso per agenti di pianificazione mobile nel mondo reale

I rapidi progressi dei grandi modelli linguistici stanno estendendo l’IA dalla generazione passiva di contenuti ai flussi di lavoro attivi dell’ingegneria e della scoperta scientifica. Questo cambiame

Qwen-Planner-Agent: un framework di IA per l’IA a ciclo chiuso per agenti di pianificazione mobile nel mondo reale
arXiv
2609.29892
Pubblicato
2026-09-24
Autori
Tingyu Qu, Weigao Sun, Yuecheng Liu, Yucheng Zhao, Yi Zhu, Yifeng Ding, Qiyi Wang, Sihan Cao, Pengkun Jiao, Hanlei Xie, Xiongwei Wu, Qichao Wang, Haodong Zhang, Jiajun Liu, Yuhao Wang, Yuqing Xie, Junpeng Zhao, Long Chen, Ming Ma, Sihan Yang, Ziwang Zhao, Yanhao Jia, Liangquan Gong, Feida Zhu, Yiran Zhong, Steven Hoi

Abstract degli autori

I rapidi progressi dei grandi modelli linguistici stanno estendendo l’IA dalla generazione passiva di contenuti ai flussi di lavoro attivi dell’ingegneria e della scoperta scientifica. Questo cambiamento solleva una domanda stimolante: l’IA può essere al tempo stesso oggetto di sviluppo e partecipare attivamente alla costruzione dei sistemi di IA di nuova generazione? Esploriamo questa domanda sviluppando Qwen-Planner-Agent all’interno di un framework di IA per l’IA a ciclo chiuso, pensato per uno sviluppo scalabile e un miglioramento iterativo. La pianificazione su dispositivi mobili rappresenta una prova impegnativa per questo approccio: i compiti complessi e di lunga durata mettono alla prova l’affidabilità degli agenti, mentre i costi elevati delle interazioni con dispositivi reali limitano la scalabilità dello sviluppo. Il framework collega la produzione dei dati, l’addestramento dei modelli e la distribuzione attraverso un contratto condiviso di azione, feedback e verifica. (i) L’IA per i dati crea un ciclo virtuoso agentico dei dati con supervisione umana, in cui agenti specializzati definiscono compiti, raccolgono traiettorie di interazione, selezionano e bilanciano i dati di addestramento e usano il feedback dell’addestramento per orientare la generazione dei dati successiva. (ii) L’IA per l’addestramento combina una fase iniziale di pianificazione supervisionata con l’apprendimento per rinforzo agentico online in ambienti ibridi, introducendo Competence-Aware Reward-and-Advantage Engineering (CARE) per ridurre i costi di ragionamento e di utilizzo degli strumenti, preservando le prestazioni nei compiti. (iii) L’IA guida la coevoluzione di modello e harness attraverso un ciclo basato sulle evidenze di esecuzione, che coordina memoria, competenze e strumenti durante l’esecuzione e restituisce feedback strutturato sulle azioni e tracce degli errori conservate, così da favorire un adattamento coordinato del modello e dell’harness. Qwen-Planner-Agent ottiene le migliori prestazioni complessive tra tutti i modelli e sistemi valutati su MobilePA-Bench, superando il modello di base nell’uso degli strumenti, nella memoria, nelle competenze e nel coordinamento dei sottoagenti. Ulteriori valutazioni del nostro modello mostrano miglioramenti nei benchmark agentici non mobili, mantenendo in larga misura le capacità generali.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv