Vai al contenuto
AI.info

Ricerca

ComputerSD: autodistillazione online dal feedback in tempo reale per agenti che usano il computer

L’addestramento online consente agli agenti che usano il computer (CUA) di migliorare interagendo con ambienti eseguibili. Tuttavia, i metodi esistenti si basano soprattutto su ricompense legate al ri

ComputerSD: autodistillazione online dal feedback in tempo reale per agenti che usano il computer
arXiv
2609.40253
Pubblicato
2026-09-30
Autori
Yong Du, Tongbo Chen, Zhengxi Lu, Yizhou Liu, Bofan Chen, Tao Jiang, Wenhao Xu, Yongliang Shen

Abstract degli autori

L’addestramento online consente agli agenti che usano il computer (CUA) di migliorare interagendo con ambienti eseguibili. Tuttavia, i metodi esistenti si basano soprattutto su ricompense legate al risultato finale, che non forniscono indicazioni per le azioni intermedie. L’autodistillazione on-policy (OPSD) offre segnali di apprendimento a livello di token tramite una rivalutazione basata su informazioni privilegiate, ma applicarla direttamente all’addestramento online dei CUA presenta due difficoltà: indicazioni fisse possono non essere più allineate allo stato attuale del modello studente e le variazioni delle probabilità indotte dalle indicazioni possono entrare in conflitto con la correttezza dei singoli passaggi. Presentiamo ComputerSD, un metodo di autodistillazione online per CUA che trasforma il feedback in tempo reale sulle transizioni eseguite nell’interfaccia grafica in indicazioni per l’apprendimento della policy. Dopo ogni azione, un analizzatore di interfacce grafiche sottoposto a fine-tuning produce indicazioni e un punteggio di valore per il singolo passaggio: le indicazioni forniscono un contesto privilegiato, mentre il punteggio regola i segnali OPSD che ne derivano. ComputerSD ottimizza congiuntamente l’OPSD a livello di token e il GRPO a livello di traiettoria in un sistema di addestramento completamente asincrono. Su OSWorld-Verified, ComputerSD supera il GRPO basato esclusivamente sui risultati di 1,9 e 4,1 punti percentuali, rispettivamente con i modelli di base Qwen3-VL-8B-Thinking, di uso generale, ed EvoCUA-8B, specializzato. La valutazione in contesti fuori distribuzione fornisce ulteriori elementi a sostegno della capacità di generalizzazione di ComputerSD. Questi risultati dimostrano l’efficacia dell’apprendimento dal feedback in tempo reale tramite autodistillazione online per i CUA.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv