Ricerca
TRACE: ammissione robusta rispetto alla traiettoria con ordinamento delle evidenze per agenti GUI efficienti
Man mano che la traiettoria si sviluppa, gli agenti GUI accumulano schermate ad alta risoluzione, con un aumento della latenza di inferenza e dell’uso della memoria. Il pruning dei token visivi senza

- arXiv
- 2609.10297
- Pubblicato
- 2026-09-09
- Autori
- Yuhao Wang, Mu Qiao, Xindong Zhang, Yunzhi Zhuge, Lei Zhang, Huchuan Lu
Abstract degli autori
Man mano che la traiettoria si sviluppa, gli agenti GUI accumulano schermate ad alta risoluzione, con un aumento della latenza di inferenza e dell’uso della memoria. Il pruning dei token visivi senza addestramento può ridurre questi costi, ma il riutilizzo della cache introduce un vincolo fondamentale: una volta scartati i token, le evidenze visive corrispondenti non possono essere recuperate senza una nuova codifica. Il pruning diventa quindi una \textit{decisione irreversibile di ammissione} che deve restare utile per obiettivi futuri sconosciuti, preservando al contempo la copertura delle aree su cui è possibile operare anche con budget limitati. Per affrontare queste sfide, proponiamo \textbf{\method{}}, un framework senza addestramento per \emph{\textbf{T}rajectory-\textbf{r}obust \textbf{A}dmission and \textbf{C}overage-aware \textbf{E}vidence ordering}. In particolare, combiniamo un prior sulle interazioni derivato dal layout e indipendente dalla query con la pertinenza rispetto all’istruzione e la novità delle caratteristiche, per ordinare le evidenze visive in base sia alla loro potenziale utilità futura sia alla loro diversità. Riserviamo poi parte del budget ai token visivi nativi distribuiti sull’intero schermo, colmando le lacune nella copertura spaziale senza alterare l’ordinamento. Insieme, questi meccanismi producono un ordinamento annidato dei token, che consente di ridurre progressivamente le evidenze visive conservate al diminuire del budget, mantenendole riutilizzabili lungo tutta la traiettoria. Infine, la nostra contrazione monotona dei KV comprime gradualmente i frame non più attivi in uno stato di sessione compatto, evitando di ripetere la codifica visiva o il pruning. Ampi esperimenti condotti su sei benchmark GUI e diversi modelli confermano l’efficacia di \method{} con budget limitati. Il codice sorgente sarà reso disponibile.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv