Ricerca
MintAct: un agente visivo unificato per gli ambienti digitali
Presentiamo MintAct, una famiglia di modelli visione-linguaggio che riunisce il grounding delle interfacce utente, la navigazione in più passaggi su dispositivi mobili, desktop e web e l’uso di strume

- arXiv
- 2609.22083
- Pubblicato
- 2026-09-18
- Autori
- Mingfei Gao, Rui Tian, Haiming Gang, Bohan Zhai, Le Zhang, Yuanzheng Gong, Di Feng, Ege Özsoy, Kaixin Ma, Vishwesh Kirthivasan, Oğuzhan Fatih Kar, Roman Bachmann, Anders Boesen Lindbo Larsen, Afshin Dehghan
Abstract degli autori
Presentiamo MintAct, una famiglia di modelli visione-linguaggio che riunisce il grounding delle interfacce utente, la navigazione in più passaggi su dispositivi mobili, desktop e web e l’uso di strumenti visivi, addestrati su scale da 2B, 4B e 8B. Grazie a un’attenta progettazione degli ambienti, dei dati e delle ricette di addestramento, i modelli MintAct eguagliano le prestazioni degli specialisti nei singoli domini in tutte queste capacità. Per rendere possibile tutto ciò, sviluppiamo un’infrastruttura scalabile per gli ambienti e l’apprendimento per rinforzo (RL). Per quanto riguarda gli ambienti, ospitiamo centinaia di istanze simultanee su backend eterogenei specifici per dominio, a supporto sia della raccolta di dati sulle traiettorie sia dell’RL online. Per consentire un addestramento RL efficiente e scalabile, un framework asincrono mantiene un controllo esplicito sulla distribuzione dell’addestramento tra i domini e rimane stabile in presenza di feedback rumorosi dagli ambienti e di deriva off-policy. I risultati sperimentali mostrano che MintAct raggiunge prestazioni all’avanguardia (48,9 su OSWorld-Verified) su un’ampia gamma di benchmark, con modelli di dimensioni comparabili.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv