Ricerca
RoboQuest: agenti fisici generalisti che cercano, ispezionano e testano
I recenti progressi dei modelli di base multimodali li hanno resi capaci di agire come agenti fisici generalisti in una serie di compiti di manipolazione. Tuttavia, per operare con successo in un ambi

- arXiv
- 2610.10388
- Pubblicato
- 2026-10-07
- Autori
- Liu Renhang, Navonil Majumder, Tej Deep Pala, Soujanya Poria
Abstract degli autori
I recenti progressi dei modelli di base multimodali li hanno resi capaci di agire come agenti fisici generalisti in una serie di compiti di manipolazione. Tuttavia, per operare con successo in un ambiente sconosciuto, un agente può dover cercare attraverso l’interazione informazioni rilevanti per il compito che non sono presenti nelle osservazioni: può aver bisogno di stabilire dove si trovi un oggetto rilevante, ispezionare una proprietà non osservata o scoprire l’effetto di uno strumento sconosciuto. Presentiamo quindi RoboQuest, un benchmark per l’esplorazione incarnata orientata a un obiettivo, in cui gli agenti devono acquisire attivamente informazioni rilevanti per il compito attraverso l’interazione fisica, usare le prove così ottenute per adattare le azioni successive e decidere autonomamente quando impegnarsi nel completamento del compito. RoboQuest comprende dieci compiti di manipolazione mobile incentrati su tre forme di incertezza: ricerca, ispezione mediante manipolazione e test interattivi. Valutiamo cinque agenti multimodali di frontiera attraverso una comune interfaccia visuomotoria, oltre a una policy $π_{0.5}$ sottoposta a fine-tuning sulle dimostrazioni di episodi completi che rendiamo disponibili. L’agente migliore riesce a completare solo il 23\% degli episodi, mentre la policy sottoposta a fine-tuning non ci riesce quasi mai. Test isolati delle abilità di esecuzione su cui si basano i compiti, condotti fornendo le informazioni nascoste, mostrano che gli agenti sono in grado di compiere la maggior parte delle azioni richieste; la nostra analisi degli insuccessi ne attribuisce solo una minoranza all’esecuzione. L’analisi rileva inoltre che gli agenti spesso interrompono l’esplorazione troppo presto, prendendo decisioni prima di aver osservato le prove necessarie per completare il compito. Rileviamo anche che gli agenti raramente prevengono o riparano le alterazioni causate dalla loro esplorazione. Inoltre, apprendere per tentativi ed errori resta difficile per la maggior parte dei modelli.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv