Vai al contenuto
AI.info

Ricerca

Valutare gli MLLM come agenti generalisti visione-linguaggio-azione per il controllo dei droni: impartire comandi, avvicinarsi, seguire e cercare

I modelli linguistici multimodali di grandi dimensioni (MLLM) sono molto capaci di percepire immagini e video. Ci chiediamo fino a che punto questa capacità si estenda all’azione: inserire un MLLM dir

Valutare gli MLLM come agenti generalisti visione-linguaggio-azione per il controllo dei droni: impartire comandi, avvicinarsi, seguire e cercare
arXiv
2609.01404
Pubblicato
2026-09-01
Autori
Jaewoo Park, Minyoung Lee, Sukmin Seo, Moonbin Yim, Hyunwook Yoon, Dohoon Ryu, Daehee Kim, Myungseo Song, Jihyuk Byun, Seunggyu Chang, Taeho Kil, Jiseob Kim, Bado Lee, Geewook Kim

Abstract degli autori

I modelli linguistici multimodali di grandi dimensioni (MLLM) sono molto capaci di percepire immagini e video. Ci chiediamo fino a che punto questa capacità si estenda all’azione: inserire un MLLM direttamente nel ciclo di controllo di un drone, dichiarando il suo intero spazio delle azioni soltanto nel prompt. I sistemi recenti si avvicinano a questa impostazione, ma restringono sempre più l’autonomia decisionale del modello. Noi la ampliamo di nuovo. Presentiamo DroneCATS-Agent, un’architettura in cui l’MLLM è un componente intercambiabile, e DroneCATS, un benchmark che tratta il modello come variabile indipendente. Il nostro agente non si limita a volare verso un pixel: affida al modello il controllo dell’imbardata e la ricerca, la valutazione delle azioni quando è incerto e la dichiarazione autonoma dell’arrivo, il tutto senza fine-tuning né schemi di chiamata delle funzioni. La valutazione di modelli di frontiera e modelli aperti in quattro capacità fondamentali — avvicinarsi a un bersaglio visibile, seguirne uno in movimento, cercare fuori dal campo visivo iniziale e impartire comandi a una flotta di più droni — rivela che anche gli scenari in cui i modelli agiscono nel mondo fisico più semplici sono ben lontani dall’essere risolti. Per individuare che cosa cede per primo nell’impiego su dispositivi edge, la nostra selezione comprende anche modelli da appena 2 miliardi di parametri. I risultati mettono in luce un netto paradosso: non è il volo a fallire. I piccoli modelli aperti spesso riescono a entrare nel raggio di successo in modo più affidabile dei modelli di frontiera, eppure falliscono l’episodio perché dichiarano l’arrivo troppo presto o non lo dichiarano affatto. Impartire comandi a più droni accentua questa differenza: i piccoli modelli falliscono copiando alla cieca un’unica coordinata tra visuali distinte. Considerati come agenti visione-linguaggio-azione, i modelli mantengono una buona percezione spaziale, ma non riescono a rispettare il protocollo d’azione. A distinguere un modello di frontiera da un modello utilizzabile su dispositivi edge non è la navigazione, ma la disciplina necessaria a seguire un protocollo dichiarato e a produrre la corretta azione di terminazione. Il problema aperto è colmare questo divario con costi computazionali sostenibili a bordo, ottenendo un modello veloce che pianifichi con continuità e sappia esattamente quando ha finito. DroneCATS è progettato per misurare questa distanza.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv