Vai al contenuto
AI.info

Ricerca

WorldAuditBench: verifica interattiva dei mondi 3D con agenti multimodali

Poiché i mondi 3D interattivi sono sempre più utilizzati per studiare il comportamento intelligente, diventa importante sviluppare pipeline efficienti per individuare anomalie in questi ambienti simul

WorldAuditBench: verifica interattiva dei mondi 3D con agenti multimodali
arXiv
2609.40325
Pubblicato
2026-09-30
Autori
Ziyan Jiang, Jingbo Yang, Jiabao Ji, Yujian Liu, Qiucheng Wu, Tommi Jaakkola, Yang Zhang, Shiyu Chang

Abstract degli autori

Poiché i mondi 3D interattivi sono sempre più utilizzati per studiare il comportamento intelligente, diventa importante sviluppare pipeline efficienti per individuare anomalie in questi ambienti simulati, come oggetti sospesi nel vuoto, muri attraversabili o oggetti incongruenti con la scena circostante. I sistemi di IA multimodali, tra cui i modelli visione-linguaggio (VLM) e i modelli visione-linguaggio-azione (VLA), hanno mostrato il potenziale per automatizzare questo compito. La verifica dei mondi 3D è però complessa e richiede di integrare strettamente due capacità distinte: l’azione, per esplorare il mondo 3D e cercare anomalie in modo sistematico ed efficiente; e il ragionamento visivo, per comprendere l’ambiente e individuare anomalie a partire da osservazioni multimodali. Resta in gran parte inesplorato se gli agenti multimodali siano in grado di integrare efficacemente queste due capacità, usando il ragionamento visivo per individuare potenziali anomalie e compiendo azioni per verificarle. In questo articolo presentiamo WorldAuditBench, un benchmark per la verifica dei mondi 3D che comprende 213 compiti relativi alle anomalie in 13 ambienti realizzati con Unreal Engine 5 e Three.js, distribuiti in cinque famiglie di anomalie. Valutiamo cinque modelli all’avanguardia con un budget di esplorazione fisso, secondo due approcci alla verifica: un’esplorazione basata su VLA seguita dall’individuazione delle anomalie basata su VLM, e un agente VLM end-to-end in cui il ragionamento visivo guida direttamente la scelta delle azioni. Nei modelli valutati e nei due approcci, i tassi di successo vanno dal 6,6% al 42,3%, nettamente al di sotto delle prestazioni umane (83,4%). Attraverso il compito di verificare i mondi, WorldAuditBench offre un banco di prova per studiare come gli agenti multimodali integrino azione e ragionamento visivo negli ambienti 3D interattivi, evidenziando al contempo gli attuali limiti della loro capacità di raccogliere e interpretare elementi di prova durante l’esplorazione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv