Vai al contenuto
AI.info

Ricerca

ReactHuman: un benchmark fondato sulla fisica per decisioni reattive simili a quelle umane nei modelli linguistici multimodali incarnati

Reagire a pericoli fisici improvvisi, come afferrare un piatto che scivola o schivare un coltello che cade, è sia un test significativo dell’intelligenza incarnata sia un requisito imprescindibile per

ReactHuman: un benchmark fondato sulla fisica per decisioni reattive simili a quelle umane nei modelli linguistici multimodali incarnati
arXiv
2609.10895
Pubblicato
2026-09-09
Autori
Yizhan Li, Jianxin You, Mengyang Xiong, Yinhuan Chen, Zicheng Zhao, Dekun Wu, Dongqing Zhang, Bang Liu

Abstract degli autori

Reagire a pericoli fisici improvvisi, come afferrare un piatto che scivola o schivare un coltello che cade, è sia un test significativo dell’intelligenza incarnata sia un requisito imprescindibile per impiegare i grandi modelli linguistici multimodali (MLLM) come nucleo decisionale dei robot domestici. Le valutazioni esistenti, tuttavia, mettono alla prova la fisica intuitiva in modo passivo, attraverso domande e risposte su video, oppure si concentrano su compiti deliberati e di lungo orizzonte, come la navigazione e la riorganizzazione di oggetti; nessuna misura se un modello sappia tradurre la comprensione della fisica in un’azione immediata e cruciale per la sicurezza. Presentiamo ReactHuman, il primo benchmark fondato sulla fisica per decisioni reattive simili a quelle umane. In questo benchmark, l’MLLM valutato funge da cervello di un umanoide simulato che affronta pericoli domestici improvvisi; comprende 17 famiglie di eventi e oltre 1.000 scene riproducibili bit per bit, con una verità di riferimento esatta, ottenuta senza annotazioni da una simulazione di corpi rigidi a 240 Hz. Sono inclusi oggetti avversari il cui aspetto contraddice le loro proprietà fisiche, come un’incudine di gommapiuma e una mela d’acciaio. Progettiamo inoltre un insieme di cinque metriche che valuta ogni reazione secondo tre criteri: se sia ragionevole, sicura e fondata sulla fisica. Eseguiamo fisicamente ogni piano adottato, così che le decisioni abbiano conseguenze osservabili. Con questo sistema valutiamo sette MLLM rappresentativi. I risultati mostrano che la sicurezza nelle reazioni è ancora lontana dall’essere un problema risolto: i modelli gestiscono male circa un pericolo su tre, agiscono in base a predisposizioni fisse anziché alla scena osservata, si fidano dell’aspetto più che del movimento e sbagliano i punti di intercettazione con errori dell’ordine dei metri anche quando l’azione scelta è corretta. Nessuno di questi problemi si riduce all’aumentare delle dimensioni del modello. ReactHuman offre dunque sia una diagnosi dettagliata sia un segnale di addestramento scalabile per sviluppare agenti incarnati consapevoli della sicurezza e fondati sulla fisica. Il benchmark è disponibile qui: https://huggingface.co/datasets/Alan123/reacthuman-benchmark-scaled

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv