Ricerca
Ego2Act: valutare la manipolazione finalizzata a un obiettivo nella generazione di video in prima persona
I modelli di generazione video sono sempre più studiati come simulatori del mondo per la pianificazione e l’apprendimento di agenti dotati di un corpo. Per svolgere efficacemente questo ruolo, non dev

- arXiv
- 2610.01092
- Pubblicato
- 2026-10-01
- Autori
- Patrick Amadeus Irawan, Iskandar Muda Rizky Parlambang, Rava Maulana, Qinrong Cui, Erland Hilman Fuadi, Zayd M. K. Zuhri, Nanda Ryaas Absar, Ahmed Elshabrawy, Wilfried Ariel Mulyawan, Shoubin Yu, Yue Zhang, Mohit Bansal, Alham Fikri Aji
Abstract degli autori
I modelli di generazione video sono sempre più studiati come simulatori del mondo per la pianificazione e l’apprendimento di agenti dotati di un corpo. Per svolgere efficacemente questo ruolo, non devono soltanto generare fotogrammi visivamente convincenti, ma anche prevedere come gli ambienti cambiano nel tempo durante l’esecuzione di azioni finalizzate a un obiettivo. Valutare queste capacità è fondamentale, ma i benchmark esistenti si concentrano soprattutto su singole azioni brevi o su istruzioni passo per passo. Il ragionamento fisico articolato in più passaggi resta quindi poco studiato, soprattutto nella generazione di video in prima persona, che richiede di pianificare la simulazione della corretta esecuzione di più manipolazioni nel mondo reale per raggiungere obiettivi di alto livello. Presentiamo Ego2Act, un benchmark basato su obiettivi che comprende 2.640 video relativi a 110 attività reali in contesti quotidiani, con diversi gradi di ingombro dovuto agli oggetti e di complessità delle sequenze di più passaggi. A partire dall’immagine di una scena iniziale e da un obiettivo di alto livello, Ego2Act valuta se i modelli di generazione video siano in grado di produrre video realistici in prima persona di una mano che manipola oggetti per svolgere l’attività. Per consentire una valutazione scalabile, presentiamo anche Ego2ActJudge, una pipeline di valutazione senza riferimenti che, rispetto ai metodi di riferimento pertinenti, ottiene un maggiore accordo con il giudizio degli esseri umani nel valutare il completamento dell’attività e la plausibilità fisica. I nostri risultati mostrano che le simulazioni generate dai modelli spesso saltano alcuni passaggi o li eseguono solo in parte, privando i passaggi successivi degli stati da cui dipendono e impedendo così di raggiungere l’obiettivo. Inoltre, i modelli falliscono sistematicamente nel riprodurre le dinamiche fisiche più dettagliate, soprattutto nella manipolazione complessa degli oggetti e nella modellazione persistente del mondo. Ci auguriamo che Ego2Act offra un banco di prova rigoroso per far progredire i modelli video verso simulazioni fisicamente plausibili e finalizzate a un obiettivo.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv