Ricerca
VeriPhy: ragionamento fisico agentico per la valutazione e il perfezionamento dei modelli del mondo
La fluidità visiva di un video generato non ne garantisce l’affidabilità fisica, e un punteggio di qualità espresso da un solo numero non basta a indicare quale vincolo violi una clip o in quale momen

- arXiv
- 2609.03153
- Pubblicato
- 2026-09-02
- Autori
- Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi, Jason Kuen, Yongxin Chen, Molei Tao, Christopher McComb, Noelia Grande Gutiérrez, Jiuxiang Gu
Abstract degli autori
La fluidità visiva di un video generato non ne garantisce l’affidabilità fisica, e un punteggio di qualità espresso da un solo numero non basta a indicare quale vincolo violi una clip o in quale momento si verifichi l’errore. Presentiamo VeriPhy, un sistema verificabile di controllo della coerenza fisica in cui un pianificatore che opera solo su testo traduce il prompt in obblighi fisici tipizzati e in un piano di esecuzione validato staticamente, prima che venga osservato qualsiasi fotogramma. Durante l’esecuzione, le osservazioni autorizzano e delimitano soltanto le chiamate dichiarate a strumenti specialistici di basso livello non modificabili (per esempio segmentazione e tracciamento, conteggio, undici misurazioni fisiche tipizzate sui tracciati ottenuti, stima della profondità, OCR e rilevamento di eventi sonori). Ogni azione restituisce un record di evidenza che ne conserva la provenienza e il cui contenuto, quando utilizzabile, è una misurazione tipizzata oppure uno stato appreso contrassegnato esplicitamente. Risolutori tipizzati e una composizione fissa associano i record utilizzabili a uno stato con tre possibili valori (supportato, contraddetto o sconosciuto, presentati rispettivamente come plausibile, implausibile o astensione), conservando la provenienza completa: ogni verdetto è così riconducibile alle evidenze che lo hanno prodotto. Basiamo la valutazione su un corpus di 1.500 clip con record dei difetti annotati da esseri umani, che localizzano errori reali di generazione rispetto ai riferimenti del prompt, nello spazio e nel tempo. Su un nucleo di 149 clip contenente 304 record di questo tipo, VeriPhy rende conto di 228, contro i 164 di un valutatore basato sulla scomposizione in domande già descritto in una pubblicazione, a cui sono state fornite le stesse clip e le stesse affermazioni. La sola recall non lo distingue dall’impiego dello stesso backbone con prompt formulati in modo monolitico, che arriva a 222. La differenza è che ogni decisione conserva il proprio record di evidenza e la relativa provenienza: le tracce possono così essere verificate un verdetto alla volta e usate come interfaccia attraverso cui il verdetto di un critico potrebbe essere reinserito nella generazione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv