Vai al contenuto
AI.info

Ricerca

World Models’ Last Exam in Physics

I modelli del mondo video possono produrre sequenze visivamente convincenti ma fisicamente incoerenti, sollevando dubbi sulla loro affidabilità per la previsione e la pianificazione nei sistemi di IA

World Models’ Last Exam in Physics
arXiv
2610.08791
Pubblicato
2026-10-06
Autori
Mingju Gao, Qingle Liu, Yuzhao Peng, Xinjie Lin, Ziming Qin, Zheng Jiang, Wenyi Li, Calvin Xiao, Youjie Zheng, Kaisen Yang, Qinhuai Na

Abstract degli autori

I modelli del mondo video possono produrre sequenze visivamente convincenti ma fisicamente incoerenti, sollevando dubbi sulla loro affidabilità per la previsione e la pianificazione nei sistemi di IA incarnata. Le valutazioni esistenti si basano spesso su giudizi formulati da modelli o su video di riferimento, mentre i test fisici diretti si concentrano in gran parte sulla meccanica. Presentiamo World Models’ Last Exam in Physics, un benchmark basato su misurazioni per valutare la coerenza fisica dei modelli del mondo video. Il benchmark comprende 40 prove controllate che spaziano dalla meccanica all’ottica, ai fluidi, ai fenomeni termici e ai cambiamenti di fase, all’elettromagnetismo e alla tensione superficiale. Ogni prova associa un’immagine iniziale e un prompt di generazione a criteri fisici predefiniti, consentendo test interpretabili delle relazioni fisiche osservabili senza richiedere video di riferimento. Il sistema di valutazione combina una verifica dell’osservabilità di ciascuna prova con misurazioni fisiche quantitative specifiche per la prova. Gli esperimenti condotti su otto modelli di generazione video, per un totale di 1.280 video, rivelano incoerenze fisiche persistenti e differenze sostanziali tra le prove: il modello migliore ottiene un punteggio complessivo di 57,76 su 100. La valutazione su video sintetici con relazioni fisiche note fornisce elementi a sostegno della validità del modulo di misurazione in condizioni controllate. Il sistema di valutazione mostra inoltre una maggiore concordanza con i giudizi umani rispetto a una baseline basata sulla valutazione diretta di un modello visivo-linguistico, sia nelle classifiche all’interno di ciascuna prova sia nei confronti a coppie. Combinando la copertura di diversi ambiti della fisica con punteggi fondati su dati misurabili e limiti delle misurazioni dichiarati esplicitamente, il benchmark offre una base interpretabile per individuare le incoerenze fisiche e monitorare i progressi verso modelli del mondo video fisicamente coerenti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv