Vai al contenuto
AI.info

Ricerca

Physis-Lang: il linguaggio che si autoevolve come rappresentazione fisica per un modello del mondo video

Ci si aspetta che i modelli del mondo video prevedano come evolve il mondo fisico, eppure spesso producono video visivamente plausibili che violano principi fisici fondamentali. Gli approcci esistenti

Physis-Lang: il linguaggio che si autoevolve come rappresentazione fisica per un modello del mondo video
arXiv
2609.40358
Pubblicato
2026-09-30
Autori
Liming Lu, Xianzheng Ma, Wenkun He, Guanqi Zhan, Yilin Zhao, Junyu Chen, Mengyao Xu, Jiaojiao Fan, Wenhang Ge, Yuchao Gu, Yunze Liu, Boyi Li, Zhen Dong, Victor Prisacariu, Ming-Yu Liu, Song Han, Han Cai

Abstract degli autori

Ci si aspetta che i modelli del mondo video prevedano come evolve il mondo fisico, eppure spesso producono video visivamente plausibili che violano principi fisici fondamentali. Gli approcci esistenti presuppongono comunemente che il linguaggio naturale non sia sufficiente a rappresentare le conoscenze fisiche necessarie per una generazione affidabile e introducono quindi segnali aggiuntivi visivi, latenti, numerici o basati sulla pianificazione. Riconsideriamo questa ipotesi e presentiamo Physis-Lang, un framework che si autoevolve e tratta il linguaggio fisico come una rappresentazione condivisa e ottimizzabile nella selezione dei dati, nell’addestramento dei modelli e nella generazione di video. Physis-Lang rappresenta i processi fisici attraverso un linguaggio che ne descrive le entità rilevanti, le cause, le interazioni, i principi che li governano, l’evoluzione temporale e gli effetti. Per migliorare questa rappresentazione, sviluppiamo PhysCapBench, che scompone i processi fisici in asserzioni atomiche e valuta le descrizioni in termini di richiamo e precisione. Un ciclo agentico analizza iterativamente gli errori a livello delle singole asserzioni e perfeziona l’istruzione usata per produrre descrizioni dei processi fisici. Physis-Lang trasforma inoltre le carenze del modello in descrizioni testuali e usa una ricerca guidata dal linguaggio per individuare video visivamente diversi che coprano i processi fisici mancanti. Esperimenti condotti su quattro benchmark ampiamente utilizzati per i video di fenomeni fisici, con architetture di base Wan e Cosmos, mostrano miglioramenti costanti nella plausibilità fisica. In particolare, partendo dalle architetture di base open source Cosmos3-Nano, i nostri modelli potenziati con Physis-Lang superano Veo 3.1, il principale modello proprietario.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv