Vai al contenuto
AI.info

Ricerca

Perché i modelli di diffusione video violano le leggi della fisica? Alla scoperta dei difetti nei meccanismi di attenzione

Nonostante l’impressionante qualità visiva, i modelli di diffusione video all’avanguardia generano spesso contenuti che violano le leggi fisiche del mondo reale. Mentre le soluzioni esistenti si basan

Perché i modelli di diffusione video violano le leggi della fisica? Alla scoperta dei difetti nei meccanismi di attenzione
arXiv
2609.23658
Pubblicato
2026-09-20
Autori
Yueyan Li, Haibo Wang, Caixia Yuan, Xiaojie Wang

Abstract degli autori

Nonostante l’impressionante qualità visiva, i modelli di diffusione video all’avanguardia generano spesso contenuti che violano le leggi fisiche del mondo reale. Mentre le soluzioni esistenti si basano su prior esterni o dati specializzati, indaghiamo le cause alla radice esplorando i meccanismi interni di questi modelli. In particolare, presentiamo il primo studio di interpretabilità sul processo di «pianificazione del movimento» dei modelli di diffusione text-to-video, mostrando come si formano le traiettorie di movimento nelle prime fasi di denoising. Partendo dalla scoperta «prima la forma, poi i dettagli», combiniamo gli schemi delle traiettorie di cross-attention con i contributi causali delle teste per individuare uno specifico sottoinsieme di teste di attenzione responsabile della pianificazione del movimento. Inoltre, la nostra analisi della self-attention mostra che la Rotary Position Embedding (RoPE) induce un decadimento spaziale dell’attenzione eccessivo. Questo fa sì che le regioni candidate iniziali si fissino prematuramente su posizioni fisicamente implausibili, sopprimendo traiettorie ragionevoli nei fotogrammi adiacenti e innescando modalità di fallimento della generazione. Per affrontare questo difetto fondamentale, proponiamo una modifica architetturale leggera che ridimensiona la frequenza della RoPE nelle diverse fasi di denoising. Questa strategia riduce il decadimento eccessivo dell’attenzione, aiutando il modello a esplorare regioni candidate migliori per stabilire un movimento fisico coerente. Infine, esperimenti senza addestramento e basati sull’addestramento confermano l’efficacia del nostro approccio nel migliorare il senso comune fisico dei video generati.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv