Vai al contenuto
AI.info

Ricerca

RealtimeWAM: modelli di azione del mondo asincroni a un solo passaggio

I World Action Models (WAMs) integrano rappresentazioni visive ottenute dai modelli alla base della generazione di video per guidare la previsione delle azioni. I recenti WAM efficienti adottano archi

RealtimeWAM: modelli di azione del mondo asincroni a un solo passaggio
arXiv
2610.06617
Pubblicato
2026-10-05
Autori
Chengtao Lv, Jinyang Du, Shuyi Feng, Yang Yong, Shiqiao Gu, Shunzi Yang, Ruihao Gong, Shen Ren, Tianwei Zhang, Wenya Wang

Abstract degli autori

I World Action Models (WAMs) integrano rappresentazioni visive ottenute dai modelli alla base della generazione di video per guidare la previsione delle azioni. I recenti WAM efficienti adottano architetture Mixture-of-Transformers (MoT) e calcolano una sola volta le rappresentazioni video, che vengono poi riutilizzate dall’esperto delle azioni. Tuttavia, l’iterazione all’interno dell’esperto (\ie, la rimozione del rumore dalle azioni in più passaggi) e l’attesa tra esperti (\ie, l’esecuzione sequenziale dell’esperto dei video e di quello delle azioni) continuano a limitare l’efficienza dell’inferenza. Per superare entrambi questi ostacoli, presentiamo RealtimeWAM, una variante dei WAM estremamente efficiente che genera le azioni in un solo passaggio ed esegue l’inferenza in modo asincrono. Per ridurre l’iterazione all’interno dell’esperto, proponiamo Teacher-Anchored Consistency Distillation (TACD), che affronta il divario tra errore locale e globale: un basso errore di coerenza locale, da solo, non garantisce azioni finali accurate. TACD integra la coerenza locale con una supervisione esplicita basata sul risultato finale dell’esecuzione in più passaggi del modello insegnante congelato, consentendo di generare azioni accurate in un solo passaggio. Proponiamo inoltre Cross-Expert Wavefront Pipelining (CEWP) per eliminare le attese non necessarie tra esperti. CEWP sovrappone l’esecuzione dei due esperti condividendo la cache KV del video blocco per blocco ed effettuando la sincronizzazione solo immediatamente prima che il corrispondente meccanismo di attenzione per le azioni la utilizzi. Numerosi esperimenti su diversi benchmark (\eg, LIBERO, LIBERO-Plus e RoboTwin) e varianti di modello (\eg, Fast-WAM e Faster-WAM) dimostrano la superiorità di RealtimeWAM. In particolare, RealtimeWAM mantiene prestazioni pressoché inalterate (\ie, un calo di $<1\%$) su questi benchmark, offrendo al contempo una significativa accelerazione dell’intero processo (\eg, $\sim25\times$ su H100). Il nostro codice e i checkpoint sono disponibili tramite questo \href{https://github.com/ModelTC/LightX2V/tree/main/examples/realtimewam}{link}.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv