Ricerca
MinkowskiPE: Minkowski Positional Encoding per la percezione spaziotemporale
Modellare l’accoppiamento spaziotemporale è una sfida fondamentale per costruire un’intelligenza fisica a diverse scale, da quella microscopica a quella macroscopica. I modelli esistenti rappresentano

- arXiv
- 2609.33804
- Pubblicato
- 2026-09-27
- Autori
- Yuhao Li, Louie Hong Yao, Tianyi Shi, Hanqun Cao, Hongxia Hao, Zhen Zhao, Shengchao Liu
Abstract degli autori
Modellare l’accoppiamento spaziotemporale è una sfida fondamentale per costruire un’intelligenza fisica a diverse scale, da quella microscopica a quella macroscopica. I modelli esistenti rappresentano questa struttura principalmente attraverso formulazioni dinamiche ispirate alla fisica o architetture ispirate all’apprendimento. Le prime offrono ipotesi a priori più forti, ma possono limitare la flessibilità; le seconde sono più flessibili, ma lasciano l’accoppiamento spaziotemporale in gran parte implicito. Cerchiamo quindi un approccio che combini la flessibilità dell’apprendimento con un bias geometrico esplicito per modellare congiuntamente il tempo e lo spazio. A questo scopo proponiamo Minkowski Positional Encoding (MinkowskiPE), che usa le coordinate temporali e spaziali congiuntamente per parametrizzare trasformazioni di Lorentz applicate alle caratteristiche di query e key. Con MinkowskiPE, il punteggio di attenzione tra query e key dipende dalla posizione solo attraverso lo spostamento spaziotemporale relativo tra i due token ed è quindi invariante rispetto a una traslazione globale delle coordinate. Questo approccio mantiene l’interfaccia standard dell’attenzione a prodotto scalare e resta compatibile con implementazioni efficienti dell’attenzione. Valutiamo MinkowskiPE su compiti di dinamica molecolare microscopica e di predizione video macroscopica, ottenendo i risultati migliori in tutte e nove le valutazioni molecolari su traiettorie multiple e riducendo del 9,9% l’MSE della predizione video su KTH rispetto al miglior modello di riferimento, pur utilizzando circa un decimo dei parametri.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv