Vai al contenuto
AI.info

Ricerca

I modelli linguistici per LiDAR comprendono davvero le relazioni spazio-temporali?

I recenti modelli linguistici per LiDAR 4D mirano a ragionare sugli oggetti e sulle loro relazioni spaziali in evoluzione. Eppure, nella nostra valutazione, scegliere sempre la stessa opzione raggiung

I modelli linguistici per LiDAR comprendono davvero le relazioni spazio-temporali?
arXiv
2609.24452
Pubblicato
2026-09-21
Autori
Runyi Yang, Murat Akkoyun, Di Wen, Ruiping Liu, Yufan Chen, Junwei Zheng, Xiaoye Wang, Kailun Yang, Danda Pani Paudel, Luc Van Gool, Kunyu Peng

Abstract degli autori

I recenti modelli linguistici per LiDAR 4D mirano a ragionare sugli oggetti e sulle loro relazioni spaziali in evoluzione. Eppure, nella nostra valutazione, scegliere sempre la stessa opzione raggiunge un’accuratezza nei quesiti a scelta multipla quasi pari a quella di due configurazioni derivate da B4DL. Introduciamo LiDAR-Hallu, un benchmark basato sulla geometria e un protocollo diagnostico con 10.000 domande distribuite su 150 scene di nuScenes. Il benchmark copre l’esistenza degli oggetti, la posizione rispetto al veicolo ego, l’ordinamento per distanza, il moto relativo e la localizzazione temporale, con regole esplicite per selezionare gli oggetti, confrontare i momenti e determinare le risposte di riferimento. Il nostro protocollo combina controlli sulle risposte fisse e sul contenuto delle opzioni, coppie di scene con prompt identici ma risposte di riferimento opposte e il richiamo specifico per relazione. L’analisi di 100.000 risposte registrate rivela problemi che l’accuratezza aggregata non mette in luce. La sola durata delle opzioni rende prevedibili le risposte temporali senza osservare il LiDAR. Nelle domande abbinate, i modelli danno spesso la stessa risposta a scene che richiedono risposte opposte. L’analisi specifica per relazione mostra inoltre che entrambe le configurazioni non rilevano nessun caso positivo di moto laterale in tutte le condizioni testate. La decodifica contrastiva con mescolamento temporale offre pochi miglioramenti netti, poiché le correzioni sono in gran parte compensate da nuovi errori e i problemi principali persistono. Questi risultati mostrano che, per valutare il ragionamento spazio-temporale, occorre verificare se i modelli distinguono le relazioni fisiche oggetto delle domande, anziché basarsi soltanto sull’accuratezza delle singole risposte. Il codice sorgente, i checkpoint e i dati sono disponibili all’indirizzo https://github.com/Awesome4D/4DMLLM_Hallucination_Bench.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv